Hacker News
-
Gemini 3.8 Flash
Google présente la fiche technique de Gemini 3.8 Flash, un modèle conçu pour un déploiement rentable d'agents généralistes prêts pour la production, avec des cas d'usage en ingénierie logicielle, tâches agentiques et workflows de connaissances complexes.
La fiche mentionne les limites habituelles des modèles de fondation (hallucinations), des travaux en cours sur la résistance aux jailbreaks, d'éventuels problèmes de lenteur ou de timeout, et une consommation de tokens parfois plus élevée selon le niveau d'effort. La date de coupure des connaissances est fixée à mars 2026, certains domaines restant limités à janvier 2025, en cohérence avec la famille Gemini 3.
La sortie de Gemini 3.8 Flash fait globalement consensus comme une amélioration nette et sans compromis : les commentateurs saluent sa vitesse (réponses quasi instantanées), son prix très bas et ses scores élevés. Plusieurs benchmarks cités dans la discussion la placent en tête : elle égalerait un score d'intelligence de 59 sur Artificial Analysis, soit le niveau d'Opus 5 en reasoning Medium, et serait première sur le benchmark DeepSWE de Datacurve et sur le leaderboard Redactle (où elle est légèrement plus rapide et moins chère que la 3.7, qu'elle dépasse sans régression). Plusieurs praticiens apportent des retours d'usage concrets : excellente génération de HTML/JavaScript (un exemple convaincant obtenu pour 1,8 centime en 13 secondes), bonne planification de voyages, très fort parsing de documents et reconnaissance d'images (la 3.8 améliore même la 3.7 sur certains cas, tout en restant plus faible sur des figures publiques pointues). Sa force distinctive reste le support multimodal natif audio/vidéo, absent chez OpenAI et Anthropic ; un utilisateur transcode en 480p avant d'envoyer via l'API batch avec de bons résultats.
Quelques nuances et points de division. Un praticien note que la latence réelle de la 3.7 Flash était parfois 2x moins bonne que les chiffres officiels (8-10 s vs 15-25 s sur gros payloads), et s'interroge sur l'absence de mention de vitesse dans cette version ; un autre répond que la latence dépend fortement du canal utilisé (OpenRouter bien plus rapide que VertexAI ou l'API grand public). Sur le code, un testeur juge que Sol écrase la Flash dès qu'il s'agit de modifier des bases de code réelles : Flash reste un outil de prototypage, pas de production. Un autre retour pointe que Gemini identifie bien les 3-4 priorités mais manque de exhaustivité face à Opus ou Fable. La comparaison des pelicans SVG de Simon Willison divise : certains y voient un benchmark désormais sans valeur discriminante.
-
A Note from LWN
LWN annonce une augmentation d'environ 20 % de ses tarifs d'abonnement, alignée sur l'inflation depuis le dernier changement de prix de 2022. Le site, indépendant grâce à son modèle par abonnement depuis 2002, explique que la croissance des abonnés s'est stabilisée et justifie cette hausse pour maintenir son activité. Les abonnements actifs conserveront l'ancien tarif pendant six mois pour les abonnements mensuels, et les souscriptions déjà payées restent valables jusqu'à leur expiration. LWN entamera en janvier sa 30e année de publication.
LWN, référence historique de la presse Linux fondée en 1998, annonce une hausse d'abonnement d'environ 20 %, sa première depuis janvier 2022. Le titre initial ambigu (« A Note from LWN ») a suscité une brève panique — plusieurs commentateurs craignant la fermeture du site, comme il y a vingt ans — avant d'être corrigé et explicité. L'équipe de LWN est active dans la discussion : elle précise que la hausse vise à compenser l'inflation (coûts d'hébergement, charge des scrapers, salaires) et qu'elle préférerait accroître le nombre d'abonnés plutôt que de rehausser les prix, la croissance s'étant essoufflée ces dernières années. Elle explique aussi le délai d'envoi des e-mails d'inscription par un mécanisme anti-spam, et se dit ouverte à ajouter une option d'interligne personnalisable.
La discussion est massivement favorable : de nombreux abonnés de longue date (dont certains depuis plus de 22 ans) déclarent renouveler sans hésiter et considèrent LWN comme la publication technique au meilleur rapport signal/bruit, sans publicité et indépendante grâce à son financement par les lecteurs. Plusieurs suggestions concrètes émergent pour élargir les revenus : abonnements de groupe payés par les employeurs, vente d'archives complètes en PDF/XML, ou licences aux entreprises d'IA. Le format EPUB pour lire les articles hors ligne sur liseuse est cité comme un argument majeur de fidélisation. Quelques critiques minoritaires tempèrent ce consensus : certains jugent les tarifs calibrés pour le marché américain et non mondial, un ingénieur de 20 ans d'expérience affirme n'avoir jamais entendu parler de LWN (à quoi d'autres répondent que le site reste très ciblé Linux/kernel), et une poignée estime le contenu insuffisant pour justifier un paywall ou l'activité menacée face à la gratuité du web.
Le fil confirme l'article plutôt qu'il ne le corrige, mais apporte deux nuances : LWN elle-même clarifie que le problème n'est pas la rentabilité immédiate mais la stagnation des abonnés qui empêche de reporter l'inflation sur le volume, et les commentateurs soulignent que la vraie difficulté est le recrutement de nouveaux lecteurs, pas la fidélité des anciens.
-
Muse Spark 1.3
Aucun contenu n'est disponible au-delà du titre « Muse Spark 1.3 ». Il s'agit vraisemblablement d'une annonce de version 1.3 d'un logiciel ou service nommé Muse Spark, mais le texte de l'article étant absent, il est impossible d'en déterminer la nature précise, les fonctionnalités ou la thématique.
La discussion porte moins sur le modèle lui-même que sur le prix « contributor » : Muse Spark 1.3 est proposé environ 20 fois moins cher (0,10 $/Mtok en entrée, 0,20 $ en sortie, contexte 1M) à condition de laisser Meta entraîner sur ses données. Plusieurs commentateurs saluent la transparence d'un tarif qui quantifie explicitement la valeur des données d'entraînement — une première selon eux, potentiellement utile même pour chiffrer des dommages dans des litiges — tandis que d'autres y voient une simple confirmation que l'utilisateur devient le produit, et s'inquiètent du type de données réellement collectées (tâches répétitives sans valeur d'entraînement, secrets ou clés API envoyés par des développeurs pressés). Sur le fond, Simon Willison a testé le modèle avec son fameux test du pélican en SVG : la 1.3 fait mieux que la 1.2, pour 4,2 cents et 38 secondes, jusqu'à 7,5 cents et 1 min 34 s au niveau de raisonnement maximal.
Les retours d'usage sur la 1.2 sont partagés : un développeur la décrit comme un bon outil de codage qui suit les instructions sans imposer ses opinions et respecte les motifs existants du code, un autre la trouve moins capable que des modèles plus chers, et un troisième note qu'elle boucle sur des résumés de pensée sans progresser sur les bugs, GLM-5.3-Flash faisant mieux sur ce cas. Des benchmarks cités (DeepSWE à 75,4, devant Gemini 3.8 Flash, proche de Sol et Opus 5) la placent très haut pour le prix, mais plusieurs commentaires appellent à la prudence : est-ce de la vraie qualité ou du « benchmaxxing », d'autant que le tableau de Meta ne montre que le mode de raisonnement max, pas encore disponible après les tests de sécurité ? Un praticien signale aussi que le modèle est optimisé pour le harness natif de Meta — l'utiliser réduit tokens et tours par rapport à d'autres harnesss.
La discussion nuance ainsi l'article : les performances annoncées en benchmark sont contestées, et un large courant de méfiance envers Meta (procès de 18 Md$ sur les dommages liés aux réseaux sociaux pour mineurs, confiance zéro sur le traitement des données) pousse certains à refuser le produit même s'il est compétitif.
-
Three sites made 215,128 “best software” pages for AI. Perplexity cites them
Une étude indépendante a interrogé deux modèles web-groundés de Perplexity (sonar et sonar-pro, via OpenRouter) sur les meilleurs produits dans 380 catégories de logiciels, et analysé les 7 534 URL citées. Résultat : 59,8 % des citations pointent vers des domaines classés au-delà de la 100 000e place du classement Tranco, et 36,5 % des domaines cités n'apparaissent même pas dans le top 1 million. Wikipedia n'est cité que trois fois.
Parmi les sources dominantes figurent trois sites — wifitalents.com, worldmetrics.org et gitnux.org — qui semblent constituer une seule opération : enregistrés chez NameCheap entre décembre 2023 et mai 2024, mêmes serveurs DNS Cloudflare, même template de pages, blogs de six articles chacun consacrés aux marques sœurs. Leurs sitemaps totalisent 215 128 pages « best
software » générées automatiquement. Leurs pages d'accueil portent le titre HTML « Facts & Grounding Page » — un terme technique désignant l'étape de récupération des modèles d'IA — et des métadonnées explicitement destinées aux machines, suggérant une optimisation ciblant directement la couche de retrieval des IA plutôt que les lecteurs humains. La discussion confirme le constat de l'article et l'amplifie : trois sites ont généré massivement des pages « best software » pour être cités par les moteurs de recherche IA, et Perplexity tombe dedans. Plusieurs commentateurs notent que les modèles manquent de scepticisme vis-à-vis des sources : en comparaison de produits, ils citent souvent des pages « comparatives » hébergées par les concurrents eux-mêmes. Un praticien SaaS raconte que son produit, en activité depuis dix ans, n'est jamais recommandé par les LLM, et que ces sites lui ont proposé de payer un abonnement annuel selon la position souhaitée — avec, selon un autre témoignage, des articles fabriqués négatifs en cas de refus. Une entreprise entière existe autour de cette industrie : « Profound », spécialisée dans le « get found by AI », aurait levé 155 M$ pour une valorisation d'un milliard auprès de Lightspeed, Sequoia, Kleiner Perkins et NVIDIA.
Deux nuances ressortent. D'une part, l'étude ne porte que sur Perplexity, sans mesurer ChatGPT, Gemini, Copilot ou Google AI Mode — plusieurs remarquent que Perplexity est visée parce que la fiabilité par citation du web est justement sa proposition de valeur. D'autre part, une partie importante de la discussion conteste la source elle-même : plusieurs commentateurs affirment que l'article et le site de la « firme de recherche indépendante » sont eux-mêmes entièrement générés par IA, que le fondateur mentionné n'a aucune trace sur le web, et que le même utilisateur a soumis plusieurs articles similaires provenant de comptes compromis. Certains jugent ces soumissions de l'« astroturfing » anti-Perplexity et demandent leur suppression. Le message central de l'article est donc en partie validé, mais sa provenance est suspecte.
Les retours de terrain sur Perplexity convergent : après des débuts jugés utiles, la qualité se serait dégradée au profit de la vitesse (réponses en une seconde mais liens ne correspondant pas au texte), conséquence selon eux de la stratégie d'acquisition par des offres Pro gratuites de douze mois qui n'ont jamais converti en abonnés payants.
-
Can I opt out of my input or output data being used for training?
Guide pratique décrivant les procédures pour refuser que ses données (conversations, documents, contenu utilisateur) soient utilisées pour l'entraînement des modèles de Mistral. L'article détaille trois méthodes selon la plateforme : la désactivation d'un toggle dans la section Privacy de l'Admin panel pour Vibe, la désélection de la case Enable data sharing dans les réglages Data & Account Controls des applications mobiles iOS et Android, et la désactivation du toggle dans la section Anonymous improvement data pour Mistral Studio et l'API.
La discussion porte sur un changement chez Mistral : le plan Team aurait basculé vers l'activation par défaut de l'entraînement sur les prompts, avec disparition temporaire du réglage central de désactivation au niveau de l'organisation. Plusieurs commentateurs nuancent fortement le titre initial (« Mistral now trains on user input by default »), jugé trompeur par les modérateurs et corrigé : la page de Mistral indique explicitement qu'on peut se désinscrire à tout moment, et des utilisateurs vérifient que leur opt-out antérieur est toujours respecté. Un récapitulatif précise les scénarios : Vibe non-enterprise est opt-in par défaut, Vibe Enterprise opt-out, Studio/API peu documenté.
Les désaccords portent sur la gravité du sujet. Un camp dénonce une dérive : un utilisateur décrit son expérience chez Mistral, où ses prompts de test ont été utilisés pour l'entraînement malgré un choix de plan motivé par la conformité européenne, avant suppression après réclamation ; un autre évoque un « rug pull » similaire chez GitHub Copilot et explique payer Duck.ai pour éviter cette bataille permanente. L'autre camp rappelle que tous les grands fournisseurs (Claude, Gemini Pro) font la même chose par défaut, et que l'indignation tient surtout au mythe d'une Europe plus respectueuse de la vie privée — Mistral, partenaire saoudien et auteur d'un livre blanc visant des dépenses souveraines obligatoires, en est un contre-exemple. Sur le fond du risque, certains estiment que ce sont surtout la propriété intellectuelle et les secrets, plus que la vie privée, qui sont en jeu, les données personnelles étant a priori anonymisées ; d'autres notent que la durée de rétention est vague et que le RGPD devrait en théorie interdire la rétention de PII dans les prompts.
-
Google avoids a breakup of its ad tech business
Google échappe à une scission de son activité de technologie publicitaire (ad tech), d'après le titre de l'article. Aucun détail supplémentaire n'est disponible dans le texte fourni.
La discussion révèle d'abord une grande confusion autour du terme « ad tech » : plusieurs commentateurs, dont un ancien employé d'AdX/AdMeld, corrigent l'article en expliquant que les 30 milliards de dollars concernés ne représentent pas toute la publicité de Google (75 % du chiffre d'affaires d'Alphabet), mais uniquement l'exchange publicitaire tiers vendant l'inventaire publicitaire excédentaire, un sous-ensemble modeste estimé à moins de 1 % du profit. Un commentateur relève toutefois l'ironie : si cette activité ne compte vraiment pas, pourquoi Google a-t-il si longtemps combattu le procès ?
Le cœur du débat porte sur l'efficacité de l'antitrust américain. Plusieurs commentateurs estiment que les juges et le DOJ ont capitulé face à un monopole reconnu en justice, certains évoquant des donations politiques ou des pressions pour expliquer l'issue. Un avis plus nuancé et populaire avance une explication structurelle : les géants technologiques « pré-digestent » désormais leurs actions sensibles via des équipes de conformité recrutant d'anciens régulateurs, effaçant les preuves flagrantes et s'installant dans une zone d'ambiguïté juridique. Un autre fil développe une proposition : faciliter ou rendre symétriques fusions et scissions, mais un employé (se présentant comme tel) explique concrètement pourquoi défaire une fusion est techniquement et organisationnellement bien plus dur que d'en faire une — recrutement de fonctions support, enregistrements dans chaque pays, séparation des stacks logiciels.
S'ajoute un débat géopolitique : un commentateur soutient que la puissance de feu capitalistique des géants est nécessaire face à la Chine, ce que d'autres contredisent en soulignant que la Chine favorise une concurrence interne intense plutôt que des « champions nationaux » protégés, et en citant l'argument de Lina Khan selon lequel les monopoles étouffent l'innovation à long terme. Enfin, un participant apporte une correction factuelle au fil : le communiqué du DOJ cité par un commentateur date de l'année précédente et concerne un autre procès.
-
FBI Probes Service Selling 153M+ Drivers Licenses
Un service de vol d'identité baptisé Nexus, apparu sur le forum cybercriminel russe Exploit, vend les numérisations de plus de 153 millions de permis de conduire américains et canadiens, ainsi que des millions d'autres documents d'identité. Le FBI (bureau de La Nouvelle-Orléans) a ouvert une enquête sur la source des images.
KrebsOnSecurity, dont le fondateur Brian Krebs a découvert son propre permis en vente comme échantillon gratuit, a mené l'enquête : les horodatages des scans correspondent aux dates de voyages ou de locations de voiture des personnes concernées, et plusieurs indices pointent vers la société de vérification d'identité idscan.net (Louisiane), dont les clients incluent Hertz, Target, FedEx, Caesars Entertainment et plus de 1 000 dispensaires de marijuana. Le service prétend exfiltrer activement de nouvelles données depuis plus d'un an auprès d'une « grande société de vérification d'identité » : près de 400 000 nouveaux permis sont apparus en 24 heures.
idscan.net a confirmé ouvrir une enquête sans commentaire officiel supplémentaire.
La discussion révèle une indignation massive sur la rétention de données : 153 millions de permis (environ la moitié de la population américaine) conservés par un simple service de vérification d'identité, alimenté notamment par des scans effectués au comptoir dans des dispensaries de cannabis ou par des acteurs comme Hertz, et non par des selfies envoyés depuis un téléphone — une précision qui corrige une interprétation initiale de l'article. Plusieurs commentateurs notent que le service de vol d'identité Nexus a fermé juste après la publication, et que ces données circulent probablement déjà sur le marché noir depuis un moment.
Le consensus porte sur l'absence d'incitations économiques : la solution récurrente est une responsabilité stricte avec indemnisation minimale par personne (un dollar suffirait, selon l'exemple) pour transformer la donnée détenue en passif. Un Européen rapporte avoir reçu environ 350 dollars au total pour trois fuites, mais d'autres tempèrent l'idée que le RGPD fonctionne réellement : ce sont souvent les mêmes sociétés (Experian, Equifax, TransUnion) qui opèrent des deux côtés de l'Atlantique, et les amendes restent dérisoires au regard de la taille des entreprises. Un commentaire corrige aussi le titre ambigu : il ne s'agit pas de faux permis vendus, mais de données fuitées.
Plusieurs interventions convergent vers une alternative structurelle : pourquoi le gouvernement ne fournit-il pas une API de vérification en Zero-Knowledge (« cette personne a plus de 18 ans », sans révéler le document) ? L'Europe est citée en exemple avec le porte-feuille numérique eIDAS 2.0, et l'Allemagne avec sa carte d'identité NFC disponible depuis quinze ans — pourtant même là, les services persistent à faire scanner les documents. En attendant, les conseils pratiques se partagent : geler son crédit et se protéger du SIM swapping.
-
Commodore 64 released September 1, 1982
Rétrospective pour le 1er septembre 1982, date de lancement du Commodore 64, premier ordinateur avec 64 Ko de mémoire vendu sous 600 dollars. L'auteur revient sur les incertitudes autour de la date exacte de mise sur le marché, les problèmes de qualité contrôle à Santa Clara et l'externalisation de la production à Kentron, puis sur son succès commercial : 500 000 unités en six mois, environ 12,3 millions au total, ce qui en fait l'ordinateur le plus vendu de l'histoire.
L'article analyse les compromis de conception qui expliquent sa longévité : graphismes 16 couleurs, 8 sprites pour le jeu, et la puce sonore SID à trois voix conçue par Bob Yannes, plus flexible que les puces concurrentes de General Instrument et Texas Instruments. Des programmeurs créatifs ont exploité la machine bien au-delà des intentions de ses concepteurs, et elle continuait de se vendre à environ 700 000 unités par an à la fin des années 1980, jusqu'en 1993.
L'auteur y ajoute un témoignage personnel : apprentissage du BASIC et de l'assembleur 6502, débuts en informatique, et utilisation récente du C-64 pour se remettre en mémoire le réflexe de programmation avant d'apprendre Python. Il note que le C-64 est de nouveau en production.
La discussion est surtout une vague de souvenirs nostalgiques : le C64 a été, pour beaucoup de commentateurs désormais quinquagénaires ou plus, leur porte d'entrée en informatique — BASIC, POKEs, mémoire cartée des routines KERNAL, jeux sur disquettes à 4,99 $, modems 300 bauds et BBS. Plusieurs racontent des trajectoires concrètes : un pré-commande avec numéro de série dans les 700, une mère qui a rédigé son mémoire avec GEOS, une C64 récupérée dans une benne en 1987-88, un passage derrière le rideau de fer en 1990 avec une 1541 et des centaines de disquettes piratées. Plusieurs soulignent aussi la dimension sociale du moment (Spectrum contre C64 à la cour de récré, victoires improbable en Forth sur TI-99/4A).
Le principal point de friction porte sur le BASIC du C64 : pour un avis minoritaire mais suivi par d'autres, il était frustrant et limité, sans accès direct au bon matériel vidéo et son, et l'accès à l'assembleur était difficile sans ressources ; un autre rappelle que le LOAD "*,8,1" sans mécanisme de boot marquait la fin des ordinateurs centrés opérateur. Sur le prix, des chiffres circulent : 595 $ en 1982 (environ 2 059 $ actuels), ce qui en faisait un mauvais achat au lancement selon un commentateur puisque le prix tomba à 229 $ dès l'année suivante ; d'autres nuancent en rappelant l'évolution très rapide des machines de l'époque et qu'au contraire, développer des jeux tôt sur C64 pouvait rentabiliser l'achat. La comparaison avec le ZX Spectrum (200 $, dominanter en Europe et pays pauvres grâce à son prix) est discutée, certains estimant le Speccy plus important que le C64 malgré ses capacités inférieures.
La discussion corrige aussi l'article sur deux points : la date du 1er septembre 1982 est contestée sur les forums, et un commentateur suggère de vérifier dans les magazines d'époque (Byte, Compute! sur archive.org) plutôt que de se fier au livre cité. Par ailleurs, une erreur de lecture (« 24 ans » pour l'anniversaire) est corrigée en 44 ans.
-
Biggest dark matter detector spots a single weird particle
Le plus grand détecteur de matière noire a détecté une seule particule inhabituelle, d'après le titre de l'article. Aucun texte supplémentaire n'est disponible pour détailler la découverte.
La discussion porte sur l'événement unique détecté par LZ (LUX-ZEPLIN), un détecteur de 7 tonnes de xénon liquide enfoui à 1480 mètres sous terre dans une ancienne mine d'or du Dakota du Sud. Plusieurs commentateurs, dont l'un a lu le preprint, soulignent la rigueur de l'analyse : les équipes ont étudié les reconstructions erronées et les fonds possibles, et il ne reste qu'un seul événement inexpliqué. Le consensus est clair : c'est intriguant mais très loin d'une découverte, l'histoire de la physique des particules regorge de « découvertes » à 3 sigma qui ont disparu avec plus de données. Un commentateur cite même un cas vécu de rétractation d'un article de 2007 sur les rayons cosmiques ultra-énergétiques, dont la signification statistique s'est effondrée juste après publication.
Des précisions techniques concrètes nuancent la lecture de l'article : l'analyse repose sur 2,8 tonne-années de données (4,7 tonnes de xénon utilisées pendant un peu plus d'un semestre, le reste étant écarté par prudence), et les « trois fois plus de données » mentionnées correspondent à environ 8,5 tonne-années déjà collectées, pas à trois événements supplémentaires observés. Les commentateurs expliquent aussi comment les fonds sont éliminés (blindage, matériaux décontaminés, rapport scintillation/ionisation distinct selon que le particle touche un noyau ou un électron). Sur la signification statistique, un désaccord apparaît : l'un affirme que c'est de l'ordre du 1 sigma et « ne veut rien dire », un autre répond que la probabilité d'un hasard (1 sur 200) correspond à plus de 3 sigma. L'hypothèse d'un neutrino particulièrement énergétique, non couvert par les simulations (solaire et atmosphérique), est évoquée comme explication plausible.
-
Aging brains blend memories together instead of just forgetting them
Une étude publiée dans Cerebral Cortex, menée par IRM auprès de 61 adultes de 18 à 74 ans, suggère que le vieillissement cérébral ne se traduit pas seulement par un oubli des souvenirs mais aussi par leur fusion. Chez les jeunes adultes, une forte similarité entre l'activité de l'hippocampe pendant l'apprentissage et pendant le rappel prédisait une bonne précision de la mémoire. Chez les personnes âgées, cette même similarité prédisait au contraire davantage d'erreurs de confusion entre catégories (par exemple lier un visage à une scène alors qu'il était associé à un objet), comme si le cerveau rejouait les souvenirs de façon trop large.
Ni l'atrophie de l'hippocampe, ni l'organisation de base du tissu cérébral, ni des différences d'attention n'expliquaient pleinement ce phénomène. Les auteurs parlent de « category-level misbinding » : le cerveau conserve le sens général d'une expérience mais perd les détails qui la distinguent des autres. Comprendre ce mécanisme pourrait aider à concevoir des outils visant à améliorer la séparation des souvenirs similaires plutôt que la mémoire en général. L'étude porte sur des appariements appris en laboratoire et se limite à l'hippocampe, ce qui en constitue les principales limites.
La discussion tourne autour d'une étude suggérant que le vieillissement cérébral fusionne les souvenirs plutôt que de simplement les effacer. Plusieurs commentateurs partageant des anecdotes personnelles confirment ce phénomène : un photographier amateur de 25 ans d'expérience raconte avoir découvert via ses archives photo que des anecdotes qu'il racontait depuis longtemps mélangeaient des événements ; d'autres évoquent des souvenirs attachés à la mauvaise époque ou au mauvais lieu, ou des proches âgés (dont des cas de démence) combinant visiblement des événements distincts.
Plusieurs nuances et corrections apparaissent. Un commentateur pointe les limites méthodologiques de l'étude : seulement 61 participants, presque personne entre 30 et 50 ans, donc impossible de conclure à un déclin continu sur la durée de vie ; surtout, les mesures d'attention n'étaient corrélées ni à l'âge ni aux patterns cérébraux, ce qui affaiblit le titre. Un autre signale que l'article lui-même serait généré par IA et donc à prendre avec prudence, tandis qu'un autre fournit le lien vers l'étude originale publiée dans Cerebral Cortex (contredisant ainsi la fiabilité de la vulgarisation). Sur le plan neuroscientifique, la métaphore informatique du « hash table trop pleine » (théorie dominante du premier commentaire) est contestée : des répondants rappellent que le cerveau n'a pas de goulot d'étranglement de von Neumann, que la mémoire n'est pas stockée en un ensemble fixe de cellules mais distribuée et recomposée à chaque rappel, et qu'un souvenir se modifie chaque fois qu'il est rappelé.
Deux pistes explicatives alternatives reviennent sans être tranchées : la saturation informationnelle (trop de souvenirs accumulés, indépendamment du vieillissement biologique) et l'affaiblissement des rythmes circadiens avec l'âge, qui influencent l'apprentissage et le rappel — ce que l'étude n'aurait pas contrôlé selon un commentateur. D'autres notent que le cerveau fusionne naturellement les événements répétitifs et que le phénomène décrit relève d'un dysfonctionnement dégénératif, pas de l'oubli normal.
-
Fable 5.1 World Modeling
Fable 5.1 présente des reconstructions 3D explorables de lieux réels (Union Square à San Francisco, la route de Higashiyama à Kyoto), entièrement générées par des essaims d'agents Claude autonomes et livrées comme applications Three.js simples, sans moteur de jeu ni assets 3D propriétaires.
Le monde de San Francisco reproduit un quadrilatère de rues sur terrain et plan de voirie réels, avec 129 commerces identifiés, feux tricolores et cable cars fonctionnels, cycles jour/nuit et deux intérieurs explorables (Apple Union Square, Nintendo San Francisco). Le monde de Kyoto restitue 2,3 km de la route de pèlerinage de Gion à Kiyomizu-dera en style d'arrière-plan anime peint à la main, avec rendu cel-shading, encre et tonalité séparée ; un relevé a aussi corrigé six chiffres largement répétés (hauteur de la pagode Yasaka, dimensions de la scène de Kiyomizu…).
Le pipeline complet est open source : des agents de recherche agrègent OpenStreetMap, l'élévation USGS et un recensement des commerces avec sources ; des scripts Blender génèrent des kits GLB optimisés ; un runtime Three.js assemble le monde depuis des specs JSON ; une QA par comparaison de captures Playwright avec des photos libres et des agents critiques indépendants pilote les cycles de correction. Code et assets sous MIT, géométrie ODbL/domaine public.
La démonstration de PhiloLabs — un Union Square de San Francisco interactif en 3D, généré via le modèle Fable 5.1 — impressionne la discussion, mais plusieurs commentateurs s'accordent pour contester le titre de l'article : ce n'est pas un « world model » au sens habituel du terme (simuler la dynamique d'un monde), mais un modèle 3D généré par code, ce qui selon eux rend le nom trompeur. Un échange souligne aussi une confusion sur la nature du projet (modèle d'image vs modèle 3D). L'auteur précise que le résultat est un one-shot : environ 2 heures de génération, 8 millions de tokens et 33 dollars via API, avec un prompt très détaillé et des sous-agents en boucle d'auto-QA. La géométrie provient d'OpenStreetMap et de l'USGS 3DEP, puis est convertie en modèle Three.js.
Les critiques techniques sont concrètes : un praticien ayant testé ce type de modélisation pour un RTS indique que le modèle ne produit pas d'assets optimisés (polycounts élevés pour des géométries simples) et recommande de générer des silhouettes low-poly puis de baker les textures avec des outils comme Meshy ; il estime aussi qu'Opus 5 donnerait un résultat similaire pour moins cher. D'autres regrettent l'absence de démonstration vidéo claire, notent que les overlays présentés comme preuves de précision ne correspondent pas réellement aux clichés, et demandent des données sur le taux d'échec et la fiabilité. Plusieurs doutent de l'utilité au-delà des démos : topologie et texturing restent problématiques, et 33 dollars par monde généré paraît dissuasif pour du jeu vidéo — même si un autre rétorque que cela reste modeste au regard des milliers d'heures de modélisation manuelle habituellement nécessaires.
Au-delà des critiques, la discussion ouvre des pistes : rapprochement avec le VRML d'il y a trente ans, intérêt pour des mondes ouverts ou des jeux de type AR, attentes de démos type pages GitHub plutôt que de simples dépôts statiques. Les auteurs annoncent un article de synthèse sur le world modeling par code avec des chercheurs de laboratoires et universités, ainsi que de nouveaux mondes (Kyoto).
-
My local model setup on an M4 Pro Mac Mini
L'auteur détaille son installation d'un serveur LLM local sur un Mac mini M4 Pro avec 48 Go de RAM, accessible depuis son iPhone et son MacBook via Tailscale. La stack comprend Qwen3.6-35B-A3B en 4 bits (modèle principal, ~20 Go en RAM), Gemma-4-E4B en 4 bits pour les tâches simples, le serveur d'inférence oMLX, et un agent backend nommé Hermes partagé entre les appareils, avec Apollo sur iOS, Raycast et Pi pour le code comme clients.
Il justifie le choix du local par plusieurs arguments : le coût imprévisible et les changements arbitraires des API cloud (il saturait deux abonnements à 200 $/mois), la confidentialité des données, la « souveraineté IA » face aux restrictions gouvernementales, la latence, l'usage hors-ligne et l'absence de limite de débit. L'objectif n'est pas de remplacer les gros modèles API mais de couvrir les 80 % de requêtes du quotidien.
L'article explique aussi comment évaluer si un modèle tient en mémoire : la différence entre modèles denses et mixture-of-experts est centrale (le 35B-A3B n'active que 3 milliards de paramètres par token, d'où un empreinte mémoire bien moindre), avec des règles pratiques sur la quantization 4 bits, l'overhead macOS et le cache KV. Les débits observés sont de 325 tok/s en préremplissage et 34 tok/s en génération, la bande passante mémoire du M4 Pro (273 Go/s) étant le facteur limitant.
La discussion autour du retour d'expérience d'un M4 Pro pour faire tourner des modèles locaux reflète le débat classique local vs cloud. Plusieurs commentateurs saluent l'intérêt du partage détaillé de setup, tandis que d'autres s'interrogent sur la réelle utilité : pourquoi payer du matériel quand les IA cloud sont gratuites ou presque ? Les réponses opposent la gratuité superficielle (« free beer ») à l'intérêt de la vie privée, de l'indépendance vis-à-vis des limites d'usage et des changements de modèles opérés unilatéralement par les fournisseurs.
Les apports concrets portent surtout sur les performances et le matériel. Un utilisateur de M4 Pro 48 Go annonce 52 tok/s sur Gemma 26b et 72 tok/s sur Qwen 3.5b, quantisés en 4 bits, jugés suffisants sauf pour le code. Un autre détaille des benchmarks oMLX sur M1 Max 32 Go, où un Qwen dense 27B est nettement plus lent en prompt processing qu'un modèle MoE de type 35B-A3B (~380-390 tok/s), et recommande la variante mxfp4 comme meilleur compromis vitesse/qualité. Un commentaire corrige utilement l'article : la RAM ne suffit pas, la bande passante mémoire est déterminante pour les tok/s ; un autre répond que le dense 27B (~125 tok/s de prompt processing) est inutilisable en agent avec de gros prompts, là où le MoE atteint ~800 tok/s. Sur le choix du Mac, l'explication consensuelle est la mémoire unifiée, le moyen le moins cher d'accéder à plus de 64 Go adressables par le GPU. On note aussi des tests sur du matériel modeste : 13 tok/s avec 5 Go de RAM sur un modèle 1 bit sur M1, et un consensus qu'un M2 24 Go ne suffit pas pour le code (48-64 Go recommandés).
Des nuances et critiques émergent : la vie privée revendiquée par l'auteur est jugée incohérente avec l'usage d'un bot Telegram, dont les conversations ne sont pas chiffrées de bout en bout — l'auteur le concède. Plusieurs jugent les modèles locaux insuffisants pour les usages avancés, préférant les API frontière pour la qualité, même si des praticiens soulignent qu'une adaptation fine du harness (prompts système spécialisés, recherche locale) rend les petits modèles réellement exploitables.
-
True Rate of Unemployment
Le True Rate of Unemployment, développé par LISEP à partir des données du Bureau of Labor Statistics, mesure la part de la population active américaine sans emploi à temps plein (35 h/semaine ou plus) qui en veut un, ou sans emploi du tout, ou ne gagnant pas un salaire décent (fixé de façon conservatrice à 26 000 $ annuels avant impôts en dollars de 2025). L'objectif est de fournir aux analystes et décideurs un indicateur plus fidèle du bien-être financier des Américains que les mesures classiques, à l'image d'un recensement précis nécessaire à un financement équitable des communautés.
La discussion porte sur l'indicateur « True Rate of Unemployment » (TRU) de LISEP, qui compte comme chômeurs les personnes sans emploi à temps plein (35h+) désirant un, ou gagnant moins d'un « living wage » fixé à 26 000 $ par an avant impôts. Plusieurs commentateurs reconnaissent l'intérêt de compléter les statistiques officielles — certains rapportent leur vécu (un diplômé sans allocation en Suisse invisible dans les chiffres, des proches en recherche d'emploi depuis des mois après des licenciements, un ingénieur logiciel fraîchement licencié) et estiment que les chiffres officiels paraissent trop flatteurs. Un commentaire technique situe le TRU comme proche du U-6 du BLS auquel on ajoute le critère de salaire de subsistance.
Mais la critique de fond est largement méthodologique : beaucoup jugent l'indicateur artificiel car il agrège des situations très différentes (chômage réel, temps partiel bien payé — un barman à 50 000 $ sur 32,5h devrait-il compter comme chômeur ? —, deux temps partiels totalisant 40h). Plusieurs notent que le TRU suit de près le taux officiel et qu'il est historiquement à son plus bas niveau sur 30 ans, donc ne révèle aucune « mensonge » ni dégradation récente ; une remarque rappelle que la valeur implicite pour 1999 (~30 %) serait absurde et suggère un défaut d'ajustement inflationniste. Le seuil de 26 000 $ est jugé trop bas comme « living wage » ; un commentateur nuance que ce revenu brut néglige les transferts sociaux (crédits d'impôt, SNAP, aide au logement) qui doublent presque le revenu effectif d'une famille modeste. Quelques graphiques ne partant pas de zéro sont également dénoncés comme trompeurs, un « own-goal » pour un article sur la crédibilité des statistiques.
Enfin, des apports concrets : un lien vers une statistique australienne équivalente de Roy Morgan, un débat sur la définition de la population active, et l'idée que la hausse des salaires minimaux étatiques depuis 1995 explique une partie de la baisse du TRU pour les moins diplômés. Un praticien s'interroge sur la robustesse de l'indicateur pour la politique monétaire, sa volatilité pouvant mener la Fed à des baisses de taux injustifiées.
-
Exit the Cave
Essai réflexif sur le culte du « grinding » en solitaire : l'auteur, ancien lutteur lycéen, raconte comment des années d'entraînement acharné dans l'ombre n'ont jamais traduit l'effort en victoires, car il confondait effort mesurable et progrès réel, et évitait en fait l'échec public plutôt qu'il ne recherchait la victoire. Il met en garde contre la « caverne » confortable que la culture actuelle — objets connectés, algorithmes, IA qui renforcent nos biais — rend plus séduisante encore, et plaide pour confronter son travail au monde réel : publier, vendre, concourir, aimer. Aucun lien avec l'actualité tech, matériel ou géopolitique.
L'article plaide pour « sortir de la caverne » : toute activité digne d'intérêt nécessite une confrontation au réel (un lectorat, des clients, des adversaires), et il vaut mieux être mis à l'épreuve en public que de s'entraîner indéfiniment en privé. La discussion se structure surtout autour de cette thèse, avec une opposition marquée.
Plusieurs commentateurs contestent frontalement l'idée que toute activité valorisante exigerait une validation externe : on juge ses progrès par rapport à soi-même, pas par l'utilité pour les autres, et garder un journal ou cultiver sa santé n'en sont pas moins légitimes. Ils y voient une projection de l'auteur qui pose ses préférences comme des faits, et invoquent des artistes reclus (Henry Darger, Kafka, Van Gogh) comme contre-exemples. La nuance qui émerge : la distinction porte sur le but poursuivi — l'art ou l'activité pour soi ne nécessite pas de sortir, mais si l'on croit que son travail a de la valeur pour autrui, mieux vaut le montrer tôt.
Les praticiens du côté entrepreneurial convergent sur la tension concrète entre construire et vendre : un fondateur raconte avoir lancé une entreprise en 2022 et essayé de vendre avant que le produit soit prêt, y gagnant du recrutement de terrain mais perdant du temps ; d'autres recommandent de « vendre d'abord, construire ensuite » (clients, sinon investisseurs), ou de viser un très petit public plutôt que de crier dans un marché saturé. Un retour de terrain note le silence indifférent qui accueille désormais les publications (50 clics, zéro commentaire), possiblement lié à la fatigue du contenu généré par IA ; un avis minoritaire soutient qu'avec l'IA, l'exécution est devenue bon marché et que les idées valent plus. Enfin, un pratiquant de MMA apporte un exemple frappant : on peut aussi rester dans la caverne collectivement — des salles entières s'accordent à éviter de confronter leurs limites réelles, et les nouveaux venus de ces « petites salles » se font démonter au premier sparring réel.
-
I wanna live an NPC life
Aucun contenu disponible au-delà du titre « I wanna live an NPC life » ; l'article ne peut être ni résumé ni rattaché à une thématique de Julian.
L'article, qui exprime l'envie de mener une « vie de NPC » (roulements régulier, travail banal, absence d'ambition spectaculaire), divise nettement la discussion en deux camps.
Un premier courant critique frontalement l'idée : plusieurs commentateurs jugent que la métaphore du NPC est mal choisie ou inversée — dans les jeux vidéo, un NPC n'a aucune agency, suit un script et ne choisit rien ; or ce que décrit l'auteur (choisir une vie simple, se désengager des injonctions de statut) relève précisément de l'exercice d'un choix, donc d'un « personnage principal ». Un autre reproche fait valoir que le monde réel a des conséquences contrairement à un jeu : quand « le dragon arrive brûler le village », la boucle tranquille ne suffit plus. Certains y voient aussi du simple escapisme, une fatigue mentale liée à la surcharge d'informations en ligne, ou une « coping mechanism » de blogueur cherchant la provoc ; un praticien rapporte même une anecdote personnelle où le désengagement ne tient pas face aux circonstances (un projet annoncé finit malgré tout par être réalisé, avec un impact financier négatif d'une décennie). Un commentateur note que ce mode de vie n'est viable que dans un pays sûr, avec une économie et des institutions correctes, ce que beaucoup de gens n'ont pas.
Le second courant défend ou relativise l'idée : plusieurs estiment que l'on est à la fois personnage principal de sa propre vie et NPC dans celles des autres, et que vivre simplement n'exclut ni le sens ni la profondeur (des références à Zhuangzi, à Platon, à la Bhagavad Gita et au film Perfect Days appuient cette lecture). D'autres pointent le contexte : la pression sociale contemporaine (« être personnage principal » signifiant aujourd'hui richesse et visibilité) rendrait attirante la perspective d'une petite vie, et un parent raconte que sa fille a déjà construit un projet de vie volontairement simple et détaillé. Au total, l'accord se porte moins sur le terme « NPC » — jugé trompeur par les deux camps — que sur l'idée que le choix d'une vie discrète peut être légitime, à condition qu'il soit un choix assumé et non une soumission au script.
-
The Emergent Symbolic Structure of Artificial Neural Networks
Un article de recherche (arXiv) propose une réponse à une question ancienne : comment les réseaux de neurones, qui représentent l'information en vecteurs continus, parviennent-ils à exceller dans des domaines traditionnellement associés aux symboles comme la logique ou le langage ? Les auteurs émettent l'hypothèse que leurs représentations internes réalisent implicitement une structure symbolique.
Pour l'appuyer, ils montrent que les représentations vectorielles de divers réseaux neuronaux peuvent être approchées par des structures symboliques : en remplaçant le processus de génération des représentations par une équation sous forme fermée instanciant une structure symbolique, le comportement du réseau reste largement inchangé. Le résultat vaut aussi bien pour de petits réseaux entraînés à manipuler des listes que pour de grands modèles de langage dans quatre domaines emblématiques du symbolisme : l'arithmétique, la logique, le code informatique et le langage naturel.
Cette approximation symbolique permet en outre de modifier le comportement d'un LLM de manière ciblée via des interventions précises sur ses représentations internes, confirmant que le modèle repose bien sur ces structures. Le travail offre une voie possible de réconciliation entre les conceptions symboliques de l'intelligence et la nature vectorielle de l'IA moderne.
La discussion reste prudente face à l'article. Un commentateur souligne la portée potentielle : si ces représentations symboliques closed-form des LLM sont réellement exploitables, cela évoquerait une « distillation analytique » (un modèle exécutable sans GPU massif) et une nouvelle voie de recherche symbolique via l'entraînement. D'autres répondent que ce ne serait qu'une autre forme de quantisation : à cette échelle, un ensemble géant d'équations serait aussi difficile à raisonner qu'un réseau, avec un trade-off stockage/calcul. Plusieurs s'interrogent aussi sur le statut du papier : une peer-review dans une conférence sérieuse n'est pas établie.
La critique la plus substantielle vient d'un praticien du domaine, qui rappelle que les méthodes d'interprétabilité supervisée de ce type peuvent trouver du structurel spureux (travaux de Hewitt & Liang 2019), et que DAS — la méthode de référence contrastée dans l'article — fait l'objet de critiques récentes multiples. Il annonce sa propre alternative à venir à EMNLP, ce qui lui vaut une réplique ironique : son argument revient à dire qu'il n'a fait qu'effleurer l'article avant de promouvoir son propre travail. Un autre commentateur modéré relève que la section 3.5 du papier invite à l'optimisme tempéré sur la robustesse et la généralisation de la méthode, et qu'elle concurrence d'autres travaux de mech interp bien établis. L'introduction du papier (postulat que les vecteurs ne peuvent pas capturer le symbolique) est jugée par plusieurs comme une paille facile à abattre, les cerveaux biologiques réalisant déjà cette proue sans « unité symbolique ».
Un avis minoritaire estime que le résultat est évident depuis longtemps et déjà décrit ailleurs ; cette affirmation est fermement démontée par un commentaire qui analyse un des textes cités et y trouve une approximation de 50 sinusoïdes sur les 1000 premiers nombres premiers, avec une extrapolation mathématiquement infondée.
-
I Don't Have a Smartphone
Ploum raconte comment il affirme ne pas avoir de smartphone pour échapper à l'injonction généralisée d'installer des applications : il a dû argumenter 18 fois en un an contre l'installation d'apps, même pour des objets du quotidien comme un siège de toilettes. Installer une app suppose une dizaine de conditions (smartphone présent et fonctionnel, batterie, stockage, réseau, compte Google valide, acceptation des conditions), dont une seule suffit à rendre le service inutilisable.
Il utilise en réalité un Mudita Kompakt, un smartphone minimaliste à e-ink sans Google, sur lequel il garde quelques outils choisis (Signal, Komoot, agenda). Il garde aussi un FairPhone 3 sous /e/OS avec microG pour contourner les apps bancaires exigeant les services Google, et un vieux OnePlus 5 sous Android vierge en secours. Il en conclut que les smartphones actuels sont inférieurs à ceux d'il y a dix ans sur presque tous les aspects, et que l'app d'authentification « Itsme », poussée dans son pays, sert explicitement à extraire des données personnelles à des fins commerciales.
La discussion autour du témoignage d'une vie sans smartphone révèle un large consensus : le problème n'est pas l'existence des applications, mais leur caractère désormais obligatoire pour des interactions quotidiennes triviales (menus de restaurant, billetteries de stades, casiers, cartes de fidélité, toilettes connectées). Plusieurs commentateurs soulignent que cette « app-ification » généralisée n'est pas un choix technique mais une stratégie commerciale : se loger sur l'appareil de l'utilisateur permet de créer de la dépendance, des revenus récurrents et des abonnements. Un avis divergent nuance cette lecture : la plupart des frictions décrites peuvent être évitées en configurant correctement son téléphone (notifications coupées, écran d'accueil épuré), et l'appareil devrait être « au service » de son propriétaire ; d'autres répliquent que la majorité des gens n'ont ni le temps ni la discipline pour ce curage, et que ce sont eux les premières victimes.
Les retours de terrain des sans-smartphone sont concrets : un praticien décrit une vie sans Google Play via F-Droid et Obtainium, avec des limites bien réelles (sites filtrés qui cassent, cartes open source inférieures à Google Maps, absence d'applications bancaires qui déporte la charge sur son épouse — point relevé par un autre commentateur). Un sportif mentionne les stades MLB qui imposent des billets numériques ou surfacturent le papier ; en Inde, la pharmacie qui refuse de vendre sans numéro de téléphone illustre la généralisation du problème. Plusieurs vivent sans smartphone depuis des années, dont l'un gère même une entreprise, mais reconnaît la difficulté croissante. Quelques pistes pratiques émergent : GrapheneOS avec lanceur minimal, iPhones « dumbifiés » via Apple Configurator (navigateur et App Store désactivés), et l'application météo wX sur F-Droid, saluée pour sa précision via les données du NWS.
Deux points de vigilance complètent le tableau : un diabétique de type 1 déplore le couplage des dispositifs médicaux aux smartphones, un point de défaillance supplémentaire, même si un commentateur estime que c'est plus fiable qu'un appareil dédié.
-
Dutch central bank moves share of gold from U.S., Canada to London
La banque centrale néerlandaise a déplacé une partie de ses réserves d'or entreposées aux États-Unis et au Canada vers Londres. Aucun détail supplémentaire n'est disponible dans le texte fourni.
La discussion confirme et précise l'article : la banque centrale néerlandaise (DNB) a rééquilibré ses réserves d'or en faisant passer la part détenue à New York de 31,3 % à 18,5 % et celle à Londres de 18,1 % à 32,1 % (Ottawa baissant légèrement, Zeist inchangé). Plusieurs commentateurs corrigent une lecture purement physique du transfert : seuls 27 tonnes ont été déplacées, le reste résulte d'opérations de vente à New York et de rachat à Londres. Ils relèvent que la France a fait de même récemment (et aurait de son côté vendu ses réserves américaines pour racheter de l'or de meilleure pureté localement), et que l'Allemagne en avait discuté sans donner suite.
Le point de clivage porte sur l'interprétation : la DNB présente officiellement l'opération comme une diversification des risques et une facilité de liquidité — vendre l'or plus facilement en cas de crise depuis Londres — en précisant que ses craintes majeures portent plutôt sur la dépendance à VISA et MasterCard. Mais une majorité de commentateurs y voit surtout un signal de défiance envers les États-Unis sous l'administration Trump : risque de saisie ou d'utilisation des réserves comme levier dans les négociations commerciales, menaces d'annexion du Canada, comportement jugé imprévisible. Un commentateur invoque la crainte d'une revalorisation des réserves d'or américaines pour combler le déficit budgétaire. Un avis nuancé rappelle cependant que la confiance perdue ne disparaîtra pas avec Trump, tout en doutant d'une rupture économique réelle avec les États-Unis, tant les intérêts commerciaux persistent.
Éléments concrets additionnels : l'or des banques centrales mondiales (~4 000 Md$) aurait dépassé début 2026 pour la première fois leurs avoirs en bons du Trésor américain (~3 900 Md$), signe d'une réorientation durable des réserves. Un commentateur note aussi qu'un an plus tôt, la tendance inverse était rapportée dans la presse, sans données de long terme pour trancher. Enfin, certains replacent la décision dans un contexte de tension géopolitique européenne (incidents russes), mais l'essentiel des échanges l'attribute à un risque côté américain plutôt que russe.
-
Mamdani bans AI in NYC schools
Le texte fourni se réduit au titre : Mamdani interdirait l'IA dans les écoles de New York. Aucun contenu supplémentaire n'est disponible pour détailler la mesure, son périmètre ou son calendrier.
La discussion porte sur l'interdiction de l'IA dans les écoles de New York, et le consensus est majoritairement favorable : de nombreux commentateurs estiment que les élèves doivent d'abord apprendre à penser par eux-mêmes avant de déléguer à l'IA, sur le modèle de l'apprentissage du calcul avant la calculatrice. Plusieurs pointent l'ironie du fait que les parents de la tech (Silicon Valley, Peter Thiel) limitent fortement les écrans pour leurs propres enfants, ce qui renforce la crédibilité de la mesure.
Cependant, plusieurs commentaires corrigent le titre de l'article : il ne s'agit pas d'une décision de Mamdani ni d'une interdiction générale, mais d'une politique du Département de l'éducation limitée au primaire et au collège (jusqu'en huitième), pour un an, le lycée restant couvert avec un cours d'alphabétisation à l'IA. La règle interdit aussi aux enseignants de faire corriger des copies par l'IA. Un commentateur souligne que, en pratique, les élèves ne pouvaient déjà pas soumettre de productions générées par IA, ce qui réduit la portée réelle du changement.
Le débat porte ensuite sur l'usage pédagogique de l'IA : certains invoquent des initiatives comme Math Academy, où l'IA pose les bonnes questions au bon moment plutôt que de donner les réponses, et craignent de jeter le bébé avec l'eau du bain ; d'autres rétorquent que le système scolaire n'a pas les moyens d'expérimenter sur les masses et qu'il faut attendre des données. Une étude liée suggère déjà des effets négatifs. Plusieurs observent que la règle touchant des mineurs encadrés en classe ne se compare pas à une interdiction générale de l'IA, et qu'elle risque surtout d'élargir l'écart entre enfants favorisés (qui utiliseront l'IA à la maison) et défavorisés. D'autres critiques portent sur le coût élevé et la médiocrité des résultats des écoles publiques de NYC, ainsi que sur le « rent-seeking » de l'edtech, indépendant de l'IA.