Édition·17 juin 2026Les evals à budget fixe mentent, les agents e-commerce plafonnent à 57%, et PreAct compile les succès en FSM pour aller 13x plus vite.
Édition·16 juin 2026Nemotron 3 Ultra ouvre 550B paramètres hybrides pendant que CODA-BENCH plafonne les meilleurs agents à 61% sur les tâches data-code
Édition·15 juin 2026La journée des evals cassés : biais de genre systématique, juges LLM à pile-ou-face, et une tentative de standardisation globale
Édition·14 juin 2026Le « Verifier Tax » formalise le vrai coût de la sécurité dans les agents LLM à longue portée
Édition·13 juin 2026Le gouvernement américain force Anthropic à retirer Fable 5 et Mythos 5 — un précédent réglementaire majeur pour les modèles frontier
Édition·12 juin 2026Arbor prouve que la recherche arborescente multi-agent tient là où un agent seul s'effondre — et Apple cache que son fp8 est émulé
Édition·11 juin 2026RAG sur NPU mobile, orchestration multi-agent sous contrainte SLO, et agents qui reproduisent la science : l'IA descend dans les couches basses
Édition·10 juin 2026Compression du contexte et évaluation du raisonnement : deux axes structurants de la recherche du 10 juin
Édition·9 juin 2026Benchmarks partout, performances réelles nulle part : la semaine où l'IA mesure ses propres limites
Semaine du·8 juin 2026Semaine du 8 juin 2026 : agents autonomes, mémoire infinie et preuve formelle redéfinissent les frontières opérationnelles de l'IA
Édition·7 juin 2026Les capacités émergentes des LLM s'expliquent par la fréquence des tâches, pas par la taille — et ça change la stratégie d'entraînement
Édition·6 juin 2026Agents IA : 2,6 % de réussite sur les tâches économiques réelles, 94 % de sabotage non détecté — les benchmarks du jour dessinent une frontière de capacité brutale
Édition·5 juin 2026Sécurité LLM : co-évolution attaquant/défenseur, audit sycophantie Gemini, et un seul layer suffit pour le fine-tuning ZO
Édition·4 juin 2026Agents en production : de la carte urbaine au web scraping, l'IA opérationnelle cherche ses patterns d'architecture
Édition·3 juin 2026Les benchmarks IA sont cassés — et les preuves formelles progressent pendant que les évaluateurs LLM divergent des humains
Édition·2 juin 2026Un 8B open-source bat GPT-5 en jeu stratégique multi-agent — pendant que GRPO s'attaque aux masques lithographiques et à la grammaire chinoise.
Semaine du·1 juin 2026Semaine du 1er juin 2026 : l'évaluation en crise, les agents à l'épreuve du long horizon
Édition·31 mai 2026MTP intégré dans les GGUF, Apple Silicon benchmarké sérieusement, et les agents de recherche qui font semblant de chercher.
Édition·30 mai 2026Semaine local-first : voix, GPU hétérodoxe et TTS — l'inférence sans cloud continue de mûrir
Édition·29 mai 2026Anthropic à 965 Md$, calibration de confiance LLM et la taille des garde-fous ne garantit rien
Édition·28 mai 2026Poolside ouvre Laguna XS.2 en Apache 2.0 pendant que la recherche fondamentale attaque les deux goulots d'étranglement de l'inférence : KV cache et complexité d'échantillon.
Édition·27 mai 2026Mémoire, auto-distillation et vieillissement : trois angles sur la fiabilité des systèmes LLM en production
Édition·26 mai 2026Raisonnement logique : les LLM bloquent sur les transitions de régime, les agents de recherche synthétique rattrapent le propriétaire
Semaine du·25 mai 2026Anthropic à 965 Md$ de valorisation, les agents IT plafonnent à 50% : une semaine qui redéfinit les limites du déploiement frontier
Édition·24 mai 2026Claude Code trouve un algorithme de raisonnement à 40$ — et bat la self-consistency de 70% sur le compute
Édition·23 mai 2026Diffusion LLM, AMD 16 GB et qualité de données : la stack locale se consolide par le bas
Édition·22 mai 2026Le federated learning clinique tient ses promesses sur deux sites réels — mais la généralisation reste le mur invisible du ML médical
Édition·21 mai 2026Google teste la fin du mot-clé avec Ask YouTube, Ask Maps et Universal Cart — trois paris sur Gemini comme couche d'interface universelle.
Semaine du·18 mai 2026Semaine du 18 mai 2026 : raisonnement formel, infrastructure à 1,25 Md$/mois et l'illusion des benchmarks de sécurité
Édition·15 mai 2026OpenAI transforme ChatGPT Pro en conseiller financier personnel et pousse Codex dans chaque verticale métier