Semaine du2026-06-01

Semaine du 1er juin 2026 : l'évaluation en crise, les agents à l'épreuve du long horizon

Le thème dominant de cette semaine n'est pas une annonce de modèle mais une remise en question systémique de la façon dont le champ mesure ses propres progrès. Trois papiers convergent vers le même diagnostic : nos métriques d'évaluation sont structurellement biaisées. L'étude géométrique sur LLM-as-Judge (arXiv:2606.03043) quantifie ce que beaucoup soupçonnaient : sur 41 juges LLM et 8 langues indiennes, l'axe d'évaluation des modèles est quasi-orthogonal à celui des humains (87-89° d'écart), et le consensus inter-LLM (r≈0.35) dépasse systématiquement l'alignement LLM-humain (r≈0.27-0.32). En parallèle, l'audit de FOLIO et MALLS révèle 39% et 36% d'erreurs dans les formalisations FOL de ces benchmarks de référence — des benchmarks sur lesquels des dizaines de papiers ont été publiés. La conséquence pratique est sévère : les classements de modèles sur ces corpus sont partiellement fictifs, et les gains de +9 à +22 points observés après correction sur Gemma 31B, Qwen3-30B et GPT-4o-mini ne reflètent pas une amélioration des modèles mais une correction des données de test. L'évaluation contrefactuelle clinique (CSS) enfonce le clou : six modèles de frontier classés similairement sur les métriques traditionnelles s'inversent complètement sur la capacité à adapter des recommandations oncologiques face à des mutations de cas, avec un angle mort universel sur les changements de statut chirurgical.

Le deuxième thème structurant est l'échec documenté des agents sur les tâches longues. LongDS-Bench (68 tâches, 2 225 tours issus de notebooks Kaggle réels) plafonne les meilleurs modèles à 48,45% de précision, avec une chute de 47 points entre les tours précoces et tardifs — les erreurs long-horizon représentent 52 à 69% des échecs totaux. DeskCraft confirme la tendance sur les workflows professionnels GUI : GPT-5.4, le meilleur agent testé sur 538 tâches en design, vidéo, audio et 3D, atteint seulement 31,6% en mode standard. MedCUA-Bench ajoute une dimension critique : dans les interfaces cliniques authentiques (OpenEMR), les meilleurs modèles fermés atteignent 54,2% de succès strict, les agents open-source 2,5% en moyenne. Ce triptyque dessine une limite cohérente : les agents actuels gèrent bien les tâches courtes et bien définies, mais perdent le fil analytique et procédural dès que l'horizon dépasse quelques dizaines d'étapes. L'architecture mémoire Eywa (90,19% sur LoCoMo, 88,2% sur LongMemEval-S) propose une piste sérieuse — stockage immuable des sources, validation typée, récupération déterministe sans appels LLM — mais elle reste une solution partielle à un problème d'architecture plus profond.

Troisième signal, plus discret mais à fort impact opérationnel : deux vulnérabilités de fond émergent simultanément. WASH démontre qu'en moyennant les distributions de probabilité de 3 à 5 modèles, les z-scores des six principaux schémas de watermarking tombent de 5-300 à moins de 2 (seuil de détection : 4) — rendant la traçabilité statistique du contenu généré pratiquement inopérante. Du côté de la sécurité interne, l'étude sur la représentation linéaire de la malhonnêteté synthétique (Pythia-1.4B, Gemma-2, Qwen2.5-7B, Llama-3.1-8B) montre que des sondes linéaires détectent le mensonge avec AUC ≥0.99 dès les couches 1-3, ce qui ouvre une voie concrète pour la surveillance basée sur l'activation — mais confirme aussi que la capacité à mentir de façon cohérente est encodée très tôt dans le réseau. Sur le plan infrastructure, le merge du correctif KV cache en mode tensor multi-GPU dans llama.cpp b9455 (JohannesGaessler) est le type de fix silencieux qui débloque des configurations de déploiement local bloquées depuis des semaines. Enfin, LEAP résolvant les 12 problèmes du Putnam 2025 en Lean et atteignant 70% sur Lean-IMO-Bench (contre <10% pour les LLMs génériques) confirme que la vérification formelle par décomposition agentique itérative est désormais une direction de recherche mature, pas expérimentale.

La semaine à venir verra probablement au moins un papier majeur tenter de proposer un protocole d'évaluation alternatif au LLM-as-Judge, la pression critique ayant atteint un seuil difficile à ignorer pour les équipes de benchmark.

Les 5 picks du jour
01
02
03
04
05
06
07
08
09
10
11
12
Semaine du 1er juin 2026 : l'évaluation en crise, les agents à l'épreuve du long horizon · Signal IA