Le thème structurant de cette semaine est l'industrialisation de la couche agent. Anthropic a publié le SDK Python officiel Claude Agent (article #1, signal 85/100), premier SDK first-party permettant de construire des agents autonomes multi-turn avec gestion native des outils — un signal fort que la compétition se déplace du modèle vers le runtime. Dans le même registre, Arbor (#5) formalise la recherche arborescente comme couche de cognition multi-agent, avec un gain Pareto throughput-latency de 193% contre 33% pour un agent seul qui s'effondre en quelques heures. ISE (#11) complète ce tableau en montrant que le fine-tuning de Qwen3-8B sur 23 132 trajectoires OS synthétiques générées avec exécution live fait passer le score ClawEval de 19,3 à 37,7 pass@1, surpassant GPT-4o zéro-shot et Qwen3-32B — preuve que la qualité des données de trajectoire prime désormais sur la taille du modèle pour les agents OS. MacArena (#10) ajoute une mise en garde critique : les agents performants sur Linux régressent de 26% sur macOS, rappelant que les benchmarks d'agents restent dangereusement spécialisés par environnement.
Le deuxième thème dominant est la résolution du problème de mémoire à long terme, longtemps le talon d'Achille des LLM en production. InfiniteKV (#2) compresse le KV cache en enregistrements de 104 bytes indexables stockés en RAM ou sur disque, permettant à Mistral-7B de répondre correctement au token 76 747 — soit 2,3× sa fenêtre d'entraînement de 32 768 tokens — avec un million de tokens ne nécessitant que ~3 GB au lieu de 122 GB. C'est une avancée d'infrastructure immédiatement déployable sur du matériel existant, sans retraining. En parallèle, Rigel (#9) révèle que l'opération matmul2d fp8 (E4M3) sur Apple M4 Max est émulée sur les shader cores GPU sans datapath matriciel dédié, accumulant en ≥fp32 à seulement 0,94× le débit fp16 — un résultat qui remet en question les hypothèses de performance des praticiens déployant des modèles sur Apple Silicon, et où un kernel GEMM fusionné récupère +6,5 à 12,9% en régime cache-resident.
Le troisième thème est la montée en puissance des modèles spécialisés compacts qui surpassent les géants généralistes sur des tâches à haute valeur. Pythagoras-Prover (#6) illustre parfaitement cette tendance : un modèle 4B paramètres open-source surpasse DeepSeek-Prover-V2-671B sur MiniF2F-Test (86,1% vs 82,4%) grâce au curriculum SFT et à l'Augmented Lean Formalisation, avec 167× moins de paramètres, tandis que le 32B atteint 93,0% sur MiniF2F-Test et résout 93/672 problèmes PutnamBench. MARD (#3) suit la même logique : 7B paramètres, +13,9 points de pourcentage vs la meilleure baseline et +6,7pp vs GPT-4o sur DrugBank avril 2026 pour la prédiction d'interactions médicamenteuses mécanistiques. PolyFact (#12) ajoute une dimension méthodologique importante : GRPO surpasse le fine-tuning supervisé pour la cohérence factuelle cross-lingue sur Qwen-2.5-7B et OLMo-2-1124-7B, en réduisant la spécialisation linguistique dans les couches MLP — un résultat qui devrait accélérer l'adoption du RL pour la post-formation multilingue.
La semaine à venir verra probablement les premiers benchmarks comparatifs indépendants du SDK Claude Agent face aux équivalents OpenAI et Google, forçant une clarification publique sur ce que signifie réellement "agent production-ready" en 2026.
Anthropic publie le SDK Python officiel pour Claude Agent. Permet de construire des agents autonomes utilisant Claude via une API Python native avec support des outils et du multi-turn.
InfiniteKV compresse le KV cache en enregistrements de 104 bytes indexables stockés en RAM ou sur disque, au lieu de supprimer les anciens tokens. Mistral-7B répond correctement à token 76,747 (2.3× sa fenêtre d'entraînement de 32,768). Un million de tokens nécessite ~3 GB au lieu de 122 GB.
MARD est un modèle de 7B paramètres pour prédire les interactions médicamenteuses au niveau mécanistique (enzyme, axe pharmacodynamique). Utilise distillation de raisonnement avec DPO pondéré par récompense de processus et récupération mécanisme-aware. Sur DrugBank avril 2026 : +13.9pp vs meilleure baseline, +6.7pp vs GPT-4o, avec généralisation robuste aux paires de médicaments inédites.
LEDGER est un benchmark de 4 999 rapports annuels d'entreprises numérisés pour évaluer les capacités long-contexte des LLM en finance. Le corpus inclut 31 KPIs financiers consolidés, 118 048 questions de retrieval TREC-style, et des tâches d'extraction sur documents denses. Étude de cas : corrélation entre rhétorique CEO et impact marché post-publication.
Arbor est un framework multi-agent introduisant la recherche arborescente comme couche de cognition pour agents autonomes. Validé sur l'optimisation d'inférence LLM full-stack, il associe un agent Orchestrator et un agent Critic avec architecture de poids et contrepoids. Arbor atteint 193% d'amélioration Pareto throughput-latency vs baselines optimisées, contre 33% pour un agent seul qui s'écroule en quelques heures.
Pythagoras-Prover est une famille open-source de prouveurs Lean efficaces (4B et 32B paramètres, incluant un prototype diffusion). Via curriculum SFT et Augmented Lean Formalisation (ALF), le modèle 4B surpasse DeepSeek-Prover-V2-671B sur MiniF2F-Test (86.1% vs 82.4%) avec 167x moins de paramètres. Le 32B atteint 93.0% sur MiniF2F-Test et résout 93/672 problèmes PutnamBench.
HKJudge est le premier corpus annoté au niveau phrase pour l'analyse du discours juridique. Il contient ~290k phrases et ~6.5M tokens de jugements criminels de Hong Kong, annotés par des experts en linguistique juridique. Deux tâches benchmark : classification de rôles rhétoriques (26 catégories) et extraction d'éléments légaux. Évaluation sur modèles BERT, LLMs open-source et commerciaux.
OpenMedQ est un modèle vision-langage médical préentraîné sur 14 datasets (~3.35M échantillons) couvrant pathologie, radiologie, microscopie et QA clinique. Il atteint 75.9 BLEU-1 sur PathVQA (surpassant Med-PaLM M 562B) et 0.757 macro-F1 moyen sur 8 benchmarks de classification médicale non vus.
Rigel caractérise empiriquement le chemin de calcul tensoriel Metal 4.1 sur Apple M4 Max. Les chercheurs découvrent que l'opération matmul2d fp8 (E4M3) est émulée, non accélérée (0.94x le débit fp16), exécutée sur les shader cores GPU sans datapath matriciel dédié, et accumule en ≥fp32. Un kernel GEMM fusionné gagne +6.5-12.9% en régime cache-resident.
MacArena est un benchmark de 421 tâches sur 50 applications macOS, évaluant les agents de computer use sur l'environnement natif Apple Silicon. Les résultats montrent que les modèles performants sur Linux régressent de 26% sur macOS, révélant que les benchmarks existants ne capturent pas la complexité réelle des interfaces graphiques multiplateformes.
ISE est un paradigme de synthèse en trois étapes pour générer des trajectoires d'agents OS multi-tours avec exécution réelle. 43 956 intents structurés, 23 132 trajectoires (8,12 tours utilisateur en moyenne), exécution live en sandbox. Fine-tuning Qwen3-8B sur ISETrace : ClawEval 19,3→37,7 pass@1, surpasse GPT-4o zéro-shot et Qwen3-32B.
PolyFact, un dataset de 100K questions factuelles multilingues sur Wikidata couvrant 12 langues, évalue trois approches pour améliorer la cohérence factuelle cross-lingue dans Qwen-2.5-7B et OLMo-2-1124-7B. GRPO surpasse le fine-tuning supervisé en réduisant la spécialisation linguistique dans les couches MLP et têtes d'attention, favorisant des représentations cross-lingues partagées.