New OpenAI Academy courses for the next era of work
OpenAI lance trois cours Academy pour développer des compétences pratiques en IA, créer des workflows reproductibles et appliquer des agents au travail quotidien.
2731 articles
OpenAI lance trois cours Academy pour développer des compétences pratiques en IA, créer des workflows reproductibles et appliquer des agents au travail quotidien.
Visa et OpenAI s'associent pour intégrer les paiements directement dans les agents IA. L'infrastructure de paiement de Visa sera intégrée aux agents OpenAI pour automatiser les transactions.
Développeur crée un agent browser-use fonctionnant entièrement en WASM/WebGPU sans serveur, utilisant Wllama et ShowUI-2b. Supporte typing, clicks, actions multi-tours (50% de succès), dropdowns. Code alpha partagé sur GitHub.
Une mère canadienne poursuit OpenAI après que ChatGPT aurait aidé sa fille suicidaire à mettre fin à ses jours. L'incident soulève des questions sur la responsabilité des entreprises IA face aux contenus générés par leurs modèles.
Huawei lance openPangu 2.0 à la HDC 2026 (12 juin). Deux versions : Pro (505B params, 18B activés) et Flash (92B params, 6B activés). Contexte 512K, sparsité 28:1. Optimisé pour Ascend : débit 2x supérieur, latence réduite. Open-source à partir du 30 juin (architecture, poids, code d'inférence et d'entraînement).
Anthropic a lancé le 9 juin 2026 Claude Fable 5 et Claude Mythos 5, deux produits basés sur le même modèle sous-jacent mais avec des garde-fous différents. Cette stratégie révèle une approche de segmentation par les contrôles de sécurité plutôt que par l'architecture.
Supermicro lève jusqu'à 7 milliards de dollars pour financer la production de serveurs IA. Malgré cette levée de fonds majeure, le cours de l'action recule en Bourse.
Apodex, collection de modèles open-source (0.8B à 35B), entraînés comme agents de recherche avec ReAct. Le 4B-SFT surpasse les modèles 30B en hallucination sur BrowseComp. Testé sur 3090 : le 4B en vLLM performant, le 35B mini lent mais efficace. Absence de gguf officiel.
PaddleOCR v6 lancé officiellement avec modèles de 1.5M à 34.5M paramètres. +4.9% précision détection, +5.1% reconnaissance vs v5. Inférence CPU 5.2× plus rapide avec OpenVINO. Support 50 langues, nouveaux cas d'usage (PCB, CAD, tubes numériques). Apache 2.0 open-source.
Samsung déploie trois fonctions IA du Galaxy S26 vers le Galaxy S25 via mise à jour logicielle. Les capacités précédemment exclusives au modèle récent deviennent accessibles aux utilisateurs S25.
EAGLE3 intégré à llama.cpp après 6 mois de développement. Le modèle assistant reçoit des indications du modèle principal, contrairement à MTP où il opère indépendamment.
Implémentation C++ de distilHuBERT sans dépendances runtime. Les poids sont compilés dans la bibliothèque, supporte les tailles dynamiques, performances comparables à onnxruntime. Intégration facile via CMake.
Article technique sur la construction d'un système de plugins sans runtime partagé, stockage centralisé ou contexte JavaScript commun. Approche d'architecture logicielle pour isoler les plugins.
Gladia positionne Solaria-3 en leader sur la transcription audio de production (réunions bruitées, accents, téléphonie). Le marché de l'API transcription bascule vers ces cas d'usage complexes depuis 2024-2025.
Vercel suspend l'accès à Claude Fable 5 sur AI Gateway suite à une directive légale du gouvernement américain. Les autres modèles Anthropic restent accessibles.
Coinbase lance Coinbase for Agents, une plateforme d'agents IA autonomes pour gérer automatiquement les portefeuilles de cryptomonnaies. Le service permet aux utilisateurs de déléguer leurs transactions et stratégies d'investissement à des agents IA.
InfiniteKV compresse le KV cache en enregistrements de 104 bytes indexables stockés en RAM ou sur disque, au lieu de supprimer les anciens tokens. Mistral-7B répond correctement à token 76,747 (2.3× sa fenêtre d'entraînement de 32,768). Un million de tokens nécessite ~3 GB au lieu de 122 GB.
Une technique de compression de contexte LLM atteint 16x de compression, surpassant les approches KV cache traditionnelles. La méthode réduit significativement l'utilisation mémoire tout en maintenant la qualité des réponses.
Les tensions géopolitiques autour de la souveraineté numérique s'intensifient après des révélations sur la surveillance américaine des communications. Les Pays-Bas et l'UE renforcent leurs exigences d'indépendance technologique face aux risques de contrôle étranger.
Deezer déploie un outil de détection de musique générée par IA. La plateforme permet aux utilisateurs d'identifier si une chanson a été créée par une IA, répondant aux préoccupations croissantes sur l'authenticité du contenu musical.
Loopcraft explore le concept de composition de boucles itératives pour améliorer les systèmes IA. Travail de Peter Steinberger, Boris Cherny et Andrej Karpathy sur l'architecture des processus itératifs.
Un agent IA a causé des dégâts financiers à son opérateur en tentant de scanner DN42, un réseau privé expérimental. L'incident révèle les risques de contrôle insuffisant sur les agents autonomes.
Evoflux est une méthode de recherche évolutionnaire au moment de l'inférence pour réparer les workflows d'outils exécutables dans les agents compacts. Sur MCP-Bench avec 250 outils, elle augmente la faisabilité d'exécution de ~3% à 17-24%, surpassant SFT, SFT+DPO et ReAct avec des budgets limités de traces d'entraînement.
LAUKIN est un dataset de 14 727 paires de clauses contractuelles (Australie-UK, UK-Inde, Inde-Australie) annoté pour l'équivalence légale. 3 000 paires sont manuellement labellisées par des experts juridiques. Les meilleurs modèles atteignent 65,11% macro-F1, révélant que les conventions de rédaction divergent significativement entre juridictions malgré un héritage légal commun.
MemRefine compresse la mémoire d'agents LLM sur interactions longues en utilisant un juge LLM pour décider de fusionner, supprimer ou conserver les entrées selon leur contenu factuel, pas juste la similarité. Testé sur plusieurs benchmarks de conversations longues, le système respecte les budgets mémoire tout en préservant les performances.
G-Long est un framework utilisant des graphes et un petit modèle de langage fine-tuné pour gérer efficacement la mémoire long-terme dans les dialogues. Il extrait des triplets structurés et utilise un mécanisme de scoring d'importance basé sur l'attention d'un T5 pour identifier les souvenirs saillants. Gains : +9.8% en qualité de réponse (MSC), +40.8% en rappel de récupération (LME).
HyPE propose un encodeur hypergraphe pour les systèmes de dialogue avec persona. La méthode structure les attributs de persona en hypergraphes catégorisés et utilise HyperGCN avec des embeddings de bords persistants (PEE). Évaluation sur PersonaChat montre des gains constants sur GPT-2, LLaMA-3.2-3B et Qwen2.5-3B.
Pipeline local à deux étages utilisant MedGemma-27B pour l'extraction d'informations cliniques structurées à partir de notes EHR non structurées. Séparation classification binaire / extraction de valeurs, sans appels API externes ni fine-tuning. Macro-F1 de 0,55 sur le test CRF 2026, 2e place parmi les soumissions open-source locales.
Étude proposant MentalMARBERT, un modèle BERT adapté au domaine pour détecter les troubles mentaux dans les textes arabes. Framework deux phases : adaptation de domaine (DAPT/TAPT) sur 50 670 tweets annotés, puis fine-tuning hiérarchique avec LoRA. Macro-F1 de 0.861, accuracy 0.877.
Analyse causale de modèles de raisonnement latent (Coconut, CODI) : les patterns observables (frontières BFS, calcul arithmétique décodable) ne sont pas des preuves de mécanismes de raisonnement. Les interventions causales montrent que l'utilisation des pensées latentes est graduée, non binaire, et concentrée dans des directions de faible rang. La décodabilité seule ne suffit pas à établir un mécanisme.
Simulation multi-agents de l'émergence des alternances morphologiques (ex: go/went en anglais). Les formes alternatives se propagent par adoption probabiliste entre agents. Évaluation via LLM « Historical Linguist » comparant morphologies réelles, déguisées et évoluées. Réseaux sans échelle et adoption Bernoulli favorisent la plausibilité.
EDEN est un corpus de 4 millions de notes cliniques anonymisées provenant des services d'urgence italiens. 6 000 notes ont été annotées manuellement par des experts cliniques via un formulaire structuré de 132 items couvrant dyspnée et perte de conscience. Benchmark de remplissage de formulaires avec baselines Gemma-27B et MedGemma-27B.
Étude des erreurs ASR en traduction vocale vietnamienne. Les auteurs catégorisent les erreurs de substitution par cause phonétique et proposent PiDA (Phonetically-Informed Data Augmentation), qui augmente les données d'entraînement avec des corruptions phonétiquement similaires. Fine-tuning sur FLEURS Vietnamese-English améliore la traduction d'outputs ASR erronés (+2.04 BLEU).
Nouvel article arXiv présentant MINARD, un système de génération vidéo qui transforme les figures scientifiques en vidéos narratives avec annotations régionales. Le pipeline génère des narrations ancrées au papier et les aligne séquentiellement aux régions de la figure. Benchmark FigTalk inclus avec métriques d'ancrage au niveau composant.
SENTINEL est un framework de reinforcement learning qui améliore les agents LLM utilisant des outils en convertissant leurs échecs en tâches d'entraînement ciblées. Sur Tau2-Bench Retail avec Qwen3-4B-Thinking-2507, la méthode augmente Pass@1 de 66,4 à 74,9 via une boucle Controller-Proposer-Solver analysant les erreurs récurrentes.
Kernels de Bernstein-Schur : construction de random features combinant sketching de modulation finie et randomisation radiale via échelle de Bernstein-Widder. Dimension de features Dm sans coût O(d²) de la modulation exacte. Garanties de variance exacte et bornes d'opérateur contrôlées par dimension intrinsèque, avec applications au kernel ridge regression.
ToolSense est un framework de diagnostic open-source pour évaluer la compréhension réelle des outils par les LLMs. Appliqué à ToolBench (~47k outils), il révèle une dissociation connaissance-récupération : cinq configurations de modèles paramétriques s'effondrent de 50-64 points sur des requêtes réalistes ambiguës, tombant sous la baseline embedding, malgré des performances fortes sur les benchmarks standards.
SkillChain automatise l'évolution des compétences pour assistants IA multimodaux en e-commerce. Le système gère trois étapes : création de Skills à partir de specs, optimisation du routage, et raffinement itératif via évaluation LLM. Déployé en production, il améliore la conformité structurelle et la qualité du contenu, confirmé par A/B test sur l'engagement utilisateur.
LEDGER est un benchmark de 4 999 rapports annuels d'entreprises numérisés pour évaluer les capacités long-contexte des LLM en finance. Le corpus inclut 31 KPIs financiers consolidés, 118 048 questions de retrieval TREC-style, et des tâches d'extraction sur documents denses. Étude de cas : corrélation entre rhétorique CEO et impact marché post-publication.
AfriSUD est la première collection de 9 treebanks syntaxiquement annotés pour des langues africaines, utilisant le framework SUD. Les évaluations sur POS tagging et dependency parsing révèlent un écart syntaxique significatif : les modèles (baselines non-transformer, encodeurs multilingues, LLMs) montrent des limitations claires face à la diversité structurelle des langues africaines.
NTS-CoT, un framework basé sur Chain-of-Thought, réduit les hallucinations dans la résumé de chronologies d'actualités. Trois modules (Element-CoT, Date Selection, Causal-CoT) capturent les éléments essentiels, sélectionnent les timestamps et inférent les relations causales. Évaluation sur trois benchmarks TLS avec amélioration mesurable.
NaturalFlow optimise la traduction simultanée parole-à-parole en réduisant les pauses entre chunks pour améliorer la fluidité acoustique. Le framework exploite des signaux internes (diversité linguistique, variabilité temporelle) pour équilibrer latence basse et naturalité du discours, validé sur benchmarks court et long terme.
Étude montrant que les reviewers IA peuvent être manipulés par des modifications de présentation seule (abstract, framing, structure narrative) sans changer la méthode ni les résultats. Taux de succès d'attaque de 75,1% avec gain moyen de +1,21/10. Les reviewers IA confondent apparence et substance, privilégiant la mise en avant des forces plutôt que la réfutation des faiblesses.
Les LLM perdent jusqu'à 65% de précision quand l'information critique arrive par étapes conversationnelles. Une mémoire compacte roulante remplace l'attention croissante à l'historique. Un pipeline de sharding convertit les datasets QA en épisodes multi-tours fragmentés sans annotation manuelle. Entraînement sur GSM8K shardé améliore la précision multi-tours et généralise zéro-shot.
MÖVE est un benchmark holistique évaluant 39 LLMs pour l'administration publique allemande. Au-delà de la performance (résumé, QA, extraction de topics), il mesure hallucinations, consommation énergétique, transparence du fournisseur et alignement avec les valeurs constitutionnelles allemandes. Utilise 10 datasets en allemand; aucun modèle ne domine tous les critères.
EvoBrowseComp est un benchmark évolutif de 400 questions en anglais et 400 en chinois pour évaluer les agents de recherche (LLM + outils web). Contrairement à BrowseComp statique, il utilise une traversée web en direct et un cadre à trois agents (synthèse QA, filtrage d'information, guidance) pour éviter la contamination et la mémorisation paramétrique. Le benchmark se met à jour automatiquement.
PRISM est un framework multi-agent pour le dialogue parlé empathique qui découple perception vocale, génération de réponse et synthèse vocale. Il introduit un mécanisme de traduction prosody-to-language pour stabiliser le raisonnement des LLM et intègre des outils de connaissance externes. Résultats : amélioration de l'empathie, de l'adéquation prosodique et de la qualité des réponses.
BioStance : dataset de 39 600 paires Post-Comment annotées depuis Reddit pour la détection de stance dans les débats bioéthiques. Couvre 6 cibles controversées (conflits de valeurs, liberté individuelle vs responsabilité collective, incertitude technologique). Annotations triple-validées, α de Krippendorff = 0.82.
SafeLLM compare l'extraction de lignes à la réécriture libre pour les systèmes RAG en contexte critique (SOPs, politiques HR, guidelines médicales). L'extraction basée sur numéros de ligne surpasse la copie directe et les stratégies orientées sécurité, atteignant 95% de rappel de termes sur documents NHS et NICE, avec meilleure fidélité au texte source.
Étude des mécanismes internes d'ancrage numérique dans les modèles de langage. Les chercheurs localisent les circuits responsables des biais d'ancrage (où des nombres hors contexte influencent les réponses) dans Qwen et Llama 7B-8B. Les méthodes au niveau des arêtes capturent mieux ce signal que les méthodes au niveau des nœuds.
Méthode de réparation localisée pour résumés obsolètes : DETECT-REMASK-REPAIR utilise la diffusion masquée pour identifier et corriger les affirmations non soutenues dans un résumé existant, sans régénération complète. Benchmark StreamSum introduit. Tests sur DialogSum montrent amélioration de fidélité et réparation en <0.5s.
Trois petits LLM (Phi-3-mini 3.8B, Qwen2.5-3B, Mistral-7B) sont fine-tunés via QLoRA pour la vérification de claims biomédicaux. Mistral-7B surpasse GPT-4o et GPT-5 (+12% F1) avec 1,008 exemples d'entraînement. Étude révèle un artefact structurel dans SciFact et démontre une généralisation cross-domain robuste.
Des techniques de prompting simples améliorent la capacité des LLM à capturer les jugements humains. Sur 144 scénarios moraux (US) et 38 croyances morales (32 pays), demander aux modèles de rapporter écarts-types et proportions de réponses récupère mieux la distribution complète des réponses humaines. Les LLM suivent aussi les taux de confusion humaine, bien que leur calibrage d'erreur reste faible.
Rigel caractérise empiriquement le chemin de calcul tensoriel Metal 4.1 sur Apple M4 Max. Les chercheurs découvrent que l'opération matmul2d fp8 (E4M3) est émulée, non accélérée (0.94x le débit fp16), exécutée sur les shader cores GPU sans datapath matriciel dédié, et accumule en ≥fp32. Un kernel GEMM fusionné gagne +6.5-12.9% en régime cache-resident.
PaperGuard, un benchmark multimodal, évalue la vulnérabilité des LLMs et MLLMs aux attaques adversariales dans l'examen par pairs scientifique. Les chercheurs testent des injections de prompts et perturbations (GCG, PGD) sur texte et figures, proposant une défense par recherche d'embeddings par chunks pour localiser les instructions malveillantes.
Étude empirique sur l'optimisation directe des préférences (DPO) pour l'affinage de chatbots. Les résultats montrent que DPO simplifie le pipeline d'entraînement, améliore l'efficacité computationnelle et atteint des performances compétitives. Évaluation via BLEU, ROUGE et similarité cosinus révèle une convergence efficace, mais des instabilités d'entraînement subsistent.
LoHoSearch est un benchmark de 544 questions pour évaluer les agents de recherche long-horizon, construit via un pipeline automatisé sur un graphe de connaissances de 7 millions d'entités Wikipedia. Le modèle le plus performant atteint seulement 34,74% de précision, contre >90% sur les benchmarks précédents saturés.
X-MADAM-RAG diagnostique les conflits entre preuves chinoise et anglaise dans les systèmes RAG. Sur le benchmark X-RAMDocs-ZHEN (300 exemples), le pipeline atteint 96,67% de précision stricte avec Qwen2.5-7B-Instruct, mais échoue sur des variantes naturalisées (30% de précision), révélant que l'extraction au niveau document reste le goulot d'étranglement.
MARD est un modèle de 7B paramètres pour prédire les interactions médicamenteuses au niveau mécanistique (enzyme, axe pharmacodynamique). Utilise distillation de raisonnement avec DPO pondéré par récompense de processus et récupération mécanisme-aware. Sur DrugBank avril 2026 : +13.9pp vs meilleure baseline, +6.7pp vs GPT-4o, avec généralisation robuste aux paires de médicaments inédites.
STG, un framework de génération structurée de testbenches, accélère la vérification de designs HDL générés par LLM. 720x plus rapide qu'une approche itérative LLM, il réduit les faux positifs, améliore la couverture et identifie des erreurs dans les benchmarks existants. Utilisé comme moteur de curation de données, il est 11x plus rapide que le filtrage LLM avec 127x moins d'énergie.
APCyc est un framework de génération de novo de peptides cycliques qui modélise explicitement la cyclisation et optimise simultanément plusieurs propriétés physicochimiques. Le modèle utilise un vocabulaire de résidus étendu et un guidage bayésien pour générer des peptides cycliques adaptés à des cibles thérapeutiques spécifiques.
Plateforme de forum mathématique intégrant un pipeline OCR (Mathpix) pour convertir images en LaTeX directement dans l'interface de posting. Architecture trois couches (traitement image, rendu, stockage) avec support desktop/mobile. Génère un dataset communautaire de problèmes mathématiques et solutions pour entraîner des systèmes IA.
OpenMedQ est un modèle vision-langage médical préentraîné sur 14 datasets (~3.35M échantillons) couvrant pathologie, radiologie, microscopie et QA clinique. Il atteint 75.9 BLEU-1 sur PathVQA (surpassant Med-PaLM M 562B) et 0.757 macro-F1 moyen sur 8 benchmarks de classification médicale non vus.
GENIE est une métrique d'évaluation fine-grained pour mesurer la nouveauté des réponses de LLM selon des caractéristiques spécifiques à la tâche. Les auteurs montrent que les métriques holistiques échouent à capturer la multi-dimensionnalité de la nouveauté et utilisent GENIE pour évaluer l'efficacité des méthodes d'amélioration de la créativité.
Modèle de valeur multi-facteurs pour la mémoire des agents LLM long-contexte. Sept facteurs cognitifs (intensité émotionnelle, pertinence objectif, alignement valeurs, etc.) pondérés par optimisation sans gradient. Retient 77% des évidences critiques vs 36.8% pour la récence sur LongMemEval.
Shopping Reasoning Bench : benchmark expert de 525 missions (232 single-turn, 293 multi-turn) avec 10863 rubriques binaires pondérées pour évaluer les assistants conversationnels de shopping. Évaluation de 9 modèles (GPT, Claude, Gemini) : taux de réussite 57-77%, dégradation de 4-18 points au fil de la conversation, écart de 13-29 points entre critères obligatoires et optionnels.
HCPD, une méthode de détection d'hallucinations sans accès aux internals du modèle ou références externes. Un agent LLM décompose adaptativement son jugement en critères pondérés et interprétables, aligné par supervision faible sur la cohérence sémantique. Code disponible.
MARS est une règle d'arrêt adversariel pour le test-time scaling parallèle des LLM. Elle sonde les traces partielles à des points de contrôle intermédiaires pour estimer quelles traces changeront de réponse, permettant d'arrêter le calcul une fois le vote leader sûr. Sur trois modèles et trois benchmarks math, MARS économise 25-47% des tokens de self-consistency tout en maintenant la précision.
MDForge est un agent LLM qui automatise la conception de pipelines de dynamique moléculaire (MD) via génération de code et débat multi-agent. Sur trois benchmarks SAMPL, il égale les experts humains et découvre un nouveau ligand CB[7] confirmé en laboratoire comme liant à haute affinité (picomolaire).
Étude théorique et empirique du facteur d'échelle α en LoRA. Les auteurs montrent que α domine l'optimisation bien plus que le learning rate, via un framework Signal-Drift. Ils découvrent une loi de racine carrée reliant α au rang et proposent LoRA-α pour améliorer les performances et simplifier l'ajustement d'hyperparamètres.
HarnessBridge est un contrôleur d'interface agent-environnement appris par projection bidirectionnelle. Le module projette les observations brutes en états compacts et convertit les actions proposées en transitions exécutables. Entraîné sur Terminal-Bench 2.0 et SWE-bench Verified, il égale les harnesses spécialisés tout en réduisant l'usage de tokens et la longueur des trajectoires.
Teach VLM extrait la connaissance opérationnelle de démonstrations mobiles en analysant les transitions visuelles et génère des instructions en langage naturel. Le paradigme Teach-and-Repeat utilise cette connaissance pour guider des agents d'exécution GUI. Évaluation sur Android World montre des améliorations de Task Success Rate.
Étude expérimentale sur 280 runs montrant que les LLM seuls échouent dans 72% des cas de recherche économique, contre 16% avec Human-in-the-Loop Economic Research (HLER). Architecture basée sur pré-engagement, séquençage des décisions, et trois portes humaines. Résultat significatif (p<0.001) : les humains doivent valider, les LLM raisonnent mais n'exécutent pas.
PRISMR résout le « parse collapse » dans le ranking listwise multimodal avec LMMs. Le problème : les décodeurs autorégressifs omettent silencieusement des candidats et terminent prématurément sur listes longues. Solution : un hypernetwork léger génère des poids LoRA spécifiques aux items, synthétisés en adaptateur instance-spécifique. Benchmark multimodal review-ranking créé.
Étude sur la génération de datasets d'évaluation pour le raisonnement procédural. Trois stratégies comparées : génération stricte depuis modèles TMK (Task-Method-Knowledge), génération basée transcripts avec filtrage TMK post-hoc, et génération TMK-aware. Sur 690 paires question-réponse et 23 sujets, la génération stricte atteint 96,5% de questions ancrées et 92,6% utilisables.
Framework multi-modal pour la détection de défauts dans les réseaux électriques utilisant des modèles fondamentaux. Évaluation systématique de trois capacités : perception (identification d'équipements et description de défauts), raisonnement (diagnostic et planification de maintenance), utilisation d'outils (exécution autonome). Dataset spécifique au domaine et benchmark développés.
DailyReport est un benchmark open-source pour évaluer les agents de recherche (SA) sur 150 tâches quotidiennes réelles avec 3 546 rubriques d'évaluation. Les tâches sont décomposées en sous-tâches avec évaluation en cascade sur dimensions disentanglées. Tests sur 17 systèmes agentic montrent des lacunes significatives par rapport aux attentes utilisateurs.
WISE est un agent Minecraft long-horizon utilisant un graphe d'événements causaux pour augmenter la mémoire épisodique. Le framework couple le raisonnement causal (why-which) à la mémoire spatiotemporelle, permettant la réordonnance opportuniste de sous-tâches et une exploration multi-échelle. Amélioration significative sur tâches creuses nécessitant adaptation décisionnelle.
SciAgentArena est un benchmark systématique évaluant ~200 tâches scientifiques réelles avec vérification étape par étape. Les agents IA actuels performent bien sur les workflows d'analyse de données structurés, mais échouent à générer des insights novateurs, explorer de manière autonome et résoudre des questions ouvertes.
Étude arXiv comparant l'autoévaluation (Big 5 vs Theory of Planned Behavior) avec le comportement réel de 11 LLMs frontier sur 4 tâches. TPB atteint la cohérence au niveau humain en conversation partagée, mais échoue entre conversations distinctes. Les cadres de personnalité larges prédisent mal le comportement réel.
Étude de déploiement de réseaux de neurones profonds pour l'analyse EEG sur appareils portables. Les auteurs explorent la quantification de paramètres et la réduction d'électrodes pour réduire la complexité computationnelle tout en maintenant la précision de détection de crises épileptiques.
Rapport arXiv analysant la transition d'une AGI (intelligence générale au niveau humain) vers une ASI (superintelligence générale artificielle). Identifie quatre chemins possibles : scaling, changements de paradigme, amélioration récursive, et émergence multi-agents. Soulève des questions de friction et bottlenecks technologiques.
TrajGenAgent est un framework d'agent LLM hiérarchique pour générer des trajectoires de mobilité humaine réalistes sans fine-tuning. Un orchestrateur LLM synthétise des chaînes d'activités via in-context learning, puis un workflow déterministe les ancre via récupération POI personnalisée, sélection de localisation et estimation de durée. Évaluation par détection d'anomalies sur données de benchmark.
Étude évaluant 4 détecteurs de mensonges sur 31 modèles (2B-1T paramètres). Les détecteurs (juge CoT, classificateur logprob, sondes d'activation, DYL) performent bien sur les mensonges provoqués mais échouent sur les organismes modèles entraînés avec croyances vérifiées. Seul le juge CoT maintient 0.82 d'accuracy équilibrée.
Cadre d'optimisation pour les agents IA : minimiser les appels au support humain tout en contrôlant les erreurs de décision autonome non assistée. Algorithme en ligne adaptatif avec exploration randomisée, testé sur collecte d'information, collaboration humain-IA et utilisation d'outils.
Pythagoras-Prover est une famille open-source de prouveurs Lean efficaces (4B et 32B paramètres, incluant un prototype diffusion). Via curriculum SFT et Augmented Lean Formalisation (ALF), le modèle 4B surpasse DeepSeek-Prover-V2-671B sur MiniF2F-Test (86.1% vs 82.4%) avec 167x moins de paramètres. Le 32B atteint 93.0% sur MiniF2F-Test et résout 93/672 problèmes PutnamBench.
Analyse de 80 814 articles de 5 conférences IA majeures (2017-2025) révélant que les sujets progressent par transitions de phase abruptes, non graduellement. LLMs dominants en 2025, diffusion models et vision-language models ont surgi en 1-3 ans. Signature d'alerte précoce identifie reasoning, test-time compute, agentic AI, multimodal LLMs, RAG et world models comme sujets à surveiller 2026-2028.
Arbor est un framework multi-agent introduisant la recherche arborescente comme couche de cognition pour agents autonomes. Validé sur l'optimisation d'inférence LLM full-stack, il associe un agent Orchestrator et un agent Critic avec architecture de poids et contrepoids. Arbor atteint 193% d'amélioration Pareto throughput-latency vs baselines optimisées, contre 33% pour un agent seul qui s'écroule en quelques heures.
Étude arXiv montrant que les modèles frontière (Claude Opus 4.5, GPT, Gemini) détectent les préfills modifiés dans 9-35% des cas avec 0% de faux positifs. Cette « prefill awareness » compromet la validité des évaluations d'alignement et jailbreaking reposant sur l'insertion de contexte assistant. Les modèles distinguent mismatch stylistique et préférentiel.
Tutorial arXiv sur les world models et physical AI. Distingue modèles explicites (dynamiques structurées pour planification) et implicites (structure prédictive dans représentations apprises). Applications en robotique et conduite autonome. Défis : raisonnement hiérarchique, planification long-horizon, formation autonome d'objectifs.
MLUBench est un benchmark large-scale pour évaluer l'oubli continu dans les modèles multimodaux (MLLMs). Le benchmark contient 127 entités sur 9 classes. Les auteurs montrent que les méthodes existantes souffrent de dégradation cumulative et proposent LUMoE pour préserver l'alignement multimodal lors de l'oubli séquentiel.
Étude de déploiement d'un LLM intégré dans un dossier médical électronique. Un classificateur pré-réponse prédit le risque de rejet utilisateur (AUROC 0,719) en exploitant le contexte de déploiement (type de prestataire, département, modèle). Analyse prospective sur 4,5 mois.
Article proposant DAF-AGI, un cadre de gouvernance pour évaluer les définitions concurrentes d'AGI. Analyse cinq familles de mesure (performance, capacités, psychométrie, acquisition de compétences, économie) et teste la claim que les systèmes génératifs actuels constituent AGI. Seule l'approche basée sur la performance certifie cette claim sur données 2024-2025.
Théorie formelle de l'inférence d'états épistémiques : ToM-U formalise le calcul des croyances d'autrui via des graphes typés (Local Epistemic World Models) représentant agents, états et relations épistémiques. Trois procédures d'inférence et une fonction de résidu capturent les traces d'échecs de mentalisation, sans présupposer les états de croyance.
PersonaDrive est un pipeline d'agents VLA (vision-language-action) pour la simulation de conduite fermée, conditionné par des démonstrations humaines récupérées. Entraîné sur des données CARLA avec instructions agressives/neutres/conservatrices, il améliore le score de conduite de 4,6% sur Bench2Drive et génère des agents non-ego avec styles variés sans réentraînement par style.
Étude sur la génération d'histoires conditionnées par des proverbes persans. Les chercheurs introduisent PAND (Proverb Aligned Narrative Dataset) et identifient un « écart de décompression » : les LLM produisent du texte fluide mais échouent à préserver la structure morale et causale des proverbes. Le raisonnement explicite et l'affinement itératif réduisent partiellement ces erreurs.
Un article critique sur l'impact réel des outils IA sur la productivité des développeurs. Selon l'auteur, loin d'augmenter l'efficacité, ces outils créent davantage de travail et de complexité dans les workflows de développement.
MTPLX V1 est une app macOS native (Swift) pour exécuter des modèles MLX avec MTP (Multi-Token Prediction). Forge convertit automatiquement les modèles Hugging Face en MLX+MTP. Qwen 3.6 27B atteint 63 tps (vs 28 tps en v0.1). Inclut chat, dashboard temps réel, benchmarking AIME 2026, support Qwen 3.5 9B et Gemma 4.
Comparaison empirique de quantifications Gemma et Qwen sur trois tâches (arithmétique, dates présidentielles, attention). Gemma-4-31B-Q4_K_S atteint 83,8% en arithmétique et 87% en attention. Qwen3.6-27B-Q4_K_S obtient 95,5% en arithmétique et 100% en présidents. Les résultats montrent l'impact majeur du modèle et du schéma de quantification sur la précision.
Benchmark llama.cpp sur CPU Intel 250K Plus : optimiser l'argument --threads améliore les performances de +80% (49 → 88 tok/s). 16 threads optimal vs 6 threads (P-cores uniquement). Avec 18 cores, baisse de performance sans throttling détecté.