OpenAI public policy agenda
OpenAI publie son agenda politique pour l'IA couvrant la sécurité, la protection des jeunes, la transition professionnelle et les normes mondiales afin que l'IA bénéficie à la société.
2731 articles
OpenAI publie son agenda politique pour l'IA couvrant la sécurité, la protection des jeunes, la transition professionnelle et les normes mondiales afin que l'IA bénéficie à la société.
Meta ajuste son initiative MCI (Model Capability Initiative) suite à des critiques internes d'employés. L'entreprise renforce les protections concernant le suivi des gestes des salariés utilisés pour entraîner ses modèles IA.
Trump a signé un décret permettant aux entreprises d'IA de partager leurs modèles. La régulation proposée reste volontaire et dépend de l'adhésion des géants technologiques.
Benchmark de spatial reasoning sur LLMs avec Sokoban en zéro-shot. ChatGPT, Qwen3.7-max et Gemini 3.5-thinking réussissent ; Gemini 3.5-flash, Qwen 3.6/3.7-plus, GLM-5 et Gemma4 échouent. Format strict (UP/DOWN/LEFT/RIGHT uniquement) élimine le chain-of-thought.
Les éditeurs britanniques peuvent désormais refuser que leurs contenus apparaissent dans les résultats de recherche IA de Google. Cette option s'ajoute aux mécanismes existants de contrôle du contenu.
Microsoft dévoile Scout, un agent autonome intégré à Microsoft 365 capable d'organiser, coordonner et exécuter des tâches en continu pour automatiser le travail en entreprise.
Helvete-nano, un modèle 2B compact, a été publié pour les conversations sans restrictions et la liberté créative.
Un malware exploite la popularité de Minecraft et a infecté plus de 116 000 victimes. La propagation s'accélère, nécessitant une vigilance accrue des utilisateurs.
Microsoft présente MAI-Thinking-1 et la famille MAI lors de Build. Nouveaux modèles avec détails techniques spécifiés.
H Company (France) lance Holo3.1, famille de VLM fine-tunés sur Qwen 3.5 pour agents informatiques. Modèles 0.8B à 35B-A3B, support web/desktop/mobile, fonction-calling native, quantifications multiples (BF16, FP8, Q4 GGUF). Licence Apache 2.0.
DeepL publie une étude sur la traduction vocale en temps réel en contexte B2B. L'article présente les chiffres clés de cette recherche sur l'adoption de la traduction vocale comme prochaine étape de l'IA linguistique.
Mellum et Granite, deux modèles d'embedding, sont désormais disponibles sur llama.cpp. Deux pull requests intègrent leur support dans le framework.
llama.cpp build b9455 avec tensor-split atteint 70+ tokens/s sur Qwen3.6-27B-UD-Q8_K_XL avec 2x3090, rivalisant avec vllm. Spéculative decoding MTP et flash-attention activés. Contexte jusqu'à 262K tokens, prefill à 1400+ t/s.
Microsoft annonce deux modèles on-device à Build 2026 : Aion 1.0 Instruct (petit modèle efficace, open-weights, concurrent d'Apple AFM-3B) et Aion 1.0 Plan (14B paramètres, reasoning + tool-calling, 32K contexte, intégré à Windows). Aion 1.0 Plan supporte workflows agentic locaux.
Microsoft lance Solara, un système d'exploitation dédié à l'IA. La plateforme vise à optimiser l'exécution des charges de travail d'intelligence artificielle avec une architecture spécialisée.
Étude sur 6000 paires tâche-condition montrant que le débat multi-agent dégrade la génération (-1.6 à -15.5pp) via confusion induite par critique, mais améliore la détection d'erreurs (+27.4pp F1). Une séparation adversariale avec vérification par code et génération contrôlée atteint +5.3pp sur tâches génératives.
GRZO est un optimiseur zeroth-order pour fine-tuner les LLM avec moins de mémoire. Il génère une perturbation par exemple du mini-batch et normalise les pertes par groupe, augmentant le nombre de directions de gradient du batch sans coût forward supplémentaire. Sur Llama3-8B, GRZO gagne +3.0 points vs MeZO avec 23% moins de mémoire GPU.
IdiomX est un benchmark multilingue à grande échelle pour la compréhension des expressions idiomatiques, contenant 190K+ exemples contextualisés couvrant 12K+ idiomes en anglais, arabe et français. Le dataset inclut des étiquettes d'usage idiomatique/littéral et des métadonnées linguistiques. Quatre tâches évaluent la détection, la récupération et l'interprétation d'idiomes.
Étude de la « dette de passation » : le coût de redécouverte quand un agent de codage reprend une tâche interrompue. Sur 75 tâches et 724 exécutions, fournir des notes structurées réduit les événements médians de 20–59 % et les tokens de 42–63 % vs. état du dépôt seul. Les benchmarks d'agents doivent évaluer l'efficacité de reprise, pas seulement la résolution.
RRISE compresse la certification de robustesse par randomized smoothing en un seul forward pass via un surrogate appris, remplaçant jusqu'à 10⁴ évaluations Monte Carlo par requête. Calibration conforme garantit des rayons certifiés conservateurs. Sur CIFAR-100 et Tiny ImageNet, 1.23–1.91× meilleure précision certifiée que les méthodes offline antérieures.
SNMPBB, première adaptation des méthodes de Barzilai-Borwein non-monotones au problème de factorisation matricielle symétrique non-négative (Symmetric NMF). Démontre 6× d'accélération vs SymANLS sur données synthétiques. Extensions pour clustering de graphes (Graph-SNMPBB) et problèmes large-scale (LAI-SNMPBB) avec convergence globale prouvée.
Étude arXiv sur la prédiction de récidive du cancer du sein via apprentissage multi-modal. Intègre dossiers de traitement, rapports de pathologie et notes cliniques. Utilise extraction par regex et réconciliation des conflits pour extraire caractéristiques tumorales du texte libre. Démontre que l'intégration multi-modale améliore la précision prédictive vs approches mono-modales.
RelGT-AC étend RelGT pour les tâches d'autocomplétion sur bases de données relationnelles. Le modèle combine un masquage de colonnes, une tête unifiée (classification/régression) et un encodeur TF-IDF pour texte libre. Sur 7 tâches RelBench v2, il surpasse GraphSAGE sur 3 tâches de régression et gagne +10 AUROC sur tâches textuelles.
Benchmark d'évaluation des attitudes environnementales dans 31 LLMs (propriétaires et open-source). Les modèles affichent des positions plus progressistes que la moyenne des répondants allemands, mais sans lien systématique avec l'origine, la taille ou le contexte de release. Risque de manipulation par prompting et dérives sycophantiques détectées.
Étude arXiv sur les représentations des LLM : le chevauchement lexical influence les embeddings plus que le contenu sémantique, persiste à travers les couches et architectures, et dégrade les performances en résumé et édition de modèles.
Étude arXiv montrant que les LLM ne déduisent pas bien les caractéristiques socio-démographiques des utilisateurs à partir d'un historique conversationnel unique. Les disparités observées dans les conseils (juridique, médical, financier) sont faibles mais présentes. Les sujets de conversation s'avèrent plus prédictifs que les données socio-démographiques et affectent les réponses de manière imprévisible.
Les chercheurs proposent Bank of Values (BoV), une méthode remplaçant les vecteurs de valeur contextuels par des vecteurs sans contexte stockés comme paramètres creux dans les derniers tiers des couches. Sur modèles 135M et 780M, BoV améliore la perte de validation et les performances sur 21 benchmarks avec moins de calcul et mémoire.
Padyam2Gadyam : dataset de 600 poèmes télougous classiques (13e-17e siècles) avec traductions en prose télougou et anglaise modernes. Évaluation de 5 LLM contemporains révèle des performances insuffisantes et des limites des métriques MT existantes.
Audit systématique des benchmarks FOLIO et MALLS révélant 39% et 36% d'erreurs dans les formalisations FOL. Les auteurs publient des annotations corrigées et un framework LLM pour guider la relabélisation manuelle, permettant d'atteindre 90% de précision en révisant <24% des instances. Tests sur Gemma 31B, Qwen3-30B et GPT-4o-mini montrent des gains de +9 à +22 points.
ALAR (Adaptive Latent Agentic Reasoning) est un framework dual-mode qui alterne entre raisonnement latent compact et chain-of-thought explicite selon la difficulté. Entraîné sur les actions de l'agent, il réduit les tokens générés de 43,6% en recherche et 84,6% en tool-use tout en maintenant la précision.
Framework combinant prédiction conforme et représentation collaborative pour analyser le comportement des LLM face aux annotateurs humains en modération de contenu. Introduit la métrique Ghost Prediction pour quantifier les divergences modèle-humains. Évaluation sur 4 LLM et 4 datasets révèle que les grands modèles sont plus confiants sur textes sans alignement humain, avec biais démographique structurel.
Étude sur la productivité linguistique dans les LLM : les modèles reproduisent l'entrenchissement (structures fréquentes) mais échouent à implémenter la préemption (absence observée de structures). Les grands modèles gèrent la coercition contextuelle mais surpassent les patterns jamais vus dans les données.
EURO-5K est un corpus de 5K phrases annotées pour l'extraction d'obligations de reporting dans la législation EU (136 actes législatifs). Comparaison de modèles BERT fine-tunés et LLMs (QLoRA) : BERT générique et juridique atteignent 0.89 F1 similaire ; le préentraînement juridique aide surtout en tuning efficace en paramètres. Convergence à 3K samples.
Méthode pour prédire les gains de scaling en inférence (best-of-N) sans exécuter la procédure complète. Ridge predictor identifie 3 features stables (accord inter-prompts, position du premier échantillon correct, variance de longueur) + entropie, atteignant ρ=0.90 de corrélation avec les gains réels sur familles de modèles et tâches math/reasoning.
Système de conseil académique basé sur RAG déployé localement pour aider les étudiants à sélectionner des cours en respectant les prérequis. Combine LLM et récupération de données de syllabus structurées, préservant la confidentialité des données.
TypewriterLM est un modèle de langage de 7.24B paramètres entraîné exclusivement sur du texte anglais antérieur à 1913. Les auteurs construisent TypewriterCorpus (54B tokens), un corpus historique nettoyé avec procédures anti-fuite, et introduisent lexically grounded instruction tuning pour ancrer les réponses dans des documents historiques. Trois datasets et un benchmark (History-Event) sont publiés.
HDPO (Hint-Guided Diversified Policy Optimization) améliore le raisonnement des LLM via renforcement avec récompenses vérifiables. La méthode incite le modèle à générer d'abord plusieurs approches candidates (hints), puis sélectionner la plus fiable. Deux étapes : Cold Start pour structurer le raisonnement, puis RL guidé par hints pour diversifier et fiabiliser les solutions.
Nouvelle méthode d'inférence DCO (Dynamic Contextual Orthogonalization) pour réduire les hallucinations dans les LLM. Basée sur l'hypothèse que les hallucinations sont du bruit orthogonal au manifold sémantique du residual stream. Testée sur Llama-3 (8B/70B) avec gains sur XSum, NQ-Swap, IFEval et TriviaQA.
SEA-Embedding est un pipeline d'embeddings textuels open-source et reproductible pour les langues d'Asie du Sud-Est, entraîné uniquement sur données publiques. L'étude analyse trois facteurs clés : composition des données, objectif d'entraînement et initialisation de l'encodeur. Résultats SOTA sur SEA-BED.
SkillDAG modélise les relations entre compétences d'agents LLM comme un graphe typé orienté, permettant une sélection dynamique de compétences à l'inférence. Sur ALFWorld et SkillsBench avec MiniMax-M2.7, le système atteint 67,1% de succès et 27,3% de récompense, surpassant les baselines Graph-of-Skills de +12,8 et +8,6 points. Le graphe s'enrichit pendant l'exécution via un protocole propose-then-commit.
CORE est un framework qui entraîne les MLLMs à détecter les fake news multimodales en identifiant les conflits sémantiques ou physiques entre modalités. Utilisant un corpus annoté (CAC) avec facteurs de conflit, CORE généralise à des manipulations inédites en few-shot ou zero-shot, surpassant les méthodes existantes.
DeltaMem organise la mémoire d'expérience des agents LLM en deux arbres résiduels : l'un stocke les tâches comme compétences réutilisables, l'autre les connaissances environnementales. Chaque arbre utilise des nœuds racine pour les expériences généralisées et des nœuds delta pour les variations, éliminant la redondance. Un mécanisme de consolidation autonome distille les chemins fréquents en nouveaux nœuds racine.
Papier arXiv proposant CLEAR, une méthode d'allocation optimale de budget de calcul pour l'inférence LLM basée sur la théorie économique. Via une fonction d'utilité « shifted-surge » et un prix fantôme global, CLEAR abandonne les requêtes non-solvables et réalloue les ressources. Résultats : 3x d'amélioration en précision globale vs allocation uniforme en régimes de ressources limitées.
Étude de la géométrie représentationnelle pour comprendre comment les prompts modifient le comportement des LLMs et VLMs. Framework de décomposition imbriquée testant translation, transformation rigide, scaling, transformation affine et non-linéaire sur 3 LLMs, 3 VLMs et 6 datasets. Résultat : le mixing linéaire cross-dimensionnel (transformation affine) est le mécanisme clé de réorganisation représentationnelle.
Nouvelle méthode pour intégrer les actualités dans la prévision de séries temporelles via compression intelligente et supervision de retrieval. Un modèle de récompense estime l'utilité prédictive de chaque article, tandis qu'un PRM guide la sélection d'articles supplémentaires. Tests sur finance, énergie, trafic et bitcoin montrent amélioration de précision et réduction des itérations.
DeskCraft est un benchmark pour agents desktop GUI évaluant des workflows professionnels longs (>50 étapes) en design, vidéo, audio et 3D avec collaboration humain-agent. 18 agents testés sur 538 tâches : GPT-5.4 atteint 31,6% en mode standard et 27,6% en mode interactif. Révèle des faiblesses en clarification proactive et exécution long horizon.
EvoTrainer co-évolue les politiques LLM et les harnesses d'entraînement via feedback empirique pour l'RL agentic autonome. Testé sur raisonnement mathématique, génération de code compétitif et ingénierie logicielle, le système égale ou surpasse les références RL conçues manuellement, avec gains majeurs sur les tâches SWE longue horizon.
Les systèmes multi-agents LLM perdent jusqu'à 72% des faits critiques lors de la délibération, créant une « illusion délibérative ». DelibTrace mesure cette attrition factuelle et l'homogénéisation des positions. Les agents convergent vers un consensus tout en oubliant les éléments essentiels pour interpréter le problème.
Étude géométrique montrant que l'accord inter-LLM sur les évaluations subjectives ne reflète pas l'alignement humain. Sur 41 juges LLM et 8 langues indiennes, les modèles utilisent 30-50% de la plage de scores humains, avec un axe d'évaluation quasi-orthogonal aux humains (87-89° vs 78-81°). L'accord LLM-LLM (r≈0.35) dépasse LLM-humain (r≈0.27-0.32). Seule la calibration post-hoc améliore tous les critères.
G²C-MT propose une sélection de contexte guidée par graphe pour la traduction automatique au niveau du document. Le système modélise les dépendances discursives entre paragraphes via un graphe léger et utilise une marche aléatoire biaisée en profondeur pour extraire des chemins de contexte. Testé sur DeepSeek-V3, Gemini-2.5-Flash-lite et Qwen-2.5/3, l'approche surpasse les baselines sur plusieurs domaines.
Regret Pre-training introduit un cadre d'apprentissage auto-supervisé basé sur LUPI, utilisant une architecture dual-view pour générer distributions Student (causale) et Teacher (future-conditionnée). Sur OLMoE-1B-7B après 4B tokens, GlobalRegret et LocalRegret atteignent 33.9% et 32.2% de précision moyenne vs 30.2% baseline, avec gain de 18.1pp sur BoolQ. Zéro paramètre supplémentaire.
Nouvelle étude arXiv sur l'édition de faits opinionnés dans les LLM. Benchmark FOE avec 261 personnalités publiques, 19 catégories de sujets, 2,178 enregistrements d'opinions. Les méthodes actuelles échouent à préserver la cohérence entre opinion éditée et preuves générées. Proposition d'une méthode Self-Generated Evidence-Aligned pour l'alignement opinion-preuves.
PhotoCraft propose un système de mémoire hiérarchique pour agents de recherche d'images. Le système combine mémoire de travail, épisodique et sémantique pour maintenir la cohérence logique sur plusieurs étapes de raisonnement. Tests sur DISBench montrent des gains jusqu'à 18,5% en récupération contextuelle.
Méthode RL pour contrôler l'échantillonnage adaptatif au test-time sur LLM. Un contrôleur léger entraîné en RL décide dynamiquement d'arrêter ou continuer l'échantillonnage, équilibrant exactitude, latence et coût. Formulation MDP avec interprétation Lagrangienne. Surpasse ASC et ESC sur les trade-offs.
Une méthode appelée Internal Coherence Maximization (ICM) génère automatiquement des exemples pour aligner les modèles IA sur des valeurs humaines diverses, sans supervision humaine extensive. Testée sur quatre benchmarks, ICM égale la performance des labels manuels. La cohérence des exemples améliore la généralisation même à précision égale, particulièrement pour les personas sous-représentées.
LEDE, un framework d'apprentissage par renforcement hors ligne, optimise l'inférence des LLM en sélectionnant dynamiquement la couche de sortie et la longueur de spéculation selon le contexte local. Sur Llama-2 et Llama-3, il atteint 2.0×–2.7× d'accélération vs décodage autorégressif, +17% vs baselines statiques.
DMT-CBT modélise l'évolution longitudinale des états thérapeutiques en TCC sur plusieurs sessions. Le framework maintient des états structurés, intègre des données multimodales et des interventions augmentées par outils. DMTCorpus, un dataset synthétique multimodal, démontre une meilleure fidélité thérapeutique et alliance thérapeutique comparé aux approches post-hoc.
SenseJudge est un framework de jugement personnalisé basé sur les préférences humaines pour évaluer les réponses d'LLM. Associé à SenseBench, un benchmark d'instruction-following issu d'interactions multi-tours réelles, il surpasse les méthodes existantes en adaptation aux préférences utilisateur et en classement de modèles aligné avec le jugement humain.
Étude factorial sur 4 LLMs open-source évaluant des décisions cliniques en diabète type 2. Les LLMs utilisés comme évaluateurs donnent des scores 74–78 points en protocole sans rubrique vs 7.69–49.64 points avec rubrique ancrée. La rubrique amplifie la discrimination entre modèles (facteur 1.76–5.10) et révèle variations comportementales masquées sans rubrique.
MedCUA-Bench est un benchmark interactif pour évaluer les agents informatiques dans les interfaces cliniques. Il couvre 18 scénarios médicaux sur 10 domaines avec interfaces authentiques. Les meilleurs modèles fermés atteignent 54,2% de succès strict, les agents open-source 2,5% en moyenne, révélant un écart majeur avec la fiabilité requise.
Un framework deux-étapes (PRPF) pour agents mobiles proactifs sépare la perception (décider d'intervenir) du raisonnement (comment aider). Un percepteur léger filtre les faux positifs, activant le reasoner MLLM seulement si nécessaire. Réduit les faux déclenchements et améliore l'efficacité sur le benchmark ProactiveMobile.
Étude empirique sur la détection de « natural experiments » (interventions implicites) dans des datasets réels via découverte causale et sélection de features. Les auteurs valident sur données synthétiques puis évaluent 50+ datasets réels, montrant que traiter les données comme interventionnelles plutôt qu'observationnelles améliore les performances.
Méthode pour extraire des règles Answer-Set Programming (ASP) depuis des LLM afin d'améliorer le Visual Question Answering (VQA). L'approche utilise des exemples de datasets VQA pour guider le LLM à étendre une théorie de raisonnement initiale, avec validation par le solveur ASP. Démontre l'efficacité sur plusieurs datasets avec peu d'exemples.
LEAP est un framework agentic qui permet aux LLMs de générer des preuves formelles vérifiables en Lean. Le système décompose les problèmes complexes en unités plus petites via interaction itérative avec le compilateur Lean. Sur les 12 problèmes du Putnam 2025, LEAP en résout tous les 12 ; sur Lean-IMO-Bench, il atteint 70% de taux de résolution contre <10% pour les LLMs génériques.
ToolGate est un contrôleur léger qui décide d'exécuter ou ignorer les appels d'outils proposés par des agents vision-langage. Sur cinq benchmarks avec Qwen3-VL, il réduit le coût en tokens à 64-69% du baseline ReAct tout en préservant la précision, et améliore même la précision de 1,65 points avec entraînement sur domaine.
TriEval est un pipeline d'évaluation des LLM testant simultanément biais, toxicité et véracité avec ressources minimales. Compatible open-source et closed-source, il fonctionne sur laptop sans GPU. Testé sur Llama 3 8B, Mistral 7B, Gemma 2 9B et Claude Haiku, révélant des différences toxicité/véracité entre modèles.
Des chercheurs proposent une économie d'agents où les IA se coordonnent via des enchères et des échanges de paiements, sans contrôle centralisé. Inspirée par la théorie économique de Hayek, cette approche génère des stratégies de raisonnement multi-étapes émergentes et surpasse les baselines sur cinq tâches (raisonnement mathématique, recherche financière, optimisation de systèmes distribués).
WRIT est une méthode de synthèse de trajectoires d'entraînement pour agents multi-tours. Elle génère des tâches complexes selon deux axes : nombre de décisions d'écriture et charge de preuves à lire. Avec 2K trajectoires synthétisées, un modèle 4B surpasse GPT-5.1 sur τ²-bench en réduisant les tokens d'inférence.
Fast-dLLM++ améliore l'inférence des modèles de diffusion LLM en remplaçant la sélection de tokens par confiance homogène par un décodage basé sur le profil Fréchet. Sans entraînement supplémentaire, cette méthode exploite les profils de confiance hétérogènes pour paralléliser davantage de tokens, gagnant jusqu'à 37% de débit sur GSM8K, MATH, HumanEval et MBPP avec LLaDA-8B.
Article philosophique examinant si les sorties de chatbots IA (ex: Claude d'Anthropic) produisent du langage meaningful. Les auteurs argumentent qu'une théorie standard du langage humain s'applique déjà aux LLMs sans nécessiter d'hypothèses anthropomorphiques sur les intentions ou états mentaux.
Framework unifié pour l'accès et la sélection de mémoire dans les systèmes de dialogue long-contexte. Utilise un facteur de Bayes pour quantifier l'utilité de chaque tour historique en mesurant l'amélioration de vraisemblance du modèle. Surpasse les approches embedding-based sur quatre benchmarks, particulièrement pour les tâches avec préférences changeantes.
Méthode de génération d'hypothèses conditionnelles pour l'analyse textuelle par LLM, intégrant des covariables spécifiées par les chercheurs. Résout les problèmes de déséquilibre de strates et d'inversion de signe via interactions features-covariables et rééquilibrage inverse-fréquence. Validation sur données synthétiques et réelles en sciences sociales computationnelles.
Framework pour agents LLM opérant sous instructions ambiguës. Propose une métrique Information Gain Reward mesurant l'utilité des questions de clarification via mise à jour bayésienne. Validation sur τ-Bench : +3.7% de taux de succès vs baseline sans clarification, +0.3 étapes d'interaction.
Dataset de 410 499 espèces tropicales couvrant plantes, aquatiques et animaux de compagnie. Intègre identifiants taxonomiques (GBIF, NCBI, iNaturalist, etc.), ajoute ontologie cross-domaine, noms vernaculaires chinois (99,50% de couverture) avec provenance explicite, et liens CITES. Déposé sur Zenodo.
Deux métriques automatisées évaluent le désalignement lexical des LLM : Lexical Alignment Score détecte la surutilisation de termes ('suggest', 'additionally', 'strategy'), Triangulated Preference Shift quantifie l'impact du RLHF. Testées sur 6 familles (Falcon, Gemma, Llama, Mistral, OLMo, Yi) via abstracts PubMed, sans annotation manuelle.
HyperPatch propose une méthode de modification de connaissances séquentielles pour LLMs basée sur des hypergraphes. Elle résout le problème de « N-ary Structural Drift » où les mises à jour complexes fragmentent les relations. Sur MQuAKE-CF et MQuAKE-T, gains de 96,24% et 21,06% en précision par rapport aux baselines.
MemTrain propose un cadre d'entraînement auto-supervisé pour améliorer les capacités de mémoire contextuelle des agents LLM. Deux tâches proxy sur Wikipedia (reconstruction d'entités masquées et rappel de mémoire intermédiaire) sont optimisées conjointement avec GRPO. Gains jusqu'à 17,67 points sur QA long-texte et benchmarks de recherche.
Étude montrant que les graphes visuels aident les LLM à organiser le raisonnement multi-sauts mieux que leur représentation textuelle. Les graphes structurés en mind maps guident le modèle sans indices directs, contrairement aux graphes aplatis en texte. L'avantage persiste après fine-tuning supervisé et distillation KL.
AURA-Mem propose une mémoire récurrente de taille constante (4,224 bytes) pour les politiques robotiques, avec une porte apprise qui n'écrit en mémoire que si l'observation change l'action suivante. Sur LIBERO-Long avec OpenVLA-OFT 7B, elle égale la politique de base (0.233 de succès) tout en réduisant les écritures mémoire de 7× et la consommation VRAM de 6,061× vs KV-cache.
Étude de biais démographiques dans la classification de lésions cutanées avec ResNet. Trois stratégies testées : modèle simple, multi-tâche renforçant, apprentissage adversarial. Les biais sexe proviennent d'imbalances de données ; les biais âge favorisent systématiquement les jeunes. Stratégies de mitigation partiellement efficaces selon la distribution.
Étude sur le transfert d'activations entre modèles de langage (Pythia-160M vers Pythia-410M). Une couche de translation linéaire aligne fortement les états cachés (similarité cosinus 0.97), mais l'injection des activations traduites n'améliore pas les performances en inférence. Résultat négatif : l'alignement représentationnel hors ligne ne suffit pas pour une communication causale utile.
Étude comparative de l'importance des régions cérébrales (EEG) pour prédire la charge cognitive. Analyse sur 4 datasets publics : les électrodes frontales surpassent la configuration complète de 15-20% en performance relative, avec moins de capteurs. Les régions fronto-centrales montrent la meilleure stabilité prédictive.
Framework d'orchestration déterministe pour valider les données ESG fragmentées (Scope 1-3) avec détection d'anomalies temporelles, apprentissage d'ensemble imbalancé et traçabilité d'audit. Benchmark synthétique calibré sur GHG Protocol, PCAF, ISSB. Évaluation sur métriques de classification, calibration et complétude de chaîne de provenance.
GATD (Geometry-Aware Tabular Diffusion) améliore la synthèse tabulaire en intégrant angles et longueurs entre colonnes comme entrées et cibles auxiliaires. Le modèle MLP atteint SOTA avec 3.5x moins de paramètres, gagnant 8/10 sur Shape, 7/10 sur Trend et 9/10 sur l'utilité downstream, réduisant erreurs de 27% et 20%.
Méthode de pruning de réseaux de neurones profonds basée sur la distribution de Marchenko–Pastur, avec fine-tuning minimal post-pruning. Sur ImageNet-1k, ViT-B/16 atteint 83.41% top-1 avec réduction MAC de 59.81% après 3 epochs de distillation; ResNet50 8:16 atteint 75.87% avec speedup 1.62× sur A40.
Article théorique sur les bornes de généralisation sous changements de distribution. Propose un cadre pour quantifier le risque supplémentaire quand le ratio d'états calmes vs crises diffère entre entraînement et déploiement, avec décomposition exacte et bornes minimax. Testé sur 25 ans d'indices boursiers.
Algorithme multifidélité adaptatif pour l'apprentissage machine en chimie quantique. Détermine dynamiquement la composition du dataset en interrogeant les échantillons à chaque niveau de fidélité. Réduit les coûts de génération de données jusqu'à 30× vs méthode monofidélité et 5× vs MFML standard sur énergies de cluster couplé et énergies d'excitation.
Une étude arXiv analyse 8 benchmarks de détection d'anomalies en séries temporelles multivariées. Le framework diagnostic révèle que 79-100% des anomalies sont détectables univariément sur 6 datasets. Les modèles cross-channel n'apportent aucun gain mesurable. Les benchmarks actuels ne valident pas réellement la modélisation multi-canal.
FiRe-OPD propose une distillation on-policy (OPD) à granularité fine combinant filtrage de trajectoires et repondération douce de tokens. Validé sur AIME 2024 (+6.25 en strong-to-weak) et Miner (+18.81 en multi-teacher), la méthode surpasse les approches token-level récentes en stabilité et performance.
Méthode ML pour classifier en temps réel l'état de la route (grip sec/humide vs glissance neige/glace) à partir de signaux véhicule en croisière. Framework feature-based et end-to-end utilisant vitesses roues, couples, accélération longitudinale, angle braquage, vitesse de lacet. Validation sur données route publique.
QUIVER enrichit les modèles ML classiques avec des vues quantiques basées sur la matrice d'information de Fisher quantique, extraite de circuits quantiques variationnels. Testé sur QM9 (propriétés moléculaires) et JetClass (LHC), le paradigme améliore les performances sans nécessiter du matériel quantique tolérant aux fautes.
Qift propose un nouvel ensemble de niveaux de quantification sans zéro pour W2A4/KV4 ({±0.5, ±1.5}) basé sur la rotation Hadamard. Sans entraînement ni codebook appris, cette méthode améliore la perplexité sur LLaMA-2-7B et LLaMA-3.1-8B comparée aux niveaux standards {-2,-1,0,+1}, tout en réduisant l'écart avec W3A4 en précision mixte.
Étude comparative d'un Transformer encoder-only vs LSTM pour prédire le débit en bassins non jaugés. Sur données NOAA NWM, l'LSTM surpasse le Transformer. L'intégration d'informations aval améliore tous les modèles (+60% NNSE médian). La mémoire récurrente s'avère mieux adaptée à cette tâche d'inférence hydrologique.
SpecFlow propose un cadre léger de raisonnement spatial multimodal utilisant l'espace cosinus discret pour représenter les pensées visuelles intermédiaires. Via guidance sans classificateur, les pensées textuelles autogénératives dirigent les mises à jour visuelles sans expansion de contexte. Résultat : réduction jusqu'à 2,1× des coûts de calcul et cache KV avec performance compétitive.
BehaviorBench est un benchmark pour évaluer la modélisation des décisions personnalisées à partir de traces comportementales réelles. Construit sur 2 000 portefeuilles avec 141 445 instances de prédiction de croyances et 1 485 972 instances de prédiction de transactions, il teste si les modèles génératifs peuvent adapter leurs prédictions aux utilisateurs individuels sans simulation.
ChatHealthAI aligne les représentations structurées des dossiers médicaux électroniques (EHR) avec l'espace sémantique d'un LLM gelé via un resampler task-aware. Le framework multimodal intègre les représentations longitudinales des patients avec des descriptions d'événements cliniques raffinées, améliorant le raisonnement clinique interprétable tout en maintenant la performance prédictive sur le benchmark EHRSHOT.
Revue systématique des architectures hybrides pour la prévision d'intervalles de puissance éolienne. Les approches combinant deep learning, décomposition modale (VMD, EEMD) et méthodes statistiques améliorent la précision. Stratégie dominante : deux modèles indépendants (LSTM, ELM) pour bornes inférieure/supérieure. Défis : absence de métriques standardisées, complexité computationnelle, validation réelle limitée.
Méthode pour extraire des primitives de raisonnement à partir de traces d'agents ReAct. Les routines récurrentes sont regroupées et converties en pseudo-outils typés. Les bibliothèques induites surpassent l'agent source : +44pp sur RuleArena NBA, +30pp sur MuSR, +22pp sur NatPlan.
Étude de trois approches pour générer automatiquement les morphologies d'ennemis dans les jeux vidéo basées sur les données de collision. Les méthodes testées surpassent ou égalent une baseline évolutionnaire adaptée de travaux en robotique.
Article proposant une architecture modulaire pour systèmes d'agents IA embarqués sur microcontrôleurs. Découple agents locaux (réseaux compressés, logique règles) d'agents cloud (SLMs pour raisonnement). Intègre couche gouvernance pour observabilité et sécurité sur flottes distribuées.