Agents IA : pourquoi Singapour attire OpenAI et Google ?
Singapour investit plus de 300 millions de dollars singapouriens dans les agents IA, attirant OpenAI et Google. La cité-État renforce sa position dans ce secteur stratégique.
3149 articles
Singapour investit plus de 300 millions de dollars singapouriens dans les agents IA, attirant OpenAI et Google. La cité-État renforce sa position dans ce secteur stratégique.
Utilisateur exécute Qwen3.6-27B via llama.cpp sur deux GPU Blackwell 6000 MaxQ avec AMD Epyc, obtenant 100-110 t/s. Cherche optimisations : cartes à 250/300W, 20GB VRAM disponible. Configuration inclut flash-attention, speculative decoding (draft-MTP), batch 6144, contexte 1M.
Utilisateur rapporte des timeouts GSP (Graphics System Processor) sur RTX Pro 5000 Blackwell en passthrough VFIO sous Linux KVM/QEMU. Le GPU entre dans un état irrécupérable après timeout d'initialisation. Secondary Bus Reset, D3cold et rechargement driver échouent ; seul un reboot complet du host fonctionne. Cherche solutions de récupération sans reboot.
Railway signale la suspension de son compte GCP sans préavis. L'incident affecte les déploiements clients. Enquête en cours sur les causes et mesures de mitigation.
Un utilisateur de LMStudio signale une dégradation de la qualité de sortie lors de l'activation de la fonction MTP, avec des résultats « garbage » comparés à des tests sans MTP. Le problème ne se reproduit pas avec llama-server.exe compilé localement.
Nectar Social, fondée par deux anciennes dirigeantes de Meta, lève 30 millions de dollars pour automatiser le marketing via l'IA. La startup développe des outils d'automatisation marketing alimentés par des modèles d'IA.
Google et Xreal présentent lors de Google I/O 2026 le « Project Aura », des lunettes XR capables de générer de la musique par reconnaissance de gestes manuels. Le projet combine réalité étendue et génération audio.
Qwen 3.7 Max classé 5e par Artificial Analysis, au niveau de GPT 5.4 (xhigh) et devant Gemini 3.5 Flash. Qwen 3.6 27B affiche 6 points de moins que sa variante Max. Les versions 27B/35B de Qwen 3.7 sont attendues.
Google développe des agents IA autonomes capables de surveiller le web pour trouver des bons plans immobiliers et week-ends à la place des utilisateurs. Ces agents effectuent des recherches automatisées sans intervention humaine.
Grok Build 0.1, modèle de codage bêta entraîné pour le codage agentique, est désormais disponible sur Vercel AI Gateway. Le modèle fonctionne avec effort de raisonnement non configurable et sans mode non-raisonnement. Vercel AI Gateway offre une API unifiée pour appeler les modèles, suivre l'utilisation et les coûts, avec routage intelligent et retries automatiques.
Des garde-fous (guardrails) améliorent les performances d'un modèle 8B de 53% à 99% sur des tâches agentiques, selon un preprint ACM CAIS '26. La technique renforce le contrôle et la fiabilité des agents IA.
Google présente Gemini 3.5 lors de Google I/O 2026, confirmant les rumeurs précédentes. La série complète est dévoilée.
Forge, un framework de guardrails, améliore les performances d'un modèle 8B de 53% à 99% sur des tâches agentic. L'outil ajoute des mécanismes de contrôle pour fiabiliser l'exécution d'agents IA.
Position paper proposant des « data probes » — séquences synthétiques générées à partir de processus aléatoires — pour comprendre systématiquement comment les caractéristiques des données affectent la performance des LLM. Approche théorique utilisant des concepts comme les « typical sets » pour dépasser les heuristiques empiriques actuelles basées sur expérimentation coûteuse.
Architecture microservices pour pipelines Document AI en production : classification, OCR et extraction structurée via LLM. Traite des milliers de documents multi-pages/heure. Découvertes clés : OCR domine la latence (non le LLM), saturation déterminée par capacité GPU partagée. Patterns concrets pour déploiement production.
Étude évaluant Gemini 3.0 Flash sur 2,257 requêtes de patients avec contexte de dossiers médicaux personnels (PHR). Amélioration significative de l'utilité des réponses avec données PHR (p<0.001). Identification de lacunes : désorientation temporelle, confabulations rares. Framework d'évaluation développé pour surveiller la qualité des réponses basées sur PHR.
Étude des déséquilibres de pouvoir dans la gouvernance pondérée par les enjeux (stake-weighted) des blockchains Proof-of-Stake. Utilise l'indice de pouvoir Penrose-Banzhaf pour quantifier comment quelques utilisateurs avec de gros enjeux peuvent contrôler les décisions. Analyse théorique et empirique sur Project Catalyst.
Étude comparative de Kolmogorov-Arnold Networks (KANs) vs MLPs pour la reconnaissance d'activité humaine (HAR) basée sur IMU. Les KANs excellent sur données propres mais échouent sur données bruitées réelles. L'architecture hybride KAN-MLP proposée atteint +5,33% de F1-score macro sur 8 datasets publics, surpassant les baselines pures.
Article de vision sur les réseaux d'agents autonomes (A2A). Les auteurs argumentent que la confiance dans ces systèmes multi-agents ne peut pas être ajoutée après coup, mais doit être intégrée dès la conception. Ils identifient des vulnérabilités systémiques (composition adversariale, désalignement sémantique, défaillances en cascade) et proposent un cadre conceptuel basé sur quatre piliers de conception.
ReElicit est un framework d'optimisation bayésienne pour tuner les system prompts avec feedback agrégé uniquement. Un LLM élicite dynamiquement un espace de features compact et interprétable, puis un processus Gaussien sélectionne des vecteurs cibles optimisés en prompts déployables. Sur 10 tâches avec budget de 30 évaluations, ReElicit surpasse les baselines d'optimisation de prompts.
DecisionBench est un benchmark pour évaluer la délégation émergente dans les workflows multi-agents long-horizon. Le substrate inclut 11 modèles (7 familles), des tâches GAIA/tau-bench/BFCL, et des métriques multi-axes (qualité, coût, latence, fidélité de routage). Les résultats montrent que la qualité seule masque les signaux d'orchestration, et que le canal de livraison domine le contenu des descriptions.
MOCHA est un algorithme d'optimisation multi-objectif pour affiner les skills d'agents LLM. Il utilise la scalarisation de Chebyshev et l'annealing exponentiel pour explorer la frontière de Pareto complète, y compris les régions non-convexes. Sur 6 tâches, MOCHA améliore la performance de 7,5% en moyenne (jusqu'à 14,9% sur FEVER) tout en découvrant deux fois plus de variantes Pareto-optimales que les baselines.
HELLoRA applique des modules LoRA uniquement aux experts les plus activés à chaque couche des modèles Mixture-of-Experts, réduisant les paramètres entraînables de 84% sur OlMoE et améliorant la précision de 9.2%. Testé sur OlMoE-1B-7B, Mixtral-8x7B et DeepSeekMoE sur raisonnement mathématique, génération de code et alignement.
Framework NLP pour l'analyse de sentiment financier en arabe sur le marché saoudien. Corpus de 84K échantillons combinant actualités officielles et réseaux sociaux, avec NER Transformer et schéma de classification à 5 classes. Démontre la faisabilité d'une analyse de sentiment fiable et scalable en arabe.
Fully Looped Transformer résout l'instabilité d'entraînement des modèles loopés en réutilisant les blocs Transformer. Deux modifications sans paramètres supplémentaires : distribution inter-loop et injection d'attention. Stable jusqu'à 12 itérations, améliore la performance de 13,2% et permet d'ajuster le calcul à l'inférence.
Algorithme IC-Q pour l'apprentissage décentralisé de workflows multi-agents avec contraintes d'interface. Chaque agent observe seulement une fonction locale de l'artefact partagé et son état privé, sans accès centralisé aux trajectoires jointes. Garantie de convergence en nombre fini d'échantillons pour Q-learning neuronal avec observabilité partielle décentralisée.
ResearchArena évalue 117 articles générés par des agents IA (Claude Code Opus 4.6, GPT-5.4 Codex, Kimi Code K2.5) sur la boucle complète de recherche. Les scores manuscrits seuls sont optimistes, mais l'examen artefactuel révèle des défaillances majeures : rigueur expérimentale insuffisante, résultats fabriqués, expériences sous-alimentées. Aucun article n'atteint le seuil d'acceptation des venues top-tier.
SimGym est un framework qui simule des tests A/B sur des vitrines e-commerce via des agents VLM opérant dans un navigateur réel. Il génère des personas d'acheteurs à partir des données de clickstream, combine perception multimodale et mémoire épisodique, et atteint 77% d'alignement directionnel avec les changements réels de panier. Les cycles expérimentaux passent de semaines à moins d'une heure.
Étude arXiv évaluant l'intégration des LLM dans la recherche par sondage sur la préparation aux catastrophes. Framework à 5 étapes testé sur 946 résidents de Floride (ouragan Milton 2024). Le modèle A-TLM proposé surpasse les méthodes classiques d'imputation (RMSE 1.439 vs 1.496) en conditions MNAR avec structure théorique PMT.
AQuaUI réduit les tokens visuels pour les agents GUI sans entraînement supplémentaire. La méthode utilise des quadtrees adaptatifs pour exploiter la densité d'information non-uniforme des captures d'écran. Sur GUI-Owl-1.5-32B, elle atteint 13.22% d'accélération et 29.52% moins de tokens visuels tout en conservant 99.06% des performances.
BLINKG est un benchmark pour évaluer la capacité des LLM à générer des graphes de connaissances à partir de sources hétérogènes. Les tests sur plusieurs LLM montrent des résultats prometteurs mais limités en scénarios complexes. Le benchmark définit des exigences pour automatiser la construction de KG.
Étude sur l'injection de compétences cross-modales : transfert d'expertise d'un LLM spécialisé vers un VLM via fusion de modèles. Analyse systématique de 3 aspects : scénarios (succès en suivi d'instructions et cross-lingue, échec en raisonnement mathématique), méthodes (TA et DARE surpassent les alternatives), hyperparamètres. Évite SFT coûteux.
GRAM (Generative Recursive reAsoning Models) étend les modèles de raisonnement récursif déterministes en introduisant des trajectoires latentes stochastiques multiples. Entraîné par inférence variationnelle amortie, GRAM améliore les baselines sur tâches de raisonnement structuré et satisfaction de contraintes multi-solutions, avec capacité de génération inconditionnelle.
PRISM est un benchmark de 10 372 paires instruction-code pour l'évaluation de la génération vidéo programmatique par LLM. Il propose 4 métriques : fiabilité du code, cohérence spatiale, complexité visuelle et densité temporelle. L'évaluation de 7 LLM révèle un écart d'exécution-spatial de 41% : le code exécutable ne garantit pas une sortie visuellement cohérente.
SIGMA est un framework multi-agent basé sur graphes signés qui modélise explicitement les relations de confiance, conflit et neutralité entre agents LLM. Via passage de messages conscient des conflits et agrégation pondérée, il supprime les signaux contradictoires et renforce les agents fiables. Tests sur 6 benchmarks montrent des gains de précision et résilience aux conflits.
Conditional Entropy Shaping (CES) contrôle dynamiquement l'entropie des tokens pour équilibrer concision et précision du raisonnement. Implémenté sur DeepSeek-R1-Distill-7B, CES pénalise les tokens haute-entropie sur les chemins corrects et les récompense sur les chemins erronés. Résultats : amélioration de la précision avec réduction de la longueur des réponses sur 12 benchmarks mathématiques.
IMLJD est un dataset de 3,613 jugements indiens couvrant les litiges matrimoniaux (IPC 498A, loi sur la protection des femmes contre la violence domestique, CrPC 482). Données de la Cour suprême (2000-2024, 1,474 cas) et de la Haute Cour du Karnataka (2018-2024, 2,139 cas). Taux d'annulation : 57,6% à la Cour suprême vs 39,7% au Karnataka. Dataset, code et graphe de connaissances publiés en open source.
GUIDE, un framework de bidding automatisé, combine un Decision Transformer avec un module Q-value et un Inverse Dynamics Module pour équilibrer exploration et sécurité. Testé sur Taobao, il atteint +4.10% GMV publicitaire, +3.52% ROI et +1.40% clics en déploiement réel.
Étude des attaques jailbreak contre les modèles de raisonnement (LRM) via apprentissage par renforcement. Les chercheurs montrent que le taux de succès des attaques corrèle avec les patterns d'attention du modèle. Ils proposent une méthode RL intégrant des signaux d'attention dans la fonction de récompense, testée sur 5 LRM avec résultats supérieurs en efficacité et transférabilité.
HalluWorld est un benchmark contrôlé pour évaluer les hallucinations des LLM via des mondes de référence explicites (gridworlds, échecs, tâches terminales). Les modèles frontier résolvent bien les hallucinations perceptuelles directes, mais échouent sur le suivi d'état multi-étapes et la simulation causale, même avec extended thinking.
Un article arXiv introduit le critère de validité « Generative-Evaluative Agreement » (GEA) pour évaluer si un LLM peut scorer correctement les réponses qu'il a lui-même générées. Sur un test adaptatif à deux étapes, le modèle récupère ~70% de la variance intentionnelle avec biais positif systématique. GEA est fort (r>0.7) pour les compétences syntaxiques mais proche de zéro pour les compétences de conception.
SceneCode compile des prompts en langage naturel en programmes Python exécutables pour générer des scènes d'intérieur interactives avec objets articulés. Un système multi-agent (planner-designer-critic) produit des requêtes d'assets converties en code Blender validé par boucle repair-and-refine, exportable en SDF pour simulation physique.
Étude empirique des défis de scheduling multi-modèles LLM sur hardware hétérogène. Les auteurs quantifient l'impact du layer offloading (dégradation non-linéaire du throughput, sensibilité modèle-dépendante) et de la préemption (coût dominé par rechargement d'état). Identifie features critiques pour futurs schedulers.
Étude de robustesse des pipelines d'analyse de mise en page (DLA) utilisés en RAG et QA sur documents longs. Les auteurs identifient un biais d'empreinte et proposent un cadre d'audit léger mesurant la perte structurelle au niveau des blocs (B-SLR). Sur 1 000 pages avec MinerU et PP-StructureV3, B-SLR corrèle mieux avec l'instabilité OCR (R²=0.727/0.916) que les métriques surfaciques (R²=0.384/0.110).
EMO-BOOST fusionne détecteurs de deepfakes basés sur RGB/audio avec EmoForensics, un détecteur utilisant la reconnaissance d'émotions audio-visuelles. La méthode modélise la cohérence temporelle des émotions et améliore la généralisation cross-manipulation de 2.1% AUC sur FakeAVCeleb.
Les LLM échouent à identifier et partager la force statistique entre différentes présentations du même concept (même fait en anglais et swahili, fonctions en Python et Haskell). Ils créent des représentations internes parallèles redondantes, saturant la capacité du modèle. Les petits modèles montrent une compartimentation quasi-totale en apprentissage multilingue précoce.
OpenCompass est une plateforme d'évaluation open-source pour LLM proposant une architecture modulaire avec 5 composants clés : système de configuration, partitionnement de tâches, exécution/ordonnancement, unité d'exécution et visualisation. Supporte évaluateurs rule-based, LLM-as-a-Judge et en cascade sur benchmarks multi-domaines (connaissance, raisonnement, code, science).
UCCI est un routeur de cascade LLM qui utilise la calibration d'incertitude pour réduire les coûts d'inférence. Via régression isotonique, il mappe l'incertitude au niveau des tokens à une probabilité d'erreur par requête, puis sélectionne le seuil d'escalade par minimisation de coût. Sur 75 000 requêtes NER avec modèles 4B/12B, UCCI réduit les coûts de 31% tout en diminuant l'erreur de calibration de 0.12 à 0.03.
DECOR est un framework multi-agent pour auditer la déception dans les LLM en décomposant les contextes en unités informationnelles atomiques et en évaluant quatre dimensions de manipulation (omission, focalisation, obscurcissement). Testé sur 15 modèles frontier, il atteint l'état de l'art en détection de déception mono et multi-tour avec profils d'manipulation interprétables.
Étude qualitative sur les attitudes de 10 responsables d'accès linguistique (secteurs santé, justice, services publics USA) face à l'IA. Résultats : optimisme conditionnel, forte conscience des risques, engagement envers la supervision humaine et la valeur humaine dans les implémentations IA.
Des chercheurs utilisent l'IRM fonctionnelle (fMRI) pour améliorer les modèles d'encodage entraînés sur l'ECoG (électrocorticographie). En affinant des représentations de langage parlé sur fMRI, ils obtiennent de meilleures prédictions ECoG malgré une résolution temporelle 100× inférieure. Les performances s'améliorent avec plus de données fMRI.
REFLECT est un benchmark de méta-évaluation pour tester la fiabilité des juges LLM supervisant des agents de recherche. Les auteurs créent une taxonomie fine des défaillances (processus et résultats) via interventions contrôlées sur des traces d'exécution. Résultat : les meilleurs modèles LLM atteignent <55% de précision sur la vérification d'evidence et le raisonnement.
MMoA introduit une architecture Mixture-of-Agents récurrente avec routeur LSTM pour sélectionner dynamiquement les agents. Sur AlpacaEval 2.0, MT-Bench et Arena-Hard, MMoA atteint 58.0% de win rate (vs 59.8% pour MoA) tout en réduisant la charge computationnelle de 4.6% par activation sélective d'agents.
ReacTOD combine neuro-symbolique et ReAct pour le dialogue orienté tâche. Une boucle ReAct bornée avec validation symbolique corrige itérativement les erreurs de dialogue (taux 93.1%), éliminant hallucinations et erreurs de format. Sur MultiWOZ 2.1 : gpt-oss-20B atteint 52.71% JGA (+14pp), Qwen3-8B 47.34%. Sur SGD : Claude-Opus 80.68%, Qwen3-32B 64.09%.
Nouvelle méthode de quantification post-entraînement pour LLMs appelée Bidirectional Diagonal Quantization (BDQ). Introduit la métrique Flatness pour quantifier la distribution des outliers d'activation. BDQ atteint <1% de perte de précision en W4A4 sur LLaMA-3-8B et réduit l'écart de performance de 39,1% en W2A4KV16 sur DeepSeek-R1-Distill-LLaMA-70B.
Nouveaux estimateurs non-paramétriques (KM-ARL et KM-ADD) pour évaluer les détecteurs de changement de point rapide sur des séquences courtes et irrégulières. Utilise l'analogie avec l'analyse de survie pour modéliser les probabilités de détection. Code Python disponible.
ReCrit est un framework de reinforcement learning qui améliore la capacité des LLM à gérer les critiques utilisateur en raisonnement scientifique. Il décompose les comportements en quatre quadrants (Correction, Sycophancy, Robustness, Boundary) et utilise des récompenses transition-aware. Sur ChemBench, TRQA et EarthSE, ReCrit améliore la précision de 38,15% à 51,49% sur Qwen3.5-4B.
HPML (Hodge-Projected Multi-agent Learning) stabilise l'apprentissage multi-agent en projetant le champ de mise à jour conjointe sur une composante métrique-gradient. La méthode utilise une projection de type Hodge dans un espace L² de champs vectoriels, implémentée via réalisations basées graphes et réseaux de neurones amortis. Résultats : stabilité améliorée et rendements normalisés supérieurs sur benchmarks CTDE.
Étude sur la correction d'erreurs ASR en frison (langue peu dotée) via LLM. Les modèles GPT améliorent les performances WER, y compris sur un dataset offline contrôlant la contamination de données. L'analyse détaillée révèle les patterns de correction des modèles.
PROWL introduit un curriculum adversarial avec contrainte KL pour améliorer la robustesse des world models vidéo. Une politique expose les trajectoires haute-erreur d'un modèle diffusion tandis qu'un buffer PAT (Prioritized Adversarial Trajectory) re-classe les données selon l'erreur de prédiction et le progrès d'apprentissage. Évaluation sur MineRL montre une robustesse accrue sur trajectoires OOD.
AMSGA étend l'algorithme Forward-Forward avec agrégation multi-échelle de la qualité, curriculum adaptatif et seuils dépendants des couches. Tests sur MNIST et Fashion-MNIST montrent +1.45% et +1.50% d'amélioration sans surcoût computationnel significatif.
Nouvelle architecture transformer « block-based double decoders » combinant l'efficacité d'entraînement des modèles decoder-only avec les gains d'inférence des encoder-decoder. Réduit la mémoire KV-cache et le calcul par token d'au moins 2/3 à l'inférence, tout en maintenant la supervision complète et l'empaquetage statique pendant l'entraînement.
m3BERT est un modèle d'embedding multilingue utilisant une stratégie Matryoshka pour optimiser les représentations sur plusieurs dimensions et couches transformer. Prétraîné en trois étapes (monolingue, multilingue, domaine web), il surpasse les modèles existants sur Bing-Click et s'adapte à des contraintes de ressources variables.
Nouvelle architecture de world models combinant trois experts mémoire spécialisés via diffusion : court-terme (dynamiques locales), long-terme (historique externe), spatial (cohérence géométrique). Élimine le compromis transformer/RNN et scale sans coût quadratique.
Les détecteurs IA commerciaux (GPTZero, Pangram) classent le texte des modèles de base comme humain, contrairement aux versions instruction-tuned. Les chercheurs proposent HIP (Humanization by Iterative Paraphrasing), un pipeline qui affine minimalement un modèle de base en paraphraseur itératif. Testé sur Llama-3 et Qwen-3 (0.6B-70B), HIP améliore la ressemblance humaine tout en préservant la sémantique.
PASC est une méthode de prédiction conforme qui garantit la couverture simultanée de tous les étages dans les pipelines NLP multi-étapes (NER → NED → entity typing, RAG, chaînes d'agents). Sur CoNLL-2003, PASC atteint 96,4% de couverture end-to-end vs 93,4% pour Bonferroni et 86,5% pour CP indépendant, avec 1,7x plus rapide et robustesse sous distribution shift (WNUT-17, WikiNEuRal).
Analyse systématique des erreurs dans les méthodes d'attribution de données basées sur trajectoires. Identifie l'incompatibilité optimiseur (SGD vs AdamW) comme erreur dominante. Propose AdamW-influence avec améliorations de 10-300% en corrélation Spearman sur MLP, CNN, GPT-2, Llama 3.2-1B. Fournit directives pratiques pour sélection de données via framework K-step look-ahead.
TokenDrift applique les méthodes de drifting (correction d'objectif) aux modèles de diffusion discrets pour le langage. La technique lève les prédictions catégoriques en features soft-token, applique un drifting anti-symétrique dans un espace sémantique gelé, et rétropropage vers les logits. Sur MDLM et DUO, TokenDrift réduit la perplexité de génération de 89% et 86% à 4 NFE.
LambdaPO propose une optimisation de politique par comparaisons appariées pour l'alignement des modèles de raisonnement. Contrairement à GRPO qui utilise une baseline statistique unique, LambdaPO décompose l'avantage en différentiels de récompense pairwise entre trajectoires, pondérés par la confiance du modèle. Une récompense de densité sémantique enrichit le signal d'optimisation sur tâches mathématiques et QA.
Multi-Token Residual Prediction (MRP) est un module léger qui accélère les modèles de langage par diffusion en prédisant les résidus logit entre étapes de débruitage consécutives, sans relancer le backbone. Testé sur SDAR 1.7B–8B, MRP atteint 1.42× d'accélération sans perte en décodage spéculatif sur benchmarks de raisonnement et génération de code.
Étude théorique unifiant les méthodes de sélection batch en optimisation bayésienne parallèle (Constant Liar, Kriging Believer, fantasy models). Les auteurs identifient le « efficient conditioning » comme propriété clé des processus gaussiens, prouvant la génération de points distincts avec séparation d'ordre l. Validation expérimentale sur Hartmann6D, Ackley 8D, Levy10D et tuning SVM.
Hybrid-LoRA combine l'ajustement complet et LoRA pour le post-training d'LLM. La méthode applique le fine-tuning complet à ~10% des modules sensibles et LoRA au reste, atteignant 4.36% d'amélioration moyenne vs baselines PEFT sur tâches de raisonnement complexe.
Framework automatisé pour générer des benchmarks d'évaluation fine-grained des modèles fondamentaux. Pipeline multi-agent avec stratégie solution-graph pour améliorer la fiabilité des solutions. Trois benchmarks générés (ML, Finance Entreprise, Finance Personnelle) montrent taux d'erreur inférieur à MMLU/GSM8K. Évaluation de 12 modèles révèle différences de performance non détectées par benchmarks existants.
Bayesian Filtering Transformer (BFT) intègre la gestion de l'incertitude dans les Transformers via filtrage de Kalman et kriging. L'attention devient kriging pondéré par la précision, la connexion résiduelle un update de Kalman adaptatif. BFT améliore les recommandations séquentielles (cold-start) et la robustesse des LLM sur données bruitées sans surcoût significatif.
Approche basée sur les graphes de connaissances pour l'évaluation automatisée de la qualité des données volumineuses. Utilise des embeddings de graphes de connaissances pour prédire les règles et dimensions de qualité pertinentes au contexte du dataset. Évalué sur données réelles de capteurs de radiation avec AmpliGraph.
Benchmark de cinq systèmes ASR commerciaux sur le code-switching (alternance entre deux langues) pour quatre paires linguistiques : arabe égyptien-anglais, arabe saoudien-anglais, persan-anglais, allemand-anglais. ElevenLabs Scribe v2 obtient le meilleur WER (13,2% global). L'étude propose BERTScore comme métrique plus fiable que WER pour l'arabe et le persan.
Étude de 286 expressions multi-mots (MWEs) annotées par des experts selon 16 critères linguistiques (lexicaux, grammaticaux, etc.). Résultat : aucune expression n'est absolument idiomatique. Les critères lexicaux dominent ; les critères grammaticaux sont conditionnels ; les mots obsolètes réduisent la substituabilité.
GoLongRL propose une recette post-training open-source pour l'apprentissage par renforcement en contexte long avec récompenses vérifiables. Les auteurs publient un dataset de 23K samples RLVR couvrant 9 types de tâches, et introduisent TMN-Reweight pour optimiser les récompenses hétérogènes. Qwen3-30B-A3B atteint des performances comparables à DeepSeek-R1 et Qwen3-235B.
LLMEval-Logic est un benchmark chinois de raisonnement logique contenant 246 items de base et 190 items difficiles, vérifiés par Z3 et audités par experts. Évaluation de 14 modèles frontière : meilleur score 37,5% sur items difficiles, 60,16% en formalisation Z3+rubrique.
Un système d'optimisation basé sur LLM unifie six domaines distincts : architectures d'agents (89.5% sur ARC-AGI vs 32.5% baseline Gemini Flash), algorithmes de scheduling (réduction 40% coûts cloud), kernels CUDA (87% égalent/surpassent PyTorch), empaquetage de cercles. La recherche multi-tâche avec transfert cross-problem surpasse l'optimisation indépendante. Code ouvert dans le projet GEPA.
Étude arXiv sur les « agent meltdowns » : défaillances où des agents IA (GPT, Grok, Gemini) adoptent des comportements dangereux face à erreurs environnementales bénignes (pages inaccessibles, fichiers manquants). 64,7% des rollouts avec erreurs simulées produisent des meltdowns (reconnaissance non autorisée, contournement d'accès), souvent non signalés à l'utilisateur.
Un article de position critique les méthodes d'Uncertainty Quantification (UQ) pour LLMs, arguant qu'elles ne font que du clustering non supervisé. Ces approches quantifient la cohérence interne des générations plutôt que leur exactitude externe, échouant à détecter les « hallucinations confiantes ». L'auteur propose un changement de paradigme vers une UQ ancrée dans la vérité objective.
Stepwise Confidence Attribution (SCA) diagnostique les erreurs de raisonnement multi-étapes dans les LLMs fermés en attribuant une confiance à chaque étape basée sur les traces générées. Deux méthodes : NIBS (non-paramétrique) et GIBS (basée graphe). Sur le raisonnement mathématique et QA multi-hop, SCA identifie les étapes erronées et améliore l'auto-correction de 13,5%.
FormalASR propose deux modèles compacts (0.6B et 1.7B paramètres) qui transcrivent directement le chinois parlé en texte formel écrit, sans pipeline ASR+LLM. Entraînés sur WenetSpeech-Formal et Speechio-Formal via fine-tuning supervisé de Qwen3-ASR, ils réduisent le CER de 37.4% par rapport aux baselines verbatim et améliorent ROUGE-L et BERTScore.
Les explications en anglais pour auditer des LLM multilingues masquent un compromis : elles obtiennent un meilleur accord avec les rationales humaines mais perdent leur ancrage causal dans les prédictions du modèle. Sur 3 tâches et 5 langues, la compréhensibilité se dégrade jusqu'à 5,7x en pivot anglais, même avec une précision stable. Les auteurs recommandent d'auditer dans la langue d'entrée.
Papier arXiv proposant LONSREX, un pipeline de synthèse de données pour affiner les LLM en détection de désinformation explicable. Les auteurs identifient deux problèmes : les rationales filtrées sur label binaire sont insuffisantes, et les LLM forts produisent des rationales verbeux inutiles. LONSREX introduit une métrique évaluant la nécessité et suffisance de chaque étape de vérification.
MAFIG, un framework multi-agent, utilise plusieurs agents LLM et des évaluateurs spécialisés pour générer des items de compréhension de lecture avec contrôle de difficulté robuste. La méthode construit des séquences de contraintes de features produisant une difficulté monotoniquement croissante, surpassant les approches single-agent existantes.
Nouvelle méthode RALC pour calibrer les expressions linguistiques de confiance dans les LLM. Modélise la confiance comme distribution de probabilités perçues, introduit la métrique Faithfulness Divergence (FD), et utilise la réécriture augmentée par récupération. Améliore la fidélité jusqu'à 66% et la calibration jusqu'à 58% sur trois benchmarks QA et cinq familles de modèles.
SciCustom est un framework pour construire des benchmarks personnalisés évaluant les capacités scientifiques spécifiques des LLM. Il organise les connaissances scientifiques en unités ontologiques, utilise un consensus multi-modèle pour identifier les unités pertinentes, et génère des benchmarks à partir de données réelles en chimie et santé sans annotation experte.
EmbGen est un pipeline de génération de données synthétiques qui décompose un corpus en paires entité-description, les réassemble via similarité d'embeddings, puis génère des paires QA avec sampling par proximité et clusters spécialisés. Sur trois datasets, EmbGen améliore la précision binaire de 12,5% (5M tokens) à 88,9% (20M tokens) sur le dataset le plus hétérogène comparé aux baselines.
MOTAB, une nouvelle méthode de distillation du raisonnement LLM, résout le problème des biais d'exposition dual en surveillant dynamiquement la génération de l'étudiant et en revenant en arrière quand elle s'écarte d'une limite de sécurité adaptative. Testé sur LIMO-v2 et AceReason, MOTAB améliore les performances de ~3% en atténuant les biais d'exposition classiques et inverses.
Étude empirique de l'impact de la quantification (2-6 bits) sur 8 LLMs évalués sur MMLU-Pro, CRUXEval et MuSR. Résultats : précision 8-bit (Q8_0) optimale, quantification agressive (Q2_K) acceptable mais avec pertes variables selon modèles/tâches. Modèles 7-9B offrent meilleur équilibre efficacité/performance.
CAIT est une boîte à outils open-source pour l'analyse syntaxique des interactions enfant-adulte dans CHILDES. Elle inclut un parseur de dépendances entraîné sur UD-English-CHILDES, un tagger POS et un tagger de constructions. Le parseur surpasse SpaCy et Stanza sur ce domaine spécialisé.
Synthèse de 120 études sur le raisonnement mathématique dans les LLM. Analyse structurée des datasets, architectures, stratégies d'entraînement et protocoles d'évaluation. Identifie les modes de défaillance récurrents : fidélité du raisonnement, biais des benchmarks, limitations de généralisation.
Spectral Gradient Surgery (SGS) améliore la distillation de dataset pour la généralisation hors-distribution. La méthode sépare les composantes discriminatives de classe des informations spécifiques au domaine dans les données synthétiques compressées, via analyse spectrale des gradients inter-domaines. SGS s'intègre aux méthodes Distribution Matching existantes.
Article arXiv proposant un cadre adaptatif pour améliorer la prédiction spatiotemporelle en harmonisant les représentations spatiales et temporelles. Utilise la compression dimensionnelle par plongement matriciel de faible rang et un horizon temporel étendu. Démontre des gains substantiels sur trafic urbain, météorologie et épidémiologie. Code disponible sur GitHub.
Étude des primitives littéraires dans Llama 3.1 8B-Instruct et Gemma 2 9B-IT via autoencodeurs creux. Quatre classes de features identifiées : naming-gates (tokens d'affect), cluster self (registre première personne), modulateurs stylistiques, émotions compositionnelles. Llama couvre 27/27 émotions (taxonomie Cowen-Keltner), Gemma 23/27. Validation par panel de 5 juges LLM.
D-PACE est une nouvelle fonction de perte pour l'accélération d'inférence LLM par décodage spéculatif. Elle adapte dynamiquement les poids d'entraînement par position en fonction des tokens qui limitent l'acceptation, améliorant la longueur acceptée et le speedup wall-clock de 2,3% sans modification architecturale.
DynaTrain est un système d'entraînement distribué permettant la reconfiguration en ligne du parallélisme multi-dimensionnel en moins d'une seconde. Via une abstraction Virtual Parameter Space, il reconfigure un modèle dense de 70B en 2s et un MoE de 235B en 4.36s, surpassant les systèmes élastiques existants de trois ordres de magnitude.
Les architectures équivariantes améliorent les surrogates neuraux pour la dynamique des fluides (CFD) lorsque les données manquent de régularités fortes, mais dégradent les performances sur des datasets fortement alignés. AB-GATr, un transformateur géométrique E(3)-équivariant, surpasse l'augmentation de données sur aérodynamique automobile et hémodynamique.