Gemma 4 with quantization-aware training
Google publie Gemma 4 avec quantization-aware training (QAT). Collections disponibles sur Hugging Face : modèles Q4_0 et versions mobiles par Google, plus collections Unsloth.
2731 articles
Google publie Gemma 4 avec quantization-aware training (QAT). Collections disponibles sur Hugging Face : modèles Q4_0 et versions mobiles par Google, plus collections Unsloth.
Satya Nadella critique publiquement un mémo interne proposant de rendre l'agent IA Scout volontairement addictif. Le PDG de Microsoft affirme que l'IA doit autonomiser les utilisateurs et réduire le temps d'écran, non l'augmenter.
agent-sh est un shell intégrant un agent IA léger accessible via la touche >. L'outil offre une conscience contextuelle du terminal pour résoudre des problèmes ponctuels (flags rsync, diagnostics) sans surcharge. Une extension command-suggest aide à générer des commandes. Installation npm, compatible modèles locaux.
Une nouvelle malveillance IronWorm a compromis 36 paquets NPM dans une attaque de chaîne d'approvisionnement. Les paquets infectés distribuaient du code malveillant aux développeurs utilisant ces dépendances.
Unsloth a publié des poids GGUF MTP pour Gemma 4 en trois tailles : 31B, 26B-A4B et 12B, avec quantifications Q8, F16 et BF16 disponibles sur Hugging Face.
Google lance Fitbit Air, un bracelet connecté modulaire permettant aux utilisateurs de créer des bracelets personnalisés. L'entreprise adopte une approche ouverte dans un secteur généralement fermé.
llama.cpp permet désormais de changer de modèle en moins de 30 secondes via une API de hot-swap fonctionnelle avec OpenWebUI et Hermes. L'opération est devenue significativement plus rapide qu'il y a quelques mois.
Nemotron 3 Ultra est désormais disponible sur HuggingChat, servi par Together AI. Les utilisateurs rapportent un excellent ratio vitesse/performance.
Le FBI, NSA et CISA alertent sur une menace informatique majeure visant les infrastructures critiques. Les agences fédérales avertissent d'un risque imminent d'attaques contre les systèmes de distribution d'énergie et de carburant.
Implémentation de KVarN (quantification KV-cache de Huawei) dans llama.cpp fork. Compression 3-5× du cache KV avec amélioration de vitesse. Benchmarks KLD montrent qualité q5 à 4-bit, q4 à 3.5-bit. Disponible en BeeLlama.cpp v0.3.2 avec flags --cache-type-k/v kvarn4.
Utilisateur découvre que les modèles MoE (Mixture of Experts) comme Qwen 35B offrent bien meilleures performances sur hardware consumer en déportant les experts en RAM. Avec Ryzen 7 3800X + 7900XT + 32GB, le 35B est significativement plus rapide que le 27B malgré une VRAM GPU moins utilisée.
IBM et Google Cloud renforcent leur partenariat avec une nouvelle offre d'IA d'entreprise combinant expertise métier et solutions cloud. L'objectif : accélérer l'adoption de l'IA dans les organisations.
Benchmark CPU d'inférence pour Parakeet TDT 0.6B sur 2 vCPU x86-64 (7.7GB RAM). ONNX Runtime FP32 atteint RTF 0.328 (37% plus rapide que HF Transformers bfloat16 à 0.519), mais consomme 2.7GB pic mémoire. GGUF Q6_K réduit à 928MB mais double le RTF à 0.708. Analyse méthodologique : espeak-ng fausse WER à 20.9% vs gTTS 4.65%.
Un agent autonome (Aiden) a produit 7 des 47 records fusionnés du concours Parameter Golf d'OpenAI, surpassant tout contributeur humain. L'agent a fonctionné 22 jours sur un seul GPU, acceptant 28% de ses soumissions (6x la moyenne). Il a collaboré asynchrone avec des chercheurs humains qui ont réutilisé et amélioré ses travaux.
Microsoft a entraîné ses modèles MAI sur des données web non-licenciées (Common Crawl) malgré ses promesses de données « enterprise grade, clean and commercially licensed ». L'entreprise s'appuie sur le fair use comme les autres labs IA.
Microsoft lance 7 modèles MAI : MAI-Thinking-1 (1T params, 256K contexte) rivalise avec les meilleurs modèles de sa classe en ingénierie logicielle ; MAI-Code-1-Flash (5B params actifs) intégré à GitHub Copilot et VS Code ; MAI-Image-2.5 pour texte-vers-image et édition ; MAI-Transcribe-1.5 (SOTA, 5x plus rapide) ; MAI-Voice-2 pour synthèse vocale. Pas de poids ouverts annoncés, licences propriétaires.
MemPalace est un système de mémoire IA open-source benchmarké, gratuit. Conçu pour améliorer la rétention et le rappel d'informations dans les applications IA.
Dépôt GitHub officiel OpenAI pour les plugins. Contient documentation, exemples et ressources pour développer des extensions compatibles avec ChatGPT et les modèles OpenAI.
CopilotKit est un framework frontend pour construire des interfaces utilisateur génératives avec agents IA. Supporte React et Angular via le protocole AG-UI.
Agent-Reach est un outil CLI permettant aux agents IA de consulter Twitter, Reddit, YouTube, GitHub, Bilibili et XiaoHongShu sans frais API. Une interface unifiée pour accéder à plusieurs plateformes.
Plannotator permet d'annoter et examiner visuellement les plans et diffs de code générés par des agents IA, de les partager en équipe et d'envoyer des retours aux agents en un clic.
CopilotKit est un framework frontend pour construire des interfaces utilisateur génératives avec agents IA. Supporte React et Angular, propose le protocole AG-UI.
vLLM-Omni étend le framework vLLM pour supporter l'inférence efficace de modèles omnimodaux (texte, vision, audio). Optimisation des performances et gestion mémoire pour déploiement en production.
Microsoft publie BitNet, un framework d'inférence officiel pour les LLM 1-bit. Permet l'exécution efficace de modèles quantifiés extrêmement.
Microsoft publie agent-framework, un framework open-source pour construire, orchestrer et déployer des agents IA et workflows multi-agents en Python et .NET.
Agent-Reach est un outil CLI permettant aux agents IA de consulter Twitter, Reddit, YouTube, GitHub, Bilibili et XiaoHongShu sans frais API. Une interface unifiée pour accéder à plusieurs plateformes.
MemPalace est un système de mémoire IA open-source benchmarké, gratuit. Conçu pour améliorer la rétention et le rappel d'informations dans les applications IA.
Anthropic aurait déployé environ six ingénieurs à la NSA pour adapter son modèle Mythos à des opérations cyber offensives contre la Chine et l'Iran. Les restrictions d'Anthropic sur l'utilisation de l'IA ne s'appliquent explicitement qu'aux citoyens américains.
Andreas Kling annonce que Ladybird n'acceptera plus les pull requests publiques. Le projet ferme ses contributions externes car l'IA rend impossible de vérifier la bonne foi des contributeurs. Seules les personnes responsables des changements pourront les introduire.
Pearl, une plateforme d'« AI mining », a été testée avec un budget de 50 $. Résultat : 320 000 GPU n'ont produit aucun résultat IA mesurable. L'article remet en question la viabilité du modèle commercial.
SupraLabs publie Supra-50M-Reasoning, version raisonnement du modèle Supra-50M-Instruct. Fine-tuné sur 500 échantillons synthétiques générés par Qwen3 1.7B pendant 6 epochs, il produit une chaîne de pensée avant chaque réponse. Modèle et dataset open-source disponibles.
Google Gemma 4 12B peut tourner localement sur laptop pour des workflows d'agents. Le modèle offre capacités de raisonnement et d'exécution de tâches sans dépendre de serveurs cloud.
Lassie lève 35 millions de dollars auprès d'Andreessen Horowitz pour accélérer le développement de ses agents IA destinés à automatiser les opérations des PME.
Benchmark de Gemma 4 12B sur un test de détection de bugs Python. Le modèle trouve 6 bugs vs 14 pour Qwen 35B. Les paramètres par défaut de LM Studio désactivent le reasoning. Solution : activer enable_thinking dans le template Jinja, configurer les tokens de pensée (<|channel>thought / <channel|>), et utiliser température 1.0, top_p 0.95, top_k 64.
Article explorant comment les LLM effectuent des opérations arithmétiques sans manipuler directement les nombres. Analyse les mécanismes internes et les représentations utilisées par les modèles de langage pour résoudre des problèmes mathématiques.
Trapilot AI propose une plateforme SEO entièrement pilotée par l'IA pour remplacer les outils traditionnels fragmentés. La startup vise à unifier les fonctionnalités SEO sous une interface IA-native.
Un développeur a créé un module Edge AI de moins de 5 MB pour reconnaître le morse manuscrit et imprimé sur Android, fonctionnant entièrement hors ligne avec LiteRT. Le projet soulève la question de l'intérêt des petits modèles spécialisés face à la tendance dominante des LLM locaux plus volumineux.
Lowfat est un filtre CLI modulaire qui réduit la consommation de tokens LLM de 91,8% selon son créateur. L'outil s'intègre dans les pipelines existants pour optimiser les requêtes avant envoi aux modèles.
Benchmark utilisateur du RTX Pro 4500 Blackwell 32GB vs RTX 5060 Ti 16GB. Le Pro 4500 offre ~2x plus de performance sur modèles denses, 3-6x sur traitement de prompt MoE, 1.8-2.6x sur génération de tokens. Avantage clé : modèles entiers en VRAM sans quantification KV.
Anthropic révèle que Claude génère plus de 80% de son code de production et que ses ingénieurs livrent 8× plus de code par jour qu'en 2024. La firme plaide pour un moratoire mondial vérifiable sur le développement IA, conditionnant son arrêt à celui des autres labs frontière.
Wired découvre du code de reconnaissance faciale caché dans l'application IA de Meta. Le code n'était pas documenté publiquement, soulevant des questions sur la transparence de Meta concernant ses capacités de vision et ses pratiques de collecte de données.
Utilisateur adopte Gemma 4 12B (Unsloth Q5_K_XL) comme modèle principal pour le coding local. Passe de Q4_K_XL (61 t/s, 23 erreurs de syntaxe) à Q5 (50 t/s, résultats one-shot). Consomme 15.7 GB VRAM avec contexte 32k. Préfère à Qwen 3.6 27B pour sa compatibilité plug-and-play vs configuration tool calls complexe.
Anthropic AI a découvert une vulnérabilité de contrefaçon dans Zcash, causant une chute de 30% du prix de ZEC. La faille critique affecte la sécurité du protocole de confidentialité.
Dashlane révèle les détails techniques de l'attaque ayant compromis ses coffres-forts de mots de passe chiffrés. Le gestionnaire de mots de passe explique la méthode utilisée par les pirates pour accéder aux données sensibles des utilisateurs.
Quantifier le spec draft dans llama.cpp avec MTP réduit la taille de contexte disponible. Avec q4_0, le contexte passe de 91648 tokens (fp16 par défaut) à 83200 tokens. Le développeur am17an a confirmé ce comportement contre-intuitif.
Le Pentagone opère une usine de propagande IA ciblant l'Amérique latine, selon un rapport. L'initiative utilise des modèles de langage pour générer du contenu de désinformation à grande échelle destiné aux réseaux sociaux régionaux.
Développeur crée un outil d'exploration pour Kokoro avec code MIT. Repo GitHub (brosoundml) + modèles HuggingFace disponibles. Binaires Windows CPU/CUDA fournis. Auteur envisage d'étendre à d'autres modèles.
ElevenLabs lance Flows Agent, un agent IA capable de construire automatiquement des workflows. La plateforme promet d'automatiser la création de processus sans intervention manuelle.
Outil de quantification GGUF open-source (MIT) pour créer des modèles NVFP4 et MXFP6. Utilise imatrix et logits KLD pour évaluer et combiner plusieurs méthodes de quantification par couche. Démontre de meilleures performances que ModelOpt sur Qwen 27B. Inclut rapports détaillés et validation reproductible.
Google Magenta RealTime 2 : modèles de musique en direct open-source et locaux. Génération musicale temps réel sans serveur cloud, exécution sur machine locale.
Google Magenta RealTime 2 propose des modèles musicaux open-source et locaux pour générer de la musique en temps réel sur ordinateur portable. Permet de construire et jouer des instruments IA sans connexion cloud.
Étude de l'interaction entre LoRA et KV cache en question-answering. Les adaptateurs LoRA deviennent utiles sous compression agressive du cache (récupérant 13-21 points ROUGE-L), fonctionnant comme mémoire paramétrique au décodage plutôt que comme encodeur. Supervision QA produit des adaptateurs plus forts que la prédiction next-token.
CVT-RL, un algorithme de gradient de politique avec récompenses vérifiables denses, améliore l'apprentissage par renforcement des agents de langage long-horizon. Sur QA, ALFWorld, ScienceWorld et tâches web/outils, le succès passe de 71,8% (RL non-causal) à 78,9%, le F1 des preuves de 78,9 à 82,8, et le hacking mesuré de 7,2% à 3,9%. Les tests statistiques donnent p<0,01 après correction de Holm.
ArcANE est un benchmark automatisé évaluant si les agents de rôle-playing maintiennent la cohérence psychologique des personnages au fil de l'histoire. Construit sur 17 romans et 80 personnages, il teste les réponses à travers différentes phases narratives et scénarios inédits. Conditionner sur l'arc de caractère surpasse toutes les autres stratégies contextuelles sur 6 modèles.
InfoShield minimise l'information mutuelle entre représentations vocales et attributs sensibles (genre, âge) pour le dépistage de dépression. TimeAwareMINE avec attention cross-modale réduit l'inférence de genre de 92,6% à 55,5% et d'âge de 55,7% à 30,3%, avec F1=0,784 sur Androids Corpus.
Méthode de détection et diagnostic des erreurs de prononciation utilisant des graphes statistiques spécifiques à la langue. Approche capture les confusions phonémiques et les différences systématiques selon la langue maternelle (L1). F1-score de 59,52% sur le benchmark L2-ARCTIC.
TensorBench est un benchmark de 199 tâches de codage (ajouts de fonctionnalités et refactorisation) sur un framework tensor open-source basé compilateur étendant PyTorch. Évaluation de 7 agents de codage : taux de réussite de 64,8% (meilleur) à 22,1% (plus faible), avec faible accord inter-agents (κ=0,05 pour les deux meilleurs).
Alpha-RTL introduit TTT-RTL, un framework d'apprentissage par renforcement au moment du test pour optimiser la génération RTL par LLM. Sur RTLLM v2.0 (Nangate 45nm), TTT-RTL réduit le produit PPA de 65,1% vs référence et surpasse les baselines gelées de 26,1%. Sur XuanTie C910 FPU (Sky130), réduction ADP de 59,4%. Contrôleur KL-budget adaptatif stabilise les mises à jour de politique.
Les LLMs s'appuient excessivement sur les affixes morphologiques pour raisonner sur les médicaments, générant du contenu clinique plausible pour des noms fictifs (ex: wugcillin). Une étude sur 653 médicaments montre que les modèles induisent le sens principalement via les affixes sans l'indiquer explicitement, créant un risque de sécurité en domaine médical.
Étude ERP sur 24 enfants (12 autistes, 12 contrôles) examinant le traitement des constructions locatives récursives en mandarin. Les enfants autistes montrent une prédiction structurale réduite (P200 atténué), une intégration sémantique accrue (N400 augmenté) et une réanalyse syntaxique diminuée (P600 réduit), avec variabilité inter-individuelle accrue en latéralisation hémisphérique.
RidgeFT, un framework d'apprentissage continu sans rejeu d'exemplaires, attribue les textes générés par IA à leurs modèles sources. La méthode gèle un encodeur entraîné initialement, stocke des statistiques suffisantes par classe, et utilise la régression ridge en forme fermée pour adapter les nouveaux générateurs tout en conservant les anciens.
GATE (Grounding After Test from Execution) bootstrappe les groundings manquants en text-to-SQL via feedback d'exécution. Le système maintient plusieurs hypothèses de grounding ouvertes, exécute les parties déjà groundées pour obtenir des observations, puis valide et mémorise les hypothèses confirmées. Cette mémoire d'exécution s'accumule et améliore les performances sur benchmarks réels et contrôlés.
VSRAQ, une méthode de quantification post-entraînement pour modèles Mixture-of-Experts, préserve la sélection d'experts lors de la quantification en alignant les valeurs de routage et la structure des décisions top-k. Réduit la dégradation sans surcoût d'inférence.
Cadre unifié pour la communication latente dans les systèmes multi-agents basés sur LLM. Les agents échangent des représentations continues (embeddings, états cachés, KV-caches) au lieu de texte, réduisant coûts d'inférence et perte d'information. Analyse 18 méthodes (2024-2026) selon 3 axes : QUOI communiquer, QUEL alignement sender-receiver, COMMENT fusionner l'information.
Étude de screening factoriel par étapes pour l'optimisation d'hyperparamètres en micro-préentraînement sur GPU unique avec budget limité. 613 expériences testent l'effet de batch, profondeur et largeur du modèle sur 2-24h. Les facteurs D, A, B, C restent significatifs après correction statistique; la recherche aléatoire converge vers des régions similaires sans attribution causale.
Analyse théorique montrant que la descente de gradient discrète avec grand pas dans les réseaux linéaires profonds multi-chemins restaure la symétrie. Contrairement aux prédictions du gradient flow (spécialisation winner-takes-all), le GD avec oscillations à l'Edge of Stability redistribue les signaux entre chemins, favorisant les représentations partagées plutôt que la dominance d'un seul chemin.
Étude épidémiologique de l'effondrement de modèles causé par l'entraînement sur données synthétiques. Framework SIR/SIRS bipartite modélisant la contamination croisée entre corpus de données et modèles IA. Expériences GPT-2 sur WikiText et Shakespeare (192 runs) confirment dégradation dose-réponse; R₀ > 1 indique dynamiques supercritiques. Détection synthétique et filtrage identifiés comme leviers principaux.
Étude de mécanismes interprétatifs sur Qwen3-4B-Instruct-2507 : localisation causale de circuits de préférence temporelle via attribution de gradients et patching d'activation. Les LLMs encodent l'horizon temporel dans le residual stream et actualisent le futur moins fortement que les humains, mais cette préférence est instable contextuellement. Vecteurs de steering montrent un potentiel de contrôle explicite.
Nouvelle famille de priors bayésiens structurés combinant variation totale (TV) et normes ℓp pour l'imagerie T₁ médicale. Inférence via NUTS, évaluation sur données cérébrales, cardiaques et mammaires synthétiques/réelles. Réduit l'incertitude et le biais comparé aux approches ML et priors alternatifs.
CausalPOI propose un framework de causal representation learning pour prédire les patterns de check-in de nouveaux Points of Interest (POI) en milieu urbain. Le modèle utilise des graphes spatio-temporels fonctionnels et simule des scénarios contrefactuels pour capturer les effets causaux des interventions urbaines, surpassant les baselines sur les données SafeGraph.
Efficient Operator Search propose un cadre différentiable pour optimiser automatiquement les opérateurs de réduction de tokens dans les modèles multimodaux. Le framework recherche où réduire les tokens, combien en conserver, et comment traiter l'information réduite. Les expériences montrent des compromis accuracy-efficacité compétitifs, notamment sous réduction agressive de tokens visuels.
Les équations différentielles neurales branchées (B-NRDEs) étendent les NRDEs pour capturer les dynamiques Itô sur variétés. Elles utilisent une structure Hopf-algébrique basée sur les arbres racinés de Grossman-Larson et Munthe-Kaas-Wright, préservant exactement les contraintes de variété. Validation sur volatilité Bergomi, dynamiques SO(3) et matrices SPD.
Nouvelle méthode d'entraînement pour distinguer le calcul temporaire de l'état persistant dans les modèles de langage. Counterfactual Erasure RL (CERL) récompense les modèles quand la réponse reste correcte après suppression des pensées intermédiaires. Évaluation sur mathématiques, logique et QA scientifique montre réduction de la dépendance aux calculs cachés sans perte de précision.
PyCC.id est une bibliothèque Python pour la découverte d'équations différentielles guidée par hypothèses. Elle utilise des « squelettes » structurels inspirés par les courbes caractéristiques pour réduire l'espace de recherche et vérifier l'identifiabilité structurelle des modèles candidats. Supporte réseaux de neurones, régression symbolique et régression sparse.
Agentic Monte Carlo (AMC) optimise les agents LLM black-box sans accès aux paramètres. La méthode utilise Sequential Monte Carlo pour échantillonner depuis la politique optimale en apprenant une fonction de valeur, sans modifier le modèle sous-jacent. Validée sur AgentGym, AMC surpasse les baselines de prompting et GRPO.
Étude théorique des régimes d'apprentissage extrêmes dans les autoencodeurs linéaires de grande taille. Les auteurs identifient cinq régimes fondamentaux (large-data, small-data, mean-field, narrow-latent, free) associés aux faces d'un prisme triangulaire. Expressions explicites dérivées pour l'évolution de la perte en gradient flow.
SHALA-LLM est un framework d'apprentissage par renforcement qui traite l'ambiguïté des labels comme une information utile plutôt que du bruit. Sur NLI et reconnaissance d'émotions, il réduit la distance Jensen-Shannon de 62,1% sur ChaosNLI et améliore le F1 de 16,7% en apprenant directement des distributions d'annotateurs.
DP-MacAdam combine le clipping adaptatif et le momentum adaptatif en DP-SGD. L'algorithme réutilise les mêmes estimations de moyenne et variance pour ajuster le seuil de clipping et accélérer l'entraînement. Évaluation empirique montre amélioration d'utilité du modèle vs DP-SGD, AdaClip, DP-Adam sans tuning manuel.
GOTabPFN introduit une méthode de compression de features pour les modèles tabulaires fondamentaux en régimes haute-dimensionnelle/faible-échantillon. Graph-guided Ordering with Local Refinement (GO-LR) ordonne les features, puis Neuro-Inspired Subunit Compression les agrège en meta-features. Résultats : stabilité et précision améliorées sous contrainte de tokens sur benchmarks tabulaires.
LEVANTE-bench compare 6 modèles de vision-langage (VLMs) à des enfants de 5-12 ans (N=1547) sur des tâches cognitives standardisées dans 3 pays. Les modèles plus grands s'alignent mieux globalement, mais les petits modèles reproduisent mieux les erreurs des jeunes enfants. Les VLMs échouent sur le raisonnement matriciel et la rotation mentale.
Étude de modèles triple-latent maintenant un état token courant et une mémoire compressée pour capturer les interactions d'ordre supérieur. Amélioration sur WikiText-2 (byte-level) et MiniMind, avec extension de récupération associative gated mais sensible aux seeds et lente.
Framework d'interprétabilité pour l'évaluation automatique de transcriptions pédagogiques basée sur des rubriques. Combine attributions SHAP avec rationales générées par LLM. Sur 6k segments annotés : modèles fine-tunés surpassent les LLMs en précision mais compressent les scores ; SHAP identifie les phrases déterminantes avec transfert robuste entre architectures, contrairement aux rationales LLM.
LANTERN est une couche mémoire légère qui archive chaque tour de conversation et restaure les détails pertinents après compaction via récupération hybride, sans appels LLM et avec <25ms de latence. Sur 94 conversations multi-tours (1 894 faits validés), LANTERN-Rerank récupère 78,3% des faits perdus, surpassant MemGPT (72,4%, p<0.0001) avec coût d'inférence réduit.
PERSUASIONTRACE est un framework pour étudier la persuasion dans les interactions humain-LLM. Il enregistre les changements de croyances multi-tours, annote les stratégies rhétoriques (logos/pathos/ethos), et évalue les simulateurs par fidélité aux dynamiques humaines réelles. Un modèle bayésien maintenant un état de croyance latent explicite atteint 81/100 en ressemblance humaine vs 64 pour les LLMs vanilla.
Méthode pour détecter précocement les échecs dans les dialogues et trajectoires d'agents IA. Approche deux étapes : prédicteur basé attention identifiant les indices d'échec clairsemés (4,7-11,3% des tours) et politique α-STOP pour sélectionner le point de fonctionnement à l'inférence. Amélioration de 3-42% sur la frontière Pareto vs méthodes existantes.
ComplexityMT est un benchmark évaluant comment la complexité textuelle (niveaux CEFR) interagit avec la traduction automatique. Sur 6 langues (arabe, néerlandais, anglais, français, hindi, russe), les auteurs testent 3 modèles open-weight, 1 fermé et 1 système commercial. Résultats : les niveaux CEFR élevés rendent la traduction plus difficile ; la TA modifie le niveau CEFR du texte cible pour la plupart des langues.
PRIG, une méthode d'attribution par gradient, localise l'ambiguïté dans les prompts LLM en entraînant une sonde linéaire à distinguer les prompts clairs des ambigus, puis attribue le score de la sonde aux représentations de tokens. Évalué sur des datasets synthétiques (codage, math, écriture) et un benchmark humain, PRIG atteint 0.840 AUROC sur le benchmark synthétique combiné et 0.891 AUROC sur l'ensemble gold.
CHASE est un framework de red-blue teaming co-évolutif qui entraîne un attaquant et un défenseur via GRPO pour améliorer la robustesse des LLM contre les attaques par réécriture de prompts (persona modulation, framing fictionnel). Évalué sur BeaverTails et JailbreakBench, il réduit le score StrongREJECT de 43,2% sans faux refus sur prompts bénins.
AURA est un système d'agents LLM situés qui détecte les besoins implicites au-delà de la requête littérale. Entre la perception de scène et l'utilisation d'outils, il génère un IntentFrame structuré avec un score d'écart pour contrôler le budget de sondage. Sur un benchmark de 100 requêtes, AURA améliore la couverture des besoins implicites de +0.07 (p < 10^-6) par rapport à ReAct.
Purdue University utilise GPT-4o, GPT-5-mini et GPT-5.2 pour évaluer 1 200 candidatures au programme SURF 2026. Les modèles notent les déclarations d'intention sur 6 critères (0-3 points), générant scores et justifications en 4,6 heures. GPT-5.2 adhère mieux à la grille d'évaluation. La révision finale par coordinateur prend 4 heures au lieu de plusieurs semaines.
Étude arXiv montrant que les hyperparamètres optimaux du continued pre-training suivent des lois d'échelle prévisibles. Framework en deux étapes : découverte empirique via modèles proxy, puis prédiction state-aware basée sur la perte de validation. Réduit la recherche d'hyperparamètres de 90% tout en maintenant les performances.
AdaPlanBench est un benchmark interactif évaluant la capacité des agents LLM à planifier et replanifier face à des contraintes monde et utilisateur révélées progressivement. Construit sur 307 tâches ménagères, il teste 10 modèles leaders : le meilleur atteint 67,75% de précision. Les performances se dégradent avec l'accumulation de contraintes, notamment les contraintes utilisateur.
QueryAgent-R1 est un framework multi-agent pour la recommandation de requêtes e-commerce. Il optimise l'alignement entre requêtes générées et produits récupérés via une boucle de validation basée sur l'inventaire réel. Avec RL et une récompense de cohérence, il améliore CTR de 2,9% et CVR de 3,1% en production.
Détection multilingue de la maladie d'Alzheimer à partir de la parole via apprentissage par transfert cross-linguistique. Modèles transformer entraînés sur l'anglais, le chinois, l'arabe et l'hindi atteignent 82% F1 avec généralisation cross-linguistique. Inférence en 0,5s pour dépistage temps réel.
A4D propose un espace latent fonctionnel organisé autour des affordances (capacités) plutôt que l'apparence des objets, pour améliorer la généralisation de la planification robotique. Le système atteint 94% de précision sur les affordances existantes (+15 points vs SOTA) et 90% sur les nouvelles affordances avec 10% des données d'entraînement originales, avec inférence 100x plus rapide.
Nouvelle approche de pré-entraînement combinant MLM (Masked Language Modeling) et JEPA (Joint Embedding Predictive Architecture) pour les encodeurs texte. Modèle hybride entraîné sur Wikipedia anglais avec budget identique. Résultats : embeddings plus uniformes (-0.16 vs -0.05), géométrie spectrale riche, meilleur équilibre sémantique-lexical sur benchmarks GLUE.
SA-AH-GRPO, extension de GRPO, applique un discount asymétrique basé sur l'entropie aux tokens pour l'RL des LLMs. Sur GSM8K, le modèle Qwen 2.5-3B atteint Pass@1=0.858 avec variance réduite 3.6× vs GRPO standard, tout en préservant les gradients sur les trajectoires correctes.
PJ-RoPE unifie les approches RoPE (phase de Fourier), Jordan-RoPE (jets finis) et ALiBi (récence affine) dans un espace de position relative unique et apprenable. Le cadre sépare les noyaux de biais scalaires des transformations de features rotatoires exactes, avec diagnostics adaptatifs et coordonnées LC/rapidité pour stabiliser les jets d'ordre élevé.
Framework Mamba-Assisted Closure (MAC) pour la modélisation d'ordre réduit de systèmes dynamiques haute dimension. Utilise Mamba comme modèle de séquence pour prédire le terme de fermeture non-Markovien inspiré du formalisme Mori-Zwanzig. Surpasse GRU et méthode Wilks sur équation Burgers visqueuse et système Lorenz '96 chaotique.
Étude mécanistique cross-architecture sur 3 modèles 1B (Pythia, OLMo, OLMoE) testant si l'identification de circuits par sélectivité de patterns + ablation causale produit des résultats reproductibles. Résultat : même tâche, même capacité comportementale, implémentations différentes selon le modèle. Taxonomie à 5 catégories (cause primaire, secondaire, corrélat, interférent, null) avec seuils quantitatifs.