SAP taps Mistral AI to help customers migrate legacy software
SAP s'associe à Mistral AI pour faciliter la migration des clients vers S/4HANA. Les modèles de Mistral AI aident à simplifier le processus de migration des logiciels legacy.
3149 articles
SAP s'associe à Mistral AI pour faciliter la migration des clients vers S/4HANA. Les modèles de Mistral AI aident à simplifier le processus de migration des logiciels legacy.
Le projet Heretic a reçu une mise en demeure légale de Meta concernant des dérivés du modèle Llama. Le projet a supprimé les poids de modèle des dépôts contrôlés et diversifie son infrastructure avec des miroirs sur Codeberg et d'autres plateformes pour préserver l'accès indépendamment des fournisseurs de services.
Un article publié sur arXiv montre que l'honnêteté de petits modèles open-source chute de 35% à 0% en changeant le ton de la requête. Face à des problèmes de codage impossibles, les modèles admettent l'impossibilité 33% du temps en langage neutre, mais 0% sous pression. L'analyse interne révèle que chaque ton laisse une signature distincte dans les couches profondes du réseau.
LlamaStation v0.9 est une interface graphique Windows pour llama.cpp avec support multi-backend (TurboQuant, MTP, AtomicChat, BeeLlama). Lance llama-server directement sans couche intermédiaire, offre contrôle complet des paramètres, mesure VRAM en temps réel, profils par modèle, mode voix hors ligne (XTTS v2 + faster-whisper), mode headless et mise à jour automatique.
LLM Planner est un guide interactif pour choisir du matériel ou des modèles open-weights. 60+ configurations, 50+ modèles, tokens/sec sourcés, consommation électrique, prix multi-régions, 150+ vidéos YouTube de reviewers. Modes bidirectionnels : « quel rig pour ce modèle/budget » ou « quels modèles sur mon GPU ». Données mises à jour hebdomadairement, repo GitHub public.
Qwen 3.7 Max d'Alibaba améliore ses performances de 4,8 points par rapport à Qwen 3.6 Max en preview sur les benchmarks IA.
Anthropic ouvre un bureau à Milan pour renforcer sa présence en Europe. L'expansion marque l'engagement de l'entreprise sur le marché européen.
Google Gemini a accidentellement divulgué son system prompt lors d'une interaction utilisateur. L'incident révèle les instructions internes du modèle et soulève des questions sur la sécurité des prompts système.
Une étude de dbt Labs révèle que la course à la vitesse en IA sacrifie la fiabilité des données. Les organisations privilégient l'efficacité immédiate au détriment de la qualité et de la confiance dans les pipelines de données.
Jensen Huang identifie un marché de 200 milliards $ pour l'IA agentique. Nvidia lance Vera, un processeur dédié aux agents IA, pour adresser ce segment.
Un développeur a mis à jour l'extension VS Code POML abandonnée par Microsoft. POML est un langage de markup pour créer des templates de prompts modulaires avec support IA local. Microsoft a arrêté le support après 2-3 mois ; une mise à jour de dépendance a cassé la fonctionnalité d'envoi direct aux LLM. Le développeur a utilisé OpenCode pour corriger le bug et moderniser les dépendances.
Tencent lance Hy-MT2, famille de modèles de traduction multilingue en trois tailles (1.8B, 7B, 30B-MoE) supportant 33 langues. Le modèle 1.8B compressé à 440 MB via quantization 1.25-bit surpasse les APIs commerciales Microsoft/Doubao. Les 7B et 30B dépassent DeepSeek-V4-Pro et Kimi K2.6. Benchmark IFMTBench et intégration WMT26 inclus.
AdventHealth déploie ChatGPT for Healthcare pour optimiser les flux de travail cliniques, réduire la charge administrative et libérer du temps pour les soins aux patients.
CPPL est un langage de programmation pour les prompts basé sur des circuits logiques. Il permet de structurer des instructions complexes via des opérateurs logiques et des flux de contrôle, offrant une alternative aux prompts textuels traditionnels.
Nexos.ai propose un outil de sécurité IA destiné aux DSI pour limiter les risques liés à l'utilisation d'IA en entreprise. L'article teste la solution face aux enjeux de gouvernance et de contrôle des usages IA en 2026.
Anthropic pourrait dépenser jusqu'à 1,25 milliard de dollars par mois auprès de xAI pour l'infrastructure jusqu'en 2029. Ce contrat représente un engagement majeur d'Anthropic envers la plateforme d'Elon Musk.
ik_llama.cpp surpasse llama.cpp sur RTX 4070 Super 12GB : 110 tok/s en moyenne vs 90.6 tok/s avec Qwen3.6-35B-A3B-IQ4_XS. Meilleure optimisation CPU offloading et speculative decoding (MTP) après dégradation des performances post-merge dans llama.cpp.
Dépôt GitHub contenant des skills pour assister les agents IA de codage avec .NET et C#. Ressources pour intégrer des capacités de développement .NET dans les workflows d'agents autonomes.
ccusage est un outil CLI pour analyser l'utilisation des tokens et les coûts associés aux agents de codage à partir de données locales.
Kata Containers est un projet open source créant des machines virtuelles légères offrant l'expérience des conteneurs avec l'isolation et la sécurité des VMs.
Datadog lance Pup, un CLI companion pour agents IA offrant 200+ commandes couvrant 33+ produits Datadog.
Outil open-source intégrant Gemini directement dans le terminal. Agent IA permettant l'interaction avec le modèle Google via CLI.
Chrome DevTools MCP intègre les outils de développement Chrome dans une interface Model Context Protocol pour les agents de code. Permet aux agents d'inspecter, déboguer et interagir avec des pages web en temps réel.
Argent est un toolkit agentic pour contrôler, déboguer et profiler les applications iOS et Android. Développé par Software Mansion.
Stitch-Skills est une bibliothèque de compétences d'agent compatible avec le serveur MCP Stitch. Les skills suivent le standard Agent Skills ouvert, compatibles avec Claude Code, Gemini CLI, Cursor et Antigravity.
Google publie adk-samples, une collection d'agents exemple construits avec l'Agent Development Kit (ADK). Dépôt open-source pour explorer les capacités de développement d'agents.
Forge est un framework Python pour l'exécution auto-hébergée d'appels d'outils LLM et de workflows multi-étapes agentic. Disponible en open-source sur GitHub.
API Python non-officielle pour Google NotebookLM offrant accès programmatique complet aux fonctionnalités, y compris celles non exposées en UI web. Support CLI et intégration avec agents IA (Claude Code, Codex, OpenClaw).
AutoResearchClaw automatise la recherche de bout en bout : génération d'idées, expériences, rédaction et publication de papiers sans intervention humaine. Système autonome et auto-évolutif basé sur des agents IA.
OpenAI Whisper est un modèle de reconnaissance vocale entraîné sur 680 000 heures de données multilingues faiblement supervisées. Le repo GitHub contient le code, les modèles pré-entraînés et les benchmarks de performance sur plusieurs langues et conditions acoustiques.
Outil et documentation pour vérifier la compatibilité OpenAI des projets open-source (vLLM, llama.cpp, etc.). Documente les signatures officielles et non-officielles, avec extensions pour d'autres types de modèles. Utile pour intégrer des endpoints LLM dans des applications ou créer des proxies/middleware.
Google annonce l'intégration officielle de publicités dans les résultats de recherche AI Mode. Cette monétisation des réponses génératives marque un tournant stratégique pour le géant de la tech face à la concurrence des chatbots.
Free, Orange, EDF et acteurs majeurs du numérique français s'allient pour construire une AI Gigafactory en France. Initiative visant à développer capacités de calcul et infrastructure IA domestique.
Vercel ajoute l'accès aux alertes d'anomalies via CLI avec la commande `vercel alerts`. L'option `--ai` affiche les résultats d'investigation IA pour chaque alerte. Disponible sur Observability Plus.
Le prompt GeoGuessr réputé pour O3 ne fonctionne pas comme annoncé. Les tests montrent que la technique virale ne produit pas les résultats attendus sur le modèle OpenAI.
Un utilisateur a développé une UI personnalisée pour jouer à One Night Werewolf avec des LLMs (Gemma 31B/26B, Qwen 3.6 36B, modèle 27B). Les modèles avaient initialement du mal à accepter les changements d'identité ; l'ajout d'une orientation vers les objectifs a amélioré les performances. Un script runner compatible avec l'API OpenAI permet désormais de jouer sans capacités de tool calls.
AMD lance la plateforme Ryzen AI Halo Developer et les processeurs Ryzen AI Max PRO 400 Series pour les ordinateurs agents nouvelle génération. Annonce officielle détaillant la disponibilité du Halo Box et de la série AI 400.
Mistral AI acquiert la startup autrichienne Emmi AI pour renforcer sa présence dans l'industrie européenne. Cette acquisition accélère la stratégie d'expansion du groupe français sur le marché continental.
OpenAI GPT-next a résolu le problème planar unit distance d'Erdős, ouvert depuis 80 ans, pour moins de 1000 dollars. Résultat significatif à l'intersection IA et mathématiques.
Google lance Universal Cart, une expérience d'achat intégrée alimentée par Gemini, pour concurrencer Amazon. La plateforme unifie le shopping across Google's services.
Qwen 3.7 Max d'Alibaba est désormais disponible sur Vercel AI Gateway. Le modèle, conçu comme fondation d'agent, excelle en prototypage frontend, ingénierie multi-fichiers et automatisation de workflows bureautiques via orchestration multi-agent.
CompactAI-O lance un concours mensuel « Model Golf » pour modèles de moins de 100M paramètres. Le gagnant reçoit 50$ de crédits RunPod chaque mois. Compétition ouverte aux développeurs.
Google lance Ask YouTube et Ask Maps, des outils de recherche conversationnelle basés sur l'IA. Ces fonctionnalités remplacent progressivement la recherche par mots-clés traditionnelle avec des réponses générées par IA.
Utilisateur rapporte une latence E2E élevée (3-5s) sur Gemma 4 26B fine-tuné malgré TTFT faible (100-300ms) sur H100 avec vLLM et quantization FP8. Cherche optimisations : speculative decoding (EAGLE/Medusa), draft models, ou investigation des goulots.
Utilisateur apprécie Qwen3.6 27B quantifié en Q5_K_XL sur llama.cpp avec deux RX 9070 XT. Le modèle excelle en débogage de code complexe (services backend distribués), maintenant 398 tokens/s en prompt eval et 46.9 tokens/s en génération. Capacités agentiques remarquables malgré la quantification basse.
Comparaison empirique de quatre harnesses d'agents de code (GitHub Copilot, Pi, Claude Code, OpenCode) avec Qwen 3.6 27B sur les mêmes tâches. Qwen excelle avec Claude Code et OpenCode (4 requêtes pour créer pelican.svg), mais échoue avec GitHub Copilot (13 requêtes). OpenCode offre recherche internet et génération de widgets interactifs.
Fivetran publie un indice mondial montrant que malgré des budgets massifs (dizaines de millions d'euros), la mise en production de l'IA agentique rencontre des obstacles significatifs de performance.
LinkedIn combat les posts générés par IA en détectant et réduisant leur visibilité. La plateforme renforce ses filtres pour limiter le contenu auto-généré et les phrases motivantes artificielles.
Un utilisateur entraîne un modèle DCGAN from scratch sur 350 images d'un gobelet rouge Solo prises avec un iPod touch 4, en variant les conditions d'éclairage et arrière-plans. L'objectif : capturer les artefacts spécifiques du capteur de l'appareil. Les résultats rappellent DALL-E 2022.
Les modèles de diffusion masqués (MDLMs) surpassent les LLMs autorégressifs comme modèles du monde pour l'RL agentic. Fine-tuning sur SDAR-8B et WeDLM-8B montre +4x sur BLEU-1/ROUGE-L/MAUVE. GRPO training atteint +15% de succès sur ScienceWorld, ALFWorld, AppWorld avec Qwen3, Mistral, LFM2.5 en zéro-shot.
CSA (Conformal Selective Acting) est un wrapper de déploiement pour LLMs fine-tunés en RLVR qui garantit un contrôle du risque par round sans pooling entre déploiements. Testé sur 480 streams spécialisés et 10,300 rounds en Expert-Iteration avec LoRA, CSA maintient une e-process de Ville par seuil et atteint une borne de risque sélectif R_T^act ≤ α+O(N_T^{-1/2}) avec validité pathwise anytime.
ProxyCoT, une méthode de fine-tuning par chaîne de pensée, améliore le raisonnement sur contextes longs (jusqu'à 10M tokens) en transférant les capacités de raisonnement depuis des contextes proxy courts vers des contextes complets via RL/distillation puis fine-tuning supervisé. Gains de performance avec surcharge computationnelle réduite et généralisation cross-domain.
Étude arXiv montrant que les LLMs idéalisent excessivement les expériences des personnes handicapées dans la génération de contenu social media, produisant des stéréotypes positifs irréalistes. Analyse comparative révèle aussi un biais négatif : certains thèmes (carrière, divertissement) sont surreprésentés chez les individus sans handicap, renforçant des narratifs d'exclusion.
Nouvelle architecture Pseudo-Siamese (FF-BPSN) pour planifier des chemins de dialogue vers des cibles prédéfinies. Utilise deux décodeurs transformers bidirectionnels avec module forward-focused. Testé sur DuRecDial et DuRecDial 2.0, améliore significativement les systèmes de dialogue proactif orientés cible.
Les LLM peinent à respecter les conventions spécialisées des benchmarks de référence. Les auteurs proposent un cadre itératif de modération qui réutilise et affine les directives d'annotation pour aligner les modèles. Tests sur trois tâches de NER biomédicales (NCBI Disease, BC5CDR, BioRED) avec GPT, Gemini, DeepSeek confirment l'efficacité de l'intégration de directives et des modèles optimisés pour le raisonnement.
Mix-Quant propose une quantification différenciée pour les agents LLM : FP4 en phase de prefilling (3x plus rapide) et BF16 en decoding. Cette approche phase-aware réduit le goulot d'étranglement computationnel des workflows agentic tout en préservant la qualité des réponses sur benchmarks long-context.
Étude sur le conflit entre suivi d'instructions et complétions de motifs dans 13 LLMs. Quand une instruction utilisateur entre en conflit avec N tours d'assistant montrant un motif opposé, les taux de suivi d'instructions varient de 1% à 99%. La transition est universelle mais dépendante du modèle. La diversité des outputs et l'alignement avec les valeurs entraînées modulent la robustesse.
Chercheurs proposent un puzzle interactif illustrant le fonctionnement, capacités, limites et implications sociétales des LLM comme ChatGPT. L'image complétée forme une infographie en bande dessinée ; chaque pièce fonctionne aussi comme carte informative autonome. Outil ludique pour l'alphabétisation IA en contexte d'apprentissage informel.
SCRIBE est un framework de diagnostic pour l'ASR en langues indiennes qui décompose les erreurs en catégories (lexicales, ponctuation, numéraux, entités) au lieu d'utiliser le WER. Alignement tolérant aux sandhi avec injection de vocabulaire domaine. Modèles open-weight pour hindi, malayalam et kannada.
Étude arXiv sur l'impact du Chain-of-Thought (CoT) sur les biais de genre dans les LLM. Les chercheurs combinent évaluation benchmark, interprétabilité mécanistique et analyse des chaînes de raisonnement. Résultat : CoT ne réduit pas systématiquement les biais ; les améliorations observées proviennent de mémorisation plutôt que d'une compréhension genuine, les biais restant ancrés dans les représentations cachées.
Étude sur les biais inductifs dans la génération morphologique neuronale. Analyse de l'inflexion des verbes au passé en japonais révèle qu'une sous-classe irrégulière rare (<1% des données) concentre une part disproportionnée des erreurs. Les ablations contrôlées montrent que supprimer cette sous-classe améliore davantage la généralisation que d'éliminer tous les verbes irréguliers.
Traduction directe entre langues des signes (ASL, CSL, DGS) via modèle MBART entraîné sur paires synthétiques générées par back-translation. Approche directe signe-à-signe surpasse la cascade (20% meilleure MPJPE, 50% meilleur BLEU-4) avec 2.3× accélération.
HRM-Text remplace les Transformers standard par un modèle récurrent hiérarchique (HRM) découplant calcul stratégique lent et exécution rapide. Un modèle 1B entraîné sur 40B tokens et $1,500 atteint 60.7% MMLU, 81.9% ARC-C, 82.2% DROP, 84.5% GSM8K, 56.2% MATH — 100-900x moins de tokens et 96-432x moins de calcul que les baselines.
Pipeline deux étapes pour captionner des images culturelles en langues autochtones : Qwen2.5-VL génère une caption intermédiaire en espagnol, puis Gemini 2.5 Flash produit la caption cible via retrieval-augmented prompting. Amélioration de 164,1% (Bribri), 131,7% (Guaraní), 122,6% (Nahuatl Orizaba) sur la baseline. Gagnant du shared task AmericasNLP 2026.
Étude d'experts (45 scientifiques, 469 heures) évaluant 2,960 critiques de 82 articles Nature. GPT-5.2 surpasse le meilleur reviewer humain (60,0% vs 48,2%), mais les IA montrent 16 faiblesses récurrentes (connaissance limitée du sous-domaine, gestion faible du contexte long). Les IA complètent plutôt qu'elles ne remplacent les humains.
DIVE compresse les embeddings de LLM via des adaptateurs légers avec perte triplet auto-limitante et contrastive NT-Xent. Surpasse Matryoshka-Adaptor, Search-Adaptor et SMEC sur 6 datasets BEIR à tous les ratios de compression. Implémentation open-source 14M paramètres.
Nouvelle métrique d_NTP pour évaluer la qualité des task vectors en ICL en mesurant l'alignement des distributions de probabilités. Méthode Linear Task Vector (LTV) minimise d_NTP via régression linéaire fermée, améliore la précision de 9,2% sur 8 benchmarks et 5 LLMs, réduit la latence. Task vectors transférables entre modèles de tailles différentes (+6,4% pour petit modèle).
Les LLM simulant des utilisateurs dans des expériences d'intervention produisent des études observationnelles biaisées. Entraînés sur données observationnelles, ils induisent des dérives de population implicite entre conditions de traitement, faussant les estimations d'effet. Les auteurs proposent des contrôles négatifs pour diagnostiquer ces biais et ajuster les spécifications de persona pour les réduire.
Article de synthèse sur l'utilisation de NLP et LLMs pour extraire des impacts socio-économiques de données textuelles (news, réseaux sociaux, rapports) concernant les aléas climatiques (inondations, sécheresses, tempêtes). Propose des recommandations méthodologiques pour standardiser la construction de datasets d'impact et améliorer la gestion des risques de catastrophes.
GRAM (Generative Recursive reAsoning Models) étend les modèles de raisonnement récursif en remplaçant les trajectoires latentes déterministes par du calcul probabiliste multi-trajectoires. Entraîné par inférence variationnelle amortie, GRAM surpasse les baselines récurrentes sur des tâches de raisonnement structuré et satisfaction de contraintes multi-solutions.
Framework neural pour estimer l'information mutuelle conditionnelle par paires directement depuis les états cachés de modèles de diffusion masqués (MDMs). L'estimateur capture les dépendances internes du modèle et permet un décodage parallèle guidé par MI, réduisant les passes forward d'inférence de 3-5x sur Sudoku et génération de séquences protéiques (ESM-C).
Geometry-Lite est une sonde de sécurité compacte qui analyse la géométrie des représentations cachées à travers les couches de LLMs (1.2B–70B). Elle mappe les marges de chaque couche via trois méthodes (centroïde, voisinage local, frontière linéaire) et montre que la détection de prompts non-sûrs repose principalement sur la géométrie persistante des marges, non sur le mouvement inter-couches.
GROW adapte GRPO (Group Relative Policy Optimization) aux agents VLM en décomposant les trajectoires en échantillons état-action pour éviter les contextes trop longs. Testé sur 800+ tâches Minecraft, la méthode atteint SOTA en RL multi-tour pour agents open-world.
Nouvelle approche pour la classification de nœuds en graphes partiellement étiquetés. Les auteurs proposent Transductive Sharpening (TS), une modification de la fonction de perte qui minimise l'entropie des prédictions sur les nœuds non étiquetés tout en équilibrant l'effet sur les nœuds étiquetés. Améliorations consistantes sur plusieurs benchmarks sans modification architecturale.
Framework de CNN avec encoder-decoder pour prédire les champs de vitesse à l'échelle des pores dans les milieux poreux. La fonction de perte combine reconstruction de vélocité, incompressibilité et contraintes physiques. Tests sur géométries hors distribution et accélération de simulations Lattice-Boltzmann (90% des cas).
Deux nouveaux modèles d'apprentissage auto-supervisé pour la prédiction de liens dans les graphes : L-GRACE et L-BGRL. Basés sur des représentations de liens plutôt que de nœuds, ils intègrent une augmentation structurelle fondée sur la structure communautaire. Performance comparable à l'état de l'art en contextes supervisé et auto-supervisé.
Chronicle est un modèle fondation multimodal de 324M paramètres entraîné de zéro sur le langage naturel et les séries temporelles dans une architecture unifiée. Le modèle partage les mêmes blocs transformer et mécanismes d'attention pour les deux modalités. Il égale Gemma-3-270M sur 19 tâches NLU, établit un nouveau record sur 24 datasets UCR/UEA et surpasse les baselines supervisées sur Time-MMD.
Article théorique sur la généralisation hors-distribution en RL. Les auteurs étendent le cadre d'abstraction d'état aux POMDPs et introduisent une réduction de modèle pondérée par successeur. Ils prouvent qu'un espace d'état abstrait plus petit améliore la généralisation à des tâches plus complexes.
OmniISR propose un cadre unifié pour l'apprentissage centralisé et fédéré via supervision intermédiaire et régularisation. Le framework utilise l'information mutuelle pour aligner les décalages de covariables internes et la négative-entropie pour régulariser les prédictions. Convergence O(1/sqrt(T)) garantie théoriquement; réduction de l'écart CL-FL de 22,60% en expériences.
Méthode plug-and-play pour convertir les opérateurs non-linéaires des Transformers en opérations compatibles avec les réseaux de neurones impulsionnels (SNN). Décompose Softmax, SiLU et normalisation en primitives (division, exponentiation, normes L2) exécutables par groupes de neurones LIF sans fine-tuning. Perte <1% sur benchmarks LLM.
Nouvelle approche de codage prédictif via filtres gaussiens hiérarchiques. Les auteurs restaurent les messages pondérés par la précision, permettant l'apprentissage simultané des activations, poids et précisions sans signal d'erreur global. Sur FashionMNIST, la méthode converge plus vite que la rétropropagation tout en maintenant les avantages biologiques du codage prédictif.
Répéter un petit dataset lors de l'entraînement accélère l'apprentissage comparé à un grand dataset, via des biais d'échantillonnage qui favorisent la croissance couche par couche. L'effet est observé sur tâches algorithmiques, architectures et optimiseurs variés. Les auteurs proposent analyse théorique et interventions empiriques.
Étude utilisant BERT pour analyser le sentiment Discord de la communauté Decentraland et prédire le prix du token MANA. Un modèle LSTM multi-modal intégrant sentiment, volume et capitalisation surpasse significativement le baseline prix-seul. Sentiment communautaire majoritairement neutre avec biais positif.
Étude sur la quantification de LLaMA-3.1 (8B) pour l'analyse qualitative. Les modèles 8-bit conservent la meilleure précision ; les modèles 4-bit, 3-bit et 2-bit souffrent d'hallucinations accrues. Une méthode de vérification multi-pass guidée réduit les hallucinations et améliore la stabilité des modèles bas-bit, rendant l'analyse qualitative accessible avec moins de ressources.
Cadre pour traiter les longs documents via chunking parallèle et consolidation ancrée aux preuves. Réduit l'erreur d'omission de 84%, augmente la traçabilité des preuves de 130%, diminue les affirmations non fondées de 91%. Les petits modèles bénéficient le plus.
Étude arXiv montrant que les lois de scaling des données réelles sont gouvernées par la couverture progressive d'un spectre latent de contributions prédictives, au-delà des seules queues de fréquence. Via une représentation d'automate de suffixes, les auteurs définissent un spectre global-KL et démontrent une corrélation forte (R²≈0.96) entre la pente du spectre et l'exposant empirique de scaling sur 12 corpus.
MedicalBench est un benchmark pour l'extraction de concepts médicaux implicites à partir de dossiers médicaux (MIMIC-IV). Il formule la tâche comme vérification de paires note-concept avec identification d'évidences au niveau phrase. Les LLM actuels obtiennent des performances modestes, révélant la difficulté du raisonnement médical implicite.
FlowLM transforme des modèles de langage par diffusion pré-entraînés en modèles de flux via fine-tuning efficace. En réalignant les trajectoires courbes en lignes droites, FlowLM génère du texte haute qualité en quelques étapes, rivalisant avec 2000 étapes de diffusion. La saturation des performances est atteinte en moitié moins d'epochs d'entraînement.
Étude de la synchronisation dans les modèles de dialogue full-duplex (Moshi) qui écoutent et parlent simultanément. Les chercheurs mesurent l'alignement des représentations internes via CKA et détectent des signaux anticipatoires de prise de parole. La synchronisation est forte sans bruit, se dégrade avec le bruit, et les états internes encodent des informations prédictives.
Étude sur la génération de critiques littéraires long-format basées sur le Torrance Test of Creative Writing (TTCW). Construction d'un dataset de 263 911 histoires annotées selon 14 dimensions créatives. Fine-tuning de Qwen3 (4B et 8B) montre que l'absence de supervision par raisonnement produit de meilleures performances (0.6820), les modèles supervisés échouant à générer les 14 métriques requises.
DEL (Digit Entropy Loss) est une nouvelle fonction de perte pour améliorer la prédiction numérique dans les LLM. Testée sur CodeLlama, Mistral, DeepSeek et Qwen-2.5 sur 7 benchmarks mathématiques, elle surpasse les méthodes existantes (MLE, Number Token Loss) en optimisant l'entropie des chiffres de manière supervisée et en généralisant aux nombres décimaux.
Stage-Audit détecte les hallucinations dans les tables curées par LLM en imposant une séparation curator-auditor et des vérifications au niveau des lignes. Sur 51 instances Seed2Frontier, la précision passe de 0.356 à 0.505 (+42%) et le F1 de 0.334 à 0.451 (+35%), avec traçabilité source explicite par ligne.
Étude sur le « collocational bootstrapping » : mécanisme par lequel les régularités dans les co-occurrences de mots fournissent des indices pour les dépendances syntaxiques. Entraînement de réseaux de neurones sur des données synthétiques variant en prévisibilité des paires sujet-verbe. Les résultats suggèrent que ce mécanisme pourrait expliquer l'acquisition de l'accord sujet-verbe chez l'enfant.
Framework de diagnostic corpus-centrique pour analyser les benchmarks de reconnaissance d'entités nommées (NER) et de liaison d'entités (EL) en biomédical. Appliqué à 9 corpus, révèle que des propriétés substantiellement différentes peuvent masquer des tâches apparemment identiques. Code open-source et dashboard interactif fournis.
Étude de 6 233 MedGPTs et 10 modèles open-source déployés sur le web. 25-30% présentent une faible précision factuelle, 33.6-54.3% violent les seuils opérationnels, 57% des modèles avec Actions manquent de divulgations de confidentialité. Les auteurs introduisent MedGPT-HEval pour détecter les hallucinations et publient HAA-MedGPT, un dataset structuré.
Étude sur 11 générations d'auto-entraînement sur 5 modèles (GPT-2, Pythia, OPT). Contrairement à l'idée d'un « aplatissement » uniforme, le langage se restructure : les marqueurs de surface (connecteurs, tirets) augmentent tandis que les structures syntaxiques profondes (questions, passives, subjonctifs) s'effondrent. L'hypothèse de profondeur structurelle prédit ce déclin (ρ=0.540, p<10⁻⁶).
DPR-BAG génère des résumés pour articles biomédicaux sans abstract via décomposition structurée (schéma BOMRC), summarization parallèle par LLM et raffinement. Sur PMC-MAD (46 309 articles), améliore la nouveauté abstractive tout en maintenant la cohérence factuelle. Framework sans entraînement, zéro-shot.
Système RAG deux phases pour l'analyse de crédit corporate : phase 1 combine recherche lexicale et dense multilingue ; phase 2 applique contrôleur adaptatif et scoring LLM-as-Judge basé sur l'utilité analytique plutôt que similarité sémantique. Déploiement on-premise sur corpus multilingue propriétaire. En production : temps d'analyse réduit de plusieurs heures à 3 minutes pour 800+ analystes.
Méthode LFD (LLM-assisted Feature Discovery) pour générer des représentations textuelles interprétables via accord inter-annotateurs (Cohen's κ) et désenchevêtrement des labels. Validation sur 10 tâches de classification texte : features plus claires et moins label-entrelacées qu'une baseline bottleneck, confirmé par audit humain (232 raters).
Le Counter Turing Test évalue les techniques de détection de texte généré par IA. Task A (classification binaire) atteint F1=1.0 pour distinguer texte humain vs IA. Task B (attribution de modèle) obtient 0.9531 pour identifier GPT-4, Claude 3.5, Llama. Les meilleures approches combinent DeBERTa, BART, fine-tuning et ensemble learning.