Page 10 sur 192

ToutHaut signalRécent
7679 articles
arXiv cs.CL·

The Culture Funnel: You Can't Align What isn't in the Data

Les modèles de langage souffrent d'un « entonnoir culturel » : les signaux culturels explicites déclinent fortement lors du post-entraînement, dominés par des données géographiquement concentrées. Une étude avec framework de tagging multidimensionnel sur 5,6M samples montre que le multilingue améliore la diversité géographique mais pas l'équilibre. Les auteurs publient un dataset culturellement tagué.

AlignementFine-tuningBenchmarks
SIG
78
HYP
25
arXiv cs.AI·

When the Tool Decides: LLM Agents Defer Blindly to Graph Neural Network Tools, and Stronger Backbones Defer More

Des agents LLM équipés d'outils GNN (Graph Neural Networks) ne font pas preuve de jugement : ils adoptent aveuglément les prédictions du GNN à 97,6-99,2% du temps. Cette déférence augmente avec la capacité du modèle (Qwen2.5 0.5B-7B), créant un « GNN parrot » qui contourne son propre raisonnement. Les alternatives simples surpassent le GNN à forte homophilie, mais l'agent continue de déférer.

Agents IABenchmarksRaisonnement
SIG
78
HYP
15
arXiv cs.CL·

LLMs Contain Multitudes: How Deployment Context Reshapes Model-Level Preferences and Values

Étude sur 1.2M décisions montrant que le contexte de déploiement (Reddit vs article news) produit des variations de préférences et valeurs bien plus importantes que les variations de prompt ou température. Les biais mesurés (favoritisme Global North) et les échanges cardinaux entre outcomes varient d'un facteur 2.47 selon le contexte, remettant en question la stabilité des propriétés model-level.

ÉvaluationsSécurité IAAlignement
SIG
78
HYP
15
arXiv cs.CL·

OdysSim: Building Foundation Models for Human Behavior Simulation

OdysSim présente une investigation systématique de modèles fondamentaux pour simuler le comportement humain. Les chercheurs proposent SOUL, une taxonomie de 5 axes (CONV, SS, COG, ROLE, EVAL) unifiant 62 datasets et 23 tâches. Le modèle OSim 8B open-source surpasse les modèles frontier sur 8/23 tâches, avec alignement réactionnel de 93.2% vs 93.5% pour les utilisateurs réels.

BenchmarksRaisonnementReinforcement learning
SIG
78
HYP
25
arXiv cs.CL·

Can Post-Training Turn LLMs into Good Medical Coders? An Empirical Study of Generative ICD Coding

Étude empirique sur l'adaptation post-entraînement de LLMs pour le codage ICD (classification des maladies). Les auteurs comparent prompting, fine-tuning supervisé et reinforcement learning (GRPO), introduisent PHI (curriculum diagnostique), et montrent que SFT + GRPO surpassent les baselines discriminatives. Code et checkpoints publiés.

Fine-tuningReinforcement learningRaisonnement
SIG
78
HYP
15
arXiv cs.CL·

Does the Judge Prefer English? Evaluating Language-Switching Invariance in LLM-as-a-Judge

Judge-LS évalue si les LLM utilisés comme juges automatiques montrent un biais linguistique. Sur 419 items du benchmark LLMBar transformés en anglais, chinois et variantes mixtes, les modèles affichent 10,7–14,4% de renversements de préférence selon la langue, avec une précision maximale en anglais. Les réponses équivalentes en traduction ne révèlent pas de préférence systématique pour l'anglais.

ÉvaluationsBenchmarksSécurité IA
SIG
78
HYP
15
arXiv cs.AI·

Poker Arena: Multi-Axis Profiling of Strategic Reasoning and Memory in LLMs

Poker Arena évalue sept modèles LLM frontier sur le Texas Hold'em sans limite via une architecture mémoire trois niveaux et neuf axes cognitifs (calibrage des mises, conscience positionnelle, etc.). Claude Opus 4.6 gagne +$15,730 jetons mais classe 5e sur le score moyen des axes, révélant que les classements scalaires masquent la structure réelle des capacités.

BenchmarksRaisonnementClaude
SIG
78
HYP
25
arXiv cs.CL·

MedLatentDx: Latent Multi-Agent Communication for Cross-Hospital Rare-Disease Diagnosis

MedLatentDx est un framework multi-agent pour le diagnostic des maladies rares en collaboration inter-hôpitaux. Les agents hospitaliers conservent les dossiers cliniques privés et échangent des blocs latents KV compacts au lieu de texte brut, respectant les régulations de confidentialité. Deux modes : distillation KV pour backbones identiques, alignement latent cross-family pour LLM différents.

Multi-agentsMCPRaisonnement
SIG
78
HYP
15
arXiv cs.AI·

VeriGeo: Controllable Geometry Question Generation with Numerical and Analytical Verification

VeriGeo génère des problèmes de géométrie contrôlables via des traces de raisonnement exécutables. Un agent Auteur crée le problème et le diagramme selon les contraintes utilisateur, un agent Solveur produit la preuve. Un pipeline à trois étapes vérifie la cohérence numérique, analytique et globale. Fine-tuning sur 8.7k exemples atteint les meilleures performances GeoQA et résultats forts sur PGPS9K et MathVista-GPS.

RaisonnementVisionBenchmarks
SIG
78
HYP
15
arXiv cs.CL·

Observable Patterns Are Not Explanations: A Causal-Geometric Analysis of Latent Reasoning Models

Analyse causale de modèles de raisonnement latent (Coconut, CODI) : les patterns observables (frontières BFS, calcul arithmétique décodable) ne sont pas des preuves de mécanismes de raisonnement. Les interventions causales montrent que l'utilisation des pensées latentes est graduée, non binaire, et concentrée dans des directions de faible rang. La décodabilité seule ne suffit pas à établir un mécanisme.

RaisonnementPapersÉvaluations
SIG
78
HYP
15
arXiv cs.AI·

ToolSense: A Diagnostic Framework for Auditing Parametric Tool Knowledge in LLMs

ToolSense est un framework de diagnostic open-source pour évaluer la compréhension réelle des outils par les LLMs. Appliqué à ToolBench (~47k outils), il révèle une dissociation connaissance-récupération : cinq configurations de modèles paramétriques s'effondrent de 50-64 points sur des requêtes réalistes ambiguës, tombant sous la baseline embedding, malgré des performances fortes sur les benchmarks standards.

Agents IABenchmarksÉvaluations
SIG
78
HYP
25
arXiv cs.AI·

PersonaDrive: Human-Style Retrieval-Augmented VLA Agents for Closed-Loop Driving Simulation

PersonaDrive est un pipeline d'agents VLA (vision-language-action) pour la simulation de conduite fermée, conditionné par des démonstrations humaines récupérées. Entraîné sur des données CARLA avec instructions agressives/neutres/conservatrices, il améliore le score de conduite de 4,6% sur Bench2Drive et génère des agents non-ego avec styles variés sans réentraînement par style.

VisionAgents IARAG
SIG
78
HYP
25
arXiv cs.AI·

Topical Phase Transitions in Artificial Intelligence Research: Large-Scale Evidence and an Early-Warning Signature for Emerging Topics

Analyse de 80 814 articles de 5 conférences IA majeures (2017-2025) révélant que les sujets progressent par transitions de phase abruptes, non graduellement. LLMs dominants en 2025, diffusion models et vision-language models ont surgi en 1-3 ans. Signature d'alerte précoce identifie reasoning, test-time compute, agentic AI, multimodal LLMs, RAG et world models comme sujets à surveiller 2026-2028.

BenchmarksPapersRaisonnement
SIG
78
HYP
25
arXiv cs.CL·

EvoBrowseComp: Benchmarking Search Agents on Evolving Knowledge

EvoBrowseComp est un benchmark évolutif de 400 questions en anglais et 400 en chinois pour évaluer les agents de recherche (LLM + outils web). Contrairement à BrowseComp statique, il utilise une traversée web en direct et un cadre à trois agents (synthèse QA, filtrage d'information, guidance) pour éviter la contamination et la mémorisation paramétrique. Le benchmark se met à jour automatiquement.

Agents IABenchmarksÉvaluations
SIG
78
HYP
25