Page 22 sur 192

ToutHaut signalRécent
7679 articles
arXiv cs.CL·

Convergence Without Understanding: When Language Models Agree on Representations but Disagree on Reasoning

Étude de 16 modèles de langage (1.5B–72B paramètres) révélant que leur convergence représentationnelle ne s'étend pas au raisonnement. Les modèles s'alignent davantage sur les problèmes qu'ils échouent collectivement (CKA=0.897) que sur ceux résolus (CKA=0.830). Les représentations post-décision divergent fortement (CKA=0.274), et l'information partagée exerce une influence causale minimale (1.5–5.5% flip rate).

PapersRaisonnementÉvaluations
SIG
78
HYP
15
arXiv cs.CL·

Metacognition as Reward: Reinforcing LLM Reasoning via Knowledge and Regulation Signals

MaR (Metacognition-as-Reward) est un framework RL qui améliore le raisonnement des LLM via deux dimensions : la connaissance métacognitive (identification d'infos pertinentes) et la régulation métacognitive (planification du processus). Testé sur 22 benchmarks, Qwen3.5-9B + MaR gagne jusqu'à 7.7% vs modèle de base et 11.0% vs DAPO vanilla, surpassant GPT-OSS-120B en moyenne.

Reinforcement learningRaisonnementQwen
SIG
78
HYP
25
arXiv cs.LG·

The Readout Shortcut: Positional Number Copying Dominates Arithmetic CoT Readout in Small Language Models

Sur des modèles 1-3B, le CoT en arithmétique repose sur un raccourci positionnel : le modèle copie simplement le nombre en dernière position avant le délimiteur de réponse, indépendamment du raisonnement intermédiaire. Cette stratégie explique 54-92 pp de précision sur GSM8K. Remplacer ce nombre par une valeur incorrecte effondre la performance même avec des étapes correctes.

RaisonnementÉvaluationsBenchmarks
SIG
78
HYP
15
arXiv cs.LG·

When Do LLMs Reason? A Dynamical Systems View via Entropy Phase Transitions

Étude montrant que le raisonnement explicite (CoT) n'est bénéfique que sur certaines tâches. Les auteurs proposent EDRM, un framework sans entraînement qui utilise la dynamique d'entropie en début de génération pour router adaptivement vers CoT ou inférence directe. Sur 15 benchmarks et 4 LLMs, EDRM réduit les tokens de 41–55% tout en améliorant la précision jusqu'à 4,7%.

RaisonnementÉvaluationsBenchmarks
SIG
78
HYP
25
arXiv cs.AI·

MemAudit: Post-hoc Auditing of Poisoned Agent Memory via Causal Attribution and Structural Anomaly Detection

MemAudit est un framework d'audit post-hoc pour détecter les mémoires empoisonnées dans les agents LLM. Il combine un score d'influence contrefactuelle et un graphe de cohérence mémoire pour identifier les enregistrements malveillants injectés via interactions normales. Évalué contre l'attaque MINJA, il réduit le taux de succès de 70% à 0% en QA et de 83,3% à 0% en reasoning.

Agents IASécurité IARAG
SIG
78
HYP
25
arXiv cs.CL·

Fast-dDrive: Efficient Block-Diffusion VLM for Autonomous Driving

Fast-dDrive est un modèle VLA (Vision-Language-Action) basé sur la diffusion par blocs pour la conduite autonome. Il combine raffinement bidirectionnel au sein d'unités sémantiques avec un ordre causal strict, gère les sorties JSON structurées et atteint 12× d'accélération de débit avec SGLang. Sur nuScenes, erreur L2 réduite à 0,32m (amélioration 22%), SOTA sur WOD-E2E.

VisionGénération de codeRaisonnement
SIG
78
HYP
25
arXiv cs.AI·

From Raw Experience to Skill Consumption: A Systematic Study of Model-Generated Agent Skills

Étude systématique du cycle de vie complet des skills générés par modèles IA : extraction, consommation et transfert. Framework d'évaluation couvrant 5 domaines agentic. Résultats : skills bénéfiques en moyenne mais transfert négatif non-trivial ; performance d'extraction/consommation indépendante de la taille du modèle. Introduction d'une meta-skill pour améliorer la qualité.

Agents IAMulti-agentsReinforcement learning
SIG
78
HYP
15
arXiv cs.CL·

A Reproducible Universal Dependencies-Style Pipeline for Katharevousa Greek Parliamentary Text

Pipeline reproductible pour construire une ressource de parsing Universal Dependencies pour le grec Katharevousa (textes parlementaires grecs post-junte). Dataset de 1.697 phrases annotées, comparaison de 6 architectures (spaCy, Stanza, XLM-R, mBERT, etc.). Meilleur modèle (XLM-R) : 0.5162 LAS vs 0.4183 pour baseline. Code et annotations publiés en open-access.

PapersBenchmarksOpen source
SIG
78
HYP
15
The Decoder·

Researchers let Claude Code discover AI scaling algorithms that humans probably wouldn't have designed

Des chercheurs de UMD, Google et Meta utilisent AutoTTS pour laisser Claude Code découvrir indépendamment des algorithmes de contrôle pour le raisonnement IA. L'algorithme trouvé réduit la consommation de calcul de 70% comparé à la self-consistency standard tout en conservant la précision. La recherche a coûté 40$ et pris 160 minutes.

Claude CodeAgents IARaisonnement
SIG
78
HYP
35
Reddit r/LocalLLaMA·

Benchmarked Needle 26M vs Qwen3-0.6B on CPU function calling, 50 queries across 5 difficulty tiers. The 23x smaller model wins on accuracy and is 4.4x faster.

Benchmark CPU de Needle (26M) vs Qwen3-0.6B sur function calling : 50 requêtes, 5 niveaux de difficulté. Needle gagne en précision (72% vs 56% tool_match) et latence (10.9s vs 47.9s). Needle échoue sur la sélection d'outil, Qwen3 sur l'émission de tags. Qwen3 domine sur requêtes multilingues (Hindi, français).

QwenBenchmarksGénération de code
SIG
78
HYP
15
Reddit r/LocalLLaMA·

Apex-Testing: real-world, real repos, agentic coding benchmark (Update)

Apex-Testing, benchmark de codage agentic basé sur 65-70 repos GitHub réels, a été mis à jour à 95% avec les modèles récents. 70 tâches réparties en 8 catégories testent les capacités d'agents IA sur du code production. Classement ELO, métriques de coût/temps et comparaisons disponibles. Qwen 3.7 Max, Deepseek v4 et autres modèles en cours de complétion.

Agents IAGénération de codeBenchmarks
SIG
78
HYP
25
arXiv cs.AI·

PlanningBench: Generating Scalable and Verifiable Planning Data for Evaluating and Training Large Language Models

PlanningBench est un framework pour générer des données de planification scalables et vérifiables. Il abstrait 30+ types de tâches et facteurs de difficulté à partir de scénarios réels, puis synthétise des problèmes avec contrôle adaptatif et vérification automatique. L'entraînement par RL sur ces données améliore les performances sur des benchmarks non vus.

BenchmarksRaisonnementReinforcement learning
SIG
78
HYP
22
arXiv cs.LG·

Embedding-Based Federated Learning with Runtime Governance for Iron Deficiency Prediction

Déploiement réel d'un pipeline federated learning pour prédire la carence en fer à partir de données de numération formule sanguine. Utilise DeepCBC (modèle fondation haematologie gelé) + FedMAP (agrégation personnalisée). Testé sur deux sites cliniques (AUMC, NHSBT) avec données non-IID. FedMAP améliore ROC-AUC de 0.947→0.959 (AUMC) et 0.856→0.867 (NHSBT) vs entraînement local.

EmbeddingsBenchmarks
SIG
78
HYP
15
arXiv cs.LG·

Provable Joint Decontamination for Benchmarking Multiple Large Language Models

JECS (Joint Envelope Conformal Selection) est une méthode pour décontaminer les benchmarks d'évaluation LLM en contrôlant le taux de contamination global (GCR) entre plusieurs modèles. Elle agrège les p-valeurs conformales par modèle et applique la procédure Benjamini-Hochberg adaptée pour sélectionner un benchmark fiable sans biais de comparaison croisée.

BenchmarksÉvaluationsSécurité IA
SIG
78
HYP
15
arXiv cs.LG·

Don't Collapse Your Features: Why CenterLoss Hurts OOD Detection and Multi-Scale Mahalanobis Wins

GOEN (Geometry-Optimised Epistemic Network) combine features multi-échelles, normalisation L2, distance de Mahalanobis et calibration pour détecter les entrées hors-distribution. Découverte clé : CenterLoss dégrade la détection OOD (AUROC 0.9366 vs 0.9483 sans), bien qu'il améliore la précision. GOEN-NoCenterLoss atteint 0.9483 AUROC sur CIFAR-10, surpassant ensembles profonds (0.8827), KNN (0.8967) et ODIN (0.8870).

Sécurité IAÉvaluationsBenchmarks
SIG
78
HYP
25
arXiv cs.LG·

From Parameters to Data: A Task-Parameter-Guided Fine-Tuning Pipeline for Efficient LLM Alignment

P2D, un framework d'alignement LLM, couple sélection de données et fine-tuning efficace en paramètres. En identifiant les têtes d'attention critiques pour chaque tâche, P2D mine des données pertinentes et élaguer 90% des paramètres. Résultat : +8.3pp de performance et 7.0x d'accélération avec seulement 10% des données et 10% des têtes.

Fine-tuningRaisonnementAlignement
SIG
78
HYP
25
arXiv cs.LG·

When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning

Les auteurs identifient que la fiabilité des tokens du teacher en auto-distillation dépend de leur position dans la trajectoire de raisonnement, pas de l'entropie locale. Ils proposent PW-OPSD, qui pondère les tokens par position croissante. Sur Qwen3-4B, AIME 2024/2025 gagnent +1.0/+1.1 points; validation sur DeepSeek-R1-Distill-Llama-8B et Olmo-3-7B-Think confirme les gains.

RaisonnementFine-tuningBenchmarks
SIG
78
HYP
15
arXiv cs.AI·

AgentAtlas: Beyond Outcome Leaderboards for LLM Agents

AgentAtlas propose une évaluation multidimensionnelle des agents LLM au-delà des simples taux de succès. L'étude introduit une taxonomie de 6 états de contrôle, une taxonomie d'erreurs à 9 catégories, et audite 15 benchmarks existants. Sur 8 modèles (4 fermés, 4 open-weight), retirer les labels explicites réduit la précision de 14-40 pp, révélant une dépendance forte au prompt.

Agents IABenchmarksÉvaluations
SIG
78
HYP
15