Page 29 sur 192

ToutHaut signalRécent
7679 articles
arXiv cs.AI·

OpenDeepThink: Parallel Reasoning via Bradley-Terry Aggregation

OpenDeepThink utilise l'agrégation Bradley-Terry pour sélectionner les meilleures solutions parmi plusieurs candidats générés en parallèle. Le système compare aléatoirement des paires de réponses, agrège les votes et préserve les meilleures pour mutation. Sur Codeforces, Gemini 3.1 Pro gagne +405 points Elo en 8 appels LLM (~27 min). Les auteurs publient CF-73, 73 problèmes annotés par des experts.

RaisonnementBenchmarksGemini
SIG
78
HYP
25
arXiv cs.CL·

SD-Search: On-Policy Hindsight Self-Distillation for Search-Augmented Reasoning

SD-Search propose une auto-distillation par hindsight pour améliorer les agents de raisonnement augmentés par recherche. Un modèle unique joue deux rôles (étudiant et enseignant) : l'enseignant a accès aux résultats des requêtes passées et guide l'étudiant via divergence Jensen-Shannon au niveau des tokens. Aucun modèle externe ni annotation supplémentaire requise.

RaisonnementReinforcement learningAgents IA
SIG
78
HYP
15
arXiv cs.LG·

When Is Rank-1 Steering Cheap? Geometry, Granularity, and Budgeted Search

Les chercheurs formalisent le steering d'activation (contrôle d'LLM sans réentraînement) comme optimisation contrainte par budget sur la couche et le coefficient. Ils introduisent la granularité conceptuelle pour mesurer l'hétérogénéité directionnelle et présentent GRACE, un framework utilisant la géométrie d'activation pour diagnostiquer les difficultés de steering et réduire de 39,8% les évaluations nécessaires.

RaisonnementAlignementPapers
SIG
78
HYP
15
arXiv cs.AI·

Ensemble Monitoring for AI Control: Diverse Signals Outweigh More Compute

Étude montrant que des ensembles diversifiés de moniteurs détectent mieux les actions mal alignées d'agents IA que des ensembles homogènes. 12 moniteurs GPT-4.1-Mini (prompting + fine-tuning) évalués sur tâches de code : le meilleur ensemble de 3 moniteurs atteint 2.4x plus de gain de détection qu'un ensemble de 3 moniteurs identiques, avec généralisation sur données indépendantes.

Sécurité IAAlignementAgents IA
SIG
78
HYP
25
arXiv cs.CL·

HEED: Density-Weighted Residual Alignment for Hybrid Vision-Language Model Distillation

HEED propose une méthode d'alignement résiduel pondéré par densité pour distiller des modèles vision-langage (ex. Qwen3-VL-8B) en architectures hybrides Mamba-2/attention. La technique cible les patches haute-densité (texte, détails fins) qui subissent 3.6× plus de dérive résiduelle. Résultats : +8.7 points OCRBench v2, +5.13 points en moyenne, 4.12× throughput, 68% économie mémoire.

VisionFine-tuningBenchmarks
SIG
78
HYP
15
arXiv cs.AI·

SkillMOO: Multi-Objective Optimization of Agent Skills for Software Engineering

SkillMOO optimise les bundles de compétences pour agents de codage via recherche multi-objectif (NSGA-II) sur taux de réussite et coût d'inférence. Sur 16 tâches SkillsBench, le framework atteint le meilleur rang de pass rate sur 11/12 tâches non-nulles, réduisant les coûts jusqu'à 31,7% et gagnant jusqu'à 21 points de pourcentage en taux de réussite.

Agents IAGénération de codeBenchmarks
SIG
78
HYP
15
arXiv cs.AI·

When Is Rank-1 Steering Cheap? Geometry, Granularity, and Budgeted Search

Les chercheurs formalisent le steering d'activation (contrôle d'LLM sans réentraînement) comme optimisation sous contrainte budgétaire. Ils introduisent la « granularité conceptuelle » pour expliquer pourquoi certains concepts sont coûteux à contrôler, et proposent GRACE, un framework qui utilise la géométrie d'activation pour diagnostiquer les difficultés et réduire de 39,8% les évaluations nécessaires.

RaisonnementAlignementPapers
SIG
78
HYP
15
arXiv cs.AI·

From Volume to Value: Preference-Aligned Memory Construction for On-Device RAG

EPIC (Efficient Preference-aligned Index Construction) optimise la RAG sur appareil en stockant les préférences utilisateur plutôt que des données brutes. Sur 4 benchmarks, réduit la mémoire d'indexation de 2404×, améliore la précision de suivi des préférences de 20,17 points, et abaisse la latence de récupération de 33,33×. Empreinte mémoire < 1 MB avec 29,35 ms/requête.

RAGAgents IAEmbeddings
SIG
78
HYP
25
arXiv cs.AI·

State-of-the-Art Claims Require State-of-the-Art Evidence

Étude critique des affirmations « state-of-the-art » en IA/ML. Analyse de 10 benchmarks publics révèle que plus de 50% des comparaisons de modèles top ne supportent pas les propriétés implicites de supériorité (effet significatif, consistance inter-tâches, robustesse). Les gains agrégés reposent souvent sur des datasets aberrants. Propose un langage de claim plus honnête sans expériences supplémentaires.

BenchmarksÉvaluations
SIG
78
HYP
15
arXiv cs.AI·

LARGER: Lexically Anchored Repository Graph Exploration and Retrieval

LARGER est un framework de récupération de contexte pour agents de codage au niveau repository. Il combine recherche lexicale et exploration de graphe structurel (imports, appels, hiérarchies de types) sans nécessiter de bases de données externes. Sur LocBench, il améliore la précision de +13.9 points (ou +11.8 avec hyperparamètres fixes) et gagne sur test generation et question-answering sur codebase.

Agents IAGénération de codeBenchmarks
SIG
78
HYP
15
arXiv cs.CL·

Full Attention Strikes Back: Transferring Full Attention into Sparse within Hundred Training Steps

RTPurbo transforme les LLMs en modèles sparse en ~100 étapes d'entraînement. L'approche exploite trois observations : seuls certains heads nécessitent l'attention complète, la récupération long-range utilise un sous-espace 16D, et la sélection top-p dynamique surpasse top-k fixe. Résultats : 9.36× speedup prefill à 1M tokens, 2.01× speedup decode, précision préservée.

RaisonnementBenchmarksInfrastructure
SIG
78
HYP
25
arXiv cs.CL·

Fine-tuning vs. In-context Learning in Large Language Models: A Formal Language Learning Perspective

Étude comparative fine-tuning vs. in-context learning sur LLMs via tâches de langages formels. Fine-tuning surpasse ICL en généralisation in-distribution, mais les deux modes égalisent hors-distribution. Les biais inductifs divergent aux niveaux de maîtrise élevés. ICL montre sensibilité au vocabulaire et à la taille du modèle.

Fine-tuningPrompt engineeringBenchmarks
SIG
78
HYP
15
arXiv cs.AI·

Med-V1: Small Language Models for Zero-shot and Scalable Biomedical Evidence Attribution

Med-V1 est une famille de modèles de langage de 3 milliards de paramètres entraînés sur des données synthétiques pour l'attribution d'évidences biomédicales. Elle surpasse ses modèles de base de +27% à +71% sur cinq benchmarks et rivalise avec GPT-5, tout en détectant les hallucinations et les erreurs d'attribution dans les directives cliniques.

BenchmarksFine-tuningSécurité IA
SIG
78
HYP
25
arXiv cs.LG·

Mixing Times of Glauber Dynamics on Masked Language Models

Les modèles de langage masqué (MLM) définissent des distributions conditionnelles locales incompatibles avec une distribution jointe globale cohérente. Les auteurs modélisent le rééchantillonnage itératif comme une chaîne de Markov Glauber dynamics et prouvent un temps de mélange O(n log n) sous influence cross-token bornée, mais exhibent une métastabilité exponentielle à basse température.

PapersRaisonnementBenchmarks
SIG
78
HYP
15
arXiv cs.CL·

Scale Determines Whether Language Models Organize Representation Geometry for Prediction

Étude sur l'organisation géométrique des représentations dans les modèles de langage selon leur échelle. Subspace PGA mesure l'alignement de la géométrie intermédiaire avec la matrice d'unembedding. Modèles petits (≤1024) perdent progressivement cette organisation aux couches tardives, tandis que grands modèles (≥2048) la préservent. L'échelle détermine comment la géométrie s'organise pour la prédiction.

PapersRaisonnementÉvaluations
SIG
78
HYP
15
arXiv cs.AI·

Breaking $\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning

GCPO (Group Cooperative Policy Optimization) remplace l'optimisation compétitive des rollouts par une attribution de crédit au niveau de l'équipe. Les rollouts sont récompensés selon leur contribution à la couverture de solutions valides (volume déterminant sur embeddings sémantiques), pas leur précision individuelle. Résultats : amélioration de la précision et de la diversité sur benchmarks de raisonnement.

Reinforcement learningRaisonnementBenchmarks
SIG
78
HYP
25
arXiv cs.CL·

Temporal Decay of Co-Citation Predictability: A 20-Year Statute Retrieval Benchmark from 396M Ukrainian Court Citations

UA-StatuteRetrieval : benchmark de 20 ans sur 396M citations judiciaires ukrainiennes. La prédictibilité co-citation décline de 33-47% (Adamic-Adar MRR 0.43→0.29). Dégradation non-uniforme : droit criminel stable (~0.40), droit civil s'effondre (0.35→0.15) après réforme 2017. Articles mid-frequency (1K-10K citations) perdent 50% prédictibilité. E5-large détecte 4.3% dérive sémantique.

BenchmarksEmbeddingsRAG
SIG
78
HYP
15
arXiv cs.AI·

(Sparse) Attention to the Details: Preserving Spectral Fidelity in ML-based Weather Forecasting Models

Mosaic, un modèle probabiliste de prévision météorologique, corrige trois défaillances spectrales des modèles ML : l'amortissement spectral, l'aliasing haute fréquence et les fuites résiduelles. Avec 214M paramètres à 1.5° de résolution, il égale des modèles entraînés 6× plus fins et génère des ensembles bien calibrés en 12s pour 10 jours sur H100.

PapersBenchmarksVision
SIG
78
HYP
15
arXiv cs.AI·

Contrastive Conceptor Activation Steering (COAST): Unlocking Vision-Language-Action Models through Hidden States

COAST (Contrastive Conceptor Activation Steering) améliore les modèles Vision-Language-Action en identifiant et en guidant les représentations latentes vers des sous-espaces critiques pour la réussite. Sur trois architectures distinctes, COAST augmente le taux de succès de +20% en simulation et +40% sur robots réels, sans entraînement supplémentaire.

VisionRobotiqueRaisonnement
SIG
78
HYP
25
arXiv cs.AI·

LiTS: A Modular Framework for LLM Tree Search

LiTS est un framework Python modulaire pour le raisonnement LLM via tree search. Il décompose la recherche en trois composants réutilisables (Policy, Transition, RewardModel) compatibles avec MCTS et BFS. Tests sur MATH500, Crosswords et MapEval montrent l'orthogonalité composants-algorithmes. Découverte clé : la diversité de la policy LLM, non la qualité de la récompense, est le goulot en espaces d'actions infinis.

RaisonnementAgents IAOpen source
SIG
78
HYP
25
arXiv cs.AI·

Helping Customers in Distress: An LLM-powered Agent that Converses, Probes, and Routes

Une banque développe un agent IA conversationnel pour trier les cas de fraude, arnaque et litiges. L'agent utilise des LLM pour poser des questions ciblées et router les clients vers les bons services. Évaluation via jumeaux numériques synthétiques simulant des dialogues réalistes. Résultat : +30,6% de précision en classification avec conformité garantie.

Agents IARaisonnementSécurité IA
SIG
78
HYP
25
arXiv cs.AI·

Learning Reasoning Rewards from Expert Demonstrations with Inverse Reinforcement Learning

R-AIRL (Reasoning Adversarial Inverse Reinforcement Learning) infère des fonctions de récompense au niveau du processus à partir des chaînes de pensée d'experts, sans nécessiter de récompenses explicites. Testé sur GSM8K, MMLU-Pro et MedReason : améliore pass@1 de 17,4 points en reranking, surpasse SFT en post-training, localise les défaillances de raisonnement avec 86,1% de précision.

Reinforcement learningRaisonnementÉvaluations
SIG
78
HYP
25
arXiv cs.AI·

What Drives Success in Physical Planning with Joint-Embedding Predictive World Models?

Étude systématique des modèles de monde JEPA (Joint-Embedding Predictive Architecture) pour la planification physique. Les auteurs caractérisent les choix techniques (architecture, objectif d'entraînement, algorithme de planification) et proposent un modèle surpassant DINO-WM et V-JEPA-2-AC sur tâches de navigation et manipulation. Code, données et checkpoints disponibles.

RaisonnementRobotiquePapers
SIG
78
HYP
15
arXiv cs.AI·

SkillGenBench: Benchmarking Skill Generation Pipelines for LLM Agents

SkillGenBench est un benchmark pour évaluer les pipelines de génération de compétences pour agents LLM. Il couvre deux régimes : génération conditionnée par tâche et génération agnostique aux tâches, avec sources procédurales basées sur des dépôts ou documents. Les expériences révèlent une variation substantielle de performance et des modes d'échec distincts.

Agents IABenchmarksGénération de code
SIG
78
HYP
15
arXiv cs.AI·

Beyond Policy Optimization: A Data Curation Flywheel for Sparse-Reward Long-Horizon Planning

BPO, un framework en trois étapes (bootstrapping, extrapolation, refinement), crée une boucle d'auto-amélioration pour entraîner des modèles de raisonnement robustes en planification long-horizon avec récompenses éparses. Utilise des quaternions de planification, fusion chain-of-thought long-court, et curriculum learning stratifié. SOTA sur ALFWorld, ScienceWorld, WebShop avec efficacité token significative.

RaisonnementAgents IAReinforcement learning
SIG
78
HYP
25
arXiv cs.CL·

Protection Is (Nearly) All You Need: Structural Protection Dominates Scoring in Globally Capped KV Eviction

Étude des politiques d'éviction KV cache (LRU, H2O, SnapKV, StreamingLLM, Ada-KV, QUEST, Random) sous contrainte globale. Sans protection structurelle aux frontières, toutes s'effondrent (F1≤0.064). Réserver 10% du cache à chaque limite restaure 69–90% de qualité sur LongBench avec C=256 (13% rétention). La position-0 concentre ~75% de l'attention; protection des tokens critiques domine le scoring.

RaisonnementBenchmarksPapers
SIG
78
HYP
15
arXiv cs.AI·

AgentArk: Distilling Multi-Agent Intelligence into a Single LLM Agent

AgentArk distille l'intelligence multi-agent dans un seul modèle LLM via trois stratégies hiérarchiques : fine-tuning amélioré, augmentation par trajectoires et distillation consciente du processus. Le modèle résultant préserve l'efficacité computationnelle d'un agent unique tout en conservant les capacités de raisonnement et d'auto-correction des systèmes multi-agent.

Agents IAMulti-agentsFine-tuning
SIG
78
HYP
25