Page 12 sur 192

ToutHaut signalRécent
7679 articles
arXiv cs.CL·

Using Probabilistic Programs to Train Inductive Reasoning in Large Language Models

Nouvelle méthode Program-based Posterior Training (PPT) pour entraîner les LLM à l'inférence inductive. Utilise des programmes probabilistes générés par LLM pour créer 10 000 scénarios d'entraînement avec étiquettes distribuées. Améliore significativement la précision, l'alignement humain et la calibration sans dépendre du temperature scaling.

RaisonnementFine-tuningPapers
SIG
78
HYP
15
arXiv cs.CL·

Do Vision-Language Models See or Guess? Measuring and Reducing Textual-Prior Reliance with a Phrasing-Controlled Benchmark

Étude arXiv mesurant la dépendance des VLMs aux priors textuels plutôt qu'au contenu visuel. Benchmark de 540 images avec 4 variantes de questions par image. 11 modèles testés : tous dégradent sur la variante la plus difficile, les modèles open-source chutent le plus. Ablation sans image réduit les modèles open à 1-9% de performance. GRPO post-training améliore la dépendance à l'image.

VisionÉvaluationsBenchmarks
SIG
78
HYP
15
arXiv cs.CL·

MIRAGE: A Polarity-Flipping Encoding Subspace in LLM Agents

Des chercheurs découvrent un sous-espace de codage partagé dans le flux résiduel des LLM permettant de détecter quand les agents encodent secrètement des données sensibles (Base64, ROT13, etc.). MIRAGE, un moniteur temps réel exploitant deux signaux mécanistiques, atteint AUC=0.918 sur 126 scénarios d'exfiltration, surpassant largement la détection en sortie (AUC=0.518).

Sécurité IAAlignementRaisonnement
SIG
78
HYP
25
arXiv cs.AI·

Self-Distillation Policy Optimization via Visual Feedback: Bridging Code and Visual Artifacts

Visual-SDPO, un framework d'auto-distillation par retour visuel, améliore la génération de code pour artefacts visuels (graphiques, pages web, slides). La méthode trace les défauts visuels détectés jusqu'aux instructions de code responsables et amplifie le signal de distillation. Sur ChartMimic, Design2Code et AeSlides, elle gagne +10 points absolus vs zéro-shot et +2.4 vs GRPO.

Génération de codeVisionReinforcement learning
SIG
78
HYP
25
arXiv cs.AI·

RealMath-Eval: Why SOTA Judges Struggle with Real Human Reasoning

RealMath-Eval, un benchmark de 224 réponses d'examen réelles, révèle que les juges LLM état-de-l'art échouent à évaluer le raisonnement humain authentique (MSE ~2.96 vs ~1.17 sur solutions synthétiques). L'analyse montre que les erreurs humaines forment un espace d'erreurs plus diversifié que les erreurs synthétiques, avec une surprisal informationnelle plus élevée.

ÉvaluationsBenchmarksRaisonnement
SIG
78
HYP
15
arXiv cs.LG·

Co-GLANCE: Uncertainty-Aware Active Perception for Heterogeneous Robot Teaming

Co-GLANCE est un système de perception embarqué temps réel pour équipes de robots hétérogènes. Il distille les capacités sémantiques des modèles vision-langage en un modèle end-to-end pour la segmentation d'occlusions et l'allocation de robots, avec garanties statistiques via prédiction conforme. Améliore la précision de 25-36% vs baselines cloud tout en réduisant la latence 350x.

VisionRobotiqueRaisonnement
SIG
78
HYP
25
arXiv cs.AI·

Less Context, Better Agents: Efficient Context Engineering for Long-Horizon Tool-Using LLM Agents

Étude sur l'optimisation du contexte pour agents LLM autonomes en workflows d'entreprise. Test de 4 configurations GPT-5 sur 50 tâches de catégorisation de dépenses (Microsoft Dynamics 365). Pruning du contexte aux 5 derniers appels outils + summarization atteint 91,6% de complétude avec 553k tokens (vs 1,48M en contexte complet), réduisant le runtime de 14,56h à 5,79h.

GPTAgents IAMCP
SIG
78
HYP
15
arXiv cs.LG·

Conformal Risk Prediction for Non-Alcoholic Fatty Liver Disease Using Gradient Boosting with Distribution-Free Coverages

Framework ML couplant gradient boosting et prédiction conforme pour le risque de NAFLD. Évalué sur 2,599 patients (Guangzhou), atteint AUROC 0.912 en interne et 0.891 en validation externe. Couverture conforme 91.3% à niveau nominal 90%. Stratification 3-niveaux : groupe haut-risque montre taux progression 4.7× supérieur au groupe bas-risque.

BenchmarksÉvaluationsSécurité IA
SIG
78
HYP
15
arXiv cs.LG·

TENP: Trapezoidal Expert Neuron Pruning For Mixture-of-Experts

TENP propose un cadre de pruning structuré pour les modèles MoE (Mixture-of-Experts). La méthode identifie les experts importants et applique un pruning au niveau des neurones aux experts moins importants, avec un pattern trapézoïdal. Sur DeepSeek avec 40% sparsité de routage et 63.76% de paramètres activés, la perte de précision est limitée à 1 point, avec +10% sur la génération de code.

DeepSeekQwenBenchmarks
SIG
78
HYP
25
arXiv cs.LG·

SHAPE: Coalition-Aware Expert Pruning for Sparse Mixture-of-Experts LLMs

SHAPE est une méthode de pruning pour modèles MoE sparse qui évalue les experts via des coalitions observées plutôt qu'individuellement. Utilisant l'attribution Shapley sur les top-k routages, elle identifie les experts essentiels aux collaborations. Testée sur Qwen3-30B-A3B, GPT-OSS-20B et DeepSeek-V2-Lite, SHAPE maintient la précision avec 20-40% de pruning sans réentraînement et réduit la mémoire GPU.

Open sourceBenchmarksInfrastructure
SIG
78
HYP
15
arXiv cs.CL·

BenSyc: Benchmarking Conversational Sycophancy and Human Alignment in LLMs for Bengali Contexts

BenSyc est le premier benchmark pour évaluer la sycophantie conversationnelle dans les contextes sociaux bengalis. Construit à partir de 170k commentaires Reddit, il teste 15+ LLMs sur la classification d'alignement et la génération de réponses. Les meilleurs modèles atteignent seulement 61,8% Macro-F1 en détection binaire, révélant des difficultés à distinguer le soutien empathique de la validation excessive.

BenchmarksAlignementSécurité IA
SIG
78
HYP
15
arXiv cs.LG·

TRAPS: Therapeutic Response Analysis via Pathway-informed Stratification

Benchmark unifié pour la prédiction de réponse thérapeutique au cancer utilisant des architectures de deep learning informées par les voies biologiques (BINN, GraphPath, PATH). Évaluation sur 2,622 patients du Cancer Genome Atlas pour trois tâches cliniques : thérapie moléculaire ciblée, radiothérapie et survie à 6 mois. GraphPath atteint AUROC 0.92 en prédiction de thérapie ciblée prostatique.

BenchmarksPapersRaisonnement
SIG
78
HYP
15
arXiv cs.LG·

Mix, Don't Pick: Why Synthetic Corpus Composition Matters for Time Series Foundation Model Pretraining

Étude sur la composition de corpus synthétiques pour le préentraînement de modèles fondamentaux de séries temporelles. Un mélange équipondéré de 11 familles de générateurs surpasse les meilleurs générateurs individuels sur Chronos-T5-Mini et Moirai-Small, réduisant l'écart d'erreur de prévision jusqu'à 2×. Le classement des générateurs varie selon l'architecture.

BenchmarksPapersFine-tuning
SIG
78
HYP
15
arXiv cs.LG·

From Confident Closing to Silent Failure: Characterizing False Success in LLM Agents

Étude de la « fausse réussite » chez les agents LLM : ils déclarent la tâche complétée alors que l'état de l'environnement contredit cela. Analyse de 9,876 trajectoires tau2-bench et 1,879 AppWorld. Les juges LLM échouent (AUROC max 0.65 sur tau2-bench, 0.54 sur AppWorld), tandis que des détecteurs TF-IDF légers atteignent 0.83–0.95 AUROC avec 3,300x moins de latence.

Agents IAÉvaluationsSécurité IA
SIG
78
HYP
15
Reddit r/LocalLLaMA·

Fine-tuned Qwen2.5-7B to 96% of Claude Haiku on a domain-specific task using ~$3 of API calls and zero human labelers

Fine-tuning de Qwen2.5-7B atteint 96% des performances de Claude Haiku sur une tâche spécialisée (moteur de décision) avec ~$3 d'appels API et zéro annotateurs humains. Méthode DV-DPO : conseil à 3 voix + contre-examen adversarial génère 1 040 paires d'entraînement. Latence 11s vs 3s (T4 4-bit). Boucle autonome en production avec détection d'erreurs et red-teaming automatique.

QwenFine-tuningReinforcement learning
SIG
78
HYP
25
arXiv cs.AI·

Stress-testing medical large language models reveals latent safety pathology beyond benchmark accuracy

AI-MASLD, un framework d'audit de stress, évalue 7 LLMs médicaux sur 240 cas cliniques avec perturbations narratives. Tous performent bien en baseline, mais divergent sous stress réaliste. Les modèles quantifiés masquent l'effondrement fonctionnel ; le fine-tuning médical dégrade stabilité logique et équité. Un modèle open-weight égale les alternatives propriétaires sur tous les critères de sécurité.

BenchmarksSécurité IAÉvaluations
SIG
78
HYP
15
arXiv cs.CL·

ThinkBooster: A Unified Framework for Seamless Test-Time Scaling of LLM Reasoning

ThinkBooster est un framework unifié pour le scaling du calcul au test-time (TTC) des modèles de raisonnement. Il intègre une librairie Python modulaire, un benchmark évaluant performance et efficacité computationnelle, et un service proxy compatible OpenAI. Résultats sur tâches mathématiques et de codage montrent les trade-offs performance-coût des stratégies TTC.

RaisonnementBenchmarksGénération de code
SIG
78
HYP
25
arXiv cs.AI·

Overcoming the Regulatory Bottleneck via Agent-to-Agent Protocols: A Nuclear Case Study

Un protocole de communication agent-à-agent (RCP) automatise les échanges entre régulateurs et demandeurs dans l'examen des réacteurs nucléaires avancés. Testé sur 1 236 documents de la NRC, il réduit les coûts de 50-77% (21-44M USD vs 89M USD) et les délais de 65% (15 mois vs 42 mois). Applicable à d'autres secteurs réglementés, les économies potentielles atteindraient 210-330 milliards USD/an.

Agents IAMulti-agentsMCP
SIG
78
HYP
35
arXiv cs.AI·

Land cover and flood type govern the detection limits of satellite-based flood mapping across diverse global flood events

Prithvi-EO-2.0, un modèle géospatial fondationnel, testé sur 19 événements de crue (2017-2025) à travers 6 continents. Précision variable selon le type de couverture terrestre : cultures 52% IoU, zones arborées 4%. Détection riveraine forte (F1=0.69). 23 modes de défaillance identifiés, l'ingénierie du pipeline domine les erreurs initiales.

VisionBenchmarksPapers
SIG
78
HYP
15
arXiv cs.LG·

Enabling KV Caching of Shared Prefix for Diffusion Language Models

Les modèles de diffusion de langage (DLMs) utilisent l'attention bidirectionnelle, ce qui invalide les techniques de cache KV classiques pour les préfixes partagés. Les chercheurs proposent bicache, une méthode qui identifie dynamiquement la profondeur de couche sûre pour réutiliser les KVs des préfixes partagés. Résultat : 36–98% d'amélioration du débit sans effondrement d'accuracy.

RaisonnementBenchmarksInfrastructure
SIG
78
HYP
15
arXiv cs.LG·

UNIQ: Conformal Calibration for Adaptive Conservatism in Offline Reinforcement Learning

UNIQ introduit une calibration conforme pour adapter la conservatisme dans l'apprentissage par renforcement hors ligne. Basé sur IQL, la méthode utilise un ensemble multi-expectile et la prédiction conforme pour estimer l'incertitude sans distribution, ajustant dynamiquement la pénalité selon la couverture locale des données. Sur D4RL MuJoCo, UNIQ surpasse IQL avec 10× moins de mémoire qu'EDAC.

Reinforcement learningPapersBenchmarks
SIG
78
HYP
15
arXiv cs.LG·

Repetition Mismatch: Why Data Mixture Experiments Don't Scale and How to Fix Them

Les expériences de mélange de données pré-entraînement échouent souvent lors du passage à l'échelle car le taux de répétition des données de haute qualité change avec le budget de tokens. Une procédure de sous-échantillonnage contrôlant la répétition permet de récupérer le mélange optimal avec 1/16 des tokens cibles (757M paramètres), réduisant l'erreur de 0.75 à 0.05.

BenchmarksPapers
SIG
78
HYP
15
arXiv cs.LG·

The Routing Plateau: Understanding and Breaking the Accuracy Limits of LLM Routers

Étude de 21 méthodes de routage LLM sur 5 benchmarks révélant un plateau d'accuracy : la plupart convergent vers une performance similaire loin de l'oracle. Le goulot d'étranglement provient d'une prédictibilité insuffisante — les routeurs apprennent des tendances globales plutôt que des signaux spécifiques par requête. Datasets plus larges, encodeurs plus forts et fine-tuning bout-à-bout améliorent les résultats.

Agents IABenchmarksÉvaluations
SIG
78
HYP
15
arXiv cs.LG·

Reachability and asymptotics of Gaussian Transformer dynamics

Étude théorique formalisent la propagation de données dans les Transformers comme système de contrôle non-linéaire. Pour le modèle mean-field avec self-attention et couches feed-forward affines, les distributions gaussiennes restent gaussiennes. Cela réduit la dynamique à un système de contrôle bilinéaire fini gouvernant moyenne et covariance, reliant l'expressivité des Transformers à des équations de Riccati.

PapersRaisonnementBenchmarks
SIG
78
HYP
15