Page 13 sur 192

ToutHaut signalRécent
7679 articles
arXiv cs.AI·

Stress-testing medical large language models reveals latent safety pathology beyond benchmark accuracy

AI-MASLD, un framework d'audit de stress, évalue 7 LLMs médicaux sur 240 cas cliniques avec perturbations narratives. Tous performent bien en baseline, mais divergent sous stress réaliste. Les modèles quantifiés masquent l'effondrement fonctionnel ; le fine-tuning médical dégrade stabilité logique et équité. Un modèle open-weight égale les alternatives propriétaires sur tous les critères de sécurité.

BenchmarksSécurité IAÉvaluations
SIG
78
HYP
15
arXiv cs.AI·

Overcoming the Regulatory Bottleneck via Agent-to-Agent Protocols: A Nuclear Case Study

Un protocole de communication agent-à-agent (RCP) automatise les échanges entre régulateurs et demandeurs dans l'examen des réacteurs nucléaires avancés. Testé sur 1 236 documents de la NRC, il réduit les coûts de 50-77% (21-44M USD vs 89M USD) et les délais de 65% (15 mois vs 42 mois). Applicable à d'autres secteurs réglementés, les économies potentielles atteindraient 210-330 milliards USD/an.

Agents IAMulti-agentsMCP
SIG
78
HYP
35
arXiv cs.AI·

Land cover and flood type govern the detection limits of satellite-based flood mapping across diverse global flood events

Prithvi-EO-2.0, un modèle géospatial fondationnel, testé sur 19 événements de crue (2017-2025) à travers 6 continents. Précision variable selon le type de couverture terrestre : cultures 52% IoU, zones arborées 4%. Détection riveraine forte (F1=0.69). 23 modes de défaillance identifiés, l'ingénierie du pipeline domine les erreurs initiales.

VisionBenchmarksPapers
SIG
78
HYP
15
arXiv cs.CL·

ThinkBooster: A Unified Framework for Seamless Test-Time Scaling of LLM Reasoning

ThinkBooster est un framework unifié pour le scaling du calcul au test-time (TTC) des modèles de raisonnement. Il intègre une librairie Python modulaire, un benchmark évaluant performance et efficacité computationnelle, et un service proxy compatible OpenAI. Résultats sur tâches mathématiques et de codage montrent les trade-offs performance-coût des stratégies TTC.

RaisonnementBenchmarksGénération de code
SIG
78
HYP
25
The Decoder·

Microsoft Research's Lens proves detailed captions matter more than raw scale for training efficient image generators

Microsoft Research présente Lens, un modèle texte-vers-image de 3,8 milliards de paramètres qui égale des rivaux bien plus grands sur les benchmarks, avec un coût d'entraînement réduit. La clé : 800 millions de captions détaillées générées par GPT-4.1 au lieu de textes alt vagues. Code et poids disponibles en open-source.

Génération d'imagesBenchmarksOpen source
SIG
78
HYP
25
arXiv cs.AI·

When Does Multi-Agent Collaboration Help? An Entropy Perspective

Étude empirique de 245 features d'entropie (token, agent, round) sur 6 benchmarks de raisonnement et 2 tâches agentic. Résultat contre-intuitif : agent unique surpasse MAS dans 43,3% des cas. Trois observations clés : préférence pour la certitude, entropie de base déterminante, variation selon la tâche. Algorithme Entropy Judger proposé pour sélectionner solutions MAS.

Multi-agentsAgents IARaisonnement
SIG
78
HYP
15
arXiv cs.AI·

DuMate-DeepResearch: An Auditable Multi-Agent System with Recursive Search and Rubric-Grounded Reasoning

DuMate-DeepResearch est un système multi-agent pour la recherche approfondie construit sur Qianfan Agent Foundry. Il découple planification et exécution, introduit une stratégie de planification dynamique basée graphe, une exécution récursive à deux niveaux, et une optimisation par rubrique au test-time. Résultats SOTA : 58,03% sur DeepResearch Bench et 61,95% sur DeepResearch Bench II.

Multi-agentsAgents IARaisonnement
SIG
78
HYP
25
arXiv cs.AI·

CrowdMath: A Dataset of Crowdsourced Mathematical Research Discussions

CrowdMath est un dataset de 164 chaînes de discussions annotées du programme MIT PRIMES–Art of Problem Solving (2016-2025), capturant la résolution collaborative de problèmes ouverts. Les posts sont étiquetés par rôle fonctionnel (progrès partiel, erreur, correction). Six modèles frontier atteignent 83-88% en prédiction du post suivant mais seulement 0.42 macro-F1 en classification de rôle.

BenchmarksRaisonnementPapers
SIG
78
HYP
15
arXiv cs.CL·

MADE: Beyond Scoring via a Multilingual Agentic Diagnosing Engine for Fine-Grained Evaluation Insights

MADE est un moteur d'analyse multilingue basé sur des agents qui décompose l'évaluation post-benchmark en planification, analyse agrégée, inspection d'instances et synthèse de rapports. Évalué sur 33 familles de modèles, 11 benchmarks et 26 langues (8,66M enregistrements), MADE surpasse les baselines de 47% en qualité de diagnostic et est préféré par 87,9% des experts humains.

Agents IAMulti-agentsÉvaluations
SIG
78
HYP
25
arXiv cs.CL·

Does Topic Sentiment Cause Perceived Ideology? Comparing Human and LLM Annotations in Political News Articles

Étude comparant annotations humaines et LLM (GPT-4o-mini, Llama-3.3-70B) sur l'idéologie politique d'articles de presse. Double Machine Learning révèle que le fine-tuning de GPT-4o-mini crée un couplage spurieux sentiment-idéologie absent du jugement humain, malgré F1=72.48. Implications pour l'utilisation des annotations LLM comme silver labels.

GPTLlamaÉvaluations
SIG
78
HYP
15
arXiv cs.CL·

What Do People Actually Want From AI? Mapping Preference Plurality

Analyse de 1 500 réponses ouvertes du dataset PRISM (75 pays) sur les préférences humaines envers les IA. Résultat : les valeurs demandées varient fortement entre individus (seule l'exactitude atteint 49%), avec des définitions divergentes du même concept. Les méthodes RLHF actuelles échouent à capturer cette pluralité en l'agrégant dans un modèle de récompense unique.

AlignementReinforcement learningÉvaluations
SIG
78
HYP
25
arXiv cs.CL·

How Language Models Fail: Token-Level Signatures of Committed and Persistent Reasoning Failures

Étude des signatures de défaillance du raisonnement dans les modèles de langage via signaux d'incertitude au niveau des tokens. Deux modes identifiés : défaillance engagée (verrouillage précoce sur un chemin incorrect) et incertitude persistante (accumulation tout au long de la trace). Framework validé sur 23 configurations modèle-dataset avec implications pour l'auto-cohérence.

RaisonnementÉvaluationsPapers
SIG
78
HYP
15
arXiv cs.AI·

Act As a Real Researcher: A Suite of Benchmarks Evaluating Frontier LLMs and Agentic Harnesses in Research Lifecycle

AARRI-Bench évalue les agents IA sur des tâches de recherche scientifique granulaires. Même la meilleure configuration (Mini-SWE-Agent + Claude Opus 4.7) atteint 68,3% de succès, révélant des lacunes en jugement nuancé et éthique. Le benchmark cible la capacité à émuler le professionnalisme des chercheurs humains, au-delà de l'exécution macro.

Agents IABenchmarksClaude
SIG
78
HYP
25
arXiv cs.AI·

Lean4Agent: Formal Modeling and Verification for Agent Workflow and Trajectory

Lean4Agent est un framework utilisant Lean4 (langage formel à types dépendants) pour modéliser et vérifier formellement les workflows d'agents IA. FormalAgentLib permet de vérifier la cohérence sémantique des workflows, tandis que LeanEvolve les améliore itérativement. Sur SWE-Bench-Verified et ELAIP-Bench, les workflows vérifiés surpassent les autres de 11,94%, avec gains supplémentaires de 7,47% via LeanEvolve.

Agents IARaisonnementBenchmarks
SIG
78
HYP
25
arXiv cs.CL·

Beyond Rubrics: Exploration-Guided Evaluation Skills for Reward Modeling

Eval-Skill, une méthode d'exploration guidée, synthétise des compétences d'évaluation réutilisables pour la modélisation de récompenses sans rubrique rigide. Entraîné sur 100 cas par domaine, le système génère progressivement des workflows et principes injectés directement dans le contexte du juge. Sur RewardBench 2, gains de +13.44% (Qwen3-8B) et +18.51% (DeepSeek-V4-Flash).

Reinforcement learningÉvaluationsRaisonnement
SIG
78
HYP
25
arXiv cs.CL·

OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios

OpenHalDet est un benchmark unifié pour la détection d'hallucinations dans les LLM. Il standardise l'évaluation (construction de prompts, génération, annotation, scoring) et supporte trois familles de détecteurs : black-box (sorties uniquement), gray-box (signaux probabilistes), white-box (signaux internes). Codebase open-source disponible.

BenchmarksSécurité IAÉvaluations
SIG
78
HYP
18
arXiv cs.CL·

ThinkBooster: A Unified Framework for Seamless Test-Time Scaling of LLM Reasoning

ThinkBooster est un framework unifié pour le scaling du calcul au test-time (TTC) des modèles de raisonnement. Il intègre une librairie Python modulaire, un benchmark évaluant performance et efficacité computationnelle, et un service proxy compatible OpenAI. Résultats sur tâches mathématiques et de codage montrent les trade-offs performance-coût des stratégies TTC.

RaisonnementBenchmarksGénération de code
SIG
78
HYP
25
arXiv cs.CL·

Interpreting Brain Responses to Language with Sparse Features from Language Models

Des chercheurs utilisent des autoencodeurs creux (SAE) issus de modèles de langage pour interpréter les réponses cérébrales au langage via fMRI 7T. Sur 8 participants écoutant 200 phrases, ils identifient des populations de voxels sensibles au contenu lié aux personnes et montrent que les régions frontales s'expliquent par la surprise seule, tandis que le réseau fronto-temporal partage des features communes.

PapersRaisonnementÉvaluations
SIG
78
HYP
15
arXiv cs.LG·

The Identity Trap in EEG Foundation Models: A Diagnostic Audit

Étude diagnostique des modèles fondamentaux EEG révélant l'« Identity Trap » : les modèles (LaBraM, CBraMod, REVE) confondent l'identité du sujet avec les biomarqueurs cliniques. FMScope, un protocole de 5 diagnostics, montre que la variance sujet domine 13-89x le hasard et persiste après fine-tuning (+10-63 pp). L'effacement de cet axe améliore le décodage du label (+6-12 pp).

BenchmarksÉvaluationsSécurité IA
SIG
78
HYP
15
arXiv cs.CL·

The Piggyback Hypothesis of Generalization: Explaining and Mitigating Emergent Misalignment

Étude sur le surapprentissage des LLM au-delà des données d'entraînement. Les auteurs proposent l'hypothèse du Piggyback : les tokens de chat-template propagent les comportements affinés vers des domaines hors-distribution. Ils introduisent Token-Regularized Finetuning (TReFT) pour atténuer ce désalignement émergent, réduisant de 33,5% le misalignment sur Llama-3.1-8B en domaine légal.

Fine-tuningAlignementSécurité IA
SIG
78
HYP
25
arXiv cs.LG·

Data-Constrained Language Model Pretraining: Improved Regularization and Scaling Laws

Étude des lois d'échelle pour le préentraînement de modèles de langage en régime limité en données. Les auteurs proposent MIR (masked-input regularization), une perte auxiliaire de prédiction du token suivant sur entrées masquées aléatoirement, et SoftQ, une loi d'échelle couplant taille du modèle et données répétées. MIR améliore la validation loss sur modèles 72M-1.4B et équivaut à 1.3× plus de données uniques.

Fine-tuningBenchmarks
SIG
78
HYP
15
arXiv cs.LG·

Evidence-Grounded Ensemble Diagnosis of 802.11 Packet Captures: A Multi-Stage Pipeline with Deterministic Reliability Scoring

PROBE, un pipeline multi-étapes, diagnostique les captures 802.11 en combinant normalisation déterministe PCAP-to-text, ensembles multi-modèles et scoring de fiabilité basé sur l'évidence (sans auto-évaluation LLM). Sur 87 captures Wi-Fi d'entreprise, atteint F1=0.957 vs 0.871 baseline expert, élimine les hallucinations et les scores de confiance non calibrés des LLM.

RaisonnementÉvaluationsBenchmarks
SIG
78
HYP
15
arXiv cs.LG·

TALAN: Task-Aligned Latent Adaptation Networks for Targeted Post-Training of Large Language Models

TALAN (Task-Aligned Latent Adaptation Networks) combine un adaptateur low-rank avec un chemin latent conditionné par la séquence inséré dans le flux résiduel du transformer. Testé sur quatre backbones Qwen3 et quatre benchmarks STEM/code, TALAN améliore les baselines LoRA (+1.41 points) et DoRA (+1.85 points) avec <1% de paramètres supplémentaires et 1.01-1.02x de surcharge inférence.

Fine-tuningRaisonnementGénération de code
SIG
78
HYP
15
arXiv cs.LG·

The Geography of Algorithmic Judgment: LLM Intermediaries, Place Identity, and Racial Steering in Housing Search

Audit comportemental de 7 LLM (open-source et propriétaires) sur 4 villes US révèle que le steering racial émerge de l'interaction entre identité utilisateur, préférences exprimées et représentations spatiales apprises du modèle. Le phénomène n'est pas uniforme : les préférences conditionnées amplifient souvent les biais. Les résultats ne généralisent pas entre marchés locaux.

Sécurité IAAlignementÉvaluations
SIG
78
HYP
25
arXiv cs.AI·

PSEBench: A Controllable and Verifiable Benchmark for Evaluating LLMs in Patient Safety Event Triage

PSEBench est un benchmark de 5 074 cas pour évaluer les LLM sur le triage des événements de sécurité des patients selon les politiques de Minnesota. La méthodologie utilise des « clause cards » pour factoriser les textes réglementaires en spécifications de décision auditables, avec vérification en boucle fermée. Évaluation de 15 LLM représentatifs révèle des tendances de capacité et des lacunes pour le triage fiable.

BenchmarksÉvaluationsSécurité IA
SIG
78
HYP
15
arXiv cs.AI·

Minimizing the Hidden Cost of Scales: Graph-Guided Ultra-Low-Bit Quantization for Large Language Models

SAGE-PTQ, une méthode de quantification ultra-faible précision pour LLM, réduit le coût caché des échelles en séparant poids saillants et non-saillants via statistiques distributionnelles et modélisation graphique. Sur LLaMA-3-8B : 6.74 perplexité WikiText2 vs 55.8 pour BiLLM, avec 50% moins de mémoire GPU. Sur LLaMA-2-70B : décodage 1.5x plus rapide sur NVIDIA L40.

LlamaBenchmarks
SIG
78
HYP
15