Page 23 sur 192

ToutHaut signalRécent
7679 articles
arXiv cs.AI·

Tool-Augmented Agent for Closed-loop Optimization,Simulation,and Modeling Orchestration

COSMO-Agent, un framework RL augmenté d'outils, entraîne des LLM à orchestrer des processus CAD-CAE itératifs. Le système apprend à générer de la géométrie paramétrique, résoudre des simulations et réviser les designs sous contraintes multiples. Dataset industriel de 25 catégories de composants. Les petits LLM entraînés surpassent les modèles fermés en faisabilité et stabilité.

Agents IAReinforcement learningOutils
SIG
78
HYP
25
arXiv cs.AI·

ScenePilot: Controllable Boundary-Driven Critical Scenario Generation for Autonomous Driving

ScenePilot génère des scénarios critiques pour tester les systèmes de conduite autonome via apprentissage par renforcement multi-objectif. Le framework combine une mesure de faisabilité physique (RSS) avec un prédicteur de risque pour cibler les scénarios à la limite : physiquement possibles mais causant des défaillances. Résultats : +6,2 points de collision sur SafeBench tout en préservant la validité physique.

Reinforcement learningSécurité IAÉvaluations
SIG
78
HYP
15
arXiv cs.CL·

Does Slightly Mean Somewhat? Measuring Vague Intensity Words in LLM Numeric Actions

Étude sur 6,620 exécutions montrant que Claude Haiku compresse 10 modifieurs d'intensité anglais en 5 sorties distinctes. Le contexte d'état système domine l'effet lexical (variance expliquée : 0,782 vs 0,079). Près des limites opérationnelles, le modèle adopte trois modes : petits ajustements pour mots faibles, abstention pour mots forts, plafonnement pour « drastically ».

ClaudeÉvaluationsRaisonnement
SIG
78
HYP
15
arXiv cs.CL·

RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator

RankJudge est un générateur de benchmark pour évaluer les LLM utilisés comme juges sur des conversations multi-tours ancrées dans des documents de référence. Le système crée des paires de conversations avec une faille injectée dans un tour, permettant un étiquetage sans ambiguïté. Évaluation de 21 juges LLM frontier avec classement via le modèle Bradley-Terry sur ML, biomédecine et finance.

ÉvaluationsBenchmarksMulti-agents
SIG
78
HYP
15
arXiv cs.CL·

Sem-Detect: Semantic Level Detection of AI Generated Peer-Reviews

Sem-Detect détecte les avis de relecture générés par IA en analysant les caractéristiques textuelles et sémantiques au niveau des affirmations. La méthode compare un avis cible à plusieurs avis générés par IA du même article, exploitant la convergence des modèles IA versus la diversité des reviewers humains. Sur 20 000+ avis ICLR/NeurIPS, Sem-Detect améliore la baseline de 25,5% en TPR@0.1% FPR.

ÉvaluationsSécurité IAPapers
SIG
78
HYP
15
arXiv cs.AI·

Data Scaling as Progressive Coverage of a Predictive Contribution Spectrum

Étude arXiv sur les lois de scaling des données : la couverture progressive d'un spectre latent de contributions prédictives (via automate de suffixes) corrèle fortement avec l'exposant de scaling empirique. Sur 12 corpus réels, log K(N) suit une relation quasi-linéaire avec log N (R²≈0.96), suggérant que l'entraînement avance une frontière effective à travers un spectre d'états prédictifs.

BenchmarksPapersRaisonnement
SIG
78
HYP
15
arXiv cs.AI·

DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation

DeepWeb-Bench est un benchmark de recherche profonde évaluant 9 modèles frontière sur des tâches exigeant collecte massive d'evidence, réconciliation cross-source et dérivation multi-étapes longue. Les erreurs proviennent surtout de la dérivation et calibration (>70%), pas de la retrieval (12-14%). Les modèles forts et faibles échouent différemment : dérivation incomplète vs hallucination de précision.

BenchmarksRaisonnementAgents IA
SIG
78
HYP
25
Reddit r/LocalLLaMA·

Agent Execution Tax: new procurement metric for browser agent benchmarks?

Benchmark WebVoyager sur 720 tâches d'agents navigateur : MiniMax M2.5 coûte 2,3× moins cher par tâche réussie que Gemini 2.5 Flash. GLM-5 atteint 57,1% d'accuracy, Kimi K2.5 affiche 0% d'erreurs de parsing. Les modèles open-weight surpassent Gemini non par intelligence mais par fiabilité. Le coût réel dépasse le prix au token une fois les retries comptabilisés.

Agents IABenchmarksOpen source
SIG
78
HYP
25
arXiv cs.CL·

Do No Harm? Hallucination and Actor-Level Abuse in Web-Deployed Medical Large Language Models

Étude de 6 233 MedGPTs et 10 modèles open-source déployés sur le web. 25-30% présentent une faible précision factuelle, 33.6-54.3% violent les seuils opérationnels, 57% des modèles avec Actions manquent de divulgations de confidentialité. Les auteurs introduisent MedGPT-HEval pour détecter les hallucinations et publient HAA-MedGPT, un dataset structuré.

Sécurité IAAlignementÉvaluations
SIG
78
HYP
25
arXiv cs.CL·

What Do Biomedical NER and Entity Linking Benchmarks Measure? A Corpus-Centric Diagnostic Framework

Framework de diagnostic corpus-centrique pour analyser les benchmarks de reconnaissance d'entités nommées (NER) et de liaison d'entités (EL) en biomédical. Appliqué à 9 corpus, révèle que des propriétés substantiellement différentes peuvent masquer des tâches apparemment identiques. Code open-source et dashboard interactif fournis.

BenchmarksÉvaluationsPapers
SIG
78
HYP
15
arXiv cs.LG·

Conformal Selective Acting: Anytime-Valid Risk Control for RLVR-Trained LLMs

CSA (Conformal Selective Acting) est un wrapper de déploiement pour LLMs fine-tunés en RLVR qui garantit un contrôle du risque par round sans pooling entre déploiements. Testé sur 480 streams spécialisés et 10,300 rounds en Expert-Iteration avec LoRA, CSA maintient une e-process de Ville par seuil et atteint une borne de risque sélectif R_T^act ≤ α+O(N_T^{-1/2}) avec validité pathwise anytime.

Reinforcement learningSécurité IAÉvaluations
SIG
78
HYP
15
arXiv cs.CL·

FlowLM: Few-Step Language Modeling via Diffusion-to-Flow Adaptation

FlowLM transforme des modèles de langage par diffusion pré-entraînés en modèles de flux via fine-tuning efficace. En réalignant les trajectoires courbes en lignes droites, FlowLM génère du texte haute qualité en quelques étapes, rivalisant avec 2000 étapes de diffusion. La saturation des performances est atteinte en moitié moins d'epochs d'entraînement.

Génération de codeRaisonnementPapers
SIG
78
HYP
25
arXiv cs.CL·

Data Scaling as Progressive Coverage of a Predictive Contribution Spectrum

Étude arXiv montrant que les lois de scaling des données réelles sont gouvernées par la couverture progressive d'un spectre latent de contributions prédictives, au-delà des seules queues de fréquence. Via une représentation d'automate de suffixes, les auteurs définissent un spectre global-KL et démontrent une corrélation forte (R²≈0.96) entre la pente du spectre et l'exposant empirique de scaling sur 12 corpus.

PapersBenchmarksRaisonnement
SIG
78
HYP
15
arXiv cs.CL·

Do as I Say, Not as I Do: Instruction-Induction Conflict in LLMs

Étude sur le conflit entre suivi d'instructions et complétions de motifs dans 13 LLMs. Quand une instruction utilisateur entre en conflit avec N tours d'assistant montrant un motif opposé, les taux de suivi d'instructions varient de 1% à 99%. La transition est universelle mais dépendante du modèle. La diversité des outputs et l'alignement avec les valeurs entraînées modulent la robustesse.

RaisonnementAlignementÉvaluations
SIG
78
HYP
15
arXiv cs.CL·

Mechanics of Bias and Reasoning: Interpreting the Impact of Chain-of-Thought Prompting on Gender Bias in LLMs

Étude arXiv sur l'impact du Chain-of-Thought (CoT) sur les biais de genre dans les LLM. Les chercheurs combinent évaluation benchmark, interprétabilité mécanistique et analyse des chaînes de raisonnement. Résultat : CoT ne réduit pas systématiquement les biais ; les améliorations observées proviennent de mémorisation plutôt que d'une compréhension genuine, les biais restant ancrés dans les représentations cachées.

RaisonnementSécurité IAAlignement
SIG
78
HYP
15
arXiv cs.LG·

Geometry-Lite: Interpretable Safety Probing via Layer-Wise Margin Geometry

Geometry-Lite est une sonde de sécurité compacte qui analyse la géométrie des représentations cachées à travers les couches de LLMs (1.2B–70B). Elle mappe les marges de chaque couche via trois méthodes (centroïde, voisinage local, frontière linéaire) et montre que la détection de prompts non-sûrs repose principalement sur la géométrie persistante des marges, non sur le mouvement inter-couches.

Sécurité IAAlignementÉvaluations
SIG
78
HYP
15
arXiv cs.LG·

OmniISR: A Unified Framework for Centralized and Federated Learning via Intermediate Supervision and Regularization

OmniISR propose un cadre unifié pour l'apprentissage centralisé et fédéré via supervision intermédiaire et régularisation. Le framework utilise l'information mutuelle pour aligner les décalages de covariables internes et la négative-entropie pour régulariser les prédictions. Convergence O(1/sqrt(T)) garantie théoriquement; réduction de l'écart CL-FL de 22,60% en expériences.

Reinforcement learningAlignementPapers
SIG
78
HYP
15
arXiv cs.CL·

Retrieval-Augmented Long-Context Translation for Cultural Image Captioning: Gators submission for AmericasNLP 2026 shared task

Pipeline deux étapes pour captionner des images culturelles en langues autochtones : Qwen2.5-VL génère une caption intermédiaire en espagnol, puis Gemini 2.5 Flash produit la caption cible via retrieval-augmented prompting. Amélioration de 164,1% (Bribri), 131,7% (Guaraní), 122,6% (Nahuatl Orizaba) sur la baseline. Gagnant du shared task AmericasNLP 2026.

VisionRAGGemini
SIG
78
HYP
25
arXiv cs.CL·

On the limits and opportunities of AI reviewers: Reviewing the reviews of Nature-family papers with 45 expert scientists

Étude d'experts (45 scientifiques, 469 heures) évaluant 2,960 critiques de 82 articles Nature. GPT-5.2 surpasse le meilleur reviewer humain (60,0% vs 48,2%), mais les IA montrent 16 faiblesses récurrentes (connaissance limitée du sous-domaine, gestion faible du contexte long). Les IA complètent plutôt qu'elles ne remplacent les humains.

GPTGeminiClaude
SIG
78
HYP
25
arXiv cs.CL·

Distributional Alignment as a Criterion for Designing Task Vectors in In-Context Learning

Nouvelle métrique d_NTP pour évaluer la qualité des task vectors en ICL en mesurant l'alignement des distributions de probabilités. Méthode Linear Task Vector (LTV) minimise d_NTP via régression linéaire fermée, améliore la précision de 9,2% sur 8 benchmarks et 5 LLMs, réduit la latence. Task vectors transférables entre modèles de tailles différentes (+6,4% pour petit modèle).

Prompt engineeringRaisonnementBenchmarks
SIG
78
HYP
15