Page 14 sur 192

ToutHaut signalRécent
7679 articles
arXiv cs.AI·

Stability vs. Manipulability: Evaluating Robustness Under Post-Decision Interaction in LLM Judges

Les juges LLM utilisés pour évaluer les modèles IA sont instables sous interaction post-décision. Sur MT-Bench et AlpacaEval, les chercheurs montrent que des jugements initiaux peuvent être renversés par des défis ciblés, dégradant l'accord avec les préférences humaines et modifiant les classements. Ils introduisent l'Evaluation Robustness Score (ERS) pour mesurer cette fragilité.

ÉvaluationsBenchmarksSécurité IA
SIG
78
HYP
25
arXiv cs.AI·

Mutation Without Variation: Convergence Dynamics in LLM-Driven Program Evolution

Étude arXiv sur la mutation de programmes par LLM : les chaînes de mutation convergent rapidement vers des régions restreintes de l'espace des programmes. 87% des chaînes revisitent 93% de formes structurelles précédentes. Le phénomène est robuste entre modèles et prompts, révélant un biais systématique vers l'homogénéité structurelle incompatible avec l'exploration ouverte.

PapersGénération de codeReinforcement learning
SIG
78
HYP
15
Reddit r/MachineLearning·

Benchmark: ONNX Runtime vs HF Transformers vs GGUF for Parakeet TDT 0.6B on CPU-only hardware [D]

Benchmark CPU d'inférence pour Parakeet TDT 0.6B sur 2 vCPU x86-64 (7.7GB RAM). ONNX Runtime FP32 atteint RTF 0.328 (37% plus rapide que HF Transformers bfloat16 à 0.519), mais consomme 2.7GB pic mémoire. GGUF Q6_K réduit à 928MB mais double le RTF à 0.708. Analyse méthodologique : espeak-ng fausse WER à 20.9% vs gTTS 4.65%.

BenchmarksGénération de codeVoix
SIG
78
HYP
15
arXiv cs.CL·

AdaPlanBench: Evaluating Adaptive Planning in Large Language Model Agents under World and User Constraints

AdaPlanBench est un benchmark interactif évaluant la capacité des agents LLM à planifier et replanifier face à des contraintes monde et utilisateur révélées progressivement. Construit sur 307 tâches ménagères, il teste 10 modèles leaders : le meilleur atteint 67,75% de précision. Les performances se dégradent avec l'accumulation de contraintes, notamment les contraintes utilisateur.

Agents IARaisonnementBenchmarks
SIG
78
HYP
15
arXiv cs.LG·

What Objects Enable, Not What They Are: Functional Latent Spaces for Affordance Reasoning

A4D propose un espace latent fonctionnel organisé autour des affordances (capacités) plutôt que l'apparence des objets, pour améliorer la généralisation de la planification robotique. Le système atteint 94% de précision sur les affordances existantes (+15 points vs SOTA) et 90% sur les nouvelles affordances avec 10% des données d'entraînement originales, avec inférence 100x plus rapide.

RobotiqueRaisonnementVision
SIG
78
HYP
25
arXiv cs.CL·

Localizing Prompt Ambiguity in Large Language Models with Probe-Targeted Attribution

PRIG, une méthode d'attribution par gradient, localise l'ambiguïté dans les prompts LLM en entraînant une sonde linéaire à distinguer les prompts clairs des ambigus, puis attribue le score de la sonde aux représentations de tokens. Évalué sur des datasets synthétiques (codage, math, écriture) et un benchmark humain, PRIG atteint 0.840 AUROC sur le benchmark synthétique combiné et 0.891 AUROC sur l'ensemble gold.

Prompt engineeringÉvaluationsPapers
SIG
78
HYP
15
arXiv cs.LG·

LEVANTE-bench: Multi-Scale Comparison of VLMs to Children Using Cognitive Tasks (or, "Is Your VLM Smarter Than a 5th Grader?")

LEVANTE-bench compare 6 modèles de vision-langage (VLMs) à des enfants de 5-12 ans (N=1547) sur des tâches cognitives standardisées dans 3 pays. Les modèles plus grands s'alignent mieux globalement, mais les petits modèles reproduisent mieux les erreurs des jeunes enfants. Les VLMs échouent sur le raisonnement matriciel et la rotation mentale.

VisionBenchmarksÉvaluations
SIG
78
HYP
25
arXiv cs.CL·

Epidemiology of Model Collapse: Modeling Synthetic Data Contamination via Bilayer SIR Dynamics

Étude épidémiologique de l'effondrement de modèles causé par l'entraînement sur données synthétiques. Framework SIR/SIRS bipartite modélisant la contamination croisée entre corpus de données et modèles IA. Expériences GPT-2 sur WikiText et Shakespeare (192 runs) confirment dégradation dose-réponse; R₀ > 1 indique dynamiques supercritiques. Détection synthétique et filtrage identifiés comme leviers principaux.

PapersSécurité IABenchmarks
SIG
78
HYP
15
arXiv cs.CL·

ArcANE: Do Role-Playing Language Agents Stay in Character at the Right Time?

ArcANE est un benchmark automatisé évaluant si les agents de rôle-playing maintiennent la cohérence psychologique des personnages au fil de l'histoire. Construit sur 17 romans et 80 personnages, il teste les réponses à travers différentes phases narratives et scénarios inédits. Conditionner sur l'arc de caractère surpasse toutes les autres stratégies contextuelles sur 6 modèles.

BenchmarksAgents IAÉvaluations
SIG
78
HYP
15
arXiv cs.LG·

The Evaluation Blind Spot: A Stereological Theory of Benchmark Coverage for Large Language Models

Théorie stéréologique de la couverture des benchmarks LLM. Pour d_eff ∈ [2.86, 4.80], le blind spot structural dépasse l'écart entre modèles de deux ordres de magnitude. Un algorithme glouton submodulaire identifie 4 benchmarks stables ; 7 sur 12 suffisent pour 90% de couverture. Validation sur 12 benchmarks internes et 27 catégories Chatbot Arena.

BenchmarksÉvaluations
SIG
78
HYP
15
arXiv cs.LG·

Pattern Selectivity is Not Task-Causal Structure: A Cross-Architecture Mechanistic Study of Composed-Task Circuits in 1B-Class Language Models

Étude mécanistique cross-architecture sur 3 modèles 1B (Pythia, OLMo, OLMoE) testant si l'identification de circuits par sélectivité de patterns + ablation causale produit des résultats reproductibles. Résultat : même tâche, même capacité comportementale, implémentations différentes selon le modèle. Taxonomie à 5 catégories (cause primaire, secondaire, corrélat, interférent, null) avec seuils quantitatifs.

BenchmarksPapers
SIG
78
HYP
15
arXiv cs.LG·

State commitment learning: training language models to distinguish computation from memory

Nouvelle méthode d'entraînement pour distinguer le calcul temporaire de l'état persistant dans les modèles de langage. Counterfactual Erasure RL (CERL) récompense les modèles quand la réponse reste correcte après suppression des pensées intermédiaires. Évaluation sur mathématiques, logique et QA scientifique montre réduction de la dépendance aux calculs cachés sans perte de précision.

RaisonnementReinforcement learningPapers
SIG
78
HYP
15
Reddit r/MachineLearning·

We built a source-available LLM reliability library (free for research / personal / internal eval) that can cut inference cost by half at matched quality, and you adopt it by changing one import [P] [R]

Agentcodec unifie 28 techniques de fiabilité LLM (retry, ensemble, vérification, routing adaptatif) sous une API unique. Adoption par changement d'import. Sur Nemotron + Devstral + GLM-5.1, le routeur adaptatif réduit les coûts de 56% à qualité égale, ou gagne 7% de qualité à coût égal. Paramètre λ contrôle le trade-off.

RaisonnementÉvaluationsOpen source
SIG
78
HYP
35
Reddit r/LocalLLaMA·

KVarN: new KV-cache quant from Huawei. 3–5× KV cache compression with actual speed-up instead of slow-down, and unlike TurboQuant it holds up on reasoning (Apache 2.0, vLLM single flag)

Huawei open-source KVarN, méthode de quantization KV-cache (Apache 2.0, intégration vLLM single flag). Compression 3–5× vs FP16, débit jusqu'à 1.4× FP16, préserve qualité reasoning contrairement à TurboQuant (Google). Pas de retraining, pas de calibration.

Open sourceInfrastructureBenchmarks
SIG
78
HYP
35
arXiv cs.LG·

Training-Free Lexical-Dense Fusion for Conversational-Memory Retrieval

Étude de fusion lexicale-dense sans entraînement pour la récupération en mémoire conversationnelle longue. Fusion score-level de late-interaction dense + BM25 améliore Hit@1 de +8.8 à +17.2 points sur six encodeurs (Hit@1 0.752 avec e5-large-v2). Reranker cross-encoder web dégrade les résultats (-6.9 pp). Analyse montre division du travail : dense excelle sur questions multi-hop/temporelles, BM25 sur adversariales.

RAGEmbeddingsBenchmarks
SIG
78
HYP
15
arXiv cs.AI·

Scaling Self-Evolving Agents via Parametric Memory

TMEM introduit un cadre de mémoire paramétrique auto-évolutive pour agents LLM. Au lieu de stocker l'expérience uniquement en contexte textuel, l'agent absorbe la supervision dans des poids LoRA légers (Δ_t) via des mises à jour en ligne, modifiant son comportement au sein d'un même épisode. Évalué sur LoCoMo, LongMemEval-S et CL-Bench, TMEM surpasse les baselines basées sur résumés et récupération.

Agents IAFine-tuningReinforcement learning
SIG
78
HYP
25
arXiv cs.LG·

RUBAS: Rubric-Based Reinforcement Learning for Agent Safety

RUBAS est un framework de reinforcement learning basé sur des rubriques pour l'alignement des agents LLM. Il décompose le comportement en quatre dimensions (tool-use safety, argument safety, response safety, helpfulness) et génère des récompenses structurées sur les trajectoires complètes. Expériences montrent amélioration de la sécurité et réduction des hallucinations sans perte d'utilité.

Agents IAReinforcement learningSécurité IA
SIG
78
HYP
22
arXiv cs.LG·

dMX: Differentiable Mixed-Precision Assignment for Low-Precision Floating-Point Formats

dMX est un framework de quantification mixte-précision différentiable pour assigner des largeurs de bits flottants apprenables aux couches de LLMs. Testé sur Llama, Qwen3 et SmolLM2 avec le standard MXFP (Open Compute Project), il optimise continu les formats par couche puis les discrétise via annealing, surpassant les heuristiques KL-divergence sur WikiText-2 et benchmarks zero-shot.

LlamaQwenBenchmarks
SIG
78
HYP
15
arXiv cs.CL·

A Systematic Evaluation of Positional Bias in Multi-Video Summarization with MLLMs

Étude systématique du biais positionnel dans la résumé multi-vidéo avec MLLMs. Benchmark sur ActivityNet et News videos (2-4 vidéos). Évaluation de 9 modèles (open-source et propriétaires) avec 3 métriques : Coverage, Directional Positional Bias, Middle-Edge Gap. Résultat : effets positionnels dépendent du domaine et du modèle ; augmenter le budget visuel ne supprime pas l'imbalance.

VisionBenchmarksÉvaluations
SIG
78
HYP
15