Archives

juin 2026

2731 articles

Reddit r/LocalLLaMA·

Open sourcing InfiniteKV: a KV cache that files old tokens as 104-byte searchable records in RAM or on disk instead of deleting them. Mistral-7B answered from token 76,747, 2.3x past its trained window. Colab demo

InfiniteKV compresse le KV cache en enregistrements de 104 bytes indexables stockés en RAM ou sur disque, au lieu de supprimer les anciens tokens. Mistral-7B répond correctement à token 76,747 (2.3× sa fenêtre d'entraînement de 32,768). Un million de tokens nécessite ~3 GB au lieu de 122 GB.

Open sourceInfrastructureLlama
SIG
82
HYP
25
arXiv cs.CL·

G-Long: Graph-Enhanced Memory Management for Efficient Long-Term Dialogue Agents

G-Long est un framework utilisant des graphes et un petit modèle de langage fine-tuné pour gérer efficacement la mémoire long-terme dans les dialogues. Il extrait des triplets structurés et utilise un mécanisme de scoring d'importance basé sur l'attention d'un T5 pour identifier les souvenirs saillants. Gains : +9.8% en qualité de réponse (MSC), +40.8% en rappel de récupération (LME).

Agents IARAGRaisonnement
SIG
72
HYP
25
arXiv cs.CL·

Observable Patterns Are Not Explanations: A Causal-Geometric Analysis of Latent Reasoning Models

Analyse causale de modèles de raisonnement latent (Coconut, CODI) : les patterns observables (frontières BFS, calcul arithmétique décodable) ne sont pas des preuves de mécanismes de raisonnement. Les interventions causales montrent que l'utilisation des pensées latentes est graduée, non binaire, et concentrée dans des directions de faible rang. La décodabilité seule ne suffit pas à établir un mécanisme.

RaisonnementPapersÉvaluations
SIG
78
HYP
15
arXiv cs.CL·

PiDA: Phonetically-Informed Data Augmentation for Robust Vietnamese Speech Translation

Étude des erreurs ASR en traduction vocale vietnamienne. Les auteurs catégorisent les erreurs de substitution par cause phonétique et proposent PiDA (Phonetically-Informed Data Augmentation), qui augmente les données d'entraînement avec des corruptions phonétiquement similaires. Fine-tuning sur FLEURS Vietnamese-English améliore la traduction d'outputs ASR erronés (+2.04 BLEU).

BenchmarksPapers
SIG
72
HYP
15
arXiv cs.CL·

Helping Figures Tell their Story! Paper-Grounded Video Generation Explaining Complex Scientific Figures

Nouvel article arXiv présentant MINARD, un système de génération vidéo qui transforme les figures scientifiques en vidéos narratives avec annotations régionales. Le pipeline génère des narrations ancrées au papier et les aligne séquentiellement aux régions de la figure. Benchmark FigTalk inclus avec métriques d'ancrage au niveau composant.

Génération de vidéosVisionBenchmarks
SIG
72
HYP
25
arXiv cs.LG·

Bernstein-Schur Kernels: Random Features by Sketched Modulation and Radial Randomization

Kernels de Bernstein-Schur : construction de random features combinant sketching de modulation finie et randomisation radiale via échelle de Bernstein-Widder. Dimension de features Dm sans coût O(d²) de la modulation exacte. Garanties de variance exacte et bornes d'opérateur contrôlées par dimension intrinsèque, avec applications au kernel ridge regression.

PapersBenchmarksEmbeddings
SIG
72
HYP
08
arXiv cs.AI·

ToolSense: A Diagnostic Framework for Auditing Parametric Tool Knowledge in LLMs

ToolSense est un framework de diagnostic open-source pour évaluer la compréhension réelle des outils par les LLMs. Appliqué à ToolBench (~47k outils), il révèle une dissociation connaissance-récupération : cinq configurations de modèles paramétriques s'effondrent de 50-64 points sur des requêtes réalistes ambiguës, tombant sous la baseline embedding, malgré des performances fortes sur les benchmarks standards.

Agents IABenchmarksÉvaluations
SIG
78
HYP
25
arXiv cs.CL·

SkillChain: Closing the Loop on Skill Evolution for Image-Based E-Commerce AI Assistants

SkillChain automatise l'évolution des compétences pour assistants IA multimodaux en e-commerce. Le système gère trois étapes : création de Skills à partir de specs, optimisation du routage, et raffinement itératif via évaluation LLM. Déployé en production, il améliore la conformité structurelle et la qualité du contenu, confirmé par A/B test sur l'engagement utilisateur.

Agents IAMulti-agentsVision
SIG
75
HYP
25
arXiv cs.CL·

LEDGER: A Long-Context Benchmark of Corporate Annual Reports for Grounded Financial Retrieval and Extraction

LEDGER est un benchmark de 4 999 rapports annuels d'entreprises numérisés pour évaluer les capacités long-contexte des LLM en finance. Le corpus inclut 31 KPIs financiers consolidés, 118 048 questions de retrieval TREC-style, et des tâches d'extraction sur documents denses. Étude de cas : corrélation entre rhétorique CEO et impact marché post-publication.

BenchmarksRAGRaisonnement
SIG
82
HYP
15
arXiv cs.CL·

AfriSUD: A Dependency Treebank Collection for Evaluating Models on African Languages

AfriSUD est la première collection de 9 treebanks syntaxiquement annotés pour des langues africaines, utilisant le framework SUD. Les évaluations sur POS tagging et dependency parsing révèlent un écart syntaxique significatif : les modèles (baselines non-transformer, encodeurs multilingues, LLMs) montrent des limitations claires face à la diversité structurelle des langues africaines.

BenchmarksPapersÉvaluations
SIG
78
HYP
15
arXiv cs.CL·

NTS-CoT: Mitigating Hallucinations in LLM-based News Timeline Summarization with Chain-of-Thought Reasoning

NTS-CoT, un framework basé sur Chain-of-Thought, réduit les hallucinations dans la résumé de chronologies d'actualités. Trois modules (Element-CoT, Date Selection, Causal-CoT) capturent les éléments essentiels, sélectionnent les timestamps et inférent les relations causales. Évaluation sur trois benchmarks TLS avec amélioration mesurable.

RaisonnementPapersÉvaluations
SIG
72
HYP
18
arXiv cs.CL·

No Hidden Prompts Needed! You Can Game AI Peer Review with Presentation-Only Revisions

Étude montrant que les reviewers IA peuvent être manipulés par des modifications de présentation seule (abstract, framing, structure narrative) sans changer la méthode ni les résultats. Taux de succès d'attaque de 75,1% avec gain moyen de +1,21/10. Les reviewers IA confondent apparence et substance, privilégiant la mise en avant des forces plutôt que la réfutation des faiblesses.

ÉvaluationsSécurité IAAlignement
SIG
78
HYP
35
arXiv cs.CL·

Multi-Turn Reasoning When Context Arrives in Pieces: Scalable Sharding and Memory-Augmented RL

Les LLM perdent jusqu'à 65% de précision quand l'information critique arrive par étapes conversationnelles. Une mémoire compacte roulante remplace l'attention croissante à l'historique. Un pipeline de sharding convertit les datasets QA en épisodes multi-tours fragmentés sans annotation manuelle. Entraînement sur GSM8K shardé améliore la précision multi-tours et généralise zéro-shot.

RaisonnementReinforcement learningMulti-agents
SIG
78
HYP
15
arXiv cs.CL·

M\"OVE: A Holistic LLM Benchmark for the German Public Sector

MÖVE est un benchmark holistique évaluant 39 LLMs pour l'administration publique allemande. Au-delà de la performance (résumé, QA, extraction de topics), il mesure hallucinations, consommation énergétique, transparence du fournisseur et alignement avec les valeurs constitutionnelles allemandes. Utilise 10 datasets en allemand; aucun modèle ne domine tous les critères.

BenchmarksÉvaluationsSécurité IA
SIG
78
HYP
15
arXiv cs.CL·

EvoBrowseComp: Benchmarking Search Agents on Evolving Knowledge

EvoBrowseComp est un benchmark évolutif de 400 questions en anglais et 400 en chinois pour évaluer les agents de recherche (LLM + outils web). Contrairement à BrowseComp statique, il utilise une traversée web en direct et un cadre à trois agents (synthèse QA, filtrage d'information, guidance) pour éviter la contamination et la mémorisation paramétrique. Le benchmark se met à jour automatiquement.

Agents IABenchmarksÉvaluations
SIG
78
HYP
25
arXiv cs.CL·

PRISM: Prosody-Integrated Multi-Agent Reasoning Framework for Empathetic Spoken Dialogue

PRISM est un framework multi-agent pour le dialogue parlé empathique qui découple perception vocale, génération de réponse et synthèse vocale. Il introduit un mécanisme de traduction prosody-to-language pour stabiliser le raisonnement des LLM et intègre des outils de connaissance externes. Résultats : amélioration de l'empathie, de l'adéquation prosodique et de la qualité des réponses.

Multi-agentsVoixAgents IA
SIG
72
HYP
28
arXiv cs.CL·

SafeLLM: Extraction as a Hallucination-Resistant Alternative to Rewriting in Safety-Critical Settings

SafeLLM compare l'extraction de lignes à la réécriture libre pour les systèmes RAG en contexte critique (SOPs, politiques HR, guidelines médicales). L'extraction basée sur numéros de ligne surpasse la copie directe et les stratégies orientées sécurité, atteignant 95% de rappel de termes sur documents NHS et NICE, avec meilleure fidélité au texte source.

RAGSécurité IAÉvaluations
SIG
75
HYP
15
arXiv cs.CL·

Small LLMs for Biomedical Claim Verification: Cost-Effective Fine-Tuning, Structural Dataset Shortcuts, and Cross-Domain Generalization

Trois petits LLM (Phi-3-mini 3.8B, Qwen2.5-3B, Mistral-7B) sont fine-tunés via QLoRA pour la vérification de claims biomédicaux. Mistral-7B surpasse GPT-4o et GPT-5 (+12% F1) avec 1,008 exemples d'entraînement. Étude révèle un artefact structurel dans SciFact et démontre une généralisation cross-domain robuste.

MistralQwenFine-tuning
SIG
78
HYP
15
arXiv cs.CL·

LLMs Can Better Capture Human Judgments--With the Right Prompts

Des techniques de prompting simples améliorent la capacité des LLM à capturer les jugements humains. Sur 144 scénarios moraux (US) et 38 croyances morales (32 pays), demander aux modèles de rapporter écarts-types et proportions de réponses récupère mieux la distribution complète des réponses humaines. Les LLM suivent aussi les taux de confusion humaine, bien que leur calibrage d'erreur reste faible.

Prompt engineeringÉvaluationsAlignement
SIG
72
HYP
18
arXiv cs.CL·

Rigel: Reverse-Engineering the Metal 4.1 Tensor Compute Path on the Apple M4 Max GPU

Rigel caractérise empiriquement le chemin de calcul tensoriel Metal 4.1 sur Apple M4 Max. Les chercheurs découvrent que l'opération matmul2d fp8 (E4M3) est émulée, non accélérée (0.94x le débit fp16), exécutée sur les shader cores GPU sans datapath matriciel dédié, et accumule en ≥fp32. Un kernel GEMM fusionné gagne +6.5-12.9% en régime cache-resident.

BenchmarksInfrastructureGénération de code
SIG
82
HYP
15
arXiv cs.CL·

Direct Preference Optimization for Chatbot Fine-Tuning: An Empirical Study

Étude empirique sur l'optimisation directe des préférences (DPO) pour l'affinage de chatbots. Les résultats montrent que DPO simplifie le pipeline d'entraînement, améliore l'efficacité computationnelle et atteint des performances compétitives. Évaluation via BLEU, ROUGE et similarité cosinus révèle une convergence efficace, mais des instabilités d'entraînement subsistent.

Fine-tuningReinforcement learningÉvaluations
SIG
55
HYP
25
arXiv cs.CL·

X-MADAM-RAG: Diagnosing and Handling Chinese-English Evidence Conflict in Retrieval-Augmented Generation

X-MADAM-RAG diagnostique les conflits entre preuves chinoise et anglaise dans les systèmes RAG. Sur le benchmark X-RAMDocs-ZHEN (300 exemples), le pipeline atteint 96,67% de précision stricte avec Qwen2.5-7B-Instruct, mais échoue sur des variantes naturalisées (30% de précision), révélant que l'extraction au niveau document reste le goulot d'étranglement.

RAGBenchmarksÉvaluations
SIG
72
HYP
18
arXiv cs.CL·

MARD: Mirror-Augmented Reasoning Distillation for Mechanism-Level Drug-Drug Interaction Prediction

MARD est un modèle de 7B paramètres pour prédire les interactions médicamenteuses au niveau mécanistique (enzyme, axe pharmacodynamique). Utilise distillation de raisonnement avec DPO pondéré par récompense de processus et récupération mécanisme-aware. Sur DrugBank avril 2026 : +13.9pp vs meilleure baseline, +6.7pp vs GPT-4o, avec généralisation robuste aux paires de médicaments inédites.

RaisonnementFine-tuningReinforcement learning
SIG
82
HYP
15
arXiv cs.AI·

Structured Testbench Generation for LLM-Driven HDL Design and Verification-Oriented Data Curation

STG, un framework de génération structurée de testbenches, accélère la vérification de designs HDL générés par LLM. 720x plus rapide qu'une approche itérative LLM, il réduit les faux positifs, améliore la couverture et identifie des erreurs dans les benchmarks existants. Utilisé comme moteur de curation de données, il est 11x plus rapide que le filtrage LLM avec 127x moins d'énergie.

Génération de codeBenchmarksÉvaluations
SIG
78
HYP
15
arXiv cs.AI·

APCyc: Property-Informed Design of Cyclic Peptides via Automated Cyclization

APCyc est un framework de génération de novo de peptides cycliques qui modélise explicitement la cyclisation et optimise simultanément plusieurs propriétés physicochimiques. Le modèle utilise un vocabulaire de résidus étendu et un guidage bayésien pour générer des peptides cycliques adaptés à des cibles thérapeutiques spécifiques.

Génération de codeReinforcement learningPapers
SIG
75
HYP
15
arXiv cs.AI·

A Mathematical Forum Platform for Collaborative Problem Solving and Dataset Generation for AI Reasoning

Plateforme de forum mathématique intégrant un pipeline OCR (Mathpix) pour convertir images en LaTeX directement dans l'interface de posting. Architecture trois couches (traitement image, rendu, stockage) avec support desktop/mobile. Génère un dataset communautaire de problèmes mathématiques et solutions pour entraîner des systèmes IA.

RaisonnementÉvaluationsOutils
SIG
65
HYP
25
arXiv cs.CL·

Shopping Reasoning Bench: An Expert-Authored Benchmark for Multi-Turn Conversational Shopping Assistants

Shopping Reasoning Bench : benchmark expert de 525 missions (232 single-turn, 293 multi-turn) avec 10863 rubriques binaires pondérées pour évaluer les assistants conversationnels de shopping. Évaluation de 9 modèles (GPT, Claude, Gemini) : taux de réussite 57-77%, dégradation de 4-18 points au fil de la conversation, écart de 13-29 points entre critères obligatoires et optionnels.

BenchmarksGPTClaude
SIG
75
HYP
25
arXiv cs.AI·

MARS: Margin-Adversarial Risk-controlled Stopping for Parallel LLM Test-time Scaling

MARS est une règle d'arrêt adversariel pour le test-time scaling parallèle des LLM. Elle sonde les traces partielles à des points de contrôle intermédiaires pour estimer quelles traces changeront de réponse, permettant d'arrêter le calcul une fois le vote leader sûr. Sur trois modèles et trois benchmarks math, MARS économise 25-47% des tokens de self-consistency tout en maintenant la précision.

RaisonnementÉvaluationsBenchmarks
SIG
78
HYP
15
arXiv cs.AI·

HarnessBridge: Learnable Bidirectional Controller for LLM Agent Harness

HarnessBridge est un contrôleur d'interface agent-environnement appris par projection bidirectionnelle. Le module projette les observations brutes en états compacts et convertit les actions proposées en transitions exécutables. Entraîné sur Terminal-Bench 2.0 et SWE-bench Verified, il égale les harnesses spécialisés tout en réduisant l'usage de tokens et la longueur des trajectoires.

Agents IARaisonnementGénération de code
SIG
72
HYP
28
arXiv cs.AI·

Teach-and-Repeat: Accurately Extracting Operational Knowledge from Mobile Screen Demonstrations to Empower GUI Agents

Teach VLM extrait la connaissance opérationnelle de démonstrations mobiles en analysant les transitions visuelles et génère des instructions en langage naturel. Le paradigme Teach-and-Repeat utilise cette connaissance pour guider des agents d'exécution GUI. Évaluation sur Android World montre des améliorations de Task Success Rate.

Agents IAVisionGénération de code
SIG
72
HYP
28
arXiv cs.AI·

(Human) Attention Is (Still) All You Need: Human oversight makes AI-assisted social science reliable

Étude expérimentale sur 280 runs montrant que les LLM seuls échouent dans 72% des cas de recherche économique, contre 16% avec Human-in-the-Loop Economic Research (HLER). Architecture basée sur pré-engagement, séquençage des décisions, et trois portes humaines. Résultat significatif (p<0.001) : les humains doivent valider, les LLM raisonnent mais n'exécutent pas.

Agents IARaisonnementÉvaluations
SIG
78
HYP
15
arXiv cs.AI·

PRISMR: Overcoming Parse Collapse in Multimodal Listwise Ranking via Parameterized Representation Internalization

PRISMR résout le « parse collapse » dans le ranking listwise multimodal avec LMMs. Le problème : les décodeurs autorégressifs omettent silencieusement des candidats et terminent prématurément sur listes longues. Solution : un hypernetwork léger génère des poids LoRA spécifiques aux items, synthétisés en adaptateur instance-spécifique. Benchmark multimodal review-ranking créé.

VisionRaisonnementFine-tuning
SIG
72
HYP
18
arXiv cs.AI·

Constructing Evaluation Datasets for Procedural Reasoning: Balancing Naturalness, Grounding, and Multi-Hop Coverage

Étude sur la génération de datasets d'évaluation pour le raisonnement procédural. Trois stratégies comparées : génération stricte depuis modèles TMK (Task-Method-Knowledge), génération basée transcripts avec filtrage TMK post-hoc, et génération TMK-aware. Sur 690 paires question-réponse et 23 sujets, la génération stricte atteint 96,5% de questions ancrées et 92,6% utilisables.

ÉvaluationsRaisonnementBenchmarks
SIG
72
HYP
15
arXiv cs.AI·

Multi-Modal Agents for Power Distribution Defect Detection: An Evaluation of Foundation Models

Framework multi-modal pour la détection de défauts dans les réseaux électriques utilisant des modèles fondamentaux. Évaluation systématique de trois capacités : perception (identification d'équipements et description de défauts), raisonnement (diagnostic et planification de maintenance), utilisation d'outils (exécution autonome). Dataset spécifique au domaine et benchmark développés.

Agents IAVisionRaisonnement
SIG
72
HYP
28
arXiv cs.AI·

DailyReport: An Open-ended Benchmark for Evaluating Search Agents on Daily Search Tasks

DailyReport est un benchmark open-source pour évaluer les agents de recherche (SA) sur 150 tâches quotidiennes réelles avec 3 546 rubriques d'évaluation. Les tâches sont décomposées en sous-tâches avec évaluation en cascade sur dimensions disentanglées. Tests sur 17 systèmes agentic montrent des lacunes significatives par rapport aux attentes utilisateurs.

Agents IABenchmarksÉvaluations
SIG
78
HYP
25
arXiv cs.AI·

WISE: A Long-Horizon Agent in Minecraft with Why-Which Reasoning

WISE est un agent Minecraft long-horizon utilisant un graphe d'événements causaux pour augmenter la mémoire épisodique. Le framework couple le raisonnement causal (why-which) à la mémoire spatiotemporelle, permettant la réordonnance opportuniste de sous-tâches et une exploration multi-échelle. Amélioration significative sur tâches creuses nécessitant adaptation décisionnelle.

Agents IARaisonnementReinforcement learning
SIG
72
HYP
25
arXiv cs.AI·

TrajGenAgent: A Hierarchical LLM Agent for Human Mobility Trajectory Generation

TrajGenAgent est un framework d'agent LLM hiérarchique pour générer des trajectoires de mobilité humaine réalistes sans fine-tuning. Un orchestrateur LLM synthétise des chaînes d'activités via in-context learning, puis un workflow déterministe les ancre via récupération POI personnalisée, sélection de localisation et estimation de durée. Évaluation par détection d'anomalies sur données de benchmark.

Agents IAPrompt engineeringRaisonnement
SIG
72
HYP
18
arXiv cs.AI·

Pythagoras-Prover: Advancing Efficient Formal Proving via Augmented Lean Formalisation

Pythagoras-Prover est une famille open-source de prouveurs Lean efficaces (4B et 32B paramètres, incluant un prototype diffusion). Via curriculum SFT et Augmented Lean Formalisation (ALF), le modèle 4B surpasse DeepSeek-Prover-V2-671B sur MiniF2F-Test (86.1% vs 82.4%) avec 167x moins de paramètres. Le 32B atteint 93.0% sur MiniF2F-Test et résout 93/672 problèmes PutnamBench.

RaisonnementGénération de codeBenchmarks
SIG
82
HYP
25
arXiv cs.AI·

Topical Phase Transitions in Artificial Intelligence Research: Large-Scale Evidence and an Early-Warning Signature for Emerging Topics

Analyse de 80 814 articles de 5 conférences IA majeures (2017-2025) révélant que les sujets progressent par transitions de phase abruptes, non graduellement. LLMs dominants en 2025, diffusion models et vision-language models ont surgi en 1-3 ans. Signature d'alerte précoce identifie reasoning, test-time compute, agentic AI, multimodal LLMs, RAG et world models comme sujets à surveiller 2026-2028.

BenchmarksPapersRaisonnement
SIG
78
HYP
25
arXiv cs.AI·

Arbor: Tree Search as a Cognition Layer for Autonomous Agents

Arbor est un framework multi-agent introduisant la recherche arborescente comme couche de cognition pour agents autonomes. Validé sur l'optimisation d'inférence LLM full-stack, il associe un agent Orchestrator et un agent Critic avec architecture de poids et contrepoids. Arbor atteint 193% d'amélioration Pareto throughput-latency vs baselines optimisées, contre 33% pour un agent seul qui s'écroule en quelques heures.

Agents IAMulti-agentsRaisonnement
SIG
82
HYP
25
arXiv cs.AI·

Definitional alignment before capability alignment: a Design-Science framework for adjudicating claims about AGI

Article proposant DAF-AGI, un cadre de gouvernance pour évaluer les définitions concurrentes d'AGI. Analyse cinq familles de mesure (performance, capacités, psychométrie, acquisition de compétences, économie) et teste la claim que les systèmes génératifs actuels constituent AGI. Seule l'approche basée sur la performance certifie cette claim sur données 2024-2025.

RaisonnementÉvaluationsAlignement
SIG
72
HYP
15
arXiv cs.AI·

PersonaDrive: Human-Style Retrieval-Augmented VLA Agents for Closed-Loop Driving Simulation

PersonaDrive est un pipeline d'agents VLA (vision-language-action) pour la simulation de conduite fermée, conditionné par des démonstrations humaines récupérées. Entraîné sur des données CARLA avec instructions agressives/neutres/conservatrices, il améliore le score de conduite de 4,6% sur Bench2Drive et génère des agents non-ego avec styles variés sans réentraînement par style.

VisionAgents IARAG
SIG
78
HYP
25
arXiv cs.CL·

Constrained Semantic Decompression in LLMs through Persian Proverb-Conditioned Story Generation

Étude sur la génération d'histoires conditionnées par des proverbes persans. Les chercheurs introduisent PAND (Proverb Aligned Narrative Dataset) et identifient un « écart de décompression » : les LLM produisent du texte fluide mais échouent à préserver la structure morale et causale des proverbes. Le raisonnement explicite et l'affinement itératif réduisent partiellement ces erreurs.

PapersRaisonnementÉvaluations
SIG
72
HYP
15
Reddit r/LocalLLaMA·

Some contrived tests comparing the accuracy of different Gemma and Qwen quantizations

Comparaison empirique de quantifications Gemma et Qwen sur trois tâches (arithmétique, dates présidentielles, attention). Gemma-4-31B-Q4_K_S atteint 83,8% en arithmétique et 87% en attention. Qwen3.6-27B-Q4_K_S obtient 95,5% en arithmétique et 100% en présidents. Les résultats montrent l'impact majeur du modèle et du schéma de quantification sur la précision.

GeminiQwenÉvaluations
SIG
72
HYP
15