Page 7 sur 192

ToutHaut signalRécent
7679 articles
arXiv cs.AI·

OProver: A Unified Framework for Agentic Formal Theorem Proving

OProver est un framework unifié pour la preuve formelle de théorèmes en Lean 4 utilisant des agents. Le système révise itérativement les tentatives échouées via des preuves récupérées et du feedback du compilateur. Entraîné par préentraînement continu et post-entraînement itératif, OProver-32B atteint 93,3% Pass@32 sur MiniF2F et 58,2% sur ProverBench.

Agents IARaisonnementReinforcement learning
SIG
82
HYP
15
arXiv cs.AI·

ContractBench: Can LLM Agents Preserve Observation Contracts?

ContractBench évalue la capacité des agents LLM à préserver les contrats d'observation (artefacts temporellement valides et intègres au niveau des octets) lors d'appels API. Sur 38 modèles testés, aucun ne dépasse 80% : Claude-Opus-4.6 atteint 77,8%. Les résultats révèlent des défaillances d'intégrité et de validité non corrélées à la taille du modèle, et une régression non-monotone dans la famille GPT-5.

Agents IABenchmarksClaude
SIG
82
HYP
15
arXiv cs.AI·

Decoupling KL and Trajectories: A Unified Perspective for SFT, DAgger, Offline RL, and OPD in LLM Distillation

Étude unifiée de la distillation de LLM montrant que SFT, DAgger, offline RL et OPD découplent deux axes orthogonaux : source de préfixe et direction KL au niveau token. Les auteurs proposent KL mixing et curriculum de longueur avec gate entropie, améliorant Pass@k de 5.8 points et réduisant la longueur moyenne de 3x sur le raisonnement mathématique.

Fine-tuningReinforcement learningRaisonnement
SIG
82
HYP
15
arXiv cs.AI·

Weak-to-Strong Elicitation via Mismatched Wrong Drafts

Injection de brouillons mathématiquement incorrects d'un petit modèle (Qwen2.5-Math-1.5B) dans l'entraînement GRPO d'un modèle plus fort (Mathstral-7B) améliore les performances sur MATH-500 (+1.62pp) et AIME 2025/2026 (+14.2pp à pass@1024). Le décalage intentionnel entre problèmes et brouillons est crucial : 71.98% sur MATH-500, meilleur résultat publié pour ce modèle.

Reinforcement learningRaisonnementBenchmarks
SIG
82
HYP
18
arXiv cs.LG·

ProxyKV: Cross-Model Proxy Pruning for Efficient Long-Context LLM Inference

ProxyKV propose un cadre de pruning cross-model pour accélérer l'inférence long-contexte des LLM. Une petite version du modèle (proxy) évalue l'importance du cache KV de manière asynchrone, via HybridAxialMapper et Multi-Granularity Hybrid Loss. Sur Llama-3.1, Qwen-2.5 et Qwen-3, récupère 98,7% de la précision de KVZip avec speedup jusqu'à 3,21× en prefilling (Llama-3.1-8B, dual-GPU) et contextes jusqu'à 170k tokens.

LlamaQwenRaisonnement
SIG
82
HYP
18
arXiv cs.AI·

The Capability Paradox: How Smarter Auditors Make Multi-Agent Systems Less Secure

Étude sur les systèmes multi-agents : des attaques par « détournement sémantique » exploitent la confiance des agents. Paradoxe identifié : augmenter la capacité des Workers élève le taux de succès d'attaque de 18,4% à 63,9%. L'analyse de médiation révèle que la « certitude linguistique » des agents forts les rend vulnérables. Solution proposée : vérification par ensemble hétérogène réduisant le taux d'attaque à 2%.

Multi-agentsAgents IASécurité IA
SIG
82
HYP
15
arXiv cs.CL·

Friends and Grandmothers in Silico: Localizing Entity Cells in Language Models

Chercheurs localisent des « cellules d'entité » dans les neurones MLP de modèles de langage (Qwen2.5-7B, etc.). Ces neurones activés de façon sélective encodent des faits spécifiques à une entité. Suppression d'une cellule efface le rappel pour cette entité seule ; activation suffit à récupérer la connaissance même sans contexte. Les cellules restent stables sous alias, acronymes et formes multilingues.

RaisonnementPapersBenchmarks
SIG
82
HYP
15
arXiv cs.CL·

MemRepair: Hierarchical Memory for Agentic Repository-Level Vulnerability Repair

MemRepair est un framework d'agent augmenté par mémoire pour la réparation de vulnérabilités au niveau du dépôt. Il combine trois couches mémoire (History-Fix, Security-Pattern, Refinement-Trajectory) avec une boucle de raffinement itérative. Évalué sur SEC-Bench, PatchEval et Multi-SWE-bench, MemRepair atteint 58.0%, 58.2% et 30.58% de taux de résolution, surpassant OpenHands, SWE-agent et InfCode-C++.

Agents IAGénération de codeSécurité IA
SIG
82
HYP
18
arXiv cs.CL·

The Point of No Return: Counterfactual Localization of Deceptive Commitment in Language-Model Reasoning

Étude sur le moment où un modèle de langage s'engage dans la tromperie. Via localisation contrefactuelle sur 5 environnements (bluff, labyrinthes, conseils financiers, vente auto, négociation), les auteurs analysent 1,46M phrases et 91,5B tokens. Les indices lexicaux ne généralisent pas, mais les features d'attention se transfèrent entre domaines.

RaisonnementSécurité IAAlignement
SIG
82
HYP
15
arXiv cs.AI·

SurgicalMamba: Dual-Path SSD with State Regramming for Online Surgical Phase Recognition

SurgicalMamba, modèle basé sur Mamba2, reconnaît les phases chirurgicales en temps réel avec coût O(d) par frame. Trois composants adressent les défis spécifiques : dual-path SSD séparant régimes long/court-terme, stepping modulé en intensité adaptant le taux effectif, et state regramming pour mélange cross-canal. Résultats SOTA : 94.6%/82.7% sur Cholec80, 89.5%/68.9% sur AutoLaparo, 238.74 fps GPU.

RaisonnementBenchmarksVision
SIG
82
HYP
15
arXiv cs.AI·

Friends and Grandmothers in Silico: Localizing Entity Cells in Language Models

Chercheurs localisent des « cellules d'entité » — neurones MLP sélectifs qui encodent des faits spécifiques — dans sept modèles de langage. Sur Qwen2.5-7B, supprimer une cellule efface le rappel pour son entité tandis qu'activer une seule cellule suffit à récupérer la connaissance, même sans contexte. Ces cellules restent stables sous alias, acronymes et formes multilingues.

Benchmarks
SIG
82
HYP
15
arXiv cs.CL·

Med-V1: Small Language Models for Zero-shot and Scalable Biomedical Evidence Attribution

Med-V1 est une famille de modèles de langage de 3 milliards de paramètres entraînés sur des données synthétiques pour l'attribution d'évidences biomédicales et la vérification de faits. Elle surpasse ses modèles de base de +27% à +71% sur cinq benchmarks et rivalise avec GPT-5 tout en étant bien plus efficace. L'étude quantifie les hallucinations dans les réponses générées par LLM selon les instructions de citation.

BenchmarksFine-tuningÉvaluations
SIG
82
HYP
18
arXiv cs.CL·

MCompassRAG: Topic Metadata as a Semantic Compass for Paragraph-Level Retrieval

MCompassRAG améliore les systèmes RAG en utilisant des métadonnées de sujets comme guide sémantique pour la récupération de paragraphes. La méthode enrichit les représentations de chunks avec des signaux au niveau des sujets dans le même espace d'embedding et entraîne un retrieveur léger par distillation LLM. Sur six benchmarks, elle gagne 8,24% en efficacité informationnelle avec 5× moins de latence.

RAGEmbeddingsBenchmarks
SIG
78
HYP
25
arXiv cs.CL·

Redact or Keep? A Fully Local AI Cascade for Educational Dialogue De-Identification

Framework local de dé-identification pour dialogues éducatifs. Cascade à deux étages : proposeur union (encodeurs légers + règles déterministes) génère candidats PII, puis reviewer binaire Redact/Keep utilise contexte et rôle du locuteur. Atteint 0.958 F1 macro sur transcriptions tutoriel math, surpasse LLM commercial (0.706) et baseline locale (0.767), s'exécute sur laptop unique.

RAGSécurité IAPapers
SIG
78
HYP
15
arXiv cs.CL·

Dual Dimensionality for Local and Global Attention

Les chercheurs proposent Distance-Adaptive Representation (DAR) : réduire la dimensionnalité des clés/valeurs au-delà d'une fenêtre locale dans les Transformers décodeur-seul. Les tokens proches nécessitent des représentations complètes pour prédire le token suivant, tandis que les tokens distants peuvent utiliser 1/4 de la dimensionnalité originale sans dégradation. Testé sur modèles 70M-410M et fine-tuning 1B.

RaisonnementInfrastructureBenchmarks
SIG
78
HYP
15