Page 30 sur 192

ToutHaut signalRécent
7679 articles
arXiv cs.AI·

SignRoundV2: Toward Closing the Performance Gap in Extremely Low-Bit Post-Training Quantization for LLMs

SignRoundV2 est un framework de quantization post-training pour LLMs qui maintient les performances sous compression extrême (2-4 bits). Il combine une stratégie de précision mixte adaptative guidée par les gradients et des techniques de stabilisation légères. Les résultats montrent une perte de ~1% à 4.5 bits en moyenne en configuration MXFP mixte, avec amélioration significative en quantization 2-bit.

Fine-tuningBenchmarksInfrastructure
SIG
78
HYP
18
arXiv cs.CL·

EnvFactory: Scaling Tool-Use Agents via Executable Environments Synthesis and Robust RL

EnvFactory automatise la création d'environnements exécutables et la synthèse de trajectoires multi-tours pour l'entraînement d'agents RL. Avec 85 environnements vérifiés sur 7 domaines, le framework génère 2 575 trajectoires SFT/RL et améliore les modèles Qwen3 de +15% sur BFCLv3, +8.6% sur MCP-Atlas et +6% sur conversational benchmarks.

Agents IAReinforcement learningGénération de code
SIG
78
HYP
25
arXiv cs.CL·

Learning from Self-Debate: Preparing Reasoning Models for Multi-Agent Debate

SDRL (Self-Debate Reinforcement Learning) entraîne les LLM à résoudre des problèmes seuls ET à bénéficier de débats multi-agents. Le modèle génère plusieurs solutions, construit un contexte de débat avec différentes trajectoires de raisonnement, puis optimise conjointement les réponses initiales et conditionnées au débat. Résultats : amélioration cohérente de MAD sur plusieurs benchmarks et configurations.

RaisonnementReinforcement learningMulti-agents
SIG
78
HYP
22
arXiv cs.AI·

Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation

OptimusVLA, un modèle Vision-Langage-Action hiérarchique, améliore la manipulation robotique via deux mémoires : Global Prior Memory (remplace le bruit gaussien par des priors de trajectoires similaires) et Local Consistency Memory (assure la cohérence temporelle). Résultats : 98.6% sur LIBERO, +13.5% vs pi_0 sur CALVIN, 2.9x plus rapide en inférence.

VisionRobotiqueAgents IA
SIG
78
HYP
25
arXiv cs.AI·

Med-V1: Small Language Models for Zero-shot and Scalable Biomedical Evidence Attribution

Med-V1 est une famille de modèles de langage de 3 milliards de paramètres entraînés sur des données synthétiques pour l'attribution d'évidences biomédicales. Elle surpasse ses modèles de base de +27% à +71% sur cinq benchmarks et rivalise avec GPT-5, tout en détectant les hallucinations et les erreurs d'attribution dans les directives cliniques.

BenchmarksFine-tuningSécurité IA
SIG
78
HYP
25
arXiv cs.AI·

SkillMOO: Multi-Objective Optimization of Agent Skills for Software Engineering

SkillMOO optimise les bundles de compétences pour agents de codage via recherche multi-objectif (NSGA-II) sur taux de réussite et coût d'inférence. Sur 16 tâches SkillsBench, le framework atteint le meilleur rang de pass rate sur 11/12 tâches non-nulles, réduisant les coûts jusqu'à 31,7% et gagnant jusqu'à 21 points de pourcentage en taux de réussite.

Agents IAGénération de codeBenchmarks
SIG
78
HYP
15
arXiv cs.CL·

SynCABEL: Synthetic Contextualized Augmentation for Biomedical Entity Linking

SynCABEL utilise les LLM pour générer des données d'entraînement synthétiques contextualisées afin de résoudre la pénurie d'annotations expertes en liaison d'entités biomédicales. Le framework atteint des résultats SOTA sur MedMentions (anglais), QUAERO (français) et SPACCC (espagnol), avec 60% moins de données annotées que la supervision humaine complète.

PapersBenchmarksFine-tuning
SIG
78
HYP
18
arXiv cs.CL·

UbuntuGuard: A Culturally-Grounded Policy Benchmark for Equitable AI Safety in African Languages

UbuntuGuard est le premier benchmark de sécurité basé sur des politiques pour les langues africaines. Construit à partir de 155 experts du domaine, il évalue 15 modèles (7 LLM génériques, 8 modèles de garde) sur trois variantes. Les résultats montrent que les benchmarks anglais surestiment la sécurité multilingue réelle et que le transfert cross-lingue reste insuffisant.

Sécurité IABenchmarksÉvaluations
SIG
78
HYP
25
arXiv cs.CL·

BELIEF: Structured Evidence Modeling and Uncertainty-Aware Fusion for Biomedical Question Answering

BELIEF combine modélisation structurée des preuves et fusion consciente de l'incertitude pour la réponse à questions biomédicales. Le framework convertit documents récupérés en objets d'evidence (attributs cliniques, qualité source, pertinence, force de support) et fusionne deux chemins : symbolique (théorie Dempster-Shafer) et neural (LLM). Résultats SOTA sur PubMedQA, MedQA, MedMCQA avec 5 backbones LLM.

RAGRaisonnementÉvaluations
SIG
78
HYP
15
arXiv cs.AI·

Adversarial Agent Collaboration for Correctness Improvements of C to Safe Rust Translation

ACToR, une boucle multi-agent adversariale, améliore la traduction C vers Rust en utilisant un agent traducteur et un agent discriminateur qui s'affrontent itérativement. Sur 63 utilitaires C réels (473 lignes en moyenne), le système atteint 90% de taux de passage des tests sans intervention humaine, avec une amélioration de 36,7% par rapport aux baselines non-adversariales.

Agents IAMulti-agentsGénération de code
SIG
78
HYP
25
arXiv cs.AI·

SD-Search: On-Policy Hindsight Self-Distillation for Search-Augmented Reasoning

SD-Search propose une auto-distillation par hindsight pour améliorer les agents de raisonnement augmentés par recherche. Un modèle unique joue deux rôles (étudiant et enseignant) : l'enseignant conditionné sur les résultats passés guide l'étudiant via divergence Jensen-Shannon au niveau des tokens. Aucun modèle externe ni annotation supplémentaire requise.

RaisonnementReinforcement learningRAG
SIG
78
HYP
15
arXiv cs.AI·

TaskGround: Structured Executable Task Inference for Full-Scene Household Reasoning

TaskGround est un framework d'inférence de tâches pour agents domestiques opérant sur des scènes complètes. Il structure le raisonnement en trois étapes : grounding (extraction de contexte pertinent), inférence (structure exécutable), exécution (séquences d'actions). Évalué sur FullHome (400 tâches), il améliore les taux de succès et rend Qwen3.5-9B compétitif avec GPT-5 tout en réduisant les coûts de tokens de 18x.

Agents IARaisonnementRobotique
SIG
78
HYP
25
arXiv cs.LG·

LoopQ: Quantization for Recursive Transformers

LoopQ est un framework de quantification post-entraînement (PTQ) conçu pour les modèles de langage récursifs (LoopLMs) qui réutilisent les blocs Transformer. Il résout trois défis : décalage de distribution entre rôles, réutilisation d'état entre boucles, et accumulation d'erreur récursive. Sous quantification W4A4, LoopQ améliore la précision de 68,8% et réduit la perplexité de 87,7% vs baseline PTQ statique.

RaisonnementBenchmarks
SIG
78
HYP
15
arXiv cs.CL·

Lying with Truths: Open-Channel Multi-Agent Collusion for Belief Manipulation via Generative Montage

Des agents LLM collusifs manipulent les croyances de victimes en coordonnant des fragments de preuves véridiques via des canaux publics, sans communication cachée. Le framework Generative Montage (Writer-Editor-Director) construit des narratifs trompeurs par débat adversarial. Sur 14 familles LLM, taux de succès 74,4% (propriétaires) et 70,6% (open-weights). Les modèles de raisonnement avancé sont plus vulnérables.

Agents IAMulti-agentsSécurité IA
SIG
78
HYP
35
arXiv cs.CL·

SignRoundV2: Toward Closing the Performance Gap in Extremely Low-Bit Post-Training Quantization for LLMs

SignRoundV2 est un framework de quantization post-training pour LLMs qui maintient les performances même en compression extrême (2-4 bits). Il combine une stratégie de précision mixte adaptative basée sur les gradients et des techniques de stabilisation légères. Les résultats montrent une perte de ~1% à 4.5 bits en moyenne en configuration MXFP mixte.

Fine-tuningBenchmarksOpen source
SIG
78
HYP
15
arXiv cs.AI·

Lean Meets Theoretical Computer Science: Scalable Synthesis of Theorem Proving Challenges in Formal-Informal Pairs

Nouvelle approche pour générer des défis de preuve formelle en exploitant l'informatique théorique (TCS). Le framework synthétise automatiquement des paires problème-preuve en Lean4 et Markdown sur deux domaines : Busy Beaver et Mixed Boolean Arithmetic. DeepSeekProver-V2-671B atteint 57,5% sur Busy Beaver mais seulement 12% sur Mixed Boolean Arithmetic, révélant des lacunes majeures en génération de preuves longues.

RaisonnementBenchmarksPapers
SIG
78
HYP
15
arXiv cs.AI·

Unleashing LLMs in Bayesian Optimization: Preference-Guided Framework for Scientific Discovery

LGBO (LLM-Guided Bayesian Optimization) intègre le raisonnement sémantique des LLM dans chaque itération d'optimisation bayésienne via un mécanisme de préférence. Testé sur benchmarks en physique, chimie, biologie et science des matériaux, LGBO atteint 90% de la meilleure valeur en 6 itérations sur l'optimisation d'électrolytes Fe-Cr, contre 10+ pour BO standard.

RaisonnementBenchmarksPapers
SIG
78
HYP
25
arXiv cs.AI·

Perovskite-R1: a domain-specialized large language model for intelligent discovery of precursor additives and experimental design

Perovskite-R1 est un LLM spécialisé basé sur QwQ-32B, fine-tuné sur 1 232 publications scientifiques et 33 269 matériaux candidats pour découvrir des additifs précurseurs optimisant les cellules solaires pérovskites. Le modèle génère des solutions pour la passivation des défauts et améliore stabilité/performance, validées expérimentalement.

QwenFine-tuningRaisonnement
SIG
78
HYP
25
arXiv cs.CL·

Proof-Carrying Certificates for LLM Pipelines: A Trust-Boundary Architecture

Framework de vérification formelle pour pipelines LLM via certificats Lean 4. Trois familles de certificats (bilattice, sensibilité embedding, Hoare-style) + deux opérateurs (Maximal Certifiable Residue, Compositional Stability) pour déploiements critiques (finance régulée, support clinique, agents). Artefact compilé couvre 22 types de certificats, 17/46 déclarations sans axiomes.

RaisonnementSécurité IAAgents IA
SIG
78
HYP
15
arXiv cs.AI·

Gradient Dynamics of Attention: How Cross-Entropy Sculpts Bayesian Manifolds

Analyse théorique complète de la dynamique des gradients dans les têtes d'attention des transformers sous entraînement cross-entropy. Les auteurs établissent une loi de routage basée sur l'avantage et une mise à jour pondérée par responsabilité, montrant que l'optimisation crée des variétés bayésiennes qui implémentent le raisonnement probabiliste en contexte.

RaisonnementPapersBenchmarks
SIG
78
HYP
15
arXiv cs.AI·

RAP: Runtime Adaptive Pruning for LLM Inference

RAP est un framework de pruning élastique pour l'inférence LLM qui utilise le reinforcement learning pour adapter dynamiquement les stratégies de compression selon les variations mémoire runtime et les demandes hétérogènes de KV-cache. L'agent RL optimise le ratio paramètres/KV-cache en temps réel, conservant uniquement les composants maximisant l'utilité dans le budget mémoire courant.

Reinforcement learningInfrastructureBenchmarks
SIG
78
HYP
15
arXiv cs.AI·

DriveMoE: Mixture-of-Experts for Vision-Language-Action Model in End-to-End Autonomous Driving

DriveMoE propose une architecture Mixture-of-Experts pour la conduite autonome de bout en bout. Le modèle combine une Vision MoE (sélection dynamique de caméras selon le contexte) et une Action MoE (activation d'experts spécialisés pour différents comportements). Construit sur la baseline Drive-π₀, DriveMoE atteint l'état de l'art sur Bench2Drive en évitant l'averaging des modes.

VisionAgents IAPapers
SIG
78
HYP
25
arXiv cs.AI·

InvDesFlow-AL: active learning-based workflow for inverse design of functional materials

InvDesFlow-AL combine diffusion et apprentissage actif pour l'inverse design de matériaux. Le modèle atteint RMSE 0.0423 Å en prédiction de structures cristallines (+32.96% vs méthodes existantes) et génère systématiquement des matériaux à basse énergie de formation. Validation : découverte de Li₂AuH₆ comme supraconducteur BCS à 140 K.

PapersBenchmarksReinforcement learning
SIG
78
HYP
25
arXiv cs.AI·

KISS - Knowledge Infrastructure for Scientific Simulation: A Scaffolding for Agentic Earth Science

KISS introduit une infrastructure de connaissances (KI) pour permettre aux agents IA d'exécuter des simulations scientifiques complexes en Earth sciences. Sur 3 000 essais, les agents équipés de KI produisent des simulations valides à 84%, contre <40% sans KI. Un toolkit automatisé (KDT) a généré 119 KIs couvrant 14 domaines scientifiques, démontrant que l'expertise opérationnelle est structurable et extractible.

Agents IARaisonnementBenchmarks
SIG
78
HYP
25
arXiv cs.LG·

ReTAMamba: Reliability-Aware Temporal Aggregation with Mamba for Irregular Clinical Time Series Prediction

ReTAMamba propose une architecture basée sur Mamba pour prédire des séries temporelles cliniques irrégulières. Le modèle estime la fiabilité des observations selon leur manque et délai écoulé, intègre informations court/long terme via « Chronological Weaving », et utilise un routeur de tokens budgété. Sur MIMIC-IV, eICU et PhysioNet 2012, gains AUPRC de 7,51%, 7,80% et 10,15% respectivement.

BenchmarksRaisonnementPapers
SIG
78
HYP
15
arXiv cs.AI·

Surface-Form Neural Sparse Retrieval: Robust Fuzzy Matching for Industrial Music Search

Amazon Music déploie un système de récupération neurale sparse robuste pour la recherche musicale à grande échelle. Le système gère les fautes de frappe, transpositions et variations phonétiques avec 91,4% de recall@10 sur 6M documents, surpassant les trigrammes (57,7%). Architecture inference-free avec tokenization subword granulaire (max 3 chars) et zéro latence en ligne.

RAGEmbeddingsRecherche vectorielle
SIG
78
HYP
15
arXiv cs.AI·

Supervising the search process produces reliable and generalizable information-seeking agents

RAG-Gym, un framework de supervision du processus de recherche plutôt que du résultat final, améliore les agents de recherche autonomes. Re²Search++, un agent supervisé au niveau du processus, atteint des gains substantiels sur les benchmarks multi-hop, particulièrement hors-domaine, grâce à des requêtes de meilleure qualité et une meilleure généralisation.

Agents IARAGRaisonnement
SIG
78
HYP
22
arXiv cs.CL·

SD-Search: On-Policy Hindsight Self-Distillation for Search-Augmented Reasoning

SD-Search propose une auto-distillation par hindsight pour améliorer les agents de raisonnement augmentés par recherche. Un modèle unique joue deux rôles (étudiant et enseignant) : l'enseignant a accès aux résultats des requêtes passées et guide l'étudiant via divergence Jensen-Shannon au niveau des tokens. Aucun modèle externe ni annotation supplémentaire requise.

RaisonnementReinforcement learningAgents IA
SIG
78
HYP
15
arXiv cs.AI·

Experimentally validated quantum-secure federated learning over a multi-user quantum network

QuNetQFL est un protocole de federated learning quantique implémenté sur des réseaux quantiques, masquant les mises à jour locales avec des clés secrètes quantiques distribuées pour une sécurité information-théorique. Validé expérimentalement sur un réseau à quatre clients, il réduit les coûts de communication de 75% et scale jusqu'à 200 clients avec convergence rapide.

Sécurité IAPapers
SIG
78
HYP
25