Page 15 sur 192

ToutHaut signalRécent
7679 articles
arXiv cs.AI·

SCI-PRM: A Tool Aware Process Reward Model for Scientific Reasoning Verification

SCI-PRM est un modèle de récompense de processus entraîné sur SCIPRM70K, un dataset de 70K trajectoires scientifiques intégrant outils et raisonnement. Il supervise la sélection d'outils, l'exactitude d'exécution et l'interprétation des résultats. Testé sur biologie, chimie, physique : améliore le scaling test-time et fournit un signal dense pour RL.

RaisonnementÉvaluationsReinforcement learning
SIG
78
HYP
25
arXiv cs.LG·

dMX: Differentiable Mixed-Precision Assignment for Low-Precision Floating-Point Formats

dMX est un framework de quantification mixte-précision différentiable pour assigner des largeurs de bits flottants apprenables aux couches de LLMs. Testé sur Llama, Qwen3 et SmolLM2 avec le standard MXFP (Open Compute Project), il optimise continu les formats par couche puis les discrétise via annealing, surpassant les heuristiques KL-divergence sur WikiText-2 et benchmarks zero-shot.

LlamaQwenBenchmarks
SIG
78
HYP
15
arXiv cs.CL·

MM-BizRAG: Rethinking Multimodal Retrieval-Augmented Generation for General Purpose Enterprise Q&A

MM-BizRAG améliore la génération augmentée par récupération multimodale pour les documents d'entreprise complexes. Le système extrait explicitement la structure des documents via des pipelines d'ingestion orientés (parsing pour rapports verticaux, représentations page-entière pour présentations), puis assemble les contextes multimodaux à l'inférence. Gains jusqu'à 32% sur SlideVQA et FinRAGBench-V sans fine-tuning.

RAGVisionBenchmarks
SIG
78
HYP
25
arXiv cs.CL·

A Systematic Evaluation of Positional Bias in Multi-Video Summarization with MLLMs

Étude systématique du biais positionnel dans la résumé multi-vidéo avec MLLMs. Benchmark sur ActivityNet et News videos (2-4 vidéos). Évaluation de 9 modèles (open-source et propriétaires) avec 3 métriques : Coverage, Directional Positional Bias, Middle-Edge Gap. Résultat : effets positionnels dépendent du domaine et du modèle ; augmenter le budget visuel ne supprime pas l'imbalance.

VisionBenchmarksÉvaluations
SIG
78
HYP
15
arXiv cs.CL·

Cartridges at Scale: Training Modular KV Caches over Large Document Collections

Cartridges at Scale (CAS) entraîne des caches KV modulaires et réutilisables pour de grandes collections documentaires, éliminant le prefilling coûteux. Le framework gère dynamiquement des centaines de cartouches par document avec rotation GPU/stockage, scalant à plus d'un million de tokens. Performance : +10-31 points vs cartouche monolithique, -3-4x tokens vs RAG classique.

RAGRaisonnementPapers
SIG
78
HYP
15
arXiv cs.LG·

Do Transformers Need Three Projections? Systematic Study of QKV Variants

Étude systématique des variantes QKV dans les transformers. Les auteurs testent trois contraintes de partage de projections (Q-K=V, Q=K-V, Q=K=V) sur tâches synthétiques, vision et modèles de langage (300M-1.2B). Q-K=V réduit le cache KV de 50% avec dégradation perplexité de 3.1%. Combiné à GQA/MQA, atteint 87.5-96.9% de réduction cache pour inférence edge.

RaisonnementBenchmarksOpen source
SIG
78
HYP
15
arXiv cs.AI·

Cascading Hallucination in Agentic RAG: The CHARM Framework for Detection and Mitigation

CHARM détecte et mitigue les hallucinations en cascade dans les pipelines RAG multi-étapes, où les erreurs précoces se propagent et s'amplifient. Framework avec 4 composants (vérification factuelle, cohérence cross-stage, monitoring de confiance, résolution). 89.4% de taux de détection sur HotpotQA/MuSiQue/2WikiMultiHopQA, réduction d'erreurs de 82.1%.

RAGAgents IARaisonnement
SIG
78
HYP
25
arXiv cs.LG·

LiftQuant: Continuous Bit-Width LLM via Dimensional Lifting and Projection

LiftQuant propose une quantification à bit-width continu pour les LLM via un mécanisme « lift-then-project » qui projette un treillis 1-bit depuis un espace de dimension supérieure. Le bit-width effectif est contrôlé par le ratio des dimensions, permettant un ajustement quasi-continu. Un modèle 70B compressé à 2.4 bits sur 24GB GPU surpasse les modèles 2-bit existants.

BenchmarksOpen source
SIG
78
HYP
25
arXiv cs.CL·

GENEB: Why Genomic Models Are Hard to Compare

GENEB est un benchmark diagnostic à grande échelle évaluant 40 modèles fondamentaux génomiques sur 100 tâches dans 13 catégories fonctionnelles sous un protocole unifié. L'analyse révèle que les classements agrégés sont instables : les rangs varient fortement entre catégories, l'échelle offre des gains modestes et inconsistants, et l'alignement architectural surpasse souvent le nombre de paramètres.

BenchmarksPapersÉvaluations
SIG
78
HYP
15
arXiv cs.LG·

Edge of Stability Selectively Shapes Learning Across the Data Distribution

L'étude montre que l'edge of stability (EoS) redistribue sélectivement l'apprentissage entre sous-groupes de données. Deux conditions permettent à un groupe de bénéficier : l'alignement de son gradient agrégé avec le vecteur propre dominant de la Hessienne, et le maintien d'une magnitude de gradient non-nulle. Sous cross-entropy loss, la saturation du gradient avantage les outliers en sortie.

PapersReinforcement learningÉvaluations
SIG
78
HYP
15
arXiv cs.CL·

Long Live Fine-Tuning: Task-Specific Transformers Outperform Zero-Shot LLMs for Misinformation Response Classification on Reddit

Fine-tuned RoBERTa surpasse les LLMs zero-shot (Claude Haiku, Gemini Flash) sur la classification de réponses à la désinformation Reddit : 0.62 macro-F1 vs 0.50. L'augmentation de taille (Llama-3-70B vs 8B) n'aide pas. Les alignements de sécurité des modèles commerciaux dégradent la détection de croyances (0.17 pour Claude Sonnet).

Fine-tuningBenchmarksSécurité IA
SIG
78
HYP
15
arXiv cs.LG·

Recover-LoRA for Aggressive Quantization: Reclaiming Accuracy in 2-Bit Language Models via Low-Rank Adaptation with Knowledge Distillation on Synthetic Data

Recover-LoRA étend une méthode de récupération d'accuracy sans données aux LLM quantifiés à 2-bit. Une stratégie mixte quantifie sélectivement les couches gate/up du MLP en W2 tandis que les autres restent en W4, gagnant 7.5–23.3% en throughput. Des adaptateurs low-rank entraînés par distillation logit sur données synthétiques récupèrent 80–95% d'accuracy sur Qwen3-4B avec 10k samples.

Fine-tuningBenchmarks
SIG
78
HYP
18
arXiv cs.AI·

Online Skill Learning for Web Agents via State-Grounded Dynamic Retrieval

SGDR, une méthode d'apprentissage de compétences en ligne, permet aux agents web de réutiliser des sous-procédures à chaque étape d'exécution. Contrairement aux approches statiques, SGDR récupère dynamiquement les compétences en fonction de l'état actuel de la page et de l'objectif. Sur WebArena, elle atteint 37,5% de succès avec GPT-4.1 et 24,3% avec Qwen3-4B, surpassant les baselines de 10,6% et 10,0%.

Agents IABenchmarksGénération de code
SIG
78
HYP
15
arXiv cs.LG·

Pseudospectral Bounds for Transient Amplification in Coupled Gradient Descent

Théorie pseudospectrale pour la descente de gradient couplée (bilevel optimization, approximation stochastique deux échelles, entraînement adversarial). Borne Kreiss K(J) ≤ 2/(1-γ) + ‖C‖/(4(1-γ)) pour Jacobiens bloc-triangulaires. Complexité itérative O(K(J)² log(1/δ)) en régime fini. Expériences sur problèmes linéaires-quadratiques et réseaux de neurones.

Reinforcement learningBenchmarksPapers
SIG
78
HYP
08
arXiv cs.CL·

LDARNet: DNA Adaptive Representation Network with Learnable Tokenization for Genomic Modeling

LDARNet, un modèle fondationnel génomique de 120M paramètres, introduit une tokenization adaptative apprise sans supervision pour remplacer les schémas fixes (k-mers, BPE). Combinant BiMamba-2 avec attention locale et routage bidirectionnel, il atteint l'état de l'art sur 5 tâches de modification d'histones et surpasse des modèles 20× plus grands à compute égal.

PapersBenchmarksFine-tuning
SIG
78
HYP
15
arXiv cs.CL·

POLARIS: Guiding Small Models to Write Long Stories

POLARIS est une méthode d'optimisation par renforcement (GRPO) pour améliorer la génération de textes longs par petits modèles. Appliquée à Qwen3.5-9B avec 1.4K paires prompt-histoire et 4 GPU A100, elle utilise un juge LLM frontier et l'injection de références humaines. POLARIS-9B rivalise avec des modèles 3× plus grands et généralise à des histoires 3× plus longues que l'entraînement.

QwenReinforcement learningFine-tuning
SIG
78
HYP
25
arXiv cs.AI·

AIP: A Graph Representation for Learning and Governing Agent Skills

AIP (Agent Instruction Protocol) modélise les compétences d'agents comme des graphes d'exécution dirigés avec nœuds déterministes et arêtes typées validées par schéma YAML. Sur 27 tâches SkillsBench, Claude Sonnet passe de 0.60 à 0.71 de récompense moyenne et 53% à 67% de taux de réussite. La structure graphique permet diagnostic précis et amélioration itérative des compétences.

Agents IAClaudeAnthropic
SIG
78
HYP
25
arXiv cs.AI·

Beyond Objective Equivalence: Constraint Injection for LLM-Based Optimization Modeling on Vehicle Routing Problems

VRPCoder, un modèle 8B, traduit des scénarios de routage de véhicules en langage naturel vers du code Gurobi. Les auteurs proposent « constraint injection » pour vérifier que les contraintes ne sont ni omises ni ajoutées spurieusement. Avec GRPO, VRPCoder atteint 93% Pass@1, surpassant Claude-Sonnet-4.5 de 28 points sur des benchmarks VRP.

Génération de codeReinforcement learningBenchmarks
SIG
78
HYP
25
arXiv cs.CL·

Read the Trace, Steer the Path: Trajectory-Aware Reinforcement Learning for Diffusion Language Models

CAPR est un algorithme de reinforcement learning pour modèles de diffusion (dLLMs) qui exploite la trace de débruitage pour générer des signaux de supervision granulaires sans coût computationnel d'arbre complet. L'approche réduit le coût de rollout à 0.75x des méthodes plates et 0.6x des arbres, atteignant SOTA sur Sudoku 4x4, Countdown, GSM8K et Math500.

Reinforcement learningRaisonnementBenchmarks
SIG
78
HYP
15
arXiv cs.LG·

Spectral Asymptotics of Neural Network Loss Landscapes: An Exact Decomposition of the Curvature Exponent

Étude théorique de la géométrie des paysages de perte des réseaux de neurones. Les auteurs prouvent une décomposition spectrale expliquant pourquoi l'exposant de courbure α varie selon les couches (α≈2 convolutions, α≈1 attention transformer, α<1 MLP). Validation empirique sur 93 couches, 5 architectures, 3 datasets avec erreur médiane ~2%.

PapersRaisonnementBenchmarks
SIG
78
HYP
15
arXiv cs.LG·

Are we really tilting? The mechanics of reward guidance in flow and diffusion models

Les algorithmes de reward guidance stérisent les processus génératifs vers des mesures favorables aux récompenses. L'étude montre que le reward hacking provient d'une approximation pratique : l'estimation plug-in à particules finies de la fonction h de Doob. Les auteurs proposent un calendrier d'amortissement fermé et valident sur cibles gaussiennes, damier 2D et FLUX.1.

Reinforcement learningRaisonnementPapers
SIG
78
HYP
15
arXiv cs.CL·

AI Rater Discrimination Depends on Scoring Protocol in Complex Clinical Decision-Making

Étude factorial sur 4 LLMs open-source évaluant des décisions cliniques en diabète type 2. Les LLMs utilisés comme évaluateurs donnent des scores 74–78 points en protocole sans rubrique vs 7.69–49.64 points avec rubrique ancrée. La rubrique amplifie la discrimination entre modèles (facteur 1.76–5.10) et révèle variations comportementales masquées sans rubrique.

ÉvaluationsBenchmarksSécurité IA
SIG
78
HYP
15
arXiv cs.CL·

The Deliberative Illusion: Diagnosing Factual Attrition and Stance Homogenization in Multi-Agent LLM Deliberation

Les systèmes multi-agents LLM perdent jusqu'à 72% des faits critiques lors de la délibération, créant une « illusion délibérative ». DelibTrace mesure cette attrition factuelle et l'homogénéisation des positions. Les agents convergent vers un consensus tout en oubliant les éléments essentiels pour interpréter le problème.

Multi-agentsAgents IAÉvaluations
SIG
78
HYP
25
arXiv cs.CL·

Regret Pre-training: Bridging Prior and Posterior Views for Enhanced Knowledge Grounding

Regret Pre-training introduit un cadre d'apprentissage auto-supervisé basé sur LUPI, utilisant une architecture dual-view pour générer distributions Student (causale) et Teacher (future-conditionnée). Sur OLMoE-1B-7B après 4B tokens, GlobalRegret et LocalRegret atteignent 33.9% et 32.2% de précision moyenne vs 30.2% baseline, avec gain de 18.1pp sur BoolQ. Zéro paramètre supplémentaire.

PapersRaisonnementFine-tuning
SIG
78
HYP
15
arXiv cs.LG·

ReLoRA: Knowledge-Reusing Adaptation for Fast Rollout of Evolving LLM Services

ReLoRA est un framework de ré-adaptation efficace pour les services LLM en évolution continue. Il utilise l'optimisation bayésienne pour initialiser les adaptateurs LoRA de manière compatible avec les mises à jour du modèle de base, puis affine avec régularisation progressive. Résultats : réduction du temps de déploiement jusqu'à 8,9× et amélioration de précision jusqu'à 4,6%.

Fine-tuningRaisonnementBenchmarks
SIG
78
HYP
15
arXiv cs.AI·

SkillDAG: Self-Evolving Typed Skill Graphs for LLM Skill Selection at Scale

SkillDAG modélise les relations entre compétences d'agents LLM comme un graphe typé orienté, permettant une sélection dynamique de compétences à l'inférence. Sur ALFWorld et SkillsBench avec MiniMax-M2.7, le système atteint 67,1% de succès et 27,3% de récompense, surpassant les baselines Graph-of-Skills de +12,8 et +8,6 points. Le graphe s'enrichit pendant l'exécution via un protocole propose-then-commit.

Agents IARaisonnementBenchmarks
SIG
78
HYP
25
arXiv cs.AI·

The Shadow Price of Reasoning: Economic Perspective on Optimal Budget Allocation for LLMs

Papier arXiv proposant CLEAR, une méthode d'allocation optimale de budget de calcul pour l'inférence LLM basée sur la théorie économique. Via une fonction d'utilité « shifted-surge » et un prix fantôme global, CLEAR abandonne les requêtes non-solvables et réalloue les ressources. Résultats : 3x d'amélioration en précision globale vs allocation uniforme en régimes de ressources limitées.

RaisonnementBenchmarksInfrastructure
SIG
78
HYP
25
arXiv cs.AI·

Decomposing how prompting steers behavior

Étude de la géométrie représentationnelle pour comprendre comment les prompts modifient le comportement des LLMs et VLMs. Framework de décomposition imbriquée testant translation, transformation rigide, scaling, transformation affine et non-linéaire sur 3 LLMs, 3 VLMs et 6 datasets. Résultat : le mixing linéaire cross-dimensionnel (transformation affine) est le mécanisme clé de réorganisation représentationnelle.

Prompt engineeringRaisonnementPapers
SIG
78
HYP
15