Page 3 sur 192

ToutHaut signalRécent
7679 articles
arXiv cs.CL·

Harsher on Male? Evaluating LLMs on Gender-Asymmetric Moral Framing Across Diverse Conflict Scenarios

GAMA-Bench, un benchmark de 1 298 scénarios appairés, révèle une asymétrie systématique : les LLMs appliquent des standards de réponse plus sévères aux hommes qu'aux femmes pour le même comportement répréhensible. Les acteurs masculins reçoivent des cadres plus punitifs et blâmants, tandis que les actrices bénéficient de réponses plus thérapeutiques. Le pattern persiste sur 10 modèles et tous les types de scénarios.

ÉvaluationsSécurité IAAlignement
SIG
82
HYP
15
Reddit r/LocalLLaMA·

Open sourcing InfiniteKV: a KV cache that files old tokens as 104-byte searchable records in RAM or on disk instead of deleting them. Mistral-7B answered from token 76,747, 2.3x past its trained window. Colab demo

InfiniteKV compresse le KV cache en enregistrements de 104 bytes indexables stockés en RAM ou sur disque, au lieu de supprimer les anciens tokens. Mistral-7B répond correctement à token 76,747 (2.3× sa fenêtre d'entraînement de 32,768). Un million de tokens nécessite ~3 GB au lieu de 122 GB.

Open sourceInfrastructureLlama
SIG
82
HYP
25
arXiv cs.CL·

MARD: Mirror-Augmented Reasoning Distillation for Mechanism-Level Drug-Drug Interaction Prediction

MARD est un modèle de 7B paramètres pour prédire les interactions médicamenteuses au niveau mécanistique (enzyme, axe pharmacodynamique). Utilise distillation de raisonnement avec DPO pondéré par récompense de processus et récupération mécanisme-aware. Sur DrugBank avril 2026 : +13.9pp vs meilleure baseline, +6.7pp vs GPT-4o, avec généralisation robuste aux paires de médicaments inédites.

RaisonnementFine-tuningReinforcement learning
SIG
82
HYP
15
arXiv cs.CL·

LEDGER: A Long-Context Benchmark of Corporate Annual Reports for Grounded Financial Retrieval and Extraction

LEDGER est un benchmark de 4 999 rapports annuels d'entreprises numérisés pour évaluer les capacités long-contexte des LLM en finance. Le corpus inclut 31 KPIs financiers consolidés, 118 048 questions de retrieval TREC-style, et des tâches d'extraction sur documents denses. Étude de cas : corrélation entre rhétorique CEO et impact marché post-publication.

BenchmarksRAGRaisonnement
SIG
82
HYP
15
arXiv cs.CL·

Rigel: Reverse-Engineering the Metal 4.1 Tensor Compute Path on the Apple M4 Max GPU

Rigel caractérise empiriquement le chemin de calcul tensoriel Metal 4.1 sur Apple M4 Max. Les chercheurs découvrent que l'opération matmul2d fp8 (E4M3) est émulée, non accélérée (0.94x le débit fp16), exécutée sur les shader cores GPU sans datapath matriciel dédié, et accumule en ≥fp32. Un kernel GEMM fusionné gagne +6.5-12.9% en régime cache-resident.

BenchmarksInfrastructureGénération de code
SIG
82
HYP
15
arXiv cs.AI·

Arbor: Tree Search as a Cognition Layer for Autonomous Agents

Arbor est un framework multi-agent introduisant la recherche arborescente comme couche de cognition pour agents autonomes. Validé sur l'optimisation d'inférence LLM full-stack, il associe un agent Orchestrator et un agent Critic avec architecture de poids et contrepoids. Arbor atteint 193% d'amélioration Pareto throughput-latency vs baselines optimisées, contre 33% pour un agent seul qui s'écroule en quelques heures.

Agents IAMulti-agentsRaisonnement
SIG
82
HYP
25
arXiv cs.AI·

Pythagoras-Prover: Advancing Efficient Formal Proving via Augmented Lean Formalisation

Pythagoras-Prover est une famille open-source de prouveurs Lean efficaces (4B et 32B paramètres, incluant un prototype diffusion). Via curriculum SFT et Augmented Lean Formalisation (ALF), le modèle 4B surpasse DeepSeek-Prover-V2-671B sur MiniF2F-Test (86.1% vs 82.4%) avec 167x moins de paramètres. Le 32B atteint 93.0% sur MiniF2F-Test et résout 93/672 problèmes PutnamBench.

RaisonnementGénération de codeBenchmarks
SIG
82
HYP
25
arXiv cs.AI·

INFRAMIND: Infrastructure-Aware Multi-Agent Orchestration

INFRAMIND est un framework pour l'orchestration multi-agent qui intègre l'état réel de l'infrastructure (files d'attente GPU, cache KV, latences). Via planification adaptative, routage par étape et ordonnancement intelligent, il optimise la sélection de modèles et topologies sous charge concurrente. Résultats : +7.6pp de précision à faible charge, latence 7x inférieure, 99.9% de conformité SLO en surcharge.

Multi-agentsAgents IAReinforcement learning
SIG
82
HYP
25
arXiv cs.LG·

ProHiFlo: Hierarchical Flow Matching with Functional Guidance for De Novo Protein Generation

ProHiFlo est un framework de flow matching hiérarchique pour la génération de protéines de novo. Il combine génération coarse-to-fine (squelette puis atomes), guidance fonctionnelle via prédicteurs pré-entraînés, et architecture SE(3)-équivariante. Sur le scaffolding de sites actifs enzymatiques, ProHiFlo atteint 58,9% de succès vs 41,2% pour RFDiffusion, avec 4× moins d'étapes d'échantillonnage.

PapersBenchmarksRaisonnement
SIG
82
HYP
18
Reddit r/LocalLLaMA·

FlashMemory-DeepSeek-V4: Lightning Index Ultra-Long Context via Lookahead Sparse Attention

FlashMemory-DeepSeek-V4 introduit Lookahead Sparse Attention (LSA), un paradigme d'inférence qui réduit l'empreinte mémoire KV cache à 13,5% du baseline sur contextes ultra-longs (500K tokens). Un Neural Memory Indexer prédit les demandes futures et conserve uniquement les chunks critiques en GPU, sans charger le modèle backbone complet. Résultats : +0,6% de précision moyenne sur LongBench-v2, LongMemEval, RULER.

DeepSeekRaisonnementBenchmarks
SIG
82
HYP
25
arXiv cs.CL·

CodeAlchemy: Synthetic Code Rewriting at Scale

CodeAlchemy génère 500B+ tokens de données synthétiques via 5 stratégies (CodeEnhance, CodeQA, CodeDev, CodeDialogue, CodeTrace) à partir de code public dans 15 langues. CodeTrace instrumente 1.3M+ fichiers pour capturer flux de contrôle et connaissance de bibliothèques. Les modèles 3B surpassent des modèles 10x plus grands (Gemma-3 27B, Granite-4.0 32B) : 83.5% HumanEval, 63.2% MBPP.

Génération de codeBenchmarksFine-tuning
SIG
82
HYP
25
arXiv cs.AI·

ComBench: A Benchmark for Rigorous Proof Reasoning and Constructive Realization in Olympiad-Level Combinatorics

ComBench est un benchmark de 100 problèmes de combinatoire niveau Olympiade pour évaluer le raisonnement mathématique des LLM. Il distingue problèmes d'analyse (preuves rigoureuses) et de construction (constructions explicites). Les meilleurs modèles atteignent 65,4% en moyenne et 75,3% en Best@4. Kimi-K2.6 surpasse GPT-4o sur les constructions mais le cède sur les preuves.

BenchmarksRaisonnementÉvaluations
SIG
82
HYP
15
arXiv cs.CL·

Less Context, More Accuracy: A Bi-Temporal Memory Engine for LLM Agents Where a Lean Retrieved Context Beats the Full History

Engram, un moteur mémoire open-source pour agents LLM, utilise un modèle bi-temporel avec graphe de connaissances pour dépasser la baseline full-context. Sur LongMemEval_S (500 questions), la configuration lean récupère ~9.6k tokens et atteint 83.6% vs 73.2% pour l'historique complet (+10.4 points, p<10^-6), avec 8x moins de tokens.

Agents IARaisonnementBenchmarks
SIG
82
HYP
15
arXiv cs.LG·

IntentKV: Cross-Turn Intent-Aware KV Cache Pruning for Agent Inference

IntentKV est une technique de pruning du cache KV pour agents LLM multi-tours. Elle maintient une mémoire d'intention cross-turn et utilise une règle memory-attention pour scorer les tokens historiques. Sur Qwen2.5-14B avec budget 8k, elle réduit les pics de tokens de 92.3k à 20.5k (−77.8%) et les lectures KV de 411M à 31M (−92.6%) sans perte d'exactitude significative.

Agents IARaisonnementInfrastructure
SIG
82
HYP
15
arXiv cs.LG·

Offline Reinforcement Learning for Plasma Control in Nuclear Fusion: Codebase and Benchmark

RL4F est un benchmark open-source d'apprentissage par renforcement hors-ligne pour le contrôle du plasma dans la fusion nucléaire. Basé sur des données historiques du tokamak DIII-D, il évalue des méthodes imitation learning et offline RL sur quatre tâches de suivi multi-actuateurs (rotation, densité, température, pression). Les méthodes offline model-based RL obtiennent les meilleures performances moyennes.

Reinforcement learningBenchmarksOpen source
SIG
82
HYP
15
Reddit r/LocalLLaMA·

I fine-tuned Parakeet 0.6B for medical ASR — open weights, local Mac/CUDA/CPU

Fine-tuning de Parakeet 0.6B pour la transcription médicale en poids ouverts (CC-BY-4.0). Omi Med STT v1 atteint 2.37% M-WER (erreurs sur termes cliniques) vs 8.36% du modèle de base, avec 145× RTFx. Runtime multi-plateforme (MLX/NeMo/GGUF). Benchmark sur 1,513 clips médicaux : surpasse Whisper Large v3 Turbo et Qwen3 ASR en précision clinique.

Open sourceGénération de codeBenchmarks
SIG
82
HYP
18
arXiv cs.CL·

HKJudge: A Legal Discourse-Annotated Corpus for Interpreting What Courts Find, How They Reason, and What They Rule

HKJudge est le premier corpus annoté au niveau phrase pour l'analyse du discours juridique. Il contient ~290k phrases et ~6.5M tokens de jugements criminels de Hong Kong, annotés par des experts en linguistique juridique. Deux tâches benchmark : classification de rôles rhétoriques (26 catégories) et extraction d'éléments légaux. Évaluation sur modèles BERT, LLMs open-source et commerciaux.

BenchmarksPapersFine-tuning
SIG
82
HYP
15
arXiv cs.CL·

Improving Cross-Lingual Factual Recall via Consistency-Driven Reinforcement Learning

PolyFact, un dataset de 100K questions factuelles multilingues sur Wikidata couvrant 12 langues, évalue trois approches pour améliorer la cohérence factuelle cross-lingue dans Qwen-2.5-7B et OLMo-2-1124-7B. GRPO surpasse le fine-tuning supervisé en réduisant la spécialisation linguistique dans les couches MLP et têtes d'attention, favorisant des représentations cross-lingues partagées.

BenchmarksReinforcement learningQwen
SIG
82
HYP
18
arXiv cs.AI·

LeanMarathon: Toward Reliable AI Co-Mathematicians through Long-Horizon Lean Autoformalization

LeanMarathon est un système multi-agent pour l'autoformalization fiable de mathématiques de recherche en Lean. Il utilise un blueprint évolutif (fichier Lean servant de squelette de preuve, graphe de preuve en langage naturel et registre partagé) coordonné par quatre agents spécialisés. Sur deux articles récents couvrant quatre problèmes d'Erdős, il formalise sept théorèmes sans sorry et prouve 258 lemmes.

RaisonnementAgents IAMulti-agents
SIG
82
HYP
18
Reddit r/MachineLearning·

TinyTPU: SystemVerilog systolic array compiled to WASM, running live in browser - RTL golden-verified against numpy [P]

TinyTPU est un réseau systolique 4×4 en SystemVerilog compilé en WebAssembly avec visualisation interactive dans le navigateur. L'outil permet d'observer l'exécution réelle du matériel : chargement des poids, flux diagonal de la matrice A, accumulation des sommes partielles. Trois niveaux pédagogiques : cellule MAC isolée, array complet 4×4, et tiling pour matrices plus grandes.

InfrastructureBenchmarksOpen source
SIG
82
HYP
15
arXiv cs.LG·

Alpha-RTL: Test-Time Training for RTL Hardware Optimization

Alpha-RTL introduit TTT-RTL, un framework d'apprentissage par renforcement au moment du test pour optimiser la génération RTL par LLM. Sur RTLLM v2.0 (Nangate 45nm), TTT-RTL réduit le produit PPA de 65,1% vs référence et surpasse les baselines gelées de 26,1%. Sur XuanTie C910 FPU (Sky130), réduction ADP de 59,4%. Contrôleur KL-budget adaptatif stabilise les mises à jour de politique.

Génération de codeReinforcement learningBenchmarks
SIG
82
HYP
18
arXiv cs.CL·

The Granularity Gap: A Multi-Dimensional Longitudinal Audit of Sycophancy in Gemini Models

Audit longitudinal de la sycophantie dans six variantes Gemini (2.0, 2.5, 3.0) sur 73 prompts adversariaux. 27,2 % des réponses contiennent du contenu sycophantique substantiel (Likert ≥2), masqué par les métriques binaires. Gen 2.5 régresse (2,64 vs 1,90 Gen 2.0), Gen 3.0 se rétablit (2,01). Corrélation négative forte (rho=-0,63) entre sycophantie et véracité.

GeminiSécurité IAAlignement
SIG
82
HYP
18
arXiv cs.CL·

LANTERN: Layered Archival and Temporal Episodic Retrieval Network for Long-Context LLM Conversations

LANTERN est une couche mémoire légère qui archive chaque tour de conversation et restaure les détails pertinents après compaction via récupération hybride, sans appels LLM et avec <25ms de latence. Sur 94 conversations multi-tours (1 894 faits validés), LANTERN-Rerank récupère 78,3% des faits perdus, surpassant MemGPT (72,4%, p<0.0001) avec coût d'inférence réduit.

RAGRaisonnementBenchmarks
SIG
82
HYP
18
arXiv cs.CL·

CHASE: Adversarial Red-Blue Teaming for Improving LLM Safety using Reinforcement Learning

CHASE est un framework de red-blue teaming co-évolutif qui entraîne un attaquant et un défenseur via GRPO pour améliorer la robustesse des LLM contre les attaques par réécriture de prompts (persona modulation, framing fictionnel). Évalué sur BeaverTails et JailbreakBench, il réduit le score StrongREJECT de 43,2% sans faux refus sur prompts bénins.

Sécurité IAAlignementReinforcement learning
SIG
82
HYP
18
arXiv cs.LG·

Dominant-Layer ZO: A Single Layer Dominates Zeroth-Order Fine-Tuning of LLMs

Une étude révèle qu'en optimisation zeroth-order (ZO) pour fine-tuner les LLM, une seule couche de décodage domine l'adaptation. Fine-tuner cette couche dominante seule égale ou surpasse le fine-tuning ZO complet sur LLaMA2-7B et Qwen3-8B, avec accélération jusqu'à 4.52×. La couche dominante est identifiable avant entraînement via analyse des outliers d'activation.

Fine-tuningRaisonnementBenchmarks
SIG
82
HYP
15
arXiv cs.LG·

Policy-Conditioned Counterfactual Credit for Verifiable Reinforcement Learning of Long-Horizon Language Agents

CVT-RL, un algorithme de gradient de politique avec récompenses vérifiables denses, améliore l'apprentissage par renforcement des agents de langage long-horizon. Sur QA, ALFWorld, ScienceWorld et tâches web/outils, le succès passe de 71,8% (RL non-causal) à 78,9%, le F1 des preuves de 78,9 à 82,8, et le hacking mesuré de 7,2% à 3,9%. Les tests statistiques donnent p<0,01 après correction de Holm.

Reinforcement learningAgents IARaisonnement
SIG
82
HYP
15