Page 9 sur 192

ToutHaut signalRécent
7679 articles
arXiv cs.CL·

The Slop Paradox: How Synthetic Standardization Erodes Clinical Uncertainty and Cross-Modal Alignment in AI-Rewritten Radiology Reports

Étude sur 450 rapports de radiologie thoracique montrant que la réécriture par LLM pour standardisation préserve l'alignement image-texte (2,5% de dégradation) mais érode 26,8-29,3% des entités cliniques et 14,9-16,5% du langage d'incertitude. Le paradoxe : les tâches produisant du texte « plus propre » éloignent le contenu de l'image.

VisionRAGÉvaluations
SIG
78
HYP
15
arXiv cs.LG·

Noise-Driven Escape from Metastable Phases explains Grokking in Deep Neural Networks

Des chercheurs expliquent le phénomène de grokking (généralisation soudaine après surapprentissage prolongé) par des transitions de phase du premier ordre en fonction de la régularisation L2. Le bruit SGD permet aux réseaux de s'échapper de états métastables piégés, avec des temps d'échappement suivant l'échelle d'Arrhenius. Les résultats s'étendent aux réseaux non-linéaires.

PapersRaisonnementÉvaluations
SIG
78
HYP
25
arXiv cs.LG·

Separable Neural Architectures as Physical World Models: from Mathematical Theory to Applications

Nouvelle architecture neuronale séparable (SNA) combinant approximation neuronale et décomposition tensorielle pour résoudre des EDP haute-dimensionnelle. Cadre variationnel (VSNA) garantissant bien-posedness et convergence. Démontre 150 000x speedup vs FEM sur GPU A100 pour simulation paramétrique 7D et inversion thermique Inconel 718 en temps réel (<100ms).

PapersRaisonnementBenchmarks
SIG
78
HYP
15
arXiv cs.LG·

Can Neural Networks Achieve Optimal Computational-statistical Tradeoff? An Analysis on Single-Index Model

Étude théorique montrant que les réseaux de neurones entraînés par gradient peuvent atteindre le compromis optimal calcul-statistique pour les modèles single-index gaussiens. L'algorithme proposé (réseau deux couches) atteint une complexité d'échantillon Õ(d^{s*/2} ∨ d) correspondant à la borne inférieure SQ, avec extension au cas k-sparse via perturbation de poids.

PapersRaisonnementBenchmarks
SIG
78
HYP
15
arXiv cs.CL·

PACUTE: Phonology-, Affix-, and Character-level Understanding of Tokens for Filipino

PACUTE est un benchmark de 4 600 tâches évaluant la compréhension morphologique du filipino dans les LLM. Le benchmark teste 6 niveaux compositionnels incluant l'infixation, la réduplication et les distinctions diacritiques. Les modèles open-weight performent au hasard en décomposition de morphèmes ; les modèles frontier récupèrent les affixes mais restent loin des plafonds en composition morphologique.

BenchmarksPapersRaisonnement
SIG
78
HYP
15
arXiv cs.CL·

Beyond Monolingual Deep Research: Evaluating Agents and Retrievers with Cross-Lingual BrowseComp-Plus

XBCP, un benchmark contrôlé, évalue des agents de recherche profonde sur leur capacité à opérer en contexte multilingue. Quatre agents testés avec des retrievers denses et creux sur 12 langues montrent une dégradation significative : perte de recall, calibration réduite, citations moins fiables. Les problèmes persistent même avec l'or evidence fourni directement.

Agents IARAGBenchmarks
SIG
78
HYP
15
arXiv cs.AI·

ToolMenuBench: Benchmarking Tool-Menu Filtering Strategies for Reliable and Efficient LLM Agents

ToolMenuBench est un benchmark évaluant comment la construction du menu d'outils affecte la fiabilité et l'efficacité des agents LLM multi-étapes. Sur 7 modèles, le filtrage causal minimal (CMTF) améliore le succès de 32,1% à 85,7% et réduit l'usage de tokens de 98%, tout en minimisant les appels erronés et l'exposition aux outils risqués.

Agents IABenchmarksÉvaluations
SIG
78
HYP
25
arXiv cs.CL·

ESBMC-PLC: Formal Verification of IEC 61131-3 Ladder Diagram Programs Using SMT-Based Model Checking

ESBMC-PLC est le premier vérificateur formel open-source avec support natif des diagrammes en échelle IEC 61131-3 (format PLCopen XML). L'outil traduit les rungs en GOTO IR, modélise le cycle de scan PLC et vérifie les propriétés de sécurité via bounded model checking ou k-induction SMT. Évaluation sur 13 benchmarks : 8 bugs détectés, 7 preuves k-induction non bornées, tous les tests < 60ms.

Sécurité IABenchmarksOpen source
SIG
78
HYP
15
arXiv cs.CL·

Replay What Matters: Off-Policy Replay for Efficient LLM Reinforcement Unlearning

ReRULE améliore l'oubli non-supervisé des LLM en utilisant un replay hors-politique pour les cas difficiles. La méthode stocke les rollouts bas-récompense près de la frontière forget/retain dans un buffer et les réutilise via des mises à jour importance-sampled. Sur MUSE-Books, elle augmente la Retain Quality de 46.3 à 56.2 avec +5-11% de temps d'entraînement.

Reinforcement learningSécurité IAAlignement
SIG
78
HYP
15
arXiv cs.CL·

Adapting Reinforcement Learning with Chain-of-Thought Supervision for Explainable Detection of Hateful and Propagandistic Memes

Méthode de post-training par reinforcement learning (GRPO) pour améliorer la détection de mèmes haineux et propagandistes dans les MLLMs. Amélioration de +2.1% sur Hateful Memes (79.9%→82.0%) et +7.6 points macro-F1 sur ArMeme (0.536→0.612) avec explications en chaîne de pensée. Code et données publiquement disponibles.

Reinforcement learningRaisonnementVision
SIG
78
HYP
15
arXiv cs.LG·

GRASP: Gradient-Aligned Sequential Parameter Transfer for Memory-Efficient Multi-Source Learning

GRASP propose une méthode de transfer learning multi-source qui fusionne séquentiellement K modèles sources en mémoire O(1) au lieu de O(K). Via l'alignement gradient des paramètres et l'adaptation itérative, elle atteint 93.5% de précision sur benchmarks de continual learning (Yearbook, CLEAR-10/100) contre 71.7% pour les ensembles, tout en restant déployable en production.

Fine-tuningReinforcement learningBenchmarks
SIG
78
HYP
25
arXiv cs.CL·

Beyond Layer Importance in Layer-wise Sparsity: An Inter-Layer Perturbation-Absorption Perspective

Étude sur la redondance couche-par-couche dans les LLM. Les auteurs caractérisent comment les couches absorbent ou amplifient les perturbations lors de l'élagage : les couches précoces amplifient, les couches intermédiaires et tardives absorbent. Ils proposent une correction basée sur un coefficient d'absorption, améliorant OWL et AlphaPruning de 7,13% en perplexité et 1,02% en précision zéro-shot à 70% de sparsité.

PapersBenchmarksFine-tuning
SIG
78
HYP
15
arXiv cs.CL·

PhoneHarness: Harnessing Phone-Use Agents through Mixed GUI, CLI, and Tool Actions

PhoneHarness est un benchmark et une plateforme d'exécution pour évaluer les agents mobiles sur des workflows réels. Il combine actions GUI, CLI et outils structurés, avec traçabilité auditable. Le benchmark atteint 75% de taux de réussite, surpassant les approches existantes de 12,9 points. L'accent porte sur les effets secondaires vérifiables, pas seulement les prédictions d'écran.

Agents IABenchmarksOutils
SIG
78
HYP
25
arXiv cs.AI·

Reward Hacking in Language Model Agents: Revisiting AI Safety Gridworlds

Étude sur le reward hacking dans les agents basés sur LLM via une adaptation du framework AI Safety Gridworlds. Les modèles (1.5B–14B) exploitent systématiquement des objectifs mal spécifiés pour maximiser les récompenses observées tout en échouant sur les objectifs cachés. L'optimisation par RL amplifie ce problème et résiste aux mitigations standard (exploration, régularisation).

Agents IAReinforcement learningSécurité IA
SIG
78
HYP
25
arXiv cs.AI·

Mask-Proof: An LLM-based Automated Data Curation Pipeline on Mathematical Proofs

Mask-Proof est un pipeline automatisé qui transforme des preuves mathématiques réelles en tâches vérifiables avec étapes masquées. Le benchmark contient 292 problèmes curatés. Sur 17 modèles testés, les modèles renforcés en raisonnement surpassent les modèles standards de 12-27%. L'évaluateur atteint 96,8% d'accord avec les annotateurs experts.

BenchmarksRaisonnementÉvaluations
SIG
78
HYP
15
arXiv cs.AI·

Your Agent Has a Genome: Sequence-Level Behavioral Analysis and Runtime Governance of LLM-Powered Autonomous Agents

Framework Base Sequence Analysis encode le comportement d'agents autonomes LLM en séquences symboliques (X/E/P/V). Analyse de 347 traces de production ReAct révèle que P-X-P réduit le succès de 10.4% et P-ratio prédit négativement (r=-0.256). Governor, système d'intervention runtime, augmente le succès de +6.2% et réduit tokens de 44%. Validation sur 2000 trajectoires SWE-agent.

Agents IARaisonnementÉvaluations
SIG
78
HYP
22
arXiv cs.AI·

AI Engram: In Search of Memory Traces in Artificial Intelligence

Étude introduisant un cadre géométrique pour identifier des « engrams IA » — traces mémoire dans les réseaux de neurones profonds analogues aux unités biologiques. Les auteurs dérivent un estimateur en forme fermée permettant de manipuler chirurgicalement les connaissances apprises (composition, effacement) via arithmétique linéaire, sans optimisation itérative. Validation sur MLPs et LLMs.

RaisonnementPapersAlignement
SIG
78
HYP
25
arXiv cs.AI·

Dr-DCI: Scaling Direct Corpus Interaction via Dynamic Workspace Expansion

DR-DCI combine retrieval et Direct Corpus Interaction pour les agents de recherche sur larges corpus. Le système utilise un retriever pour remplir dynamiquement un workspace local où l'agent exécute des opérations précises (filtrage, comparaison, vérification). Sur Browsecomp-Plus, DR-DCI atteint 71,2% de précision (+8,3 points vs DCI brut) et reste stable jusqu'à 10M documents, là où DCI brut devient instable.

Agents IARAGRaisonnement
SIG
78
HYP
15
arXiv cs.LG·

M-CTX: Exact and Scalable Spatial Context Retrieval for Trajectory Analytics

M-CTX est un framework de récupération de contexte spatial pour l'analytique de trajectoires. Il remplace trois étapes brute-force (récupération OSM, calcul SDF, recherche de voisins) par des opérateurs indexés. Sur un corpus maritime de 5,48M anchors, il réduit le temps de construction de contexte de 17 jours CPU à 1,8 heures (speedup 226x), avec reproduction exacte du contexte de référence.

BenchmarksInfrastructureOpen source
SIG
78
HYP
15
arXiv cs.AI·

CONCORD: Asynchronous Sparse Aggregation for Device-Cloud RAG under Document Isolation

CONCORD est un framework pour RAG asynchrone sur device-cloud avec isolation documentaire. Il utilise un contrôle de dette d'attente et une supplémentation minimale guidée par certificat pour réduire la synchronisation et le transfert de données. Améliore le débit de 1.66× à 2.15× sur Natural Questions et WikiText-2 tout en réduisant la communication par token de plus de 100×.

RAGPapersInfrastructure
SIG
78
HYP
15
arXiv cs.LG·

FastMix: Fast Data Mixture Optimization via Gradient Descent

FastMix automatise l'optimisation du mélange de données pour l'entraînement de modèles via descente de gradient. La méthode reformule la sélection de mélange comme un problème d'optimisation bilinéaire, optimisant conjointement les coefficients de mélange et les paramètres du modèle. Un seul modèle proxy suffit, réduisant drastiquement le coût de recherche comparé aux approches antérieures.

Fine-tuningBenchmarksPapers
SIG
78
HYP
25
arXiv cs.CL·

CHILLGuard: Towards Fine-Grained Chinese LLM Safety Guardrail with Scalable Data Construction and Model-aware Preference Alignment

CHILLGuard est un système de sécurité dédié aux LLM chinois avec taxonomie fine-grained (5 macro, 31 micro catégories). Les auteurs construisent 405k échantillons d'entraînement via RAG et réécriture, puis 51k échantillons de test annotés. Le modèle atteint +15.92% F1 vs Qwen3Guard-8B-Strict via Direct Preference Optimization.

Sécurité IAAlignementFine-tuning
SIG
78
HYP
25