Page 18 sur 192

ToutHaut signalRécent
7679 articles
arXiv cs.CL·

Generalistic or Specific Embeddings, Which is Better? An Empirical Study on Search for Clinical Coding in Non-English Languages

Étude comparative d'embeddings génériques vs spécialisés pour la recherche clinique multilingue (ICD-10-CM). Un bi-encoder fine-tuné sur données synthétiques Gemini (6 langues) surpasse BioBERT-ST : R@5=0.822 vs 0.790, avec gains majeurs en portugais (+0.115). Recette open-source pour retrievers médicaux basés sur LLM.

EmbeddingsRAGBenchmarks
SIG
78
HYP
15
arXiv cs.AI·

LLM-FACETS: A Privacy-Preserving Framework for Evaluating LLM Transparency and Accountability

LLM-FACETS est un framework open-source pour évaluer la factualité, l'étalonnage épistémique et la reproductibilité des LLM. Interface web, architecture plugin, métriques déterministes (BLEU, ROUGE, BERTScore) exécutées localement, visualisation log-probabilités, consensus multi-judge, métriques RAG Triad. Conçu pour experts techniques, domaine et compliance officers selon EU AI Act et NIST.

ÉvaluationsSécurité IAAlignement
SIG
78
HYP
15
arXiv cs.LG·

SubsurfaceGen: Procedural Generation of Field-Scale Earth Models and Seismic Data

SubsurfaceGen est un générateur GPU pour modèles de vélocité 3D et données sismiques à l'échelle du terrain. Les auteurs publient un dataset de 4 276 tranches 2D, couvrant 6 contextes géologiques (10 km × 10 km × 6,19 km à 10 m de résolution). Évaluation d'opérateurs neuronaux sur prédiction de champs d'ondes et inversion de vélocité end-to-end.

BenchmarksPapersOpen source
SIG
78
HYP
15
arXiv cs.CL·

Cross-Lingual Steering for Figurative Language Generation

Étude d'activation steering sur quatre LLMs multilingues (5 catégories figuratives, 6 langues). Les directions d'activation apprises dans une langue transfèrent efficacement vers d'autres, notamment l'allemand. Les directions composites cross-lingues égalent ou surpassent les directions natives, prouvant l'existence de signaux figuratifs réutilisables mais dépendants de la langue cible.

RaisonnementMulti-agentsPapers
SIG
78
HYP
15
arXiv cs.CL·

ImmigrationQA: A Source-Grounded Dataset and Small-Model Adaptation for U.S. Immigration Law

ImmigrationQA : dataset de 17 058 paires QA source-grounded sur le droit d'immigration américain (13 sous-domaines). Fine-tuning d'un Llama 3.2 3B avec LoRA sur corpus de 10 056 documents validés. Modèle fine-tuné : 1.08/3.0 (16.8% correct) vs Llama 3 8B base : 0.85/3.0 (4% correct), amélioration relative 27%. Coût : ~29$. Dataset, modèle et code publics.

LlamaFine-tuningRAG
SIG
78
HYP
15
Reddit r/LocalLLaMA·

I bolted an 8-arm reasoning MoE onto a frozen 1.4B Mamba backbone on a single RTX 3060. Here’s the mechanistic autopsy of what broke and what worked.

Un chercheur a construit Mamba-Titan-1.4B-Reasoning (2.54B params MoE) sur RTX 3060 en gelant un backbone Mamba-1 1.4B et en ajoutant 8 experts entraînables. Entraîné sur traces CoT DeepSeek, le modèle a développé un mécanisme de « vault door » : le token </think> s'isole à la plus petite norme (1.991 vs 4.742 moyenne) pour contrôler la terminaison du raisonnement latent.

RaisonnementFine-tuningOpen source
SIG
78
HYP
35
Reddit r/LocalLLaMA·

Parallax: Parameterized Local Linear Attention for Language Modeling

Parallax est un mécanisme d'attention linéaire local paramétrisé pour les LLM, dérivé de la régression statistique. Il remplace l'estimation locale constante du softmax par une estimation linéaire, offrant de meilleurs compromis biais-variance. Prétraîné à 0.6B et 1.7B, Parallax montre des améliorations de perplexité cohérentes et surpasse FlashAttention 2/3 en décodage.

RaisonnementBenchmarksPapers
SIG
78
HYP
25
arXiv cs.LG·

PrismFlow: Residual Dynamics for Flow Matching in Time-Series Generation

PrismFlow propose une nouvelle méthode de Flow Matching pour la génération de séries temporelles. Elle utilise des experts dynamiques inspirés de Koopman qui apprennent des corrections résiduelles en espace latent, avec un objectif Winner-Take-All conscient de la confiance. Résultats : +15.6% en Context-FID et +38.6% en Discriminative Score sur plusieurs benchmarks.

PapersBenchmarksRaisonnement
SIG
78
HYP
25
arXiv cs.CL·

GenesisFunc: Multi-Agent Data Generation for Accurate and Generalizable Function-Calling

GenesisFunc est un pipeline automatisé multi-agent pour générer des données d'entraînement de function-calling. À partir d'outils fiables de benchmarks publics, le système produit des conversations diversifiées avec contrôle qualité multi-étapes. Un modèle 8B fine-tuné sur ces données synthétiques surpasse les modèles open-source similaires en performance in-domain et généralisation out-of-domain.

Multi-agentsGénération de codeFine-tuning
SIG
78
HYP
25
arXiv cs.LG·

Theoretical Foundations and Effective Algorithms for Policy-Aware Simulator Learning

Article arXiv proposant une approche de robustesse stratégique pour l'apprentissage de simulateurs en MBRL. Formule l'objectif comme un jeu minimax entre un modèle et une politique adversariale. Démontre convergence avec regret sublinéaire et dualité Error-MDP. Expériences montrent réduction d'erreur prédictive de 1.5–2.2× et politiques simulées atteignant performance quasi-optimale réelle.

Reinforcement learningPapersRaisonnement
SIG
78
HYP
15
arXiv cs.AI·

PRO-CUA: Process-Reward Optimization for Computer Use Agents

PRO-CUA propose une méthode d'optimisation par récompense de processus pour entraîner des agents d'utilisation informatique (CUA). Le framework découple l'interaction en environnement réel de l'optimisation de politique via apprentissage par renforcement itératif au niveau des étapes, utilisant un modèle de récompense de processus (PRM) pour fournir des signaux denses sans dépendre de trajectoires expertes.

Agents IAReinforcement learningRaisonnement
SIG
78
HYP
25
arXiv cs.AI·

OpenClawBench: Benchmarking Process-side Anomalies in Real-world Agent Execution Trajectories

OpenClawBench est un dataset de 31,264 trajectoires annotées pour détecter les anomalies de processus dans l'exécution d'agents IA, au-delà du simple succès de tâche. Parmi 31,135 exécutions réussies, 2,904 contiennent des anomalies (ambiguïté non résolue, écritures non sûres, erreurs ignorées). Un détecteur Gemma 3 12B fine-tuné atteint F1=0.729.

Agents IABenchmarksÉvaluations
SIG
78
HYP
25
arXiv cs.AI·

The Chain Holds, the Answer Folds: Trace-Answer Dissociation in Reasoning Models Under Adversarial Pressure

Les modèles de raisonnement conservent des chaînes de pensée correctes mais changent leur réponse finale sous pression adversariale répétée en dialogue multi-tour. Ce phénomène, appelé « capitulation infidèle », affecte 50% des cas en mode reasoning et 11-15% sans reasoning. L'effet varie selon l'architecture (fort chez Qwen3-32B et GPT-OSS-20B, faible chez Gemma-4-31B-it).

RaisonnementÉvaluationsSécurité IA
SIG
78
HYP
25
arXiv cs.LG·

Mechanistic origins of catastrophic forgetting: why RL preserves circuits better than SFT?

Étude comparative RL vs SFT sur Qwen2.5-3B-Instruct : le renforcement par RL préserve mieux les circuits internes du modèle de base que l'ajustement supervisé (SFT), qui adapte plus vite mais détruit davantage les capacités antérieures. Métrique proposée : vulnérabilité différentielle des circuits au niveau des têtes d'attention.

Reinforcement learningFine-tuningPapers
SIG
78
HYP
18
arXiv cs.AI·

Orthogonal Concept Erasure for Diffusion Models

Orthogonal Concept Erasure (OCE) propose une méthode d'édition pour supprimer des concepts indésirables dans les modèles de diffusion via transformations orthogonales multiplicatives. Contrairement aux approches additives existantes, OCE préserve la magnitude neuronale et la géométrie angulaire tout en effaçant précisément les concepts. L'approche efface jusqu'à 100 concepts en 4,3 secondes.

PapersSécurité IAAlignement
SIG
78
HYP
15
arXiv cs.LG·

Label-Free Reinforcement Learning via Cross-Model Entropy

Cross-Model Entropy (CME) propose un signal de récompense sans labels pour l'entraînement RL des LLM post-training. CME utilise la log-vraisemblance moyenne des réponses sous un modèle vérificateur indépendant, évitant l'auto-cohérence et le reward hacking. Intégré à GRPO, CME atteint 52,5–71,4% de taux de victoire ajustés sur UltraFeedback/AlpacaEval 2.0 sur Qwen, Llama, Gemma, OLMo.

Reinforcement learningLlamaQwen
SIG
78
HYP
25
arXiv cs.AI·

ReasonOps: Operator Segmentation for LLM Reasoning Traces

ReasonOps est une méthode non supervisée pour analyser les traces de chaîne de pensée des LLMs. Elle identifie 7 opérateurs de raisonnement récurrents (backtracking, inférence, hypothèse) à partir de 44 662 traces de 12 modèles sur 8 benchmarks. Ces opérateurs permettent d'identifier le modèle source avec 70-76% de précision et de prédire la correction des réponses avant la fin de la trace.

RaisonnementÉvaluationsPapers
SIG
78
HYP
25
arXiv cs.LG·

OISD: On-Policy Internal Self-Distillation of Language Models

OISD introduit l'auto-distillation interne on-policy pour améliorer le raisonnement des modèles de langage. La dernière couche agit comme enseignant détaché pour les couches intermédiaires via alignement logit (comportements de raisonnement) et alignement attention (patterns d'attention), sans information externe. Résultats positifs sur quatre tâches de raisonnement mathématique.

Reinforcement learningRaisonnementPapers
SIG
78
HYP
15
arXiv cs.CL·

Same Question, Different Source, Different Answer: Auditing Source-Dependence in Medical Multi-Source RAG

Étude sur la dépendance aux sources dans les systèmes RAG multi-sources médicaux. Les auteurs montrent qu'un même système peut donner des réponses différentes selon la source récupérée, créant un angle d'évaluation manquant en NLP. Ils proposent TransplantQA (benchmark), HERO-QA (stratégie de récupération hiérarchique) et un juge structuré pour auditer les relations inter-sources sur une taxonomie validée.

RAGÉvaluationsPapers
SIG
78
HYP
15
arXiv cs.CL·

UA-Legal-Bench: A Benchmark for Evaluating Large Language Models on Ukrainian Legal Reasoning

UA-Legal-Bench évalue 11 LLMs (3B–675B) sur 5 tâches de raisonnement juridique ukrainien issues de 99,5 millions de décisions judiciaires. Les résultats montrent des effets few-shot variables : +38,6 pp pour la classification de formulaires, mais effets mixtes sur la prédiction d'issue. L'accuracy masque les biais : le meilleur modèle en accuracy (62%) est un prédicteur de classe majoritaire (macro-F1 : 23%).

BenchmarksÉvaluationsPapers
SIG
78
HYP
15
arXiv cs.AI·

Robust and Efficient Guardrails with Latent Reasoning

COLAGUARD, un modèle de garde-fou, transfère le raisonnement de sécurité multi-étapes dans un espace latent continu via un curriculum d'entraînement par étapes. Évalué sur 10 tâches de modération et 8 benchmarks de sécurité, il améliore macro-F1 de 8,24 points sur Llama Guard 3, égale GuardReasoner en performance tout en offrant 12,9X d'accélération et 22,4X de réduction d'usage de tokens.

Sécurité IARaisonnementÉvaluations
SIG
78
HYP
18
arXiv cs.CL·

Reasoning that Travels: Dissecting How Chain-of-Thought Transfers Across Models

Étude de la transfert de chaînes de pensée (CoT) entre modèles via un cadre provider-receiver. Les traces complètes transfèrent souvent avec succès, mais les mécanismes varient : extraction de réponse (AIME), compétence du récepteur (MMLU-Pro), ou information structurée partielle (ZebraLogic). En mode génération libre, les CoT partiels améliorent les performances, suggérant un guidage du raisonnement continu.

RaisonnementPrompt engineeringBenchmarks
SIG
78
HYP
15
Reddit r/MachineLearning·

Wall-OSS-0.5: 4B VLA with open training code and zero-shot real-robot evaluation[D]

Wall-OSS-0.5 est un VLA de 4B paramètres d'X Square Robot avec code d'entraînement ouvert. Évaluation zéro-shot sur 17 tâches robotiques réelles : 4 tâches >80% de progrès, dont Rope Tightening (82%). Après fine-tuning : 60.5% de progrès moyen (+17.5pp vs pi0.5). Architecture Mixture-of-Transformers avec tokenizer RVQ aligné vision et optimiseur DMuon distribué.

RobotiqueVisionGénération de code
SIG
78
HYP
25