Page 62 sur 192

ToutHaut signalRécent
7679 articles
arXiv cs.LG·

Memory-Efficient Meta-Reinforcement Learning for Adaptive Safety-Critical Control in Adversarial Spacecraft Proximity Operations

Étude comparative de trois architectures récurrentes (LSTM, GRU, Mamba) et deux algorithmes (PPO, SAC) pour l'apprentissage par renforcement méta appliqué aux fonctions de barrière de contrôle (ICCBF) en opérations de proximité spatiale. Mamba + PPO surpasse les autres configurations en sécurité, complétude des tâches et économies de carburant, même en présence de comportements adversariaux.

Reinforcement learningSécurité IARobotique
SIG
72
HYP
15
Reddit r/LocalLLaMA·

A benchmark for tiny LLMs based on a real world problem: natural language file search (using monkeSearch)

Benchmark pour petits LLM (<3B paramètres) évaluant la capacité à parser du langage naturel en JSON structuré pour la recherche de fichiers. 9 modèles testés (Gemma-3 270M à DeepSeek R1 Distill 1.5B) sur 80 requêtes couvrant types de fichiers, contexte temporel et spécificité. Résultats : modèles 0.8B–1.5B surpassent les sub-0.5B.

BenchmarksOpen sourceGénération de code
SIG
72
HYP
25
Reddit r/MachineLearning·

My offline ablation said -0.19pp. The production retrain said +1.11pp. [D]

Un ingénieur ML rapporte que ses ablations offline (retraining avec/sans feature) donnaient des résultats opposés à la production. Quatre changements : Best Offer feature (+0.12pp offline → -0.19pp prod), backfill données enchères (+0.37pp prod), trimming outliers (-0.19pp offline → +1.11pp prod), encodeur CatBoost. Causes : train/serve skew, distribution shift non mesurée, population drift, instabilité baseline.

ÉvaluationsBenchmarks
SIG
72
HYP
15
Reddit r/LocalLLaMA·

Be wary of Qwen/Claude distillations - they're often worse than the base model

Les distillations Qwen/Claude circulant sur r/LocalLLaMA (Qwopus, Fable 5 sur Qwen 3.6) utilisent 4k-10k samples d'entraînement, insuffisant pour améliorer les performances. Comparé aux 700k samples des distillations DeepSeek-R1 officielles, ces modèles ne dépassent pas le Qwen de base et dégradent légèrement la qualité malgré un style de raisonnement différent.

QwenClaudeFine-tuning
SIG
72
HYP
45
arXiv cs.AI·

Hierarchical Modeling of ICD Codes in EHR Foundation Models

Étude sur l'intégration de la hiérarchie ICD-10-CM dans les modèles de fondation EHR. Les auteurs comparent deux approches : augmentation de séquences BERT avec tokens hiérarchiques et injection de hiérarchie dans des représentations graphiques. Expériences sur MIMIC-IV et eICU montrent que l'encodage explicite de la hiérarchie améliore les prédictions en domaine et en transfert cross-dataset.

PapersEmbeddingsRAG
SIG
72
HYP
15
arXiv cs.CL·

SHARD: Safe and Helpful Alignment via Self-Reframing Distillation

SHARD est une méthode de distillation par auto-reformulation pour améliorer l'équilibre sécurité-utilité des LLM. Elle réécrit les prompts sensibles selon des principes philosophiques, reformule les réponses de manière sûre et plus utile, puis fine-tune le modèle sur ces réponses auto-reformulées. Testée sur DNA et LINGUASAFE, SHARD améliore l'utilité tout en préservant la sécurité.

Fine-tuningSécurité IAAlignement
SIG
72
HYP
28
arXiv cs.AI·

APEX: Adaptive Principle EXtraction A Three-Layer Self-Evolution Framework for Production AI Agents

APEX est un framework d'auto-amélioration pour agents IA en production qui évolue simultanément sur trois dimensions : le prompt harness (L1), les principes comportementaux (L2) et la topologie du workflow (L3). Testé sur Joe, un super-agent NVIDIA Nemotron, APEX atteint un Health Score de 0.570 (+90% vs baseline) et distille 6 principes réutilisables avec seulement 4 appels LLM.

Agents IAPrompt engineeringReinforcement learning
SIG
72
HYP
35
arXiv cs.AI·

Visual-Seeker: Towards Visual-Native Multimodal Agentic Search via Active Visual Reasoning

Visual-Seeker est un agent de recherche multimodal qui améliore le raisonnement visuel des MLLMs dans des scénarios complexes. L'approche utilise un pipeline de raisonnement visuel actif et 5K trajectoires multimodales synthétiques pour entraîner le modèle. L'agent atteint des performances SOTA sur cinq benchmarks de recherche multimodal, surpassant certains modèles propriétaires.

Agents IAVisionMulti-agents
SIG
72
HYP
35
arXiv cs.AI·

CogGuard: Cognitive and Operational Profiling for Proactive Warning in Edge Intelligent Services

CogGuard est un framework de prédiction proactive pour services edge utilisant des LLM hors-ligne pour construire des profils cognitifs et opérationnels, puis des SLM pour scorer en temps réel. Réduction de 48% du temps de construction de profils et 19% du fine-tuning distribué sur clusters hétérogènes. Erreur réduite de 15.4% vs baseline sur données éducatives.

RaisonnementFine-tuningBenchmarks
SIG
72
HYP
18
arXiv cs.LG·

Contextual Bandits for Maximizing Stimulated Word-of-Mouth Rewards

Framework de bandit contextuel multi-bras pour optimiser le bouche-à-oreille stimulé via réseaux sociaux. L'approche apprend les probabilités individuelles de débordement (spillover) et classe les utilisateurs connectés pour maximiser les récompenses. Expériences sur données réelles montrent une amélioration de la précision de ciblage et des récompenses par rapport aux méthodes baseline.

Reinforcement learningBenchmarks
SIG
72
HYP
15
arXiv cs.LG·

TriAdReview: Triangular Adversarial Review Architecture for Multi-Model Technical Document Generation

TriAdReview propose une architecture adversariale triangulaire avec deux modèles reviewers (ingénierie et sécurité) pour améliorer la génération de documents techniques. Sur 75 expériences, le système triple atteint +10.1% vs baseline (26.2 vs 23.8/50, p<0.05), avec gains forts en audit sécurité (+27.6%), génération code (+20.8%), design architecture (+15.6%), mais dégradation sur analyse requirements (-7.5%).

Multi-agentsGénération de codeBenchmarks
SIG
72
HYP
18
arXiv cs.LG·

An Integrable Token Mixing Layer from the Generalized Yang Baxter Equation

YB Mixer est une couche de mélange de tokens dérivée de structures de fermions libres et de l'équation de Yang-Baxter généralisée. Elle utilise l'algèbre d'Ising pour créer une structure fermionique orthogonale préservant la norme, avec matrices de transfert commutantes permettant une inférence sans ordre. Un générateur circulant spectral assure la généralisation à des séquences plus longues.

RaisonnementPapers
SIG
72
HYP
15
arXiv cs.LG·

Edu-Theater: A Data-Efficient Agent Framework for Scalable Learner Behavior Simulation through Staging Roll-Call

Edu-Theater est un système multi-agent basé LLM pour simuler le comportement d'apprenants à grande échelle. Il utilise une approche cohort-aware avec diagnostic ciblé plutôt que des historiques denses par apprenant, réduisant les appels LLM et les données nécessaires. Testé sur deux datasets réels, il améliore la précision de simulation et les applications aval comme les tests adaptatifs.

Agents IAMulti-agentsRaisonnement
SIG
72
HYP
25
arXiv cs.LG·

Beyond Accuracy: Measuring Bias Acknowledgment in Chain-of-Thought Reasoning for Responsible AI Evaluation

Étude sur l'évaluation des modèles de raisonnement au-delà de la simple précision. Les auteurs introduisent deux métriques : susceptibilité (si le biais casse une réponse correcte) et reconnaissance (si la trace mentionne explicitement le contenu biaisé). Sur GSM8K, GPT-4o et Claude Sonnet 4 montrent des taux de susceptibilité similaires (1,3% vs 1,2%) mais des taux de reconnaissance très différents (13,0% vs 75,0%).

ÉvaluationsRaisonnementSécurité IA
SIG
72
HYP
15
arXiv cs.CL·

Evaluating and Preserving Lexical Stress in English-to-Chinese Speech-to-Speech Translation

Étude sur le transfert de l'accent lexical en traduction parole-à-parole anglais-chinois. Les auteurs créent un dataset annoté en chinois mandarin, développent un détecteur d'accent basé XLS-R et proposent une métrique d'évaluation objective. Un système S2ST affiné sur CosyVoice3 surpasse les systèmes existants en préservant l'accent tout en maintenant la qualité de traduction.

VoixBenchmarksÉvaluations
SIG
72
HYP
15
arXiv cs.AI·

Metric Match: A Subset Selection Approach to Evaluating LLM Judge Reliability

Metric Match est une méthode pour évaluer la fiabilité des juges LLM avec moins d'annotations humaines. Elle sélectionne un sous-ensemble d'échantillons dont les étiquettes synthétiques correspondent aux métriques de fiabilité de la population. Sur 15 datasets, elle réduit l'erreur d'estimation de 18,7% et les besoins en annotation de 32,5%, économisant $1,041.67 dans un cas médical.

ÉvaluationsBenchmarksPapers
SIG
72
HYP
18
arXiv cs.CL·

Privacy-Preserving Text Sanitization for Distributed Agents Collaboration via Disentangled Representations

DiSan, un framework de sanitization préservant la vie privée, factorise le texte en deux sous-espaces : un préservant la sémantique métier et un contenant les signatures stylistiques. Sur un benchmark RAG multi-agent distribué, DiSan réduit l'exposition PII de 20× tout en maintenant 83% de fidélité, et abaisse l'attribution stylométrique Enron de 73,2% (TF-IDF) et 70,6% (sonde neurale).

Multi-agentsRAGSécurité IA
SIG
72
HYP
15
arXiv cs.CL·

Encode Errors: Representational Retrieval of In-Context Demonstrations for Multilingual Grammatical Error Correction

Méthode de récupération de démonstrations in-context basée sur les représentations d'erreurs grammaticales (GER) pour la correction grammaticale multilingue. Sur 8 modèles open-source 8B, les résultats égalent GPT-4o-mini et Deepseek2.5. Pour les langues peu dotées, amélioration F₀.₅ jusqu'à 1.20× vs baseline.

RAGPrompt engineeringBenchmarks
SIG
72
HYP
25
arXiv cs.AI·

Frame-Conditioned Moral Computation in LLaMA 3.1-8B-Instruct: A Mechanistic Interpretability Audit of Ethical Reasoning

Audit de mécanismes internes du modèle LLaMA 3.1-8B-Instruct sur 54 prompts moraux utilisant Transluce. Découverte d'un « Situational Anchor Effect » : les représentations domaine-spécifiques dominent indépendamment du contenu éthique. L'éthique reste constante en capacité mais très sensible au cadre interprétatif du prompt. Identification d'un neurone candidat (L16/N3837) stable en température.

LlamaAlignementÉvaluations
SIG
72
HYP
28
arXiv cs.AI·

Large Language Models as Optimizers: A Survey of Direct vs. Tool-Augmented Approaches and Their Performance Frontiers

Enquête sur l'utilisation des LLM comme optimiseurs mathématiques selon trois paradigmes : optimisation directe (prompting itératif), augmentée par outils (traduction en spécifications formelles), et création d'outils (découverte d'algorithmes réutilisables). L'article identifie un écart de raisonnement critique et propose des compromis entre potentiel futur et auditabilité.

RaisonnementAgents IAOutils
SIG
72
HYP
18
arXiv cs.AI·

Minimal Oversight: Uncertainty-Aware Governance for Delegated AI Systems

Principe de supervision minimale suffisante (MSO) pour gouverner l'autonomie des systèmes IA délégués. Formulation variationnelle sur la variété d'information de Fisher minimisant la charge de gouvernance sous contrainte de performance. Théorème de capacité pour politiques de révision symbolique, loi d'échelle autonomie-temps, et identification du masquage comme pathologie de gouvernance. Code Python disponible.

Agents IASécurité IAAlignement
SIG
72
HYP
15
arXiv cs.LG·

Machine Learning and the Random Walk Puzzle: Forecasting the CAD/USD Exchange Rate with Expanding Window Evaluation and SHAP Interpretability

Étude comparant 5 modèles ML (régression linéaire, random forest, gradient boosting, XGBoost, AdaBoost) pour prévoir le taux CAD/USD mensuel (2017-2026, 113 observations). Seule la régression linéaire surpasse statistiquement la marche aléatoire (DM=3.06, p=0.0071). Random Forest atteint MAPE=1.17%. SHAP révèle que les lags courts (lag1-2) et moyennes mobiles dominent les prédictions.

BenchmarksÉvaluationsPapers
SIG
72
HYP
15
arXiv cs.AI·

Fusion is not one-size-fits-all: Cross-Modal Representation Alignment for Time-to-Event Modeling

Framework de fusion multimodale pour prédire le temps jusqu'à un événement clinique (mortalité PE, résultats CVD) en alignant représentations CT et données EHR longitudinales via modèles fondation. Quatre stratégies testées (late fusion, contrastive alignment, cross-attention, co-attention) sur 3,099-2,951 patients. Fusion contrastive améliore l'indice de concordance de 1,5-5,4% vs unimodal.

BenchmarksEmbeddingsVision
SIG
72
HYP
18