Page 61 sur 192

ToutHaut signalRécent
7679 articles
arXiv cs.CL·

Revisiting LLM Adaptation for 3D CT Report Generation: A Study of Scaling and Diagnostic Priors

Étude d'adaptation d'LLM pour la génération de rapports CT 3D en imagerie médicale. RAD3D-Prefix, un framework léger basé sur des priors diagnostiques, intègre embeddings d'images et logits de classification multi-label. Sur LLMs de 96.1M à 1.6B paramètres, geler le modèle et entraîner uniquement des couches de projection surpasse le fine-tuning complet, réduisant l'hallucination clinique et l'overfitting.

Fine-tuningVision
SIG
72
HYP
15
arXiv cs.AI·

Shattering the Autoregressive Curse: Dynamic Epistemic Entropy Orchestrated Erasable Reinforcement Learning for LLMs

E³RL, une méthode de reinforcement learning, résout le problème de propagation d'erreurs en raisonnement long-horizon des LLMs. En utilisant l'entropie croisée autoregressive comme signal d'incertitude épistémique, le modèle peut corriger localement les défauts logiques et réutiliser le cache KV. Sur AIME, les modèles 4B et 8B surpassent l'état de l'art de 5,3% et 6,5%.

Reinforcement learningRaisonnementBenchmarks
SIG
72
HYP
45
arXiv cs.AI·

Beyond Domains: Reusing Web Skills via Transferable Interaction Patterns

SkillMigrator est un agent LLM qui apprend des compétences web réutilisables en les transférant entre sites via la correspondance de structure de mise en page plutôt que de références d'éléments spécifiques. Les compétences induites sont stockées comme des motifs d'interaction transférables (TIP). Sur WebArena et Mind2Web, SkillMigrator réduit le nombre d'actions LLM de 8-10% à taux de succès équivalent.

Agents IAGénération de codeBenchmarks
SIG
72
HYP
18
arXiv cs.AI·

FinAcumen: Financial Multimodal Reasoning via Self-Evolving Experience Memory Harness

FinAcumen est un agent de raisonnement financier multimodal qui accumule l'expérience des trajectoires antérieures dans une mémoire persistante. Le système améliore un modèle vision-langage 8B gelé sur quatre benchmarks financiers en utilisant l'activation sélective d'expériences et un environnement d'outils déterministe pour le calcul numérique et la vérification.

Agents IAMulti-agentsVision
SIG
72
HYP
28
arXiv cs.AI·

Treatment Response Optimized Clinical Decision Support AI System via Digital Twin Simulation

Système IA d'aide à la décision clinique utilisant des jumeaux numériques (Digital Twin), l'estimation des effets de traitement et l'apprentissage par renforcement pour recommander des traitements adaptatifs en temps réel. Validation sur données synthétiques et dataset ovarian cancer TCGA. Module de sécurité basé sur règles avec escalade clinicienne pour cas d'incertitude.

Reinforcement learningRaisonnementSécurité IA
SIG
72
HYP
28
arXiv cs.LG·

Geometry-Aware Post-Hoc Uncertainty Quantification in Operator Learning

REEF-GP, un cadre post-hoc pour la quantification d'incertitude dans les opérateurs neuronaux, adapte les représentations intrinsèques de l'opérateur pour construire des incertitudes conscientes de la géométrie. Testé sur 5 benchmarks PDE, il préserve la précision prédictive tout en fournissant des estimations d'incertitude calibrées, plus efficace que les ensembles profonds.

PapersRaisonnementÉvaluations
SIG
72
HYP
18
arXiv cs.CL·

From Parasocial Scripts to Dyadic Persistence in Autonomous AI-Agent Communities

Étude de 4 434 posts et 50 338 commentaires sur Moltbook montrant que les indices de relations parasociales (langage d'intimité, offres de réciprocité, auto-identification) persistent dans les communautés d'agents IA autonomes. Les résultats, validés par keyword matching et annotation LLM, révèlent une association forte entre ces signaux et la ré-engagement de l'auteur original.

Agents IAMulti-agentsPapers
SIG
72
HYP
15
arXiv cs.CL·

Self-Generated Error Training for Token Editing in Diffusion Language Models

Méthode d'entraînement pour améliorer l'édition de tokens dans les modèles de diffusion (LLaDA2.1). Résout le décalage entre l'entraînement sur corruptions aléatoires et l'inférence sur erreurs du modèle lui-même. Utilise une passe sans gradient suivie d'une supervision sur corruptions auto-générées via LoRA. Réduit l'intensité d'édition et les erreurs de transcription.

Génération de codeFine-tuningRaisonnement
SIG
72
HYP
15
arXiv cs.LG·

Sum-of-Squares Degree Barriers for the Reweighted-Hinge Method in Robust Halfspace Learning: A Christoffel-Function Characterization

Article théorique sur les barrières de degré Sum-of-Squares pour l'apprentissage robuste de demi-espaces avec bruit malveillant. La fonction de Christoffel caractérise exactement la corruption qu'un certificat de degré borné ne peut pas éliminer. Démontre un compromis marge-degré et un algorithme de degré-2t atteignant la frontière η^(1-1/2t).

PapersRaisonnementSécurité IA
SIG
72
HYP
08
arXiv cs.CL·

Speaking in Self-Assessing Tongues: On the Verbalized Confidence of LLMs in Machine Translation

Étude de la fiabilité de la confiance verbalisée des LLM en traduction automatique. Cinq méthodes d'extraction de confiance par token sans accès aux signaux internes sont comparées aux probabilités prédites. Résultats : performance similaire pour la détection d'erreurs et la calibration, mais faible corrélation entre méthodes internes et verbalisées.

ÉvaluationsRaisonnement
SIG
72
HYP
15
arXiv cs.LG·

Uncertainty Quantification of Engineering Structures by Polynomial Chaos Expansion and Multivariate Active Learning

Méthode d'échantillonnage adaptatif séquentiel pour construire des modèles de substitution par expansion en chaos polynomial, optimisée pour plusieurs quantités d'intérêt simultanées. L'approche équilibre exploration de l'espace d'entrée et exploitation de la variance agrégée, améliorant la précision et la stabilité des surrogates par rapport à l'échantillonnage Latin Hypercube.

BenchmarksÉvaluations
SIG
72
HYP
08
arXiv cs.CL·

Implicit vs. Explicit Prompting Strategies for LVLMs in Referential Communication

Deux études récentes tirent des conclusions contradictoires sur la capacité des LVLMs à coordonner des expressions référentielles efficaces. Cette recherche contrôle les différences de tâches et compare directement les styles de prompting. Les modèles coordonnent efficacement avec un prompting explicite, mais échouent à inférer le besoin d'efficacité communicative avec un prompting implicite.

Prompt engineeringVisionÉvaluations
SIG
72
HYP
15
arXiv cs.CL·

Evaluating Second-Order Bias of LLMs Through Epistemic Entitlement

Étude d'un biais de second ordre chez les LLMs : comment les modèles jugent les contenus biaisés, au-delà de leur génération. Basée sur l'épistémologie de l'entitlement, la méthode évalue si les LLMs infèrent correctement les démographies sans justification suffisante. Résultats : biais systématique selon les groupes ciblés, contournement des garde-fous, persistance des déclencheurs démographiques.

ÉvaluationsSécurité IAAlignement
SIG
72
HYP
18
arXiv cs.CL·

Evaluating Large Language Models Abilities for Addressee, Turn-change, and Next Speaker Prediction in Meetings

Étude comparative des capacités des LLM pour prédire le locuteur suivant, les changements de tour et l'adressataire dans des conversations multi-parties. Sur le corpus AMI, les LLM surpassent les modèles supervisés et les humains en prédiction du locuteur suivant sans accès audio-visuel. Les MM-LLM dépassent les LLM textuels mais restent sous la performance humaine pour l'adressataire et les changements de tour.

BenchmarksÉvaluationsVision
SIG
72
HYP
18
arXiv cs.CL·

OPD-Evolver: Cultivating Holistic Agent Evolver via On-Policy Distillation

OPD-Evolver est un framework de co-évolution lent-rapide qui cultive des agents auto-évolutifs via auto-distillation on-policy. Le système gère une hiérarchie mémoire à quatre niveaux pour lire, utiliser, écrire et maintenir l'expérience. Sur benchmarks multi-domaines, OPD-Evolver surpasse ReasoningBank (+11.5%) et Skill0 (+5.8%), avec OPD-Evolver-9B rivalisant avec Qwen3.5-397B et Step-3.5-Flash.

Agents IARaisonnementReinforcement learning
SIG
72
HYP
35
arXiv cs.CL·

Improving low-resource ASR using bilingual fine-tuning with language identification: a cross-linguistic evaluation

Étude sur le fine-tuning bilingue pour la reconnaissance vocale en langues peu dotées. Évaluation sur 9 paires linguistiques avec tokens d'identification de langue en entrée. Résultat : le fine-tuning bilingue améliore les performances quand l'identification de langue est précise ; fournir le token à l'inférence compense les erreurs d'identification.

VoixFine-tuningBenchmarks
SIG
72
HYP
15
arXiv cs.CL·

Learning task-specific subspaces via interventional post-training of speech foundation models

Méthode de post-entraînement pour les modèles de fondation vocale via apprentissage contrastif interventionnel. Transforme les représentations enchevêtrées en sous-espaces séparés (contenu/locuteur) en utilisant un dataset interventionnel et une perte contrastive multi-parties. Améliore la vérification de locuteur hors-domaine et la détection de mots-clés.

VoixFine-tuningPapers
SIG
72
HYP
15
arXiv cs.CL·

VoidPadding: Let [VOID] Handle Padding in Masked Diffusion Language Models so that [EOS] Can Focus on Semantic Termination

VoidPadding introduit un token [VOID] dédié au padding dans les modèles de diffusion masqués (MDLMs), libérant [EOS] pour la terminaison sémantique. Sur Dream-7B-Instruct, cela améliore les benchmarks de raisonnement mathématique et génération de code de +17.84 points vs baseline et +6.95 vs RainbowPadding, réduisant les NFE de 55.7%.

Génération de codeRaisonnementBenchmarks
SIG
72
HYP
25
arXiv cs.LG·

The Critical Role of Model Selection in Causal Inference: A Comparative Analysis of Classification Models within the InferBERT Framework for Pharmacovigilance

InferBERT combine transformers et Do-calculus pour détecter les effets indésirables causaux en pharmacovigilance. Étude comparative sur AILF et TRAM : BioBERT surpasse XGBoost, ALBERT et Med-LLaMA. Conclusion : le pré-entraînement spécialisé (biomedical) prime sur la taille du modèle.

BenchmarksFine-tuningSécurité IA
SIG
72
HYP
15
arXiv cs.LG·

Counterfactual Optimization of Baseball Pitch Sequences and Estimation of Its Impact on Season-Level Statistics

Étude arXiv utilisant un modèle Transformer sur données MLB Statcast pour optimiser les séquences de lancers au baseball. Analyses contrefactuelles montrant que l'optimisation des lancers finaux et préparatoires peut améliorer les statistiques saisonnières de plus de 1.0 K/9. Insights pratiques sur les emplacements efficaces par bande de vélocité et l'importance du contrôle.

PapersBenchmarks
SIG
72
HYP
15