Page 76 sur 192

ToutHaut signalRécent
7679 articles
arXiv cs.CL·

SANE Schema-aware Natural-language Evaluation of Biological Data

SANE propose un paradigme d'évaluation text-to-SQL spécifique aux domaines biologiques, utilisant des benchmarks générés automatiquement et ancrés aux schémas réels. Les tests montrent que les LLM en few-shot génèrent des requêtes SQL fiables sans fine-tuning, avec des erreurs principalement dues à des entrées ambiguës plutôt qu'à des défauts de génération.

BenchmarksPrompt engineeringRAG
SIG
72
HYP
18
arXiv cs.AI·

Trivium: Temporal Regret as a First-Class Objective for Causal-Memory Controllers

Trivium propose une approche pour corriger les erreurs récurrentes des systèmes agentic en optimisant trois objectifs : regret de résultat, regret épistémique et regret temporel. Le regret temporel capture la durée pendant laquelle une erreur persiste. Sur CausalBench-Seq, Trivium atteint O(log E) de regret temporel contre une croissance linéaire pour les baselines.

Agents IARaisonnementReinforcement learning
SIG
72
HYP
25
arXiv cs.AI·

ChatHealthAI: Aligning Electronic Health Record Representations with Large Language Models for Grounded Clinical Reasoning

ChatHealthAI aligne les représentations structurées des dossiers médicaux électroniques (EHR) avec l'espace sémantique d'un LLM gelé via un resampler task-aware. Le framework multimodal intègre les représentations longitudinales des patients avec des descriptions d'événements cliniques raffinées, améliorant le raisonnement clinique interprétable tout en maintenant la performance prédictive sur le benchmark EHRSHOT.

RAGRaisonnementÉvaluations
SIG
72
HYP
18
arXiv cs.LG·

Testing the Test: Score-Direction Instability in Class-Split Anomaly Detection

Les auteurs montrent que l'évaluation class-split (une classe retenue comme anomalie) en détection d'anomalies est instable quand la classe anomale chevauche le mélange normal en espace de représentation. Les scores d'anomalie peuvent s'effondrer ou s'inverser. Un diagnostic simple (neighborhood class leakage) prédit cette instabilité sur Fashion-MNIST, CIFAR-10, Imagenette.

ÉvaluationsBenchmarks
SIG
72
HYP
15
arXiv cs.LG·

Locality Does Not Imply Reachability: Boundary Repair in Block-Sparse Causal Attention

Article théorique sur les limites de l'attention causale par blocs fixes : deux tokens adjacents peuvent être déconnectés dans le graphe d'attention. Les auteurs formalisent ce problème via les ensembles de dépendance structurelle et proposent Boundary Bridge Attention, une réparation sans paramètres supplémentaires utilisant des arêtes causales auxiliaires aux frontières des blocs.

RaisonnementBenchmarksPapers
SIG
72
HYP
15
arXiv cs.CL·

Can Factual Opinions Be Edited (Manipulated) in Large Language Models?

Nouvelle étude arXiv sur l'édition de faits opinionnés dans les LLM. Benchmark FOE avec 261 personnalités publiques, 19 catégories de sujets, 2,178 enregistrements d'opinions. Les méthodes actuelles échouent à préserver la cohérence entre opinion éditée et preuves générées. Proposition d'une méthode Self-Generated Evidence-Aligned pour l'alignement opinion-preuves.

PapersÉvaluationsSécurité IA
SIG
72
HYP
28
arXiv cs.LG·

Before Fusion, Ask What to Keep: Contextual Calibration of Multimodal Signals

Méthode de calibration des signaux multimodaux avant fusion. Un module compact compare chaque modalité (langage, son, vision) avec les autres, extrait les signaux de support et conflit cross-source, et module les représentations avant leur combinaison. Testé sur 5 benchmarks (sentiment, reconnaissance d'actions, détection d'événements audio-visuels, classification d'émotions) avec améliorations consistantes.

VisionVoixMulti-agents
SIG
72
HYP
15
arXiv cs.AI·

A Negative Result on Cross-Model Activation Transfer in a Pythia Multi-Hop Setting

Étude sur le transfert d'activations entre modèles de langage (Pythia-160M vers Pythia-410M). Une couche de translation linéaire aligne fortement les états cachés (similarité cosinus 0.97), mais l'injection des activations traduites n'améliore pas les performances en inférence. Résultat négatif : l'alignement représentationnel hors ligne ne suffit pas pour une communication causale utile.

RaisonnementPapersÉvaluations
SIG
72
HYP
15
arXiv cs.CL·

Hint-Guided Diversified Policy Optimization for LLM Reasoning

HDPO (Hint-Guided Diversified Policy Optimization) améliore le raisonnement des LLM via renforcement avec récompenses vérifiables. La méthode incite le modèle à générer d'abord plusieurs approches candidates (hints), puis sélectionner la plus fiable. Deux étapes : Cold Start pour structurer le raisonnement, puis RL guidé par hints pour diversifier et fiabiliser les solutions.

RaisonnementReinforcement learningPapers
SIG
72
HYP
28
arXiv cs.AI·

From Long News to Accurate Forecast: Importance-Aware Fusion and PRM-Guided Reflection for Time Series Forecasting

Nouvelle méthode pour intégrer les actualités dans la prévision de séries temporelles via compression intelligente et supervision de retrieval. Un modèle de récompense estime l'utilité prédictive de chaque article, tandis qu'un PRM guide la sélection d'articles supplémentaires. Tests sur finance, énergie, trafic et bitcoin montrent amélioration de précision et réduction des itérations.

LlamaRaisonnementRAG
SIG
72
HYP
28
arXiv cs.CL·

Topics as Proxies for Sociodemographics: How Conversational Context Affects LLM Answers

Étude arXiv montrant que les LLM ne déduisent pas bien les caractéristiques socio-démographiques des utilisateurs à partir d'un historique conversationnel unique. Les disparités observées dans les conseils (juridique, médical, financier) sont faibles mais présentes. Les sujets de conversation s'avèrent plus prédictifs que les données socio-démographiques et affectent les réponses de manière imprévisible.

PapersSécurité IAAlignement
SIG
72
HYP
15
arXiv cs.CL·

DMT-CBT: Longitudinal Therapeutic State Modeling for CBT Counseling

DMT-CBT modélise l'évolution longitudinale des états thérapeutiques en TCC sur plusieurs sessions. Le framework maintient des états structurés, intègre des données multimodales et des interventions augmentées par outils. DMTCorpus, un dataset synthétique multimodal, démontre une meilleure fidélité thérapeutique et alliance thérapeutique comparé aux approches post-hoc.

RaisonnementVisionAgents IA
SIG
72
HYP
28