Page 103 sur 192

ToutHaut signalRécent
7679 articles
arXiv cs.AI·

Reasoning Before Diagnosis: Physician-Inspired Structured Thinking for ECG Classification

CardioThink, un framework MLLM inspiré par la pratique médicale, structure le diagnostic ECG en étapes explicites (rythme, conduction, morphologie, impression) pour améliorer l'interprétabilité. L'optimisation Structured Set Policy Optimization (SSPO) aligne le raisonnement clinique sans annotations manuelles, surpassant les approches directes sur plusieurs benchmarks ECG.

RaisonnementVisionReinforcement learning
SIG
72
HYP
28
arXiv cs.AI·

Response-free item difficulty modelling for multiple-choice items with fine-tuned transformers: Component-wise representation and multi-task learning

Modélisation de la difficulté d'items sans réponses pour questions à choix multiples via transformers fine-tunés. Approche end-to-end sur le texte des items éliminant l'ingénierie manuelle des features. Variante multi-tâche avec objectif auxiliaire QA améliore significativement les petits échantillons.

Fine-tuningBenchmarks
SIG
72
HYP
15
arXiv cs.CL·

Evaluating Language Models' Evaluations of Games

Étude arXiv évaluant comment les modèles de langage et de raisonnement jugent les jeux de plateau. Sur 100+ jeux et 450 jugements humains, les modèles de raisonnement s'alignent mieux aux humains que les LLM classiques pour évaluer l'équité et le plaisir des jeux. Paradoxe : plus les modèles approchent l'optimalité théorique des jeux, moins ils correspondent aux préférences humaines.

RaisonnementÉvaluationsBenchmarks
SIG
72
HYP
15
arXiv cs.CL·

Unlocking the Potential of Diffusion Language Models through Template Infilling

Template Infilling (TI) est une méthode de conditioning pour les Diffusion Language Models qui aligne des ancres structurelles sur l'ensemble de l'espace de réponse, remplaçant le prefix prompting. Évaluée sur raisonnement mathématique, génération de code et planification, TI améliore les performances de 9,40% et accélère la génération multi-token.

Prompt engineeringGénération de codeRaisonnement
SIG
72
HYP
28
arXiv cs.AI·

CAREBench: Evaluating LLMs' Emotion Understanding by Assessing Cognitive Appraisal Reasoning

CAREBench est un benchmark évaluant la compréhension émotionnelle des LLMs via le raisonnement d'appraisal cognitif. Testé sur 6 modèles avec annotations complètes de chaînes inférentielles (perspectives première/troisième personne), il révèle que les modèles forts égalent les humains sur certaines tâches mais échouent sur le raisonnement d'appraisal et la reconnaissance d'émotions positives.

BenchmarksÉvaluationsRaisonnement
SIG
72
HYP
25
arXiv cs.AI·

Content-Style Identification via Differential Independence

Nouvel article arXiv proposant CSDI (content-style differential independence) pour identifier les facteurs de contenu et style dans les modèles génératifs multi-domaines. Relaxe les conditions d'indépendance statistique antérieures via une contrainte d'orthogonalité sur les sous-espaces jacobiens. Démontre l'identifiabilité même avec contenu/style dépendants et jacobien dense.

PapersGénération d'imagesRaisonnement
SIG
72
HYP
15
arXiv cs.AI·

Learning Displacement-Robust Representations for Landslide Early Warning under Rainfall Forecast Uncertainty

Système d'alerte précoce aux glissements de terrain robuste aux incertitudes de prévisions pluviométriques. Utilise l'apprentissage contrastif sensible au mouvement des champs de pluie (RMCL) pour apprendre des représentations stables sous déplacement spatial. Testé sur 2 ans de données au Japon (19 régions) : +37% de précision vs baselines.

Reinforcement learningBenchmarksPapers
SIG
72
HYP
15
arXiv cs.AI·

From Imitation to Interaction: Mastering Game of Schnapsen with Shallow Reinforcement Learning

Des agents de réseaux de neurones peu profonds maîtrisent le jeu de cartes Schnapsen via apprentissage par renforcement. RLBot, entraîné par mises à jour Monte Carlo asynchrones, surpasse MLPBot (imitation supervisée) et bat significativement RdeepBot, un baseline basé sur la recherche. La combinaison d'une fonction de valeur apprise avec une recherche plus profonde en jeu améliore les performances.

Reinforcement learningBenchmarksPapers
SIG
72
HYP
15
arXiv cs.CL·

GraphMind: Theorem Selection and Conclusion Generation Framework with Dynamic GNN for LLM Reasoning

GraphMind combine GNN et LLM pour le raisonnement multi-étapes en mathématiques. Le framework modélise le processus de raisonnement comme un graphe hétérogène évolutif où nœuds (conditions, théorèmes, conclusions) et arêtes (dépendances logiques) permettent la sélection dynamique de théorèmes et la génération itérative de conclusions. Résultats améliorés sur benchmarks QA.

RaisonnementAgents IABenchmarks
SIG
72
HYP
28
arXiv cs.AI·

Latent Heuristic Search: Continuous Optimization for Automated Algorithm Design

Méthode de découverte automatique d'heuristiques via optimisation continue dans un espace latent. Un encodeur mappe des programmes discrets en embeddings continus, un modèle de substitution différentiable prédit les performances, et un flux de normalisation invertible régularise la trajectoire d'optimisation. Évaluation sur TSP, CVRP, KSP et Online Bin Packing avec résultats compétitifs aux baselines évolutionnaires.

Agents IARaisonnementBenchmarks
SIG
72
HYP
18
arXiv cs.AI·

Capturing LLM Capabilities via Evidence-Calibrated Query Clustering

ECC, un algorithme de clustering de requêtes, calibre les embeddings sémantiques via comparaisons de modèles pour aligner la sémantique de surface avec les capacités latentes des LLM. Utilisant un modèle Bradley-Terry, il améliore le classement des capacités de 17,64 points vs baselines humaines et 18,02 points vs embeddings, avec applications au routage de requêtes.

ÉvaluationsBenchmarksRaisonnement
SIG
72
HYP
18
arXiv cs.AI·

Scientific Logicality Enriched Methodology for LLM Reasoning: A Practice in Physics

Étude systématique de la logicité dans le raisonnement scientifique des LLM. Les auteurs développent une méthodologie enrichie incluant des critères d'évaluation et des méthodes d'échantillonnage pour l'entraînement guidé par la logicité. Expériences sur trois LLM différents avec données de physique extraites de littérature académique. Code disponible.

RaisonnementFine-tuningPapers
SIG
72
HYP
18
arXiv cs.AI·

Progressive Generalization Augmentation with Deeply Coupled RND-PPO and Domain-Prioritized Noise Injection for Robust Crop Management Reinforcement Learning

Papier arXiv proposant Progressive Generalization Augmentation (PGA) pour améliorer la robustesse des systèmes RL agricoles. Architecture RND-PPO couplée + injection de bruit hiérarchisée. Résultats : +8.43% rendement, +16.42% efficacité azotée vs BERT-DQN en Floride ; 94.4% rétention performance sous perturbations combinées.

Reinforcement learningPapersBenchmarks
SIG
72
HYP
28
arXiv cs.CL·

Probing Multimodal Large Language Models on Cognitive Biases in Chinese Short-Video Misinformation

Étude évaluant 8 modèles multimodaux (Gemini-2.5-Pro, o3, etc.) sur leur robustesse face aux biais cognitifs dans des vidéos courtes chinoises contenant de la désinformation. Dataset de 200 vidéos annotées manuellement couvrant 4 domaines sanitaires. Gemini-2.5-Pro obtient 71.5/100, o3 35.2. Les modèles sont vulnérables aux indices sociaux comme les IDs de chaînes autoritaires.

VisionBenchmarksSécurité IA
SIG
72
HYP
25
arXiv cs.CL·

ADMEDTAGGER: an annotation framework for distillation of expert knowledge for the Polish medical language

Framework d'annotation pour distiller les connaissances expertes d'un LLM multilingue (Llama3.1) afin d'entraîner des classifieurs BERT pour le tagging médical en polonais. DistilBERT atteint F1 > 0.80 sur 5 catégories cliniques (Radiologie, Oncologie, Cardiologie, Hypertension, Pathologie) avec 500× moins de paramètres et 300× moins de VRAM qu'un LLM.

LlamaFine-tuningGénération de code
SIG
72
HYP
18
arXiv cs.CL·

"The Whole Is Greater Than the Sum of Its Parts": A Compatibility-Aware Multi-Teacher CoT Distillation Framework

COMPACT, un framework de distillation CoT multi-enseignants, fusionne adaptativement les supervisions de plusieurs LLMs vers des modèles compacts. Il pondère dynamiquement les gradients des enseignants via trois métriques : consensus basé graphe, adaptabilité par information mutuelle, et difficulté basée perte. Résultats SOTA sur plusieurs benchmarks sans oubli catastrophique.

RaisonnementFine-tuningPapers
SIG
72
HYP
25
arXiv cs.AI·

Effort as Ceiling, Not Dial: Reasoning Budget Does Not Modulate Cognitive Cost Alignment Between Humans and Large Reasoning Models

Les grands modèles de raisonnement (LRM) génèrent des traces alignées avec les temps de réaction humains, mais cet alignement persiste indépendamment du budget de raisonnement en inférence. Étude sur GPT-OSS-20B et GPT-OSS-120B : trois niveaux d'effort, six tâches cognitives. L'allocation de tokens suit les patterns de difficulté humains et reflète une structure figée à l'entraînement, non modulée en temps réel.

RaisonnementBenchmarksPapers
SIG
72
HYP
15
arXiv cs.AI·

Towards Human-Level Book-Writing Capability

Chercheurs présentent un framework pour l'écriture créative à l'échelle du livre. À partir de romans du domaine public, ils construisent un échafaudage multi-résolution (résumé → chapitres → scènes → texte complet) et entraînent un modèle long-contexte sur des trajectoires prompt-to-book. L'objectif : générer de la prose littéraire humaine plutôt que du texte générique assisté.

Fine-tuningRaisonnementGénération de code
SIG
72
HYP
28
arXiv cs.AI·

Optimal Knock-Pick Planning for Tightly Packed Tabletop Blocks With Parallel Grippers

Étude du réarrangement d'objets densément empilés sur table avec des pinces parallèles. Introduit une primitive de « knock » (coup) pour contourner l'infaisabilité des prises directes. Formule le problème knock-pick optimal et propose des abstractions avec appariement parfait de poids maximal pour calculer en temps polynomial un plan minimisant le nombre d'actions. Validé en simulation (IsaacSim).

RobotiqueRaisonnement
SIG
72
HYP
15
arXiv cs.CL·

Finding Sense in Nonsense with Generated Contexts: Perspectives from Humans and Language Models

Étude comparative sur la capacité des humains et des LLM à distinguer les phrases anomales des phrases véritablement non-sensiques. Analyse de cinq datasets sémantiquement déviants avec et sans contexte. Résultat : la plupart des phrases jugées anomales peuvent être interprétées avec contexte ; les LLM génèrent efficacement des contextes plausibles.

BenchmarksÉvaluationsPapers
SIG
72
HYP
15
arXiv cs.AI·

Automated Knowledge Component Generation for Interpretable Knowledge Tracing in Coding Problems

Pipeline automatisé basé LLM pour générer et étiqueter des composants de connaissances (KC) sur des problèmes de programmation. Le framework KCGen-KT utilise ces KC générés pour le knowledge tracing. Évaluation sur deux datasets réels : surpasse les méthodes existantes et les KC écrits par humains pour prédire les réponses futures des étudiants.

LlamaGénération de codeÉvaluations
SIG
72
HYP
25
arXiv cs.CL·

Embracing Anisotropy: Turning Massive Activations into Interpretable Control Knobs for Large Language Models

Les LLM présentent des représentations internes hautement anisotropes avec des activations massives. Au lieu de les traiter comme des artefacts, les auteurs les identifient comme des unités fonctionnelles interprétables via un critère basé sur la magnitude. Le steering appliqué à ces dimensions critiques surpasse le steering conventionnel en adaptation de domaine et jailbreaking.

Sécurité IA
SIG
72
HYP
18
arXiv cs.AI·

MR-SLAM: Immersive Spatial Supervision for Multi-Robot Mapping via Mixed Reality

MR-SLAM est un système de réalité mixte utilisant un Meta Quest 3 pour téléopérer trois robots TurtleBot3 en SLAM collaboratif. L'opérateur voit le monde réel en passthrough avec des panneaux d'information ancrés spatialement. Trois instances SLAM Toolbox fusionnent leurs grilles d'occupation en temps réel via ROS 2, atteignant 94,7% de cohérence inter-robots et 8,83 Hz de scan.

RobotiqueMulti-agentsInfrastructure
SIG
72
HYP
25
arXiv cs.AI·

Vision-OPD: Learning to See Fine Details for Multimodal LLMs via On-Policy Self-Distillation

Vision-OPD propose une auto-distillation régionale-globale pour améliorer la compréhension visuelle fine des MLLMs. Le framework transfère la perception privilégiée du modèle sur des crops centrés sur les preuves vers sa politique pleine image, via minimisation de divergence KL entre distributions de tokens. Résultats compétitifs sur benchmarks de compréhension visuelle fine sans modèles externes ni labels.

VisionReinforcement learningBenchmarks
SIG
72
HYP
18