Page 90 sur 192

ToutHaut signalRécent
7679 articles
arXiv cs.LG·

Harnesses for Inference-Time Alignment over Execution Trajectories

Étude de l'ingénierie des « harnesses » pour l'alignement en temps d'inférence des agents LLM. Les auteurs décomposent les harnesses en deux mécanismes : décomposition de tâches et exécution guidée. Ils identifient des modes de défaillance (sur-décomposition, sur-élagage) et montrent que les harnesses partielles peuvent surpasser les workflows entièrement structurés.

Agents IAPrompt engineeringRaisonnement
SIG
72
HYP
18
arXiv cs.AI·

AgentCo-op: Retrieval-Based Synthesis of Interoperable Multi-Agent Workflows

AgentCo-op est un framework de synthèse basé sur la récupération qui compose des compétences réutilisables, outils et agents externes en workflows exécutables via des transferts d'artefacts typés. Appliqué à la génomique et aux benchmarks de codage/math, il coordonne des agents spécialisés sans recherche globale de topologie et réduit les coûts par rapport aux baselines multi-agents.

Multi-agentsAgents IAGénération de code
SIG
72
HYP
28
arXiv cs.LG·

Equilibrium Propagation and Hamiltonian Inference in the Diffusive Fitzhugh-Nagumo Model

Extension du framework Equilibrium Propagation aux systèmes skew-gradient avec équivalence démontrée entre Energy-Based Models profonds et réseaux Hamiltoniens. Application à des réseaux de neurones Fitzhugh-Nagumo couplés diffusivement, montrant que les solutions stationnaires admettent une structure Hamiltonienne spatiale et permettent l'application de Hamiltonian Echo Backpropagation.

PapersRaisonnementReinforcement learning
SIG
72
HYP
15
arXiv cs.AI·

Neural Estimation of Pairwise Mutual Information in Masked Discrete Sequence Models

Méthode neurale pour estimer l'information mutuelle conditionnelle par paires dans les modèles de diffusion masqués (MDMs). Le framework utilise les états cachés d'un MDM préentraîné et supervision par MI calculée depuis les distributions conditionnelles du modèle. Appliqué à Sudoku et génération de séquences protéiques (ESM-C), réduit les passes forward d'inférence de 3-5x en décodage parallèle guidé par MI.

PapersRaisonnementGénération de code
SIG
72
HYP
18
arXiv cs.AI·

Parallel LLM Reasoning for Bias-Resilient, Robust Conceptual Abstraction

Étude proposant un cadre de traitement parallèle par chunks pour analyser les longs documents avec les LLM. Le texte est divisé en segments sémantiques traités indépendamment, puis consolidés avec ancrage explicite aux preuves. Résultats : réduction de 84% des erreurs d'omission, augmentation de 130% de la traçabilité, réduction de 91% des affirmations non fondées.

RaisonnementÉvaluationsPrompt engineering
SIG
72
HYP
25
arXiv cs.CL·

LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning

LatentOmni propose un cadre de raisonnement audio-visuel utilisant un espace latent unifié au lieu de chaînes de pensée textuelles explicites. Le modèle intercale le raisonnement textuel avec des états latents audio-visuels, introduit OSPE pour la cohérence temporelle, et s'appuie sur LatentOmni-Instruct-35K (35K trajectoires annotées). Surpasse les baselines textuelles sur les benchmarks audio-visuels.

RaisonnementPapers
SIG
72
HYP
28
arXiv cs.LG·

Leveraging Self-Paced Curriculum Learning for Enhanced Modality Balance in Multimodal Conversational Emotion Recognition

Cadre Self-Paced Curriculum Learning (SPCL) pour la reconnaissance d'émotions multimodales en conversations. Mesureur de difficulté dual (niveau énoncé et conversation) guide l'apprentissage des cas faciles aux difficiles. Tests sur IEMOCAP (+1.2% à +6.6% F1) et MELD (+10.4%) montrent amélioration de l'équilibre modalité.

RaisonnementBenchmarks
SIG
72
HYP
18
arXiv cs.LG·

A Reproducible Log-Driven AutoML Framework for Interpretable Pipeline Optimization in Healthcare Risk Prediction

yvsoucom-iterkit, un framework AutoML déterministe et log-driven, optimise les pipelines de prédiction de risque médical via 18 000+ configurations. Sur Pima et Stroke, l'augmentation (0.454), le choix du modèle (0.198) et la gestion du déséquilibre (0.101-0.406) sont les drivers clés. Ensembles atteignent F1 0.89-0.94 avec robustesse cross-seed (variabilité 0.023-0.026).

BenchmarksÉvaluationsFine-tuning
SIG
72
HYP
18
arXiv cs.LG·

Correcting Class Imbalance in Prior-Data Fitted Networks for Tabular Classification

Les réseaux pré-entraînés sur données (PFN) excellent sur la classification tabulaire mais souffrent du déséquilibre de classes. Cette étude adapte des techniques classiques (thresholding, downsampling) aux PFN, montrant que le thresholding surperforme grâce à la calibration des PFN, tandis que le downsampling offre un bon compromis avec coût computationnel réduit.

BenchmarksÉvaluations
SIG
72
HYP
15
arXiv cs.CL·

GHI: Graphormer over Conditioned Hypergraph Incidence for Aspect-Based Sentiment Analysis

GHI est un framework basé sur Graphormer pour l'analyse de sentiment basée sur les aspects (ABSA). Il utilise une structure hypergraphe bipartite pour représenter les relations entre tokens et hyperedges, intégrant des signaux linguistiques et sémantiques. Avec 247M paramètres, GHI surpasse DeBERTa sur six benchmarks SemEval et approche les performances de Flan-T5 11B sur ISE.

PapersBenchmarksRaisonnement
SIG
72
HYP
18
arXiv cs.CL·

PromptNCE: Pointwise Mutual Information Predictions Using Only LLMs and Contrastive Estimation Prompts

PromptNCE estime l'information mutuelle ponctuelle via LLM sans entraînement, en utilisant uniquement des prompts et probabilités élicitées. La méthode encadre l'estimation de probabilité conditionnelle comme tâche contrastive avec catégorie OTHER explicite. Corrélation Spearman jusqu'à 0.82 sur trois datasets avec vérité terrain humaine.

Prompt engineeringPapersBenchmarks
SIG
72
HYP
18
arXiv cs.CL·

Audience Engagement with Arabic Women's Social Empowerment and Wellbeing: A Decadal Corpus

Corpus de 252 487 posts Facebook arabes (2013-2024) collectés sur 51 660 pages dans 77 pays, couvrant l'autonomisation des femmes et le bien-être social. 267 millions d'interactions utilisateur analysées avec métriques d'engagement (partages, commentaires, réactions). Pipeline automatisé pour identification linguistique, normalisation et nettoyage des métadonnées.

BenchmarksPapers
SIG
72
HYP
15
arXiv cs.LG·

I-SAFE: Wasserstein Coherence Metrics for Structural Auditing of Scientific AI Models

I-SAFE est un framework d'audit post-hoc pour modèles IA scientifiques basé sur la métrique de cohérence Wasserstein (WCM). Il évalue si les prédictions d'un modèle reflètent la structure du domaine ou exploitent des raccourcis statistiques. Testé sur la prédiction d'interactions drogue-cible (DeepConvDTI, DeepDTA, TAPB), il révèle des profils de réponse distribués distincts invisibles aux métriques de précision.

ÉvaluationsSécurité IAAlignement
SIG
72
HYP
15
arXiv cs.LG·

Alike Parts: A Feature-Informed Approach to Local and Global Prototype Explanations

Nouvelle méthode de prototypes explicables intégrant l'importance des features à deux niveaux : « alike parts » pour les explications locales (met en avant les features partagées entre instance et prototype) et sélection globale augmentée pour promouvoir la diversité des attributions. Tests sur 6 benchmarks montrent maintien ou amélioration de la fidélité du modèle.

ÉvaluationsPapers
SIG
72
HYP
15
arXiv cs.AI·

Personality Engineering with AI Agents: A New Methodology for Negotiation Research

Des chercheurs proposent une méthodologie appelée « personality engineering » utilisant des agents IA pour tester rigoureusement les théories de négociation. Les agents IA paramètrent précisément les personnalités des négociateurs selon deux dimensions (chaleur et dominance) du circumplex interpersonnel, permettant des expériences contrôlées impossibles avec des humains.

Agents IAPapersRaisonnement
SIG
72
HYP
25
arXiv cs.CL·

Claim-Selective Certification for High-Risk Medical Retrieval-Augmented Generation

Système de certification sélective par réclamation pour RAG médical haute-risque. Chaque réponse est décomposée en affirmations vérifiables, évaluées contre les preuves récupérées et mappées à {complet, partiel, conflit, abstention}. Sur le protocole de certification faible-label, UCCR=0.0000, PAU=1.0000, précision PAU=0.9901, précision action=0.9204 (dev, n=314) et 0.8997 (test, n=319).

RAGÉvaluationsSécurité IA
SIG
72
HYP
15
arXiv cs.AI·

GraphDiffMed: Knowledge-Constrained Differential Attention with Pharmacological Graph Priors for Medication Recommendation

GraphDiffMed propose un cadre de recommandation médicamenteuse basé sur l'attention différentielle dual-scale et des contraintes pharmacologiques. Testé sur MIMIC-III, le modèle filtre le bruit intra-visite et inter-visite tout en intégrant les interactions médicamenteuses, surpassant les baselines existantes en qualité et sécurité.

BenchmarksPapersSécurité IA
SIG
72
HYP
18
arXiv cs.AI·

Mind the Sim-to-Real Gap & Think Like a Scientist

Article théorique sur l'équilibre entre simulateurs pré-entraînés et expériences réelles en planification séquentielle. Décompose l'erreur du simulateur en décalage calibration-déploiement et résidu paramétrique. Propose Fisher-SEP, une politique expérimentale qui minimise la variance prédictive. Cas d'étude : chaîne logistique de distributeurs et dépistage du VIH.

Reinforcement learningRaisonnementPapers
SIG
72
HYP
15
arXiv cs.AI·

Declarative Data Services: Structured Agentic Discovery for Composing Data Systems

DDS (Declarative Data Services) est une architecture pour la découverte agentic structurée de compositions de systèmes de données. Face à l'échec de la découverte agentic non bornée, le framework décompose la recherche en sous-recherches typées via quatre contrats (intent, DAG d'opérateurs, skills, attribution runtime). Testé sur une charge de trading-backend, DDS converge où les approches non bornées échouent.

Agents IAMulti-agentsPapers
SIG
72
HYP
18