Page 77 sur 192

ToutHaut signalRécent
7679 articles
arXiv cs.CL·

G^2C-MT: Graph-Guided Context Selection for Document-Level Machine Translation

G²C-MT propose une sélection de contexte guidée par graphe pour la traduction automatique au niveau du document. Le système modélise les dépendances discursives entre paragraphes via un graphe léger et utilise une marche aléatoire biaisée en profondeur pour extraire des chemins de contexte. Testé sur DeepSeek-V3, Gemini-2.5-Flash-lite et Qwen-2.5/3, l'approche surpasse les baselines sur plusieurs domaines.

PapersBenchmarksDeepSeek
SIG
72
HYP
18
arXiv cs.CL·

Economy of Minds: Emerging Multi-Agent Intelligence with Economic Interactions

Des chercheurs proposent une économie d'agents où les IA se coordonnent via des enchères et des échanges de paiements, sans contrôle centralisé. Inspirée par la théorie économique de Hayek, cette approche génère des stratégies de raisonnement multi-étapes émergentes et surpasse les baselines sur cinq tâches (raisonnement mathématique, recherche financière, optimisation de systèmes distribués).

Multi-agentsAgents IARaisonnement
SIG
72
HYP
35
arXiv cs.CL·

Coherence Maximization Improves Pluralistic Alignment

Une méthode appelée Internal Coherence Maximization (ICM) génère automatiquement des exemples pour aligner les modèles IA sur des valeurs humaines diverses, sans supervision humaine extensive. Testée sur quatre benchmarks, ICM égale la performance des labels manuels. La cohérence des exemples améliore la généralisation même à précision égale, particulièrement pour les personas sous-représentées.

AlignementPrompt engineeringPapers
SIG
72
HYP
25
arXiv cs.LG·

Spectral-Progressive Thought Flow for Lightweight Multimodal Reasoning

SpecFlow propose un cadre léger de raisonnement spatial multimodal utilisant l'espace cosinus discret pour représenter les pensées visuelles intermédiaires. Via guidance sans classificateur, les pensées textuelles autogénératives dirigent les mises à jour visuelles sans expansion de contexte. Résultat : réduction jusqu'à 2,1× des coûts de calcul et cache KV avec performance compétitive.

RaisonnementVisionMulti-agents
SIG
72
HYP
18
arXiv cs.LG·

Auditable Climate Risk Intelligence from Fragmented ESG Data: Deterministic Orchestration and Imbalance-Aware Learning for Scope 1-3 Validation

Framework d'orchestration déterministe pour valider les données ESG fragmentées (Scope 1-3) avec détection d'anomalies temporelles, apprentissage d'ensemble imbalancé et traçabilité d'audit. Benchmark synthétique calibré sur GHG Protocol, PCAF, ISSB. Évaluation sur métriques de classification, calibration et complétude de chaîne de provenance.

BenchmarksÉvaluationsReinforcement learning
SIG
72
HYP
15
arXiv cs.LG·

Improvise, Adapt, Overcome: An On-The-Fly Multifidelity Algorithm for Efficient Machine Learning

Algorithme multifidélité adaptatif pour l'apprentissage machine en chimie quantique. Détermine dynamiquement la composition du dataset en interrogeant les échantillons à chaque niveau de fidélité. Réduit les coûts de génération de données jusqu'à 30× vs méthode monofidélité et 5× vs MFML standard sur énergies de cluster couplé et énergies d'excitation.

BenchmarksPapersFine-tuning
SIG
72
HYP
18
arXiv cs.LG·

Representational Capacity: Geometric Limits on Feature Representation in Transformer Language Models

Étude théorique sur les limites géométriques de la représentation de features dans les transformers. Les auteurs établissent un cadre basé sur les hypothèses de représentation linéaire et superposition, montrant que la capacité représentationnelle dépend du ratio vecteurs/dimensions (k/d) plutôt que du nombre brut. Analyse de dizaines de modèles open-source révèle deux classes selon la contrainte d'orthogonalité ε.

PapersRaisonnementBenchmarks
SIG
72
HYP
15
arXiv cs.CL·

The Ghost Annotator: a Framework to Explore Human Label Variation in Content Moderation through Conformal Prediction

Framework combinant prédiction conforme et représentation collaborative pour analyser le comportement des LLM face aux annotateurs humains en modération de contenu. Introduit la métrique Ghost Prediction pour quantifier les divergences modèle-humains. Évaluation sur 4 LLM et 4 datasets révèle que les grands modèles sont plus confiants sur textes sans alignement humain, avec biais démographique structurel.

ÉvaluationsSécurité IAAlignement
SIG
72
HYP
18
arXiv cs.CL·

Conditional Hypothesis Generation for LLM-Based Text Analysis with Researcher-Specified Covariates

Méthode de génération d'hypothèses conditionnelles pour l'analyse textuelle par LLM, intégrant des covariables spécifiées par les chercheurs. Résout les problèmes de déséquilibre de strates et d'inversion de signe via interactions features-covariables et rééquilibrage inverse-fréquence. Validation sur données synthétiques et réelles en sciences sociales computationnelles.

Prompt engineeringÉvaluationsPapers
SIG
72
HYP
15
arXiv cs.AI·

Do Real-World Datasets Contain Natural Experiments? An Empirical Study Using Causal Feature Selection

Étude empirique sur la détection de « natural experiments » (interventions implicites) dans des datasets réels via découverte causale et sélection de features. Les auteurs valident sur données synthétiques puis évaluent 50+ datasets réels, montrant que traiter les données comme interventionnelles plutôt qu'observationnelles améliore les performances.

BenchmarksPapers
SIG
72
HYP
18
arXiv cs.CL·

Fully Automated Identification of Lexical Alignment and Preference-Stage Shifts in Large Language Models

Deux métriques automatisées évaluent le désalignement lexical des LLM : Lexical Alignment Score détecte la surutilisation de termes ('suggest', 'additionally', 'strategy'), Triangulated Preference Shift quantifie l'impact du RLHF. Testées sur 6 familles (Falcon, Gemma, Llama, Mistral, OLMo, Yi) via abstracts PubMed, sans annotation manuelle.

AlignementÉvaluationsReinforcement learning
SIG
72
HYP
18
arXiv cs.AI·

Perceive Before Reasoning: A Pre-Reasoning Perception Framework for Efficient and Reliable Proactive Mobile Agents

Un framework deux-étapes (PRPF) pour agents mobiles proactifs sépare la perception (décider d'intervenir) du raisonnement (comment aider). Un percepteur léger filtre les faux positifs, activant le reasoner MLLM seulement si nécessaire. Réduit les faux déclenchements et améliore l'efficacité sur le benchmark ProactiveMobile.

Agents IAVisionRaisonnement
SIG
72
HYP
25
arXiv cs.LG·

A Nonmonotone Gradient-Based Algorithm for Symmetric Nonnegative Matrix Factorization and Graph Clustering

SNMPBB, première adaptation des méthodes de Barzilai-Borwein non-monotones au problème de factorisation matricielle symétrique non-négative (Symmetric NMF). Démontre 6× d'accélération vs SymANLS sur données synthétiques. Extensions pour clustering de graphes (Graph-SNMPBB) et problèmes large-scale (LAI-SNMPBB) avec convergence globale prouvée.

BenchmarksPapers
SIG
72
HYP
15