Page 87 sur 192

ToutHaut signalRécent
7679 articles
arXiv cs.AI·

Beyond Predefined Learning Objects: A Thinking-Learning Interaction Model for Up-to-Date Autonomous Robot Learning

Modèle d'interaction pensée-apprentissage pour robots autonomes en environnements changeants. La pensée guide l'apprentissage (identification de changements, sélection d'évidences, planification), l'apprentissage améliore la pensée (mise à jour des connaissances, stratégies d'action). Résultats : précision de reconnaissance 0.419→0.845, longueur d'action 13.0→4.0, taux de sélection d'évidences 0.272→0.965.

RobotiqueReinforcement learningRaisonnement
SIG
72
HYP
25
arXiv cs.AI·

Low-Cost Labels, Reliable Choices: Rollout-Calibrated Hyper-Heuristics for Job Shop Scheduling

Hyper-heuristiques assistées par apprentissage pour le Job Shop Scheduling (JSSP). Le sélecteur proposé utilise des labels normalisés par regret, une estimation d'incertitude KNN contextuelle et une porte qui n'agit que si le gain prédit dépasse une marge ajustée. Réduit RPD moyen de Random-HH d'un ordre de magnitude sur instances synthétiques.

Reinforcement learningBenchmarksPapers
SIG
72
HYP
15
arXiv cs.LG·

Federated Learning over Human-Body Communication for On-Body Edge Intelligence: A Survey, Taxonomy, and BODYFED-HBC Scheduling Vignette

Article de synthèse sur l'intersection entre la communication intra-corporelle (HBC) et l'apprentissage fédéré pour les réseaux de capteurs portables. Propose une taxonomie des déploiements FL (intra-corps, corps-hub, multi-utilisateur, cloud clinique) et introduit BODYFED-HBC, une architecture de référence avec algorithme de planification et simulation reproductible basée sur des données publiques.

Benchmarks
SIG
72
HYP
15
arXiv cs.AI·

Operationalizing Reconstructive Authority: Runtime Construction, Dependency Resolution, and Execution Gating in Autonomous Agent Systems

Papier sur l'application en temps réel de l'Autorité Reconstructive (RAM) dans les systèmes d'agents autonomes. Introduit un modèle d'exécution avec trois états (admit/deny/halt), résolution dynamique des dépendances, et une Recovery Loop intégrant détection de dérive et contrôle d'exécution. Garantit qu'aucune action n'est exécutée sans autorité constructible.

Agents IASécurité IARaisonnement
SIG
72
HYP
15
arXiv cs.AI·

LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition

LC-ERD est un framework d'auto-alignement pour LLM qui mine les structures logiques latentes via décomposition de récompenses régulées. Il résout trois défis : le bruit d'étiquetage par biais mimétique, la supervision grossière et l'effondrement distributionnel. Utilise un Potentiel Logique Variationnel et décomposition multi-agent basée sur le principe IGM.

RaisonnementReinforcement learningAlignement
SIG
72
HYP
28
arXiv cs.CL·

Decompose-and-Refine: Structured Legal Question Answering with Parametric Retrieval

DaR (Decompose-and-Refine) est un framework pour répondre à des questions juridiques complexes en décomposant la question en sous-questions atomiques et en générant des requêtes paramétriques alignées sur le texte statutaire. Évalué sur KoBLEX (benchmark coréen multi-hop), avec Qwen3-32B et Gemma3-27B, DaR améliore la précision de récupération et la qualité des réponses en réduisant les hallucinations.

RaisonnementRAGQwen
SIG
72
HYP
18
arXiv cs.CL·

How Much Structure Do LLMs Need? Evaluating LLMs for Bibliometric Cluster Description

Étude évaluant 6 pipelines LLM pour générer des descriptions de clusters bibliométriques. Sur 100 analyses publiées, les LLMs produisent des descriptions sémantiquement proches des versions humaines mais hallucinent des références et échouent à inférer la structure bibliométrique seuls. Performance optimale en workflow hybride : algorithmes définissent clusters, LLMs génèrent descriptions lisibles.

BenchmarksÉvaluationsRAG
SIG
72
HYP
15
arXiv cs.CL·

Distinguishing Right from Wrong in Debates: Attribution Analysis of Chinese Harmful Memes

Nouvel article arXiv sur la détection interprétable de mèmes nuisibles en chinois. Les auteurs créent Ex-ToxiCN-MM, premier dataset d'explications avec interprétations opposées (nuisible/non-nuisible), et C-HarmKB, base de connaissances culturelles chinoises. Ils proposent RIKE, framework d'analyse d'attribution avec modules AKE et RIR, surpassant les baselines. Code et données open-sourcés.

VisionSécurité IAÉvaluations
SIG
72
HYP
18
arXiv cs.CL·

DRInQ: Evaluating Conversational Implicature with Controlled Context Variation

DRInQ est un benchmark pour évaluer le raisonnement pragmatique des LLM sur l'implicature conversationnelle. Les chercheurs montrent une asymétrie génération-inférence : les modèles génèrent des scénarios pragmatiques plausibles mais échouent à récupérer l'implication intended à l'inférence. Le prompting structuré améliore l'alignement pour les petits modèles.

BenchmarksRaisonnementÉvaluations
SIG
72
HYP
18
arXiv cs.CL·

Discovering Lexical Gaps Using Embeddings from Multilingual LLMs

Cadre automatisé pour détecter les lacunes lexicales (mots inexistants dans certaines langues) via embeddings de LLMs multilingues. Sur paires de traduction coréen-anglais, 4000 espaces d'embedding testés montrent que les mots lacunaires ont un alignement sémantique cross-lingue plus faible. Classifieurs logistiques atteignent AUC 0.81-0.76 et récupèrent 18/19 et 26/27 mots lacunaires.

EmbeddingsBenchmarksPapers
SIG
72
HYP
15
Reddit r/LocalLLaMA·

Update on 12x32gb sxm v100 cluster / local AI for legal drafting

Un avocat partage son retour d'expérience sur un cluster de 12 V100-SXM2 32GB pour le traitement juridique local. Après avoir abandonné vLLM pour les modèles MoE (incompatibilité GPU Volta), il utilise llama.cpp avec des modèles comme Gemma-4-26B et Qwen3.5-122B. Les modèles denses sur V100 sont inefficaces (~20-28 tok/s) ; les MoE atteignent 50-113 tok/s en décodage sur contextes longs.

LlamaOpen sourceInfrastructure
SIG
72
HYP
15
Reddit r/LocalLLaMA·

I built a computer use sandbox framework for codex on headless linux. GPU passthrough, computer use, and sudo access for codex all work. It's the perfect dev sandbox to allow full auto work while minimizing the "rm -rf /" risk

Développeur crée un framework sandbox pour agents IA sur Linux headless avec GPU passthrough, accès sudo et isolation du système hôte. Basé sur des VM configurables, permet navigation web autonome, exécution Docker et sessions parallèles. Code disponible sur GitHub.

Agents IAGénération de codeInfrastructure
SIG
72
HYP
28
arXiv cs.CL·

Cultural Adaptation in Large Language Models for Political Discourse

Article proposant un cadre de « cultural adaptation » pour les LLM en analyse politique. Identifie les biais anglais et les défaillances systématiques sur données multilingues. Propose une matrice d'évaluation (fidélité culturelle, calibration, sécurité démocratique) et des méthodes : datasets participatifs, transfer learning culturellement conscient, benchmarks adaptés.

BenchmarksÉvaluationsSécurité IA
SIG
72
HYP
25
arXiv cs.AI·

Human-in-the-Loop Multi-Agent Ventilator Decision Support with Contextual Bandit Preference Learning

VDSS, un système multi-agent pour l'aide à la décision en ventilation mécanique, coordonne des composants modulaires via des interfaces structurées et apprentissage contextuel des préférences clinicien (contextual bandit). Rejets structurés déclenchent replanning ciblé. Validation rétrospective ICU montre acceptabilité accrue et cycles réduits.

Multi-agentsReinforcement learningAgents IA
SIG
72
HYP
18
arXiv cs.LG·

A mathematical theory of balancing relational generalization and memorization

Étude théorique sur l'équilibre entre généralisation relationnelle et mémorisation dans les systèmes d'apprentissage. Les auteurs introduisent une tâche d'inférence transitive avec exceptions et caractérisent analytiquement le comportement de modèles de régression ridge à noyau. Validation sur des modèles de langage préentraînés montrant que la généralisation réussie dépend de la géométrie représentationnelle.

PapersRaisonnementÉvaluations
SIG
72
HYP
15
arXiv cs.AI·

Ontological Knowledge Blocks: Executable Compliance and Profile-Based Validation for Trustworthy AI Systems

Ontological Knowledge Blocks (OKBs) : infrastructure de gouvernance programmable qui compile les obligations réglementaires en contraintes vérifiables par machine sur des graphes de preuves structurées. Utilise RDF/OWL, SHACL et PROV-O. Prototype évalué sur allocation de ressources HPC avec 24 exécutions et 4 profils de gouvernance. Latence SHACL : 12,6–100,3 ms.

RégulationSécurité IAAlignement
SIG
72
HYP
15
arXiv cs.CL·

Knowledge Distillation for Low-Resource Open-source Text-to-SQL Model

Framework de distillation de connaissances pour Text-to-SQL en contexte low-resource. Construit une base de connaissances (sémantique schéma, abréviations, logique métier) injectée en entraînement et inférence. Génère données synthétiques contextualisées. Évalué sur 7 benchmarks : améliore LLMs open-source et fermés, notamment sur données domain-specific.

Génération de codeFine-tuningRAG
SIG
72
HYP
25
arXiv cs.CL·

What Training Data Teaches RL Memory Agents: An Empirical Study of Curriculum Effects in Memory-Augmented QA

Étude empirique sur l'effet du curriculum d'entraînement sur les agents RL avec mémoire externe en dialogue multi-session. Trois conditions testées (LoCoMo seul, LoCoMo + LongMemEval, LongMemEval seul) montrent que la composition des données façonne les compétences spécialisées plutôt que la performance globale. Le curriculum mixte obtient le meilleur F1 global.

Reinforcement learningAgents IARaisonnement
SIG
72
HYP
15
arXiv cs.CL·

The Efficiency Frontier: A Unified Framework for Cost-Performance Optimization in LLM Context Management

Cadre unifié pour optimiser le coût-performance de la gestion du contexte dans les LLM. Évalue conjointement performance, coût en tokens et réutilisation du prétraitement sur 5000 instances HotpotQA. Réduit l'usage de tokens de 25% à performance comparable (F1≈0.78) et atteint 50% de réduction de coût avec compression mémoire.

RAGBenchmarksInfrastructure
SIG
72
HYP
18
arXiv cs.CL·

A Comparative Evaluation of Structural Topic Models and BERTopic for Short, Open-Ended Survey Responses

Comparaison de Structural Topic Models (STM) et BERTopic pour analyser des réponses courtes à des enquêtes ouvertes. BERTopic produit une cohérence thématique supérieure, renforcée par l'augmentation contextuelle (stratégie introduite pour enrichir les réponses très courtes). STM offre meilleure support pour l'analyse inférentielle des covariables, BERTopic pour l'interprétabilité.

EmbeddingsBenchmarksPapers
SIG
72
HYP
15
arXiv cs.CL·

When Symptoms Are Not Enough: Evidence-Weighting Patterns in Large Language Model Psychiatric Screening

Benchmark SCID de 555 entretiens semi-structurés évalue 5 LLMs (GPT-4.1 Mini, GPT-5 Mini) sur dépistage psychiatrique (anxiété, dépression, PTSD). Précision 0.49–0.86, MCC 0.16–0.38. Les faux négatifs révèlent que les modèles sous-pondèrent les symptômes face à un fonctionnement préservé ou un soutien social, nécessitant validation clinique avant déploiement.

BenchmarksGPTSécurité IA
SIG
72
HYP
25
arXiv cs.CL·

Hidden Human-Like Nature of Machine-Generated Texts: Theory and Detection Enhancement

Des chercheurs révèlent que les textes générés par LLM contiennent des spans « humain-like » cachés qui compliquent leur détection. Ils proposent un framework stacked model-agnostic utilisant une procédure hard-EM pour filtrer itérativement les sous-séquences humaines et améliorer les détecteurs existants, fonctionnant aussi sans entraînement.

ÉvaluationsSécurité IAPapers
SIG
72
HYP
28
arXiv cs.CL·

ClimateChat-300K: A Multi-Modal Facebook Dataset for Understanding Diverse Perspectives in Climate Communication

ClimateChat-300K : dataset de 299 329 posts Facebook publics sur le changement climatique (mai 2020 - mai 2024), collectés via CrowdTangle. 41 features de métadonnées, 26 000+ pages globales. Analyse thématique (10 thèmes, 5 domaines) et sentiment révèlent que contenu émotionnel et visuel génère plus d'engagement. Ressource ouverte pour étudier polarisation et désinformation.

BenchmarksPapersOpen source
SIG
72
HYP
25
arXiv cs.AI·

When Planning Fails Despite Correct Execution: On Epistemic Calibration for LLM-Based Multi-Agent Systems

Les systèmes multi-agents basés sur LLM échouent parfois malgré une exécution correcte des plans, car les agents mal évaluent leurs connaissances (« epistemic miscalibration »). Les auteurs proposent EPC-AW, un workflow qui sélectionne les plans stables entre agents et affine l'état épistémique au fil du temps. Amélioration de 9,75% du succès système.

Multi-agentsAgents IARaisonnement
SIG
72
HYP
15