Page 66 sur 192

ToutHaut signalRécent
7679 articles
arXiv cs.LG·

Bernstein-Schur Kernels: Random Features by Sketched Modulation and Radial Randomization

Kernels de Bernstein-Schur : construction de random features combinant sketching de modulation finie et randomisation radiale via échelle de Bernstein-Widder. Dimension de features Dm sans coût O(d²) de la modulation exacte. Garanties de variance exacte et bornes d'opérateur contrôlées par dimension intrinsèque, avec applications au kernel ridge regression.

PapersBenchmarksEmbeddings
SIG
72
HYP
08
arXiv cs.CL·

NTS-CoT: Mitigating Hallucinations in LLM-based News Timeline Summarization with Chain-of-Thought Reasoning

NTS-CoT, un framework basé sur Chain-of-Thought, réduit les hallucinations dans la résumé de chronologies d'actualités. Trois modules (Element-CoT, Date Selection, Causal-CoT) capturent les éléments essentiels, sélectionnent les timestamps et inférent les relations causales. Évaluation sur trois benchmarks TLS avec amélioration mesurable.

RaisonnementPapersÉvaluations
SIG
72
HYP
18
arXiv cs.CL·

PRISM: Prosody-Integrated Multi-Agent Reasoning Framework for Empathetic Spoken Dialogue

PRISM est un framework multi-agent pour le dialogue parlé empathique qui découple perception vocale, génération de réponse et synthèse vocale. Il introduit un mécanisme de traduction prosody-to-language pour stabiliser le raisonnement des LLM et intègre des outils de connaissance externes. Résultats : amélioration de l'empathie, de l'adéquation prosodique et de la qualité des réponses.

Multi-agentsVoixAgents IA
SIG
72
HYP
28
arXiv cs.AI·

HarnessBridge: Learnable Bidirectional Controller for LLM Agent Harness

HarnessBridge est un contrôleur d'interface agent-environnement appris par projection bidirectionnelle. Le module projette les observations brutes en états compacts et convertit les actions proposées en transitions exécutables. Entraîné sur Terminal-Bench 2.0 et SWE-bench Verified, il égale les harnesses spécialisés tout en réduisant l'usage de tokens et la longueur des trajectoires.

Agents IARaisonnementGénération de code
SIG
72
HYP
28
arXiv cs.AI·

Teach-and-Repeat: Accurately Extracting Operational Knowledge from Mobile Screen Demonstrations to Empower GUI Agents

Teach VLM extrait la connaissance opérationnelle de démonstrations mobiles en analysant les transitions visuelles et génère des instructions en langage naturel. Le paradigme Teach-and-Repeat utilise cette connaissance pour guider des agents d'exécution GUI. Évaluation sur Android World montre des améliorations de Task Success Rate.

Agents IAVisionGénération de code
SIG
72
HYP
28
arXiv cs.AI·

Constructing Evaluation Datasets for Procedural Reasoning: Balancing Naturalness, Grounding, and Multi-Hop Coverage

Étude sur la génération de datasets d'évaluation pour le raisonnement procédural. Trois stratégies comparées : génération stricte depuis modèles TMK (Task-Method-Knowledge), génération basée transcripts avec filtrage TMK post-hoc, et génération TMK-aware. Sur 690 paires question-réponse et 23 sujets, la génération stricte atteint 96,5% de questions ancrées et 92,6% utilisables.

ÉvaluationsRaisonnementBenchmarks
SIG
72
HYP
15
arXiv cs.CL·

G-Long: Graph-Enhanced Memory Management for Efficient Long-Term Dialogue Agents

G-Long est un framework utilisant des graphes et un petit modèle de langage fine-tuné pour gérer efficacement la mémoire long-terme dans les dialogues. Il extrait des triplets structurés et utilise un mécanisme de scoring d'importance basé sur l'attention d'un T5 pour identifier les souvenirs saillants. Gains : +9.8% en qualité de réponse (MSC), +40.8% en rappel de récupération (LME).

Agents IARAGRaisonnement
SIG
72
HYP
25
arXiv cs.AI·

WISE: A Long-Horizon Agent in Minecraft with Why-Which Reasoning

WISE est un agent Minecraft long-horizon utilisant un graphe d'événements causaux pour augmenter la mémoire épisodique. Le framework couple le raisonnement causal (why-which) à la mémoire spatiotemporelle, permettant la réordonnance opportuniste de sous-tâches et une exploration multi-échelle. Amélioration significative sur tâches creuses nécessitant adaptation décisionnelle.

Agents IARaisonnementReinforcement learning
SIG
72
HYP
25
arXiv cs.CL·

LLMs Can Better Capture Human Judgments--With the Right Prompts

Des techniques de prompting simples améliorent la capacité des LLM à capturer les jugements humains. Sur 144 scénarios moraux (US) et 38 croyances morales (32 pays), demander aux modèles de rapporter écarts-types et proportions de réponses récupère mieux la distribution complète des réponses humaines. Les LLM suivent aussi les taux de confusion humaine, bien que leur calibrage d'erreur reste faible.

Prompt engineeringÉvaluationsAlignement
SIG
72
HYP
18
arXiv cs.AI·

Definitional alignment before capability alignment: a Design-Science framework for adjudicating claims about AGI

Article proposant DAF-AGI, un cadre de gouvernance pour évaluer les définitions concurrentes d'AGI. Analyse cinq familles de mesure (performance, capacités, psychométrie, acquisition de compétences, économie) et teste la claim que les systèmes génératifs actuels constituent AGI. Seule l'approche basée sur la performance certifie cette claim sur données 2024-2025.

RaisonnementÉvaluationsAlignement
SIG
72
HYP
15
arXiv cs.AI·

PRISMR: Overcoming Parse Collapse in Multimodal Listwise Ranking via Parameterized Representation Internalization

PRISMR résout le « parse collapse » dans le ranking listwise multimodal avec LMMs. Le problème : les décodeurs autorégressifs omettent silencieusement des candidats et terminent prématurément sur listes longues. Solution : un hypernetwork léger génère des poids LoRA spécifiques aux items, synthétisés en adaptateur instance-spécifique. Benchmark multimodal review-ranking créé.

VisionRaisonnementFine-tuning
SIG
72
HYP
18
arXiv cs.AI·

Multi-Modal Agents for Power Distribution Defect Detection: An Evaluation of Foundation Models

Framework multi-modal pour la détection de défauts dans les réseaux électriques utilisant des modèles fondamentaux. Évaluation systématique de trois capacités : perception (identification d'équipements et description de défauts), raisonnement (diagnostic et planification de maintenance), utilisation d'outils (exécution autonome). Dataset spécifique au domaine et benchmark développés.

Agents IAVisionRaisonnement
SIG
72
HYP
28
arXiv cs.CL·

X-MADAM-RAG: Diagnosing and Handling Chinese-English Evidence Conflict in Retrieval-Augmented Generation

X-MADAM-RAG diagnostique les conflits entre preuves chinoise et anglaise dans les systèmes RAG. Sur le benchmark X-RAMDocs-ZHEN (300 exemples), le pipeline atteint 96,67% de précision stricte avec Qwen2.5-7B-Instruct, mais échoue sur des variantes naturalisées (30% de précision), révélant que l'extraction au niveau document reste le goulot d'étranglement.

RAGBenchmarksÉvaluations
SIG
72
HYP
18
arXiv cs.CL·

PiDA: Phonetically-Informed Data Augmentation for Robust Vietnamese Speech Translation

Étude des erreurs ASR en traduction vocale vietnamienne. Les auteurs catégorisent les erreurs de substitution par cause phonétique et proposent PiDA (Phonetically-Informed Data Augmentation), qui augmente les données d'entraînement avec des corruptions phonétiquement similaires. Fine-tuning sur FLEURS Vietnamese-English améliore la traduction d'outputs ASR erronés (+2.04 BLEU).

BenchmarksPapers
SIG
72
HYP
15
arXiv cs.CL·

Constrained Semantic Decompression in LLMs through Persian Proverb-Conditioned Story Generation

Étude sur la génération d'histoires conditionnées par des proverbes persans. Les chercheurs introduisent PAND (Proverb Aligned Narrative Dataset) et identifient un « écart de décompression » : les LLM produisent du texte fluide mais échouent à préserver la structure morale et causale des proverbes. Le raisonnement explicite et l'affinement itératif réduisent partiellement ces erreurs.

PapersRaisonnementÉvaluations
SIG
72
HYP
15
arXiv cs.AI·

TrajGenAgent: A Hierarchical LLM Agent for Human Mobility Trajectory Generation

TrajGenAgent est un framework d'agent LLM hiérarchique pour générer des trajectoires de mobilité humaine réalistes sans fine-tuning. Un orchestrateur LLM synthétise des chaînes d'activités via in-context learning, puis un workflow déterministe les ancre via récupération POI personnalisée, sélection de localisation et estimation de durée. Évaluation par détection d'anomalies sur données de benchmark.

Agents IAPrompt engineeringRaisonnement
SIG
72
HYP
18
arXiv cs.CL·

Helping Figures Tell their Story! Paper-Grounded Video Generation Explaining Complex Scientific Figures

Nouvel article arXiv présentant MINARD, un système de génération vidéo qui transforme les figures scientifiques en vidéos narratives avec annotations régionales. Le pipeline génère des narrations ancrées au papier et les aligne séquentiellement aux régions de la figure. Benchmark FigTalk inclus avec métriques d'ancrage au niveau composant.

Génération de vidéosVisionBenchmarks
SIG
72
HYP
25
Reddit r/LocalLLaMA·

Some contrived tests comparing the accuracy of different Gemma and Qwen quantizations

Comparaison empirique de quantifications Gemma et Qwen sur trois tâches (arithmétique, dates présidentielles, attention). Gemma-4-31B-Q4_K_S atteint 83,8% en arithmétique et 87% en attention. Qwen3.6-27B-Q4_K_S obtient 95,5% en arithmétique et 100% en présidents. Les résultats montrent l'impact majeur du modèle et du schéma de quantification sur la précision.

GeminiQwenÉvaluations
SIG
72
HYP
15
Reddit r/LocalLLaMA·

Step-3.7-Flash on AMD: ROCm corrupts long context past ~94k, and thinking needs a hard token budget

Step-3.7-Flash sur AMD/ROCm corrompt le contexte long au-delà de ~94k tokens. Le mode reasoning est actif par défaut et consomme 2000+ tokens sans budget défini, causant des réponses vides. Solution : limiter le contexte à 90k, fixer thinking_budget_tokens à 256 via llama.cpp, ignorer enable_thinking:false et reasoning_effort.

RaisonnementOpen sourceInfrastructure
SIG
72
HYP
15
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> NVIDIA /</span> SkillSpector

SkillSpector est un scanner de sécurité open-source NVIDIA pour les compétences d'agents IA. Il détecte les vulnérabilités, les patterns malveillants et les risques de sécurité dans les outils et fonctions utilisés par les agents.

Agents IASécurité IAOpen source
SIG
72
HYP
25
arXiv cs.AI·

Automating Geometry-Intensive Compliance Checking in BIM: Graph-Based Semantic Reasoning Framework

SGR-BIM, un système de raisonnement basé graphes, automatise la vérification de conformité géométrique dans la modélisation BIM. Validé sur 679 requêtes de codes de sécurité incendie, il atteint 84,3% de précision (+8,6% vs baselines single-agent) en construisant dynamiquement un graphe de connaissances multi-modal alignant intent utilisateur, sémantique réglementaire et géométrie BIM.

RaisonnementAgents IABenchmarks
SIG
72
HYP
25