Page 72 sur 192

ToutHaut signalRécent
7679 articles
arXiv cs.CL·

TA-RAG: Tone-Aware Retrieval-Augmented Generation for Peer-Support Health Communication

TA-RAG est un framework RAG léger basé sur des prompts qui intègre le contrôle du ton dans les pipelines RAG sans fine-tuning. Il opérationnalise le ton via quatre composants : réécriture sans stigma, ajustement de lisibilité, adaptation au destinataire et reformulation empathique. Évalué sur des données HIV peer-support (HOLA, NAPWHA), il améliore la qualité communicationnelle tout en préservant le contenu.

RAGPrompt engineeringSécurité IA
SIG
72
HYP
18
arXiv cs.CL·

Signal-Driven Observation for Long-Horizon Web Agents

Les agents web sur long horizon consomment des milliers de tokens à chaque étape (DOM brut, arbres d'accessibilité), dégradant le contexte. Signal-Driven Observation (SDO) découple observation et action : une sous-requête lit le DOM complet mais retourne uniquement les éléments pertinents, réinvoquée seulement si un détecteur léger se déclenche (transitions URL, éléments interactifs, échecs d'action).

Agents IARaisonnementPapers
SIG
72
HYP
18
arXiv cs.CL·

CRAFT: A Unified Counterfactual Reasoning Framework for Tabular Question Answering and Fact Verification

CRAFT est un framework de raisonnement contrefactuel unifié pour le question-answering tabulaire et la vérification de faits. La méthode reformule ces tâches en processus de vérification bidirectionnel, construisant explicitement des énoncés déclaratifs et leurs variantes contrefactuelles. Résultats : améliorations sur WikiTQ et TabFact, réduction des écarts de performance entre LLMs.

RaisonnementBenchmarksPapers
SIG
72
HYP
18
arXiv cs.LG·

GRASP: Geometry-aware Residual Alignment for Scalable Pretraining Data Attribution

GRASP est une méthode d'attribution de données qui modélise les interactions entre sous-ensembles d'entraînement via une pénalité géométrique quadratique, dépassant les approches additives isolées. Évaluée sur du préentraînement à grande échelle, elle double la corrélation de rang pour la fidélité contrefactuelle et réduit les coûts de construction d'artefacts d'un ordre de magnitude.

PapersBenchmarksFine-tuning
SIG
72
HYP
18
arXiv cs.CL·

Are Large Language Models Suitable for Graph Computation? Progress and Prospects

Étude systématique de l'utilisation des LLM pour le calcul sur graphes. Les auteurs proposent une taxonomie basée sur deux paradigmes : LLM comme exécuteur (résolution directe) et LLM comme planificateur (décomposition et invocation d'outils externes). Conclusion : fiables pour tâches simples et petite échelle, peu fiables pour tâches complexes et exigeant de la précision.

RaisonnementAgents IABenchmarks
SIG
72
HYP
15
arXiv cs.CL·

EASE-TTT: Evidence-Aligned Selective Test-Time Training for Long-Context Question Answering

EASE-TTT combine la récupération de preuves et l'adaptation au test-time pour améliorer la QA sur long contexte. La méthode convertit les chunks de preuves en supervision d'attention douce, guidant l'adaptation des paramètres d'attention côté requête. Testée sur 6 tâches LongBench avec 3 petits modèles, elle surpasse les baselines de récupération et qTTT.

RAGRaisonnementBenchmarks
SIG
72
HYP
15
arXiv cs.CL·

Tree-of-Experience: A Structured Experience-Management Solution for Self-Evolving Agents under Low-Repetition and Implicit-Reward Environments

Nouvel article sur la gestion structurée d'expérience pour agents LLM en environnements à récompenses implicites. Présente FinEvolveBench, un benchmark de prédiction de sentiment financier avec retours retardés et bruyants, et Tree-of-Experience (ToE), une méthode d'organisation et validation d'expérience qui surpasse les baselines sans mémoire.

Agents IAReinforcement learningBenchmarks
SIG
72
HYP
28
arXiv cs.AI·

CARVE-Q: Quantum-Proposed, Classically Certified Interactive Driving Repair

CARVE-Q propose une architecture de certification pour réparer les manœuvres de conduite autonome rejetées. Un algorithme quantique (Grover) réduit la recherche dans le treillis de réparation multi-agents de O(M) à O(√M) requêtes, tandis que l'autorité de sécurité reste classique. Validation sur 65 536 assignations avec 100% respect du droit de passage.

RaisonnementRobotiqueSécurité IA
SIG
72
HYP
15
arXiv cs.LG·

Modeling Nonlinear Feature Interactions with Product-Unit Residual Networks

Les chercheurs proposent PURe (Product-Unit Residual Networks), des réseaux intégrant des unités multiplicatives et connexions résiduelles pour modéliser explicitement les interactions non-linéaires entre features. Évaluation sur benchmarks synthétiques et données réelles montre meilleure robustesse au bruit, efficacité en régime low-data, et interprétabilité améliorée via SHAP comparé aux MLPs standards.

PapersRaisonnement
SIG
72
HYP
15
arXiv cs.AI·

Accelerated Fourier SAT (AFSAT): Fully Realising a GPU-based Symmetric Pseudo-Boolean SAT Solver

AFSAT est un solveur GPU pour la satisfiabilité pseudo-booléenne basé sur la recherche locale continue. Implémenté en JAX, il utilise la composition de fonctions pures, la vectorisation automatique et la compilation JIT pour paralléliser massivement la recherche sur des batches. Améliore stabilité numérique, performance et efficacité mémoire par rapport au prototype FastFourierSAT.

BenchmarksInfrastructurePapers
SIG
72
HYP
15
arXiv cs.AI·

OpenSkill: Open-World Self-Evolution for LLM Agents

OpenSkill propose un framework pour l'auto-évolution d'agents LLM en environnement ouvert, sans supervision de tâche cible. L'agent acquiert connaissances et signaux de vérification depuis documentation/web, synthétise des compétences transférables, et les affine via des tâches virtuelles auto-construites. Résultats sur 3 benchmarks montrent meilleure performance que baselines avec transfert cross-modèle.

Agents IAReinforcement learningPapers
SIG
72
HYP
28
arXiv cs.AI·

Workflow-to-Skill: Skill Creation via Routing-Workflow-Semantics-Attachments Decomposition

Papier arXiv proposant W2S, un framework pour construire automatiquement des Skills (procédures encodées) pour agents LLM à partir de traces d'interaction hétérogènes. Introduit RWSA, une représentation intermédiaire décomposant Skills en structure Workflow, Semantics et Attachments. Sur 70 Skills, W2S améliore la cohérence de rejeu comportemental de 10.5% vs baselines textuelles.

Agents IARaisonnementPapers
SIG
72
HYP
18
arXiv cs.AI·

Quantum-Inspired Trace-Augmented Evidence Selection for Reasoning over Structured Hypothesis Spaces

Les LLM échouent sur les tâches juridiques exigeant une sélection rigoureuse des preuves. EP-HUBO traite la sélection de fragments de raisonnement (CoT) comme un problème d'optimisation combinatoire binaire d'ordre supérieur, pondéré par pertinence/spécificité/distinctivité. Testé sur benchmarks légaux avec recuit simulé et hardware quantique Dirac-3.

RaisonnementBenchmarksPapers
SIG
72
HYP
15
arXiv cs.AI·

Hierarchical Semantic-Constrained Heterogeneous Graph for Audio-Visual Event Localization

Méthode HSCHG pour la localisation d'événements audio-visuels en vocabulaire ouvert. Construit un graphe hétérogène hiérarchique en espace euclidien avec nœuds de segments et vidéo, applique une fusion multi-modale sélective et projette les représentations en espace hyperbolique avec régularisation d'implication hiérarchique. Surpasse les méthodes existantes sur le benchmark OV-AVEL.

VisionVoixBenchmarks
SIG
72
HYP
15
arXiv cs.LG·

Gaussian Process Latent Factor Regression for Low-Data, High-Dimensional Output Problems

Nouvelle méthode GPLFR combinant processus gaussiens et décodage linéaire-gaussien pour prédire des sorties haute-dimensionnelle à partir de peu d'exemples. Marginalisation analytique des poids du décodeur couple compression et prédiction en un seul objectif. Application : premier émulateur spatialement résolu de modèles climatiques globaux pour exoplanètes rocheuses.

PapersBenchmarks
SIG
72
HYP
15
arXiv cs.CL·

Contrastive Training with LLM-generated Near-Misses for Robust Code-Switching Speech Recognition

Méthode de contrastive training pour améliorer la reconnaissance vocale en code-switching (alternance entre langues). Les auteurs identifient les régions critiques, génèrent des contre-exemples acoustiquement plausibles via LLM, puis affinent Whisper-small avec LoRA. Résultats : réduction >2% des erreurs sur CS-FLEURS et ViMedCSS.

VoixFine-tuningReinforcement learning
SIG
72
HYP
18
arXiv cs.AI·

SafeGene: Reusable Adapters for Transferable Safety Alignment

SafeGene propose des adaptateurs de sécurité réutilisables pour préserver l'alignement de sécurité lors du fine-tuning de LLMs open-weight. Le module découple la sécurité des mises à jour spécifiques aux tâches via des vecteurs de sécurité transférables et une recalibration par couche. Expériences sur plusieurs familles de modèles montrent réduction des réponses nuisibles sans perte de performance.

Sécurité IAAlignementFine-tuning
SIG
72
HYP
25
arXiv cs.AI·

Position: Don't Just "Fix it in Post": A Science of AI Must Study Training Dynamics

Article de position argumentant qu'une science rigoureuse de l'IA doit étudier les dynamiques d'entraînement plutôt que d'analyser les modèles post-hoc. Propose d'étendre les lois d'échelle au-delà de la perte pour prédire capacités, biais et comportements de sécurité. Examine progrès en interprétabilité mécaniste, équité et biais de simplicité.

PapersRaisonnementSécurité IA
SIG
72
HYP
18
Reddit r/LocalLLaMA·

Galaxy Z Fold6 as a local inference node — llama.cpp/Vulkan, homelab telemetry, SHA-256 model verification

Développeur crée Pocket Node, une app Android exécutant llama.cpp sur Galaxy Z Fold6. Charge SmolLM3 Q4_0 (1.1B params) via backend Vulkan, vérifie SHA-256 du modèle, expose API compatible OpenAI sur Tailscale, intègre monitoring homelab. Limites : contexte réduit, pas de RAG, thermique élevée en usage prolongé.

LlamaGénération de codeOpen source
SIG
72
HYP
18