Page 71 sur 192

ToutHaut signalRécent
7679 articles
Reddit r/LocalLLaMA·

An Implementation of NanoQuant: A flexible binary quantization method

NanoQuant est une méthode de quantification post-entraînement qui compresse les modèles transformers denses à 1-bit et sub-1-bit par poids. L'implémentation utilise une factorisation en matrices binaires avec vecteurs d'échelle, permettant des ratios de compression jusqu'à 16x sur matrices f16. Une étape de fine-tuning est nécessaire pour aligner les sorties quantifiées.

Open sourcePapersFine-tuning
SIG
72
HYP
25
Reddit r/LocalLLaMA·

Been watching real adversarial input hit my detection API for six months. Here's what's actually landing.

Analyse de 6 mois d'attaques réelles contre une API de détection d'injections de prompts (Bordair). Trois patterns dominent : configurations multi-tours invisibles isolément, exploitation du momentum conversationnel, et redéfinition de rôles exploitant l'utilité du modèle. Les classifieurs single-message échouent systématiquement. Défenses stateful recommandées.

Prompt engineeringSécurité IAAgents IA
SIG
72
HYP
28
arXiv cs.AI·

StainFlow: Entity-Stain Tracking and Evidence Linking for Process Rewards in GUI Agents

StainFlow est un modèle de récompense de processus pour agents GUI basé sur le suivi d'entités (« stain tracking »). Il décompose objectivement les tâches en phases via l'évolution des états d'entités visuelles, et construit dynamiquement des fenêtres de preuve pour évaluer les étapes clés. Résultats : +3,2% de succès RL et +1,8% de précision sur AndroidWorld et OGRBench.

Agents IAReinforcement learningÉvaluations
SIG
72
HYP
18
arXiv cs.AI·

Declarative Skills for AI Agents in Knowledge-Grounded Tool-Use Workflows

Étude comparative de trois paradigmes d'orchestration pour agents IA en workflows de service client : agents déclaratifs (skills en langage naturel), agents impératifs (machines d'état), et baseline non-scaffoldé. Tests sur 5 LLMs et 2 régimes de retrieval. Résultat : la qualité du retrieval est le goulot dominant ; les skills déclaratifs améliorent la précision sur tâches procédurales quand le retrieval est bon.

Agents IARAGPrompt engineering
SIG
72
HYP
18
arXiv cs.AI·

Exploring Agentic Tool-Calling Decisions via Uncertainty-Aligned Reinforcement Learning

TRUST, une méthode de reinforcement learning, améliore les décisions d'appel d'outils des agents LLM en intégrant la quantification d'incertitude dans la conception des récompenses. Testée sur plusieurs benchmarks, elle réduit les invocations d'outils non supportées et les hallucinations tout en maintenant des estimations d'incertitude fiables.

Agents IAReinforcement learningRaisonnement
SIG
72
HYP
18
arXiv cs.AI·

Teaching the Way, Not the Answer: Privileged Tutoring Distillation for Multimodal Policy Optimization

PTD-PO, un framework de distillation de politique pour optimiser les modèles vision-langage (2B-8B paramètres) via renforcement. Fournit une supervision dense au niveau des tokens sans exposer la réponse, utilisant des indices structurés (attention spatiale, étapes de raisonnement) et une divergence Jensen-Shannon Top-K pour stabiliser l'apprentissage.

VisionReinforcement learningRaisonnement
SIG
72
HYP
18
arXiv cs.AI·

Beyond Post-hoc Explanation: Toward Glassbox AI via Probabilistic Mediation

Article proposant une architecture « Glassbox » pour rendre les LLM transparents dans les contextes institutionnels critiques (santé, droit, administration). Au lieu d'explications post-hoc instables, utiliser des réseaux bayésiens comme couches de médiation ante-hoc pour encoder la connaissance de domaine, les hypothèses causales et les dépendances probabilistes avant l'inférence.

RaisonnementSécurité IAAlignement
SIG
72
HYP
25
arXiv cs.AI·

The Sim-to-Real Gap of Foundation Model Agents: A Unified MDP Perspective

Les agents basés sur des modèles de fondation souffrent d'un écart sim-to-réel. Cet article formalise le problème via le cadre MDP (observation, action, transition, récompense) et propose d'adapter les solutions classiques de la robotique (randomisation de domaine). Exemple : l'appel d'outils multilingue révèle des écarts d'espace d'observation causant des actions invalides malgré une intention sémantique correcte.

Agents IARaisonnementSécurité IA
SIG
72
HYP
28
arXiv cs.AI·

Trading Engagement for Sustainability: Carbon-Aware Re-ranking for E-commerce Recommendations

Étude sur les systèmes de recommandation e-commerce intégrant l'empreinte carbone des produits. Les chercheurs estiment les PCF manquantes via recherche sémantique et prompting LLM, puis appliquent un re-ranking post-hoc sur BPR, NeuMF et LightGCN. Sur Amazon Reviews (3 catégories), des réductions carbone substantielles sont possibles avec coût d'engagement minimal.

RAGEmbeddings
SIG
72
HYP
18
arXiv cs.AI·

Human Adults and LLMs as Scientists: Who Benefits from Active Exploration?

Étude comparative montrant que l'exploration active améliore significativement le raisonnement causal conjonctif chez les adultes humains, contrairement aux paradigmes passifs. Les LLMs modernes atteignent des performances proches des humains en précision d'inférence, mais avec des stratégies d'exploration moins efficaces et des écarts conjonctif-disjonctif similaires.

RaisonnementÉvaluations
SIG
72
HYP
15
arXiv cs.CL·

The Dark Regulome: Disentangling Predictability from Regulation in Genomic Foundation Models

Étude des fondations génomiques pour identifier les éléments régulateurs du génome non-codant (dark regulome) dans les gliomes. Les auteurs séparent la prédictibilité de séquence de la régulation réelle via résidualisation-permutation sur trois modèles (Caduceus-Ph, HyenaDNA, Enformer). Résultat : horizon régulateur proximal de 10kb, enrichissement 3.3× en eQTL cérébraux, mais hiérarchie LM non reproductible.

BenchmarksPapersRaisonnement
SIG
72
HYP
15
arXiv cs.CL·

Progress-SQL: Improving Reinforcement Learning for Text-to-SQL via Progressive Rewards

Progress-SQL propose un cadre d'apprentissage par renforcement multi-tour pour la génération Text-to-SQL. La méthode introduit un arbre de diagnostic guidé par oracle (ODT) qui abstrait les requêtes SQL au niveau des clauses et fournit des récompenses progressives mesurant l'amélioration du SQL initial au final. Évaluée sur BIRD, Spider et variantes robustesse.

Reinforcement learningGénération de codeRaisonnement
SIG
72
HYP
18
arXiv cs.AI·

A Geometric Gaussian Mixture Representation of Plane Curves

Représentation probabiliste de courbes planes via mélange gaussien. Les auteurs proposent une approximation polygonale avec incertitude normale, transformée en modèle de mélange gaussien (GMM) qui préserve la géométrie locale. Applicable aux courbes lisses, fermées, ouvertes et auto-intersectantes, avec applications en CAO incertaine, modélisation d'obstacles robotiques et planification de trajectoires.

PapersRobotiqueRaisonnement
SIG
72
HYP
15
arXiv cs.LG·

FAIR-Calib: Frontier-Aware Instability-Reweighted Calibration for Post-Training Quantization of Diffusion Large Language Models

FAIR-Calib propose une méthode de quantification post-entraînement (PTQ) pour les modèles de langage diffusifs (dLLMs). Le framework en deux étapes protège les décisions fragiles à la frontière d'écriture en pondérant les états cachés instables, sans rollouts diffusion coûteux. Résultats sur LLaDA et Dream (W4A4) montrent réduction des erreurs de quantification.

LlamaFine-tuningPapers
SIG
72
HYP
15
arXiv cs.CL·

Quantifying Media Representation Dynamics Across 25 Years of News Reporting on Policing-related Deaths

Analyse computationnelle de 4 000 articles canadiens sur les décès liés à la police (25 ans). Le modèle PerspectiveGap révèle que les perspectives de bureaucrates d'État apparaissent 3× plus que celles du public (familles, témoins, avocats). Les comptes rendus officiels sont cliniques ; les discours civils chargés émotionnellement. La représentation civile augmente récemment.

PapersBenchmarks
SIG
72
HYP
15
arXiv cs.LG·

Flatland: The Adventures of Gradient Descent with Large Step Sizes

Article théorique sur la convergence de la descente de gradient avec grands pas d'apprentissage. Les auteurs définissent formellement les « grands » pas en ne requérant que la continuité locale de Lipschitz du gradient, conçoivent des méthodes adaptatives du premier ordre qui opèrent à la limite de stabilité dès le début, et montrent que rechercher la platitude globale trop tôt ralentit la convergence.

Reinforcement learningRaisonnement
SIG
72
HYP
15
arXiv cs.LG·

Performance Variation in Deep Reinforcement Learning

Étude sur la variabilité des performances en apprentissage par renforcement profond. Les auteurs critiquent les méthodes conventionnelles de mesure d'incertitude et proposent des statistiques basées sur les percentiles (min-max IPR). Trois cas d'étude : LayerNorm réduit la variation dans PPO mais pas SAC ; TD-MPC2 montre moins de variation que PPO/SAC ; DQN et Rainbow présentent une variabilité similaire sur Atari.

Reinforcement learningBenchmarksÉvaluations
SIG
72
HYP
15
arXiv cs.CL·

When Better Codebooks Are Not Enough: Predictive Performance and Behavioral Reliability in LLM Political Event Coding

Étude sur le codage d'événements politiques avec LLM : une meilleure précision ne garantit pas la fiabilité comportementale. Des codebooks experts optimisés (définitions claires, exemples, contexte) améliorent les performances, mais les modèles échouent les tests de fiabilité sous variations contrôlées (noms de labels, ordre, mappings). La précision seule ne suffit pas pour les applications en sciences sociales.

ÉvaluationsRaisonnementPrompt engineering
SIG
72
HYP
15
arXiv cs.CL·

CAF-Gen: A Multi-Agent System for Enriching Argumentation Structures

CAF-Gen est un système multi-agent qui enrichit les structures argumentatives extraites du texte en modèles conformes au Carneades Argumentation Framework (CAF). Un agent créateur génère des structures enrichies validées par un agent critique dans une boucle itérative, améliorant la qualité et la stabilité structurelle par rapport aux modèles génératifs mono-pass.

Multi-agentsRaisonnementPapers
SIG
72
HYP
28
arXiv cs.CL·

Evidence Graph Consistency in Retrieval-Augmented Generation: A Model-Dependent Analysis of Hallucination Detection

Nouvelle méthode Evidence Graph Consistency (EGC) pour détecter les hallucinations dans les systèmes RAG. Testée sur 5,767 réponses de 6 LLMs (Llama-2, GPT-4, GPT-3.5, Mistral-7B), elle révèle que la cohérence structurelle des graphes d'évidence fonctionne inversement selon les familles de modèles, invalidant son usage comme signal universel.

RAGBenchmarksPapers
SIG
72
HYP
18
arXiv cs.CL·

Explain Like I'm 5 or Whatever I Choose: Evaluating the Interactive Potential of Language Model Responses

Étude d'évaluation de LLMs (GPT-5.1, GPT-5 mini, Claude Sonnet 4.5 + Thinking, DeepSeek-V3.1) sur leur capacité à générer plusieurs réponses à une même requête scientifique en variant la complexité du langage. Sur 98 requêtes, Claude Sonnet 4.5 ne maintient une complexité cohérente que 46% du temps. Framework d'évaluation basé sur étude formative avec 16 participants.

ÉvaluationsClaudeGPT
SIG
72
HYP
25