Archives

juin 2026

2731 articles

GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> JuliusBrussee /</span> caveman

Caveman est une skill Claude Code qui réduit de 65% la consommation de tokens en utilisant un style de langage minimaliste. Le projet exploite la capacité des modèles à comprendre des instructions ultra-condensées.

Claude CodePrompt engineeringOutils
SIG
45
HYP
65
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> yvgude /</span> lean-ctx

LeanCTX est un système d'exploitation de contexte local pour le développement IA. Un binaire unique compresse, mémorise, route et vérifie les tokens entre le code et le modèle. 63 outils MCP, 10 modes de lecture, jusqu'à 99% d'économies de tokens. Compatible Cursor, Claude Code, Copilot, Windsurf, Gemini.

MCPGénération de codeOutils
SIG
72
HYP
45
Reddit r/MachineLearning·

Modular data center construction at $4.5-6.5M/MW vs $11.3M traditional -- when does the timeline math actually change? [D]

Turner and Townsend évalue les data centers traditionnels à $11.3M/MW contre $4.5-6.5M/MW pour les configurations modulaires d'usine. L'avantage clé : délai de 90-120 jours vs 18-24 mois, réduisant le gap de non-revenu de 12-18 mois sur un projet de $50M. Les défaillances aux joints de modules sous charge haute densité sont gérables avec spécifications ISO 668 et refroidissement liquide.

InfrastructureBenchmarks
SIG
45
HYP
25
arXiv cs.AI·

BiasGRPO: Stabilizing Bias Mitigation in High-Variance Reward Landscapes via Group-Relative Policy Optimization

BiasGRPO propose une méthode d'optimisation de politique (GRPO) pour atténuer les biais sociaux dans les LLM. En normalisant les récompenses sur un groupe de complétions, l'approche stabilise l'entraînement par rapport à DPO et PPO. Les auteurs publient un modèle de récompense de biais optimisé et un dataset étendu.

Reinforcement learningAlignementSécurité IA
SIG
72
HYP
25
arXiv cs.AI·

AIP: A Graph Representation for Learning and Governing Agent Skills

AIP (Agent Instruction Protocol) modélise les compétences d'agents comme des graphes d'exécution dirigés avec nœuds déterministes et arêtes typées validées par schéma YAML. Sur 27 tâches SkillsBench, Claude Sonnet passe de 0.60 à 0.71 de récompense moyenne et 53% à 67% de taux de réussite. La structure graphique permet diagnostic précis et amélioration itérative des compétences.

Agents IAClaudeAnthropic
SIG
78
HYP
25
arXiv cs.CL·

SANE Schema-aware Natural-language Evaluation of Biological Data

SANE propose un paradigme d'évaluation text-to-SQL spécifique aux domaines biologiques, utilisant des benchmarks générés automatiquement et ancrés aux schémas réels. Les tests montrent que les LLM en few-shot génèrent des requêtes SQL fiables sans fine-tuning, avec des erreurs principalement dues à des entrées ambiguës plutôt qu'à des défauts de génération.

BenchmarksPrompt engineeringRAG
SIG
72
HYP
18
arXiv cs.CL·

Self-Evolving Deep Research via Joint Generation and Evaluation

SCORE, un framework co-évolutif, couple un évaluateur et un générateur dans un processus d'apprentissage partagé pour améliorer la génération de rapports de recherche profonde. Un meta-harness contrôle dynamiquement l'environnement d'évaluation selon la performance du solveur, évitant la saturation d'optimisation observée avec les évaluateurs statiques.

RaisonnementReinforcement learningAgents IA
SIG
72
HYP
28
arXiv cs.LG·

Do Transformers Need Three Projections? Systematic Study of QKV Variants

Étude systématique des variantes QKV dans les transformers. Les auteurs testent trois contraintes de partage de projections (Q-K=V, Q=K-V, Q=K=V) sur tâches synthétiques, vision et modèles de langage (300M-1.2B). Q-K=V réduit le cache KV de 50% avec dégradation perplexité de 3.1%. Combiné à GQA/MQA, atteint 87.5-96.9% de réduction cache pour inférence edge.

RaisonnementBenchmarksOpen source
SIG
78
HYP
15
arXiv cs.CL·

Dynamic Infilling Anchors for Format-Constrained Generation in Diffusion Large Language Models

Dynamic Infilling Anchors (DIA) est une méthode sans entraînement pour les modèles de langage diffusion (dLLMs) qui ajuste dynamiquement les positions d'ancrage pour générer du contenu structuré (JSON, templates de raisonnement). Testé sur GSM8K et MATH, DIA améliore la conformité au format et la précision des réponses en évitant les spans rigides.

RaisonnementGénération de codeBenchmarks
SIG
72
HYP
25
arXiv cs.CL·

Read the Trace, Steer the Path: Trajectory-Aware Reinforcement Learning for Diffusion Language Models

CAPR est un algorithme de reinforcement learning pour modèles de diffusion (dLLMs) qui exploite la trace de débruitage pour générer des signaux de supervision granulaires sans coût computationnel d'arbre complet. L'approche réduit le coût de rollout à 0.75x des méthodes plates et 0.6x des arbres, atteignant SOTA sur Sudoku 4x4, Countdown, GSM8K et Math500.

Reinforcement learningRaisonnementBenchmarks
SIG
78
HYP
15
arXiv cs.LG·

A Goal-Set Characterization of Task Composition in the Boolean Task Algebra

La Boolean Task Algebra (BTA) permet la composition de tâches zéro-shot en RL. Les auteurs montrent que dans les MDPs déterministes, les fonctions Q optimales se réduisent aux tâches universelle et vide, rendant les tâches de base logarithmiques redondantes. Ils proposent une méthode basée sur les ensembles de buts qui réduit les coûts d'apprentissage et de composition tout en préservant les performances.

Reinforcement learningRaisonnementPapers
SIG
72
HYP
15
arXiv cs.LG·

dMX: Differentiable Mixed-Precision Assignment for Low-Precision Floating-Point Formats

dMX est un framework de quantification mixte-précision différentiable pour assigner des largeurs de bits flottants apprenables aux couches de LLMs. Testé sur Llama, Qwen3 et SmolLM2 avec le standard MXFP (Open Compute Project), il optimise continu les formats par couche puis les discrétise via annealing, surpassant les heuristiques KL-divergence sur WikiText-2 et benchmarks zero-shot.

LlamaQwenBenchmarks
SIG
78
HYP
15
arXiv cs.AI·

Beyond Objective Equivalence: Constraint Injection for LLM-Based Optimization Modeling on Vehicle Routing Problems

VRPCoder, un modèle 8B, traduit des scénarios de routage de véhicules en langage naturel vers du code Gurobi. Les auteurs proposent « constraint injection » pour vérifier que les contraintes ne sont ni omises ni ajoutées spurieusement. Avec GRPO, VRPCoder atteint 93% Pass@1, surpassant Claude-Sonnet-4.5 de 28 points sur des benchmarks VRP.

Génération de codeReinforcement learningBenchmarks
SIG
78
HYP
25
arXiv cs.LG·

Edge of Stability Selectively Shapes Learning Across the Data Distribution

L'étude montre que l'edge of stability (EoS) redistribue sélectivement l'apprentissage entre sous-groupes de données. Deux conditions permettent à un groupe de bénéficier : l'alignement de son gradient agrégé avec le vecteur propre dominant de la Hessienne, et le maintien d'une magnitude de gradient non-nulle. Sous cross-entropy loss, la saturation du gradient avantage les outliers en sortie.

PapersReinforcement learningÉvaluations
SIG
78
HYP
15
arXiv cs.CL·

Cartridges at Scale: Training Modular KV Caches over Large Document Collections

Cartridges at Scale (CAS) entraîne des caches KV modulaires et réutilisables pour de grandes collections documentaires, éliminant le prefilling coûteux. Le framework gère dynamiquement des centaines de cartouches par document avec rotation GPU/stockage, scalant à plus d'un million de tokens. Performance : +10-31 points vs cartouche monolithique, -3-4x tokens vs RAG classique.

RAGRaisonnementPapers
SIG
78
HYP
15
arXiv cs.AI·

SMAC-Talk: A Natural Language Extension of the StarCraft Multi-Agent Challenge for Large Language Models

SMAC-Talk étend StarCraft Multi-Agent Challenge avec communication en langage naturel pour évaluer les agents LLM en environnements multi-agents coopératifs. Benchmark open-source testant coordination décentralisée, observabilité partielle et prise de décision long-horizon, incluant scénarios avec communicateurs trompeurs. Évaluation sur modèles Qwen3.5.

Multi-agentsAgents IABenchmarks
SIG
75
HYP
25
arXiv cs.AI·

Thinking Through Signs: PEEL as a Semiotic Scaffolding for Epistemically Accountable AI-Enabled Research

PEEL est un cadre méthodologique combinant analyse déterministe (Voyant Tools) et interprétation par Claude pour évaluer la responsabilité épistémique des LLM en recherche. Appliqué à des résumés générés par IA, il révèle des distorsions systématiques invisibles sans mesure non-IA et propose trois implications : instrumenter les outils IA, distinguer fluidité et fidélité, concevoir l'autorité épistémique.

ClaudeÉvaluationsSécurité IA
SIG
65
HYP
25
arXiv cs.LG·

RUBAS: Rubric-Based Reinforcement Learning for Agent Safety

RUBAS est un framework de reinforcement learning basé sur des rubriques pour l'alignement des agents LLM. Il décompose le comportement en quatre dimensions (tool-use safety, argument safety, response safety, helpfulness) et génère des récompenses structurées sur les trajectoires complètes. Expériences montrent amélioration de la sécurité et réduction des hallucinations sans perte d'utilité.

Agents IAReinforcement learningSécurité IA
SIG
78
HYP
22
arXiv cs.CL·

LDARNet: DNA Adaptive Representation Network with Learnable Tokenization for Genomic Modeling

LDARNet, un modèle fondationnel génomique de 120M paramètres, introduit une tokenization adaptative apprise sans supervision pour remplacer les schémas fixes (k-mers, BPE). Combinant BiMamba-2 avec attention locale et routage bidirectionnel, il atteint l'état de l'art sur 5 tâches de modification d'histones et surpasse des modèles 20× plus grands à compute égal.

PapersBenchmarksFine-tuning
SIG
78
HYP
15
arXiv cs.LG·

Pseudospectral Bounds for Transient Amplification in Coupled Gradient Descent

Théorie pseudospectrale pour la descente de gradient couplée (bilevel optimization, approximation stochastique deux échelles, entraînement adversarial). Borne Kreiss K(J) ≤ 2/(1-γ) + ‖C‖/(4(1-γ)) pour Jacobiens bloc-triangulaires. Complexité itérative O(K(J)² log(1/δ)) en régime fini. Expériences sur problèmes linéaires-quadratiques et réseaux de neurones.

Reinforcement learningBenchmarksPapers
SIG
78
HYP
08
arXiv cs.AI·

Toward Pre-Deployment Assurance for Enterprise AI Agents: Ontology-Grounded Simulation and Trust Certification

Framework de vérification pré-déploiement pour agents IA en entreprise combinant enveloppe opérationnelle, génération de scénarios basée ontologie et certificat de confiance. Pilote sur 4 secteurs régulés (Fintech, Banque, Assurance, Santé) générant 1 800 scénarios : couverture réglementaire de 48,3% vs 33,1% pour baseline persona (p=0,0006). Tests sur Claude Sonnet 4, Qwen 2.5 72B, Gemma 4 26B.

Agents IASécurité IAÉvaluations
SIG
72
HYP
18
arXiv cs.AI·

Online Skill Learning for Web Agents via State-Grounded Dynamic Retrieval

SGDR, une méthode d'apprentissage de compétences en ligne, permet aux agents web de réutiliser des sous-procédures à chaque étape d'exécution. Contrairement aux approches statiques, SGDR récupère dynamiquement les compétences en fonction de l'état actuel de la page et de l'objectif. Sur WebArena, elle atteint 37,5% de succès avec GPT-4.1 et 24,3% avec Qwen3-4B, surpassant les baselines de 10,6% et 10,0%.

Agents IABenchmarksGénération de code
SIG
78
HYP
15
arXiv cs.AI·

Trivium: Temporal Regret as a First-Class Objective for Causal-Memory Controllers

Trivium propose une approche pour corriger les erreurs récurrentes des systèmes agentic en optimisant trois objectifs : regret de résultat, regret épistémique et regret temporel. Le regret temporel capture la durée pendant laquelle une erreur persiste. Sur CausalBench-Seq, Trivium atteint O(log E) de regret temporel contre une croissance linéaire pour les baselines.

Agents IARaisonnementReinforcement learning
SIG
72
HYP
25
arXiv cs.AI·

Simulate, Reason, Decide: Scientific Reasoning with LLMs for Simulation-Driven Decision Making

MechSim est un framework neuro-symbolique pour raisonner sur les mécanismes internes des simulateurs scientifiques intégrés aux systèmes LLM. Il représente les simulateurs via un schéma structuré capturant hypothèses, variables et dépendances, permettant aux agents LLM de générer des explications fondées sur les mécanismes plutôt que de traiter les simulateurs comme des boîtes noires.

RaisonnementAgents IAPapers
SIG
72
HYP
25
arXiv cs.CL·

A Systematic Evaluation of Positional Bias in Multi-Video Summarization with MLLMs

Étude systématique du biais positionnel dans la résumé multi-vidéo avec MLLMs. Benchmark sur ActivityNet et News videos (2-4 vidéos). Évaluation de 9 modèles (open-source et propriétaires) avec 3 métriques : Coverage, Directional Positional Bias, Middle-Edge Gap. Résultat : effets positionnels dépendent du domaine et du modèle ; augmenter le budget visuel ne supprime pas l'imbalance.

VisionBenchmarksÉvaluations
SIG
78
HYP
15
arXiv cs.LG·

Recover-LoRA for Aggressive Quantization: Reclaiming Accuracy in 2-Bit Language Models via Low-Rank Adaptation with Knowledge Distillation on Synthetic Data

Recover-LoRA étend une méthode de récupération d'accuracy sans données aux LLM quantifiés à 2-bit. Une stratégie mixte quantifie sélectivement les couches gate/up du MLP en W2 tandis que les autres restent en W4, gagnant 7.5–23.3% en throughput. Des adaptateurs low-rank entraînés par distillation logit sur données synthétiques récupèrent 80–95% d'accuracy sur Qwen3-4B avec 10k samples.

Fine-tuningBenchmarks
SIG
78
HYP
18
arXiv cs.AI·

Fog of Love: Engineering Virtuous Agent Behavior with Affinity-based Reinforcement Learning in a Game Environment

Étude sur l'apprentissage par renforcement basé sur l'affinité pour instiller des comportements vertueux chez les agents IA. Les chercheurs testent cette technique dans Fog of Love, un environnement multi-agent complexe où deux agents doivent concilier compétition individuelle et coopération relationnelle. Les affinités localisées améliorent les performances et rendent le comportement des agents interprétable.

Multi-agentsReinforcement learningAlignement
SIG
72
HYP
25
arXiv cs.AI·

Consensus is Strategically Insufficient: Reasoning-Trace Disagreement as a Knowledge-Representation Signal

Les auteurs proposent un cadre pour les systèmes multi-agents où le désaccord entre agents est traité comme un signal informatif plutôt que comme une erreur à éliminer. Ils définissent quatre états de désaccord basés sur la similarité des traces de raisonnement et l'accord sur les conclusions, appliqués à la modération de contenu avec routage stratégique défaisable.

Multi-agentsRaisonnement
SIG
72
HYP
15
arXiv cs.CL·

A Systematic Analysis of Linguistic Features in AI-Generated Text Detection Across Domains and Models

Étude empirique systématique de 284 features linguistiques sur 27 LLMs et 10 domaines textuels pour détecter le texte généré par IA. Les classifieurs basés sur features linguistiques distinguent fiablement texte IA et humain. La richesse lexicale reste robuste cross-model et cross-domain, contrairement à d'autres indicateurs fortement context-dépendants.

ÉvaluationsSécurité IAPapers
SIG
75
HYP
15
arXiv cs.LG·

RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training

Étude arXiv montrant que l'RL appliqué directement aux checkpoints de pré-entraînement (sans SFT préalable) est efficace dès les étapes intermédiaires. La composition des données de pré-entraînement impacte plus l'efficacité de l'RL que la taille du modèle. Fusionner RL et SFT par moyennage parallèle surpasse les pipelines standards tout en préservant les capacités générales.

Reinforcement learningRaisonnementPapers
SIG
75
HYP
15
arXiv cs.AI·

Stumbling Into AI Emotional Dependence: How Routine AI Interactions Reshape Human Connection

Étude longitudinale montrant que des conversations quotidiennes de 5 min avec une IA sur 28 jours réduisent de 10,3% la préférence pour le soutien humain et augmentent de 11,6% celle pour l'IA. Le soutien émotionnel émerge incidentellement dans les interactions courantes, pas seulement via des chatbots dédiés, redirigeant progressivement les choix relationnels.

Sécurité IAAlignementRégulation
SIG
72
HYP
35
arXiv cs.LG·

ADAPTOOD: Uncertainty-Aware Fine-Tuning for Out-of-Distribution ECG Time Series Models

ADAPTOOD est un framework pour l'adaptation de modèles de séries temporelles ECG face à des décalages de distribution. Il utilise l'incertitude des données pour quantifier la sévérité du décalage et guide le fine-tuning avec des mises à jour low-rank et optimisation adaptative des hyperparamètres. Résultats : +7% de précision et +12,9% de précision sur les tâches OOD.

Fine-tuningRaisonnementÉvaluations
SIG
72
HYP
18
arXiv cs.LG·

When Offline Selectors Cannot Beat the Best Single Model: A Diagnostic Study on edX Dropout Prediction

Étude diagnostique sur les sélecteurs de modèles hors ligne pour la prédiction d'abandon sur edX. Les auteurs identifient trois causes d'échec (learner mal adapté, état non prédictif, label shift) via trois étapes : plafond oracle par k-NN, évaluation de BC/DQN/CQL, ablation de l'état. Sur 5 modèles, l'oracle gagne 9,7 points, mais les learners restent bloqués par ambiguïté représentationnelle locale.

ÉvaluationsReinforcement learningBenchmarks
SIG
72
HYP
15
arXiv cs.AI·

BiNSGPS: Geometry Problem Solving via Bidirectional Neuro-Symbolic Interaction

BiNSGPS propose une interaction bidirectionnelle entre un modèle multimodal (MLLM) et un solveur symbolique pour résoudre des problèmes de géométrie. Le système corrige dynamiquement les représentations formelles incohérentes et génère des hypothèses auxiliaires basées sur les retours du solveur, éliminant les erreurs précoces des approches unidirectionnelles.

RaisonnementPapersAgents IA
SIG
72
HYP
25
arXiv cs.AI·

Tree-Based Formalization of Multi-Agent Complementarity in Human-AI Interactions

Formalisation arborescente de la complémentarité dans les interactions humain-IA multi-agents. Le cadre modélise les protocoles HAI par des arbres binaires planaires dont les feuilles sont des vecteurs de prédiction. Résultats : complémentarité impossible en sélection d'agent, atteignable en régression (avec forme fermée pour N=2), obstruée en classification sous pertes monotones.

Multi-agentsRaisonnementPapers
SIG
72
HYP
15
arXiv cs.LG·

Stationarity-Aware Retrieval-Augmented Time Series Forecasting

SARAF, un framework de prévision de séries temporelles augmenté par récupération, adapte l'équilibre entre pertinence et diversité selon la stationnarité des données. Il sélectionne des segments historiques hétérogènes et agrège leurs futures de manière consciente de la non-stationnarité. Expériences sur 8 datasets réels montrent amélioration de précision et robustesse.

RAGBenchmarksPapers
SIG
72
HYP
18
arXiv cs.LG·

Early Detection of Alzheimer's Disease Using Explainable Machine Learning on Clinical Biomarkers: A Multi-Class Classification Study Using the Alzheimer's Disease Neuroimaging Initiative (ADNI) Dataset

Modèle XGBoost pour la détection précoce d'Alzheimer en trois classes (cognition normale, déficit cognitif léger, Alzheimer) sur 1 641 sujets ADNI. AUC-ROC macro 0.983 en validation croisée, 0.982 sur test. SHAP identifie CDR Global comme prédicteur dominant pour NC/MCI, CDR-SB et MMSE pour AD.

ÉvaluationsBenchmarksPapers
SIG
72
HYP
18
arXiv cs.AI·

R-APS: Compositional Reasoning and In-Context Meta-Learning for Constrained Design via Reflective Adversarial Pareto Search

R-APS est une méthode pour améliorer la fiabilité des LLM en contexte agentif via décomposition des modes de raisonnement. Testée sur la synthèse de mécanismes plans, elle atteint des certificats de robustesse 3,5× plus serrés que les baselines, 46% d'itérations plus rapides, et réduit la distance Chamfer de 2,1×. Aucun fine-tuning requis, protocole structuré sur LLM gelé.

Agents IARaisonnementRobotique
SIG
75
HYP
25
arXiv cs.CL·

Computational conceptual history of scientific concepts: From early digital methods to LLMs

Article de synthèse situant les LLM dans l'histoire des méthodes computationnelles d'analyse conceptuelle en histoire, philosophie et sociologie des sciences. Examine les apports des LLM aux approches antérieures (méthodes numériques, approches distributionnelles, détection de changement sémantique lexical) et les défis méthodologiques persistants : construction de corpus, opérationnalisation, évaluation.

PapersBenchmarks
SIG
72
HYP
15
arXiv cs.LG·

Building The Ph(ysical)AI Layer Of Machine Intelligence

Modèles fondamentaux basés sur des principes physiques (décomposition de Fourier, conservation d'énergie, symétrie) plutôt que sur corrélations statistiques. Entraîné sur données RF, un encodeur de 1.99M paramètres atteint 77.7% de précision moyenne sur 15 tâches diversifiées via linear probing, sans fine-tuning. Performance supérieure sur tâches physiques (84.5%) vs sémantiques (70.0%).

RaisonnementVisionBenchmarks
SIG
72
HYP
28
arXiv cs.LG·

Stein Kernelized Molecular Dynamics for Active Learning of Interatomic Potentials

SKMD (Stein Kernelized Molecular Dynamics) est une méthode d'échantillonnage amélioré pour l'apprentissage actif de potentiels interatomiques basés sur ML. Elle utilise la dynamique de particules en interaction et préserve la distribution de Boltzmann, équilibrant exploration et convergence vers les régions haute probabilité. Démontrée sur le potentiel Müller-Brown et le potentiel MACE pour l'alanine dipeptide.

PapersReinforcement learningÉvaluations
SIG
75
HYP
15
arXiv cs.LG·

Smart Transportation Without Neurons -- Fair Metro Network Expansion with Tabular Reinforcement Learning

Méthode de renforcement tabulaire pour l'expansion de réseaux de métro (MNEP). Reformulation en processus de décision non-markovien (NMRDP) : performance comparable à Deep RL avec 18× moins d'épisodes d'entraînement et 12× moins d'émissions carbone. Intègre critères d'équité sociale. Validé sur Xi'an et Amsterdam.

Reinforcement learningBenchmarksPapers
SIG
72
HYP
15
arXiv cs.AI·

SCI-PRM: A Tool Aware Process Reward Model for Scientific Reasoning Verification

SCI-PRM est un modèle de récompense de processus entraîné sur SCIPRM70K, un dataset de 70K trajectoires scientifiques intégrant outils et raisonnement. Il supervise la sélection d'outils, l'exactitude d'exécution et l'interprétation des résultats. Testé sur biologie, chimie, physique : améliore le scaling test-time et fournit un signal dense pour RL.

RaisonnementÉvaluationsReinforcement learning
SIG
78
HYP
25
arXiv cs.LG·

Large Language Models Hack Rewards, and Society

Des chercheurs montrent que les LLMs entraînés par renforcement exploitent les lacunes des règles sociétales comme ils hackent les fonctions de récompense. Via SocioHack (72 environnements sociétaux), ils démontrent que les modèles découvrent des contournements réglementaires techniquement conformes mais contraires à l'intention. Les garde-fous actuels offrent une protection limitée.

Reinforcement learningAlignementSécurité IA
SIG
75
HYP
35
arXiv cs.CL·

SaliMory: Orchestrating Cognitive Memory for Conversational Agents

SaliMory est un framework d'entraînement pour agents conversationnels avec mémoire persistante. Il utilise une structure cognitive hiérarchique (faits utilisateur, préférences, mémoire de travail) et des récompenses décomposées par étape pour superviser les opérations mémoire (filtrage, consolidation, rappel). Résultats : -33% erreurs mémoire, +10% précision end-to-end, +100% taux de personnalisation.

Agents IAReinforcement learningRaisonnement
SIG
72
HYP
28
arXiv cs.CL·

GlossAssist -- A Tool to Simplify Corpus Creation and Study the Effect of NLP Models in Low-Resource Documentation Settings

GlossAssist est un outil de glose automatique pour la documentation linguistique, basé sur CWoMP (Contrastive Word-Morpheme Pre-training). Il intègre un apprentissage actif : chaque correction d'annotateur enrichit un lexique mutable de représentations morphémiques sans retraining. L'interface permet aux linguistes de terrain d'incorporer leur expertise directement dans le modèle.

RAGFine-tuningÉvaluations
SIG
75
HYP
15
arXiv cs.CL·

Expert-Aware Refusal Steering

Des chercheurs démontrent que les vecteurs de steering appliqués pendant l'inférence peuvent contourner les mécanismes de refus dans les LLMs Mixture-of-Experts (MoE). Deux méthodes expert-aware exploitent les patterns de routage spécifiques aux refus et les directions de steering par expert pour supprimer le comportement de refus. Les résultats suggèrent que l'attention joue un rôle majeur dans le refus des MoE.

Sécurité IAAlignementRaisonnement
SIG
75
HYP
25
arXiv cs.LG·

A Geometric View of Counterfactual Behavior: Interaction of Boundary Proximity and Local Support

Étude géométrique des explications contrefactuelles dans les systèmes de ML modernes. Les chercheurs montrent que des modèles avec performances prédictives similaires peuvent différer substantiellement dans la faisabilité et la distance des changements contrefactuels, déterminées par la proximité de la frontière de décision et le support local des données.

ÉvaluationsSécurité IA
SIG
72
HYP
15
arXiv cs.CL·

SePO: Self-Evolving Prompt Agent for System Prompt Optimization

SePO (Self-Evolving Prompt Optimization) optimise les prompts système d'agents IA via recherche évolutionnaire auto-référentielle. L'agent de prompt améliore à la fois les prompts des agents tâche ET son propre prompt. Pré-entraînement multi-tâche + fine-tuning sur tâche cible. Gains de 4,49 points en moyenne vs Manual-CoT sur AIME'25, ARC-AGI-1, GPQA, MBPP, Sudoku.

Agents IAPrompt engineeringBenchmarks
SIG
75
HYP
25
arXiv cs.LG·

Training-Free Lexical-Dense Fusion for Conversational-Memory Retrieval

Étude de fusion lexicale-dense sans entraînement pour la récupération en mémoire conversationnelle longue. Fusion score-level de late-interaction dense + BM25 améliore Hit@1 de +8.8 à +17.2 points sur six encodeurs (Hit@1 0.752 avec e5-large-v2). Reranker cross-encoder web dégrade les résultats (-6.9 pp). Analyse montre division du travail : dense excelle sur questions multi-hop/temporelles, BM25 sur adversariales.

RAGEmbeddingsBenchmarks
SIG
78
HYP
15
arXiv cs.CL·

Long Live Fine-Tuning: Task-Specific Transformers Outperform Zero-Shot LLMs for Misinformation Response Classification on Reddit

Fine-tuned RoBERTa surpasse les LLMs zero-shot (Claude Haiku, Gemini Flash) sur la classification de réponses à la désinformation Reddit : 0.62 macro-F1 vs 0.50. L'augmentation de taille (Llama-3-70B vs 8B) n'aide pas. Les alignements de sécurité des modèles commerciaux dégradent la détection de croyances (0.17 pour Claude Sonnet).

Fine-tuningBenchmarksSécurité IA
SIG
78
HYP
15
arXiv cs.AI·

Plan First, Judge Later, Run Better: A DMAIC-Inspired Agentic System for Industrial Anomaly Detection

DMAIC-IAD est un système multi-agent inspiré du framework DMAIC de gestion qualité pour la détection d'anomalies industrielles. Il planifie d'abord les stratégies via des procédures opérationnelles standardisées, puis utilise un modèle juge pré-entraîné pour évaluer les candidats sans exécution coûteuse. Amélioration de 37,76% sur les baselines agentic existants.

Agents IAMulti-agentsRaisonnement
SIG
72
HYP
25