Archives

juin 2026

2731 articles

arXiv cs.AI·

Neetyabhas: A Framework for Uncertainty-Aware Public Policy Optimization in Rational Agent-Based Models

Neetyabhas propose un cadre de simulation multi-agents pour optimiser les politiques de santé publique face aux incertitudes. Le modèle intègre 1 000 agents individuels (décisions de masquage, vaccination, déplacements) et des décideurs politiques utilisant des agents RL hiérarchiques (DQN, DDPG, TD3). Les résultats montrent que masquage et vaccination réduisent significativement pic et durée épidémique.

Agents IAMulti-agentsReinforcement learning
SIG
65
HYP
25
arXiv cs.AI·

Scaling Self-Evolving Agents via Parametric Memory

TMEM introduit un cadre de mémoire paramétrique auto-évolutive pour agents LLM. Au lieu de stocker l'expérience uniquement en contexte textuel, l'agent absorbe la supervision dans des poids LoRA légers (Δ_t) via des mises à jour en ligne, modifiant son comportement au sein d'un même épisode. Évalué sur LoCoMo, LongMemEval-S et CL-Bench, TMEM surpasse les baselines basées sur résumés et récupération.

Agents IAFine-tuningReinforcement learning
SIG
78
HYP
25
arXiv cs.AI·

Cascading Hallucination in Agentic RAG: The CHARM Framework for Detection and Mitigation

CHARM détecte et mitigue les hallucinations en cascade dans les pipelines RAG multi-étapes, où les erreurs précoces se propagent et s'amplifient. Framework avec 4 composants (vérification factuelle, cohérence cross-stage, monitoring de confiance, résolution). 89.4% de taux de détection sur HotpotQA/MuSiQue/2WikiMultiHopQA, réduction d'erreurs de 82.1%.

RAGAgents IARaisonnement
SIG
78
HYP
25
arXiv cs.LG·

TPA-AD: A Two-Stage Pseudo Anomaly-Guided Method for Bearing Time-Series Anomaly Detection

TPA-AD propose une méthode deux étapes pour détecter les anomalies dans les séries temporelles de roulements. Elle génère des pseudo-anomalies près de la frontière normale via un modèle de reconstruction, puis apprend des représentations sensibles aux anomalies par apprentissage contrastif et scoring KNN. Testée sur des données de roulements et 13 benchmarks publics.

BenchmarksPapers
SIG
72
HYP
15
arXiv cs.CL·

POLARIS: Guiding Small Models to Write Long Stories

POLARIS est une méthode d'optimisation par renforcement (GRPO) pour améliorer la génération de textes longs par petits modèles. Appliquée à Qwen3.5-9B avec 1.4K paires prompt-histoire et 4 GPU A100, elle utilise un juge LLM frontier et l'injection de références humaines. POLARIS-9B rivalise avec des modèles 3× plus grands et généralise à des histoires 3× plus longues que l'entraînement.

QwenReinforcement learningFine-tuning
SIG
78
HYP
25
arXiv cs.AI·

Exploring Cross-Scenario Generality of Agentic Memory Systems: Diagnostics and a Strong Baseline

Étude comparative de 8 systèmes de mémoire pour agents LLM sur 5 scénarios (QA single-turn, chat multi-session, trajectoires agentic, stress tests, tâches long-horizon). AutoMEM, un harness avec interface d'outils auto-gérée, obtient la meilleure généralisation cross-scénario en donnant au agent le contrôle actif du stockage/récupération.

Agents IARaisonnementBenchmarks
SIG
75
HYP
20
arXiv cs.CL·

Noisy memory encoding explains negative polarity illusions

Une étude arXiv explique les « illusions de polarité négative » — où des phrases grammaticalement incorrectes sont jugées acceptables — par un encodage imparfait de la mémoire. Les chercheurs montrent que les locuteurs confondent les déterminants dans les propositions enchâssées, ce qui licencie à tort le mot « ever ». Six paires de déterminants testées confirment que la similarité augmente l'effet d'illusion.

PapersRaisonnement
SIG
72
HYP
15
arXiv cs.LG·

LiftQuant: Continuous Bit-Width LLM via Dimensional Lifting and Projection

LiftQuant propose une quantification à bit-width continu pour les LLM via un mécanisme « lift-then-project » qui projette un treillis 1-bit depuis un espace de dimension supérieure. Le bit-width effectif est contrôlé par le ratio des dimensions, permettant un ajustement quasi-continu. Un modèle 70B compressé à 2.4 bits sur 24GB GPU surpasse les modèles 2-bit existants.

BenchmarksOpen source
SIG
78
HYP
25
arXiv cs.CL·

Listening to the Workforce: Measuring Construction Worker Safety Attitudes from Social Media Discourse Using LLMs

Étude arXiv validant un cadre d'analyse (CSAF) pour mesurer les attitudes de sécurité des ouvriers du bâtiment via leurs discussions Reddit. Un classificateur LLM atteint κ=0.90 sur 450 posts r/Construction et κ=0.89 sur 400 posts r/Roofing, puis analyse 10 346 contributions pour identifier les dimensions d'attitudes par thème de sécurité.

RAGÉvaluationsBenchmarks
SIG
72
HYP
15
arXiv cs.CL·

Learning What to Learn: Stage-Specific Data Sets for SFT-then-RL in Small Language Model Reasoning

Cadre d'entraînement SFT-puis-RL pour petits modèles de langage : SFT acquiert les compétences de raisonnement non maîtrisées, RL les consolide. Mécanisme Bridge transforme les traces de raisonnement brutes en supervision apprenante. Critique Fine-Tuning convertit les échecs en supervision diagnostique. Améliorations consistantes sur cinq benchmarks de raisonnement.

Fine-tuningReinforcement learningRaisonnement
SIG
75
HYP
15
arXiv cs.AI·

AgentJet: A Flexible Swarm Training Framework for Agentic Reinforcement Learning

AgentJet est un framework distribué pour l'entraînement par renforcement d'agents LLM. Son architecture découplée sépare les nœuds serveur (optimisation GPU) des nœuds client (exécution agents). Elle supporte l'RL multi-modèles hétérogènes, l'entraînement multi-tâches, la tolérance aux pannes et l'itération de code en direct. Un module de suivi de contexte avec fusion de timeline accélère l'entraînement de 1,5-10x.

Agents IAMulti-agentsReinforcement learning
SIG
75
HYP
25
arXiv cs.CL·

SparDA: Sparse Decoupled Attention for Efficient Long-Context LLM Inference

SparDA introduit une architecture d'attention clairsemée découplée pour l'inférence LLM sur contextes longs. Une quatrième projection par couche (Forecast) prédit les blocs KV nécessaires à la couche suivante, chevauchant le préchargement CPU-GPU avec l'exécution courante. Sur modèles 8B, SparDA atteint 1.25× speedup prefill et 1.7× speedup decode, jusqu'à 5.3× throughput decode supérieur.

RaisonnementInfrastructureBenchmarks
SIG
82
HYP
15
arXiv cs.CL·

GENEB: Why Genomic Models Are Hard to Compare

GENEB est un benchmark diagnostic à grande échelle évaluant 40 modèles fondamentaux génomiques sur 100 tâches dans 13 catégories fonctionnelles sous un protocole unifié. L'analyse révèle que les classements agrégés sont instables : les rangs varient fortement entre catégories, l'échelle offre des gains modestes et inconsistants, et l'alignement architectural surpasse souvent le nombre de paramètres.

BenchmarksPapersÉvaluations
SIG
78
HYP
15
arXiv cs.CL·

MM-BizRAG: Rethinking Multimodal Retrieval-Augmented Generation for General Purpose Enterprise Q&A

MM-BizRAG améliore la génération augmentée par récupération multimodale pour les documents d'entreprise complexes. Le système extrait explicitement la structure des documents via des pipelines d'ingestion orientés (parsing pour rapports verticaux, représentations page-entière pour présentations), puis assemble les contextes multimodaux à l'inférence. Gains jusqu'à 32% sur SlideVQA et FinRAGBench-V sans fine-tuning.

RAGVisionBenchmarks
SIG
78
HYP
25
arXiv cs.AI·

The Digital Apprentice: A Framework for Human-Directed Agentic AI Development

Le Digital Apprentice est un framework pour l'IA agentive qui calibre l'autonomie progressivement selon des preuves empiriques. L'agent internalise la méthodologie tacite d'un humain superviseur, escalade les niveaux d'autonomie par compétence, et corrige la dérive d'alignement en temps réel. Trois piliers : capture de méthodologie, autorisation avec escalade explicite, alignement continu.

Agents IAAlignementSécurité IA
SIG
72
HYP
28
arXiv cs.AI·

What Type of Inference is Active Inference?

Article théorique sur l'inférence active : démontre que la minimisation de l'Expected Free Energy (EFE) peut se réécrire comme minimisation de la Variational Free Energy (VFE) avec corrections d'entropie explicites. Propose une caractérisation variationnelle complète de la planification basée sur l'EFE et un schéma de passage de messages. Validation sur trois environnements grid-world.

RaisonnementReinforcement learningPapers
SIG
72
HYP
15
Reddit r/MachineLearning·

How are production ML systems typically handling distribution shift over time? [D]

Discussion sur la gestion de la dérive de distribution dans les systèmes ML en production. Les approches couvertes incluent le réentraînement continu (intervalles fixes ou déclenché), la surveillance en ligne de la dérive, les modèles fantômes et l'examen humain. L'auteur note que les contraintes opérationnelles dominent souvent les décisions techniques.

ÉvaluationsInfrastructure
SIG
35
HYP
15
The Decoder·

Trump's new executive order wants AI companies to voluntarily submit models for government safety reviews

Un décret exécutif de la Maison-Blanche demande aux agences fédérales (Pentagon, CISA) de renforcer la cyberdéfense avec l'IA en 30 jours. Les développeurs d'IA peuvent soumettre volontairement leurs modèles à des tests de sécurité, mais le décret exclut explicitement l'approbation obligatoire. Le caractère réellement volontaire reste incertain.

RégulationSécurité IABusiness
SIG
55
HYP
35
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> aquasecurity /</span> trivy

Trivy est un scanner de sécurité open-source qui détecte les vulnérabilités, configurations erronées, secrets et génère des SBOM dans les conteneurs, Kubernetes, dépôts de code et environnements cloud.

Open sourceSécurité IAInfrastructure
SIG
75
HYP
15
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> opendataloader-project /</span> opendataloader-pdf

OpenDataLoader-PDF est un parseur open-source conçu pour extraire des données de PDF en format prêt pour l'IA. Automatise l'accessibilité des documents PDF.

Open sourceOutilsRAG
SIG
45
HYP
25
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> lyogavin /</span> airllm

AirLLM permet l'inférence de modèles 70B sur une GPU 4GB unique via une technique de streaming et partitionnement des poids. Le projet GitHub montre une implémentation open-source réduisant drastiquement les besoins en mémoire GPU.

Open sourceInfrastructureLlama
SIG
75
HYP
35
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> graykode /</span> abtop

Outil de monitoring en temps réel pour agents IA de codage. Affiche sessions Claude Code & Codex CLI, tokens, fenêtre de contexte, limites de débit et ports. Interface inspirée de htop.

Claude CodeAgents IAOutils
SIG
65
HYP
25
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> aaif-goose /</span> goose

Goose est un agent IA open-source extensible qui dépasse les simples suggestions de code. Il peut installer, exécuter, éditer et tester avec n'importe quel LLM.

Agents IAGénération de codeOpen source
SIG
65
HYP
35
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> BoundaryML /</span> baml

BAML est un framework d'ingénierie pour la gestion structurée des prompts. Compatible Python, TypeScript, Ruby, Java, C#, Rust, Go. Vise à professionnaliser le prompt engineering avec des outils d'engineering robustes.

Prompt engineeringOutilsOpen source
SIG
65
HYP
35
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> NVIDIA-NeMo /</span> Gym

NVIDIA-NeMo/Gym est un framework pour évaluer et améliorer les modèles et agents dans des environnements contrôlés. Outil open-source destiné aux benchmarks et tests de performance.

Open sourceÉvaluationsAgents IA
SIG
45
HYP
25
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> 0x4m4 /</span> hexstrike-ai

HexStrike AI MCP Agents est un serveur MCP permettant aux agents IA (Claude, GPT, Copilot) d'exécuter autonomement 150+ outils de cybersécurité pour le pentesting automatisé, la découverte de vulnérabilités et la recherche en sécurité.

MCPAgents IAClaude
SIG
65
HYP
45
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> datawhalechina /</span> hello-agents

Tutoriel open-source chinois sur la construction d'agents IA de zéro. Couvre principes fondamentaux et implémentation pratique des systèmes multi-agents.

Agents IAMulti-agentsOpen source
SIG
45
HYP
25
Reddit r/MachineLearning·

TorchDAE: Implicit DAE Solvers with Index Reduction and Adjoint Sensitivity [P]

TorchDAE est une bibliothèque PyTorch pour résoudre les équations différentielles-algébriques (DAE) avec accélération GPU. Elle implémente l'intégration Generalized-Alpha, la réduction d'index par dérivées fictives, et les méthodes de sensibilité adjointe pour DAE. Cible : identification de systèmes, apprentissage scientifique et modélisation physique.

Open sourceOutilsInfrastructure
SIG
65
HYP
25