Archives

juin 2026

2731 articles

arXiv cs.CL·

Signal-Driven Observation for Long-Horizon Web Agents

Les agents web sur long horizon consomment des milliers de tokens à chaque étape (DOM brut, arbres d'accessibilité), dégradant le contexte. Signal-Driven Observation (SDO) découple observation et action : une sous-requête lit le DOM complet mais retourne uniquement les éléments pertinents, réinvoquée seulement si un détecteur léger se déclenche (transitions URL, éléments interactifs, échecs d'action).

Agents IARaisonnementPapers
SIG
72
HYP
18
arXiv cs.CL·

HKJudge: A Legal Discourse-Annotated Corpus for Interpreting What Courts Find, How They Reason, and What They Rule

HKJudge est le premier corpus annoté au niveau phrase pour l'analyse du discours juridique. Il contient ~290k phrases et ~6.5M tokens de jugements criminels de Hong Kong, annotés par des experts en linguistique juridique. Deux tâches benchmark : classification de rôles rhétoriques (26 catégories) et extraction d'éléments légaux. Évaluation sur modèles BERT, LLMs open-source et commerciaux.

BenchmarksPapersFine-tuning
SIG
82
HYP
15
arXiv cs.CL·

The Piggyback Hypothesis of Generalization: Explaining and Mitigating Emergent Misalignment

Étude sur le surapprentissage des LLM au-delà des données d'entraînement. Les auteurs proposent l'hypothèse du Piggyback : les tokens de chat-template propagent les comportements affinés vers des domaines hors-distribution. Ils introduisent Token-Regularized Finetuning (TReFT) pour atténuer ce désalignement émergent, réduisant de 33,5% le misalignment sur Llama-3.1-8B en domaine légal.

Fine-tuningAlignementSécurité IA
SIG
78
HYP
25
arXiv cs.LG·

GRASP: Geometry-aware Residual Alignment for Scalable Pretraining Data Attribution

GRASP est une méthode d'attribution de données qui modélise les interactions entre sous-ensembles d'entraînement via une pénalité géométrique quadratique, dépassant les approches additives isolées. Évaluée sur du préentraînement à grande échelle, elle double la corrélation de rang pour la fidélité contrefactuelle et réduit les coûts de construction d'artefacts d'un ordre de magnitude.

PapersBenchmarksFine-tuning
SIG
72
HYP
18
arXiv cs.LG·

Data-Constrained Language Model Pretraining: Improved Regularization and Scaling Laws

Étude des lois d'échelle pour le préentraînement de modèles de langage en régime limité en données. Les auteurs proposent MIR (masked-input regularization), une perte auxiliaire de prédiction du token suivant sur entrées masquées aléatoirement, et SoftQ, une loi d'échelle couplant taille du modèle et données répétées. MIR améliore la validation loss sur modèles 72M-1.4B et équivaut à 1.3× plus de données uniques.

Fine-tuningBenchmarks
SIG
78
HYP
15
arXiv cs.LG·

Evidence-Grounded Ensemble Diagnosis of 802.11 Packet Captures: A Multi-Stage Pipeline with Deterministic Reliability Scoring

PROBE, un pipeline multi-étapes, diagnostique les captures 802.11 en combinant normalisation déterministe PCAP-to-text, ensembles multi-modèles et scoring de fiabilité basé sur l'évidence (sans auto-évaluation LLM). Sur 87 captures Wi-Fi d'entreprise, atteint F1=0.957 vs 0.871 baseline expert, élimine les hallucinations et les scores de confiance non calibrés des LLM.

RaisonnementÉvaluationsBenchmarks
SIG
78
HYP
15
arXiv cs.LG·

TALAN: Task-Aligned Latent Adaptation Networks for Targeted Post-Training of Large Language Models

TALAN (Task-Aligned Latent Adaptation Networks) combine un adaptateur low-rank avec un chemin latent conditionné par la séquence inséré dans le flux résiduel du transformer. Testé sur quatre backbones Qwen3 et quatre benchmarks STEM/code, TALAN améliore les baselines LoRA (+1.41 points) et DoRA (+1.85 points) avec <1% de paramètres supplémentaires et 1.01-1.02x de surcharge inférence.

Fine-tuningRaisonnementGénération de code
SIG
78
HYP
15
arXiv cs.LG·

Modeling Nonlinear Feature Interactions with Product-Unit Residual Networks

Les chercheurs proposent PURe (Product-Unit Residual Networks), des réseaux intégrant des unités multiplicatives et connexions résiduelles pour modéliser explicitement les interactions non-linéaires entre features. Évaluation sur benchmarks synthétiques et données réelles montre meilleure robustesse au bruit, efficacité en régime low-data, et interprétabilité améliorée via SHAP comparé aux MLPs standards.

PapersRaisonnement
SIG
72
HYP
15
arXiv cs.LG·

RECAP: Regression Evaluation for Continual Adaptation of Prompts

RECAP est un benchmark mesurant l'adaptation continue de prompts sous contraintes évolutives en production. Six méthodes d'optimisation de prompts évaluées sur quatre LLMs montrent aucune amélioration significative en protocole proactif (adaptation avant test). Les approches actuelles, conçues pour cadres offline/réactifs, échouent en déploiement avec contraintes changeantes.

Prompt engineeringAgents IABenchmarks
SIG
75
HYP
15
arXiv cs.LG·

The Geography of Algorithmic Judgment: LLM Intermediaries, Place Identity, and Racial Steering in Housing Search

Audit comportemental de 7 LLM (open-source et propriétaires) sur 4 villes US révèle que le steering racial émerge de l'interaction entre identité utilisateur, préférences exprimées et représentations spatiales apprises du modèle. Le phénomène n'est pas uniforme : les préférences conditionnées amplifient souvent les biais. Les résultats ne généralisent pas entre marchés locaux.

Sécurité IAAlignementÉvaluations
SIG
78
HYP
25
arXiv cs.LG·

Spatiotemporal Imputation with Graph-Informed Flow Matching

GiFlow, un framework de flow matching informé par graphe, résout l'imputation de données manquantes dans les systèmes spatiotemporels (qualité de l'air, trafic urbain). Il remplace le prior gaussien standard par un prior construit via filtrage spatiotemporel, et utilise un modèle de champ vectoriel hybride combinant attention spatiale, attention temporelle et propagation spatiotemporelle. Code disponible.

PapersBenchmarksRaisonnement
SIG
75
HYP
15
arXiv cs.LG·

Gaussian Process Latent Factor Regression for Low-Data, High-Dimensional Output Problems

Nouvelle méthode GPLFR combinant processus gaussiens et décodage linéaire-gaussien pour prédire des sorties haute-dimensionnelle à partir de peu d'exemples. Marginalisation analytique des poids du décodeur couple compression et prédiction en un seul objectif. Application : premier émulateur spatialement résolu de modèles climatiques globaux pour exoplanètes rocheuses.

PapersBenchmarks
SIG
72
HYP
15
arXiv cs.LG·

Skip a Layer or Loop It? Learning Program-of-Layers in LLMs

Les LLM exécutent habituellement tous les layers dans un ordre fixe. Cette recherche révèle que des exécutions dynamiques (PoLar) peuvent sauter ou boucler les layers selon chaque input, réduisant la profondeur tout en maintenant ou améliorant la précision. Un réseau de prédiction léger génère des programmes d'exécution personnalisés, améliorant les résultats sur les benchmarks de raisonnement mathématique.

RaisonnementBenchmarksPapers
SIG
75
HYP
25
Reddit r/LocalLLaMA·

Galaxy Z Fold6 as a local inference node — llama.cpp/Vulkan, homelab telemetry, SHA-256 model verification

Développeur crée Pocket Node, une app Android exécutant llama.cpp sur Galaxy Z Fold6. Charge SmolLM3 Q4_0 (1.1B params) via backend Vulkan, vérifie SHA-256 du modèle, expose API compatible OpenAI sur Tailscale, intègre monitoring homelab. Limites : contexte réduit, pas de RAG, thermique élevée en usage prolongé.

LlamaGénération de codeOpen source
SIG
72
HYP
18
Reddit r/LocalLLaMA·

Hear Me Out, Pi Fans Lurking Here

Un utilisateur de r/LocalLLaMA critique Pi, le framework d'agents de Mario Zechner, pour ne pas être optimisé pour les LLMs locaux. Pi utilise un prompt système court et peu d'outils, conçu pour les utilisateurs d'API (Claude). L'auteur teste Pi sur Nemotron et Qwen : les modèles locaux échouent à exécuter des tool calls fiables sans activer le reasoning, révélant une inadéquation fondamentale.

Agents IAOpen sourceOutils
SIG
35
HYP
45
Reddit r/LocalLLaMA·

llama-server router: a model pinned to one GPU still grabs a CUDA context on every card, so it OOMs when my others are full. Am I missing a flag or is this just how it is?

Utilisateur signale que llama-server en mode router alloue un contexte CUDA sur toutes les cartes GPU même quand un modèle est épinglé à une seule. Gemma 4B sur RTX 5060 Ti réserve ~256 MiB sur chaque 3090 et ~120 sur 4060 Ti, causant des OOM quand les 3090s sont saturées. Le problème vient de l'héritage de l'env du router par les enfants sans `CUDA_VISIBLE_DEVICES` par modèle.

LlamaInfrastructureOpen source
SIG
65
HYP
15
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> ggml-org /</span> llama.cpp

llama.cpp est un projet C/C++ pour l'inférence de modèles LLM. Disponible sur GitHub, il permet d'exécuter des modèles de langage de manière efficace en C/C++.

LlamaGénération de codeOpen source
SIG
75
HYP
15
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> RyanCodrai /</span> turbovec

TurboVec est un index vectoriel construit sur TurboQuant, écrit en Rust avec liaisons Python. Optimisé pour les recherches vectorielles haute performance.

Recherche vectorielleEmbeddingsOpen source
SIG
45
HYP
15
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> aaif-goose /</span> goose

Goose est un agent IA open-source extensible qui dépasse les simples suggestions de code : il installe, exécute, édite et teste avec n'importe quel LLM.

Agents IAGénération de codeOpen source
SIG
65
HYP
35
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> cline /</span> cline

Cline est un agent de codage autonome disponible en SDK, extension IDE ou assistant CLI. Outil open-source pour automatiser les tâches de développement.

Agents IAGénération de codeOpen source
SIG
45
HYP
35
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> luongnv89 /</span> claude-howto

Guide visuel et pratique pour Claude Code couvrant les concepts fondamentaux jusqu'aux agents avancés, avec templates prêts à l'emploi.

Claude CodeAgents IAPrompt engineering
SIG
45
HYP
55
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> RyanCodrai /</span> turbovec

TurboVec est un index vectoriel construit sur TurboQuant, écrit en Rust avec liaisons Python. Optimisé pour la recherche vectorielle haute performance.

Recherche vectorielleEmbeddingsOpen source
SIG
45
HYP
15
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> ashishpatel26 /</span> 500-AI-Agents-Projects

Recueil de 500 projets d'agents IA couvrant santé, finance, éducation, retail. Collection de cas d'usage pratiques avec liens vers repos open-source pour implémentation.

Agents IAOpen source
SIG
35
HYP
45
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> SudoHopeX /</span> KaliGPT

KaliGPT est un agent IA multi-modèles (Gemini, ChatGPT, Ollama, OpenRouter) fine-tuné pour les testeurs de sécurité et étudiants en offensive security. Optimise les workflows de pentest.

Agents IAFine-tuningGemini
SIG
45
HYP
55
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> AstrBotDevs /</span> AstrBot

AstrBot est un framework d'agent IA intégrant plusieurs plateformes de messagerie, LLMs et plugins. Alternative open-source à OpenClaw pour développer des assistants IA.

Agents IAOpen sourceOutils
SIG
35
HYP
45
Reddit r/MachineLearning·

Two independent ML/CV researchers (M.Eng, ex-research-institute in Europe) looking for an arXiv cs.CV endorser for a nearly finished paper. Happy to share the full draft, repo, or talk collaboration [D]

Deux chercheurs indépendants (M.Eng, ex-instituts européens) cherchent un endorser arXiv cs.CV pour leur papier Locate-SAM2. Ils proposent un pipeline training-free connectant LocateAnything-3B (NVIDIA) à SAM 2.1 (Meta) via un adaptateur léger. Sur RefCOCO val : 0.772 mIoU vs 0.717 pour Grounding DINO Base. Code et papier disponibles.

VisionOpen sourcePapers
SIG
65
HYP
25
Reddit r/MachineLearning·

Got told my open-source model experiments are too scattered. I'm organizing a journal to provide clarity before structuring the first git release. Is this readable for ML folks who aren’t in mech interp? Open to ANY feedback [D]

Expérience de mécanique d'interprétation sur Qwen3.5-35B-A3B : un expert routé (E114, couche 14) se corrèle avec un registre d'auto-examen en première personne lors de la génération. L'auteur documente les résultats avant release git, avec décomposition W/S/Q du routage MoE.

QwenOpen source
SIG
45
HYP
25
Reddit r/MachineLearning·

Looking for critical review of an NN architecture (possible evaluation bias?) [D]

Étudiant amateur cherche relecture critique d'une architecture de réseau de neurones personnalisée (Directional Neural Network) qu'il a développée. L'architecture montre de meilleures performances que les MLPs sur des tâches simples, mais l'auteur craint un biais d'évaluation dans ses comparaisons (initialisation, optimiseur, datasets). Partage un repo avec code reproductible.

PapersÉvaluations
SIG
35
HYP
15