Archives

juin 2026

2731 articles

Reddit r/LocalLLaMA·

Semantic distance as routing layer: an on-device, serverless alternative to the central-index model

Prototype décentralisé utilisant des embeddings locaux (EmbeddingGemma-300M) pour remplacer les index centralisés. Les appareils communiquent en peer-to-peer, classent les contenus par distance sémantique (cosine similarity) sans serveur ni ranking global. Extension proposée aux agents IA découvrant mutuellement leurs besoins/offres par proximité sémantique.

EmbeddingsAgents IAOpen source
SIG
45
HYP
35
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> addyosmani /</span> agent-skills

Agent-skills : framework open-source pour équiper les agents IA de compétences d'ingénierie production. Dépôt GitHub visant à standardiser les capacités des agents de codage.

Agents IAGénération de codeOpen source
SIG
45
HYP
35
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> x1xhlol /</span> system-prompts-and-models-of-ai-tools

Dépôt GitHub compilant les system prompts et modèles internes de 25+ outils IA (Claude Code, Cursor, Devin AI, Perplexity, Replit, v0, etc.). Inclut aussi des outils open-source. Ressource pour reverse-engineer les instructions système des assistants populaires.

Claude CodeGénération de codePrompt engineering
SIG
45
HYP
55
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> Ataraxy-Labs /</span> sem

Ataraxy-Labs/sem : contrôle de version sémantique au-dessus de git avec diffs au niveau entité, blame et analyse d'impact. Support de 26 langages via tree-sitter. Conçu pour les agents de code.

Agents IAGénération de codeOutils
SIG
72
HYP
25
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> cube-js /</span> cube

Cube Core est une couche sémantique open-source pour l'IA, le BI et l'analytics embarquée. Le projet gagne en popularité sur GitHub Trending.

Open sourceInfrastructureRAG
SIG
45
HYP
35
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> chroma-core /</span> chroma

Chroma est une infrastructure de recherche vectorielle pour applications IA. Le projet GitHub trending propose des outils de stockage et requête de vecteurs d'embeddings pour RAG et systèmes basés sur des modèles de langage.

Recherche vectorielleEmbeddingsRAG
SIG
65
HYP
25
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> luongnv89 /</span> asm

Asm est un gestionnaire de compétences universel pour agents IA de codage. Le projet GitHub propose une infrastructure pour orchestrer et gérer les capacités des agents autonomes.

Agents IAGénération de codeOutils
SIG
35
HYP
45
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> wonderwhy-er /</span> DesktopCommanderMCP

DesktopCommanderMCP est un serveur MCP pour Claude offrant le contrôle du terminal, la recherche dans le système de fichiers et l'édition de fichiers avec diff.

ClaudeMCPOutils
SIG
65
HYP
20
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> wanshuiyin /</span> Auto-claude-code-research-in-sleep

ARIS (Auto-Research-In-Sleep) : framework léger basé Markdown pour recherche ML autonome. Boucles de révision cross-modèles, découverte d'idées et automatisation d'expériences. Compatible Claude Code, Codex, OpenClaw et tout agent LLM.

Claude CodeAgents IAMulti-agents
SIG
45
HYP
55
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> anthropics /</span> claude-code-security-review

Action GitHub utilisant Claude pour analyser automatiquement les changements de code et détecter les vulnérabilités de sécurité.

ClaudeGénération de codeOutils
SIG
65
HYP
25
Reddit r/LocalLLaMA·

Still a VERY lightweight open web-search tool for smaller local LLMs - now with SearXNG support

TinySearch v0.2.0 (première bêta stable) remplace DuckDuckGo par SearXNG comme backend de recherche par défaut. Cet outil MCP/FastAPI léger pour petits LLMs locaux crawle quelques pages, les chunke et reranke pour fournir un contexte compressé (max 8k tokens) aux agents, évitant de surcharger le prompt avec du contenu inutile. Testé avec Qwen 3.5-9B.

Open sourceMCPAgents IA
SIG
72
HYP
25
arXiv cs.AI·

Online Agent-as-a-Judge: Situation-Generating Evaluation for Interactive Agents

Nouvelle méthode d'évaluation pour agents sociaux IA : un agent évaluateur interagit activement avec l'agent cible pour générer des situations spécifiques testant des critères sociaux (gestion de conflits, etc.). Testé sur 32 critères dans un environnement de simulation de vie, améliore la couverture et l'accord avec les labels humains par rapport aux méthodes passives.

Agents IAÉvaluationsMulti-agents
SIG
72
HYP
18
arXiv cs.AI·

Stress-testing medical large language models reveals latent safety pathology beyond benchmark accuracy

AI-MASLD, un framework d'audit de stress, évalue 7 LLMs médicaux sur 240 cas cliniques avec perturbations narratives. Tous performent bien en baseline, mais divergent sous stress réaliste. Les modèles quantifiés masquent l'effondrement fonctionnel ; le fine-tuning médical dégrade stabilité logique et équité. Un modèle open-weight égale les alternatives propriétaires sur tous les critères de sécurité.

BenchmarksSécurité IAÉvaluations
SIG
78
HYP
15
arXiv cs.AI·

EditSR: Enhancing Neural Symbolic Regression via Edit-based Rectification

EditSR propose un framework deux couches pour la régression symbolique neurale. Une première couche génère des expressions via décodage autorégressif, une deuxième couche (Rectifier) corrige les erreurs syntaxiques par édition pas-à-pas. Le Rectifier est préentraîné pour maintenir l'efficacité sans relancer la recherche globale. Gains significatifs sur expressions complexes.

RaisonnementGénération de codePapers
SIG
72
HYP
18
arXiv cs.CL·

ThinkBooster: A Unified Framework for Seamless Test-Time Scaling of LLM Reasoning

ThinkBooster est un framework unifié pour le scaling du calcul au test-time (TTC) des modèles de raisonnement. Il intègre une librairie Python modulaire, un benchmark évaluant performance et efficacité computationnelle, et un service proxy compatible OpenAI. Résultats sur tâches mathématiques et de codage montrent les trade-offs performance-coût des stratégies TTC.

RaisonnementBenchmarksGénération de code
SIG
78
HYP
25
arXiv cs.AI·

Overcoming the Regulatory Bottleneck via Agent-to-Agent Protocols: A Nuclear Case Study

Un protocole de communication agent-à-agent (RCP) automatise les échanges entre régulateurs et demandeurs dans l'examen des réacteurs nucléaires avancés. Testé sur 1 236 documents de la NRC, il réduit les coûts de 50-77% (21-44M USD vs 89M USD) et les délais de 65% (15 mois vs 42 mois). Applicable à d'autres secteurs réglementés, les économies potentielles atteindraient 210-330 milliards USD/an.

Agents IAMulti-agentsMCP
SIG
78
HYP
35
arXiv cs.AI·

Land cover and flood type govern the detection limits of satellite-based flood mapping across diverse global flood events

Prithvi-EO-2.0, un modèle géospatial fondationnel, testé sur 19 événements de crue (2017-2025) à travers 6 continents. Précision variable selon le type de couverture terrestre : cultures 52% IoU, zones arborées 4%. Détection riveraine forte (F1=0.69). 23 modes de défaillance identifiés, l'ingénierie du pipeline domine les erreurs initiales.

VisionBenchmarksPapers
SIG
78
HYP
15
arXiv cs.AI·

PathoSage: Towards Multi-Source Evidence Adjudication in Pathology via Experience-Aware Agentic Workflow

PathoSage est un framework à trois étapes pour le raisonnement multimodal en pathologie computationnelle. Il sépare explicitement la récupération de connaissances, la collecte de preuves et l'adjudication des preuves via un système de délibération structurée. Un système Beta-Bernoulli sans entraînement modélise la fiabilité des outils pour réduire les hallucinations et les biais d'ancrage.

Agents IAMulti-agentsVision
SIG
72
HYP
28
arXiv cs.AI·

MemToolAgent overview with a simple restaurant booking scenario where the agent retrieves similar memories, receives feedback on an invalid time format, and generates a reflection to update its memory

MemToolAgent améliore l'utilisation d'outils par les agents LLM via un système de mémoire structuré. Le framework extrait des expériences passées en entrées mémoire, les récupère dynamiquement et génère des réflexions basées sur les retours utilisateur. Gains de 29%, 80% et 17% sur WorkBench, NESTFUL et PEToolBench sans fine-tuning.

Agents IAOutilsBenchmarks
SIG
72
HYP
28
arXiv cs.AI·

Some hypotheses on how chatbots work in problem-solving-driven conversations. Large Language Models as confirmation of the Innovation Illusion

Article théorique sur les limites cognitives des chatbots dans la résolution de problèmes. Les auteurs argumentent que les LLM encodent des « propagations métaphoriques » artificielles issues des données d'entraînement, incapables de reproduire la compréhension humaine. Conclusion : l'amélioration des LLM ne permettra pas aux chatbots de devenir des partenaires de réflexion équivalents aux humains.

RaisonnementPapers
SIG
35
HYP
25
arXiv cs.LG·

Contribution Weights: A Geometrical Analysis of Self-Attention Transformers

Nouvelle métrique « Contribution Weights » pour analyser les transformers au-delà des poids d'attention. Intègre magnitude des vecteurs de valeur et alignement directionnel. Surpasse les métriques basées sur l'attention pour identifier les tokens critiques. Révèle que les « attention sinks » jouent un rôle actif de suppression d'information, stabilisant les représentations.

RaisonnementÉvaluationsPapers
SIG
72
HYP
18
arXiv cs.LG·

Sample-Efficient Post-Training for LEGO Spatial-Physics Reasoning

Les LLM pour la génération d'assemblages LEGO souffrent du problème PhysHack : structures physiquement valides mais géométriquement mal alignées. Les auteurs proposent PVPO, une méthode RL sample-efficient couplant faisabilité physique et récompenses géométriques en voxel-space. Résultats : amélioration de l'alignement sémantique, stabilité structurelle et calibration.

RaisonnementReinforcement learningPapers
SIG
72
HYP
15
arXiv cs.LG·

DiffoR: A Unified Continuous Generative Framework for Universal Ordinal Regression

DiffOR propose un nouveau paradigme pour la régression ordinale en la formulant comme une tâche de génération continue. Le framework utilise des modèles de diffusion pour récupérer des valeurs ordinales via débruitage itératif, avec une stratégie de double découplage (agrégation multi-échelle et perception dynamique du débruitage) pour préserver la topologie ordinale. Validé sur 12 benchmarks.

PapersBenchmarksRaisonnement
SIG
72
HYP
28
arXiv cs.LG·

Shortcuts in the Tail: Debiasing via Post-Hoc Spectral Compression of Fine-Tuning Updates

Une méthode post-hoc réduit les biais de fine-tuning en tronquant la queue de la décomposition SVD des mises à jour de poids (ΔW). Testée sur 3 modèles (0.5B–7B) et 4 benchmarks, elle diminue l'écart de performance sur groupes sous-représentés jusqu'à 5× (CivilComments) avec <2pp de perte d'accuracy, sans retraining ni labels de groupe.

Fine-tuningAlignementSécurité IA
SIG
72
HYP
15
arXiv cs.LG·

MST-Direct at Scale: Multivariate and Conditional Geostatistical Simulation via Sinkhorn Optimal Transport

MST-Direct étendu à grande échelle pour simulation géostatistique multivariée et conditionnelle via transport optimal de Sinkhorn. Résout scalabilité (O(nC) mémoire), extension multivariée et conditionnement par kriging. Validation sur 6 variables, grilles 200×200 et 100×100 avec 200 données observées. Reproduit distribution jointe exactement vs approximation PPMT.

PapersBenchmarks
SIG
72
HYP
08
arXiv cs.LG·

Enabling KV Caching of Shared Prefix for Diffusion Language Models

Les modèles de diffusion de langage (DLMs) utilisent l'attention bidirectionnelle, ce qui invalide les techniques de cache KV classiques pour les préfixes partagés. Les chercheurs proposent bicache, une méthode qui identifie dynamiquement la profondeur de couche sûre pour réutiliser les KVs des préfixes partagés. Résultat : 36–98% d'amélioration du débit sans effondrement d'accuracy.

RaisonnementBenchmarksInfrastructure
SIG
78
HYP
15
arXiv cs.LG·

STARIXNet: Multivariate and Multi-attribute Deep Learning Approach to Real-Time Resource Allocation in Cloud Platforms

STARIXNet est un réseau de neurones léger pour l'allocation de ressources en temps réel dans les clouds. Il capture les relations spatio-temporelles entre plusieurs métriques système (saisonnalité, tendance, auto-régression, variables exogènes) et priorise la stabilité des services avant la précision de prédiction. Déployé chez Walmart, il génère 10-50% d'économies.

InfrastructureBenchmarksGénération de code
SIG
75
HYP
25
arXiv cs.LG·

Offline Reinforcement Learning for Plasma Control in Nuclear Fusion: Codebase and Benchmark

RL4F est un benchmark open-source d'apprentissage par renforcement hors-ligne pour le contrôle du plasma dans la fusion nucléaire. Basé sur des données historiques du tokamak DIII-D, il évalue des méthodes imitation learning et offline RL sur quatre tâches de suivi multi-actuateurs (rotation, densité, température, pression). Les méthodes offline model-based RL obtiennent les meilleures performances moyennes.

Reinforcement learningBenchmarksOpen source
SIG
82
HYP
15
arXiv cs.LG·

HASA: Subnet Allocation for Compute-Constrained Model-Heterogeneous Federated Learning

HASA propose une allocation de sous-réseaux pour l'apprentissage fédéré hétérogène en ressources et données. La méthode assigne les largeurs de sous-réseaux selon des scores d'hétérogénéité calculés à partir des données locales, sous contrainte de budget de calcul fixe. Sur prédiction de titre (7 clients), HASA améliore la précision moyenne de 13,82% à 14,32% et renforce la performance des clients les plus faibles.

Benchmarks
SIG
72
HYP
15
arXiv cs.LG·

Query Lens: Interpreting Sparse Key-Value Features with Indirect Effects

Query Lens étend Logit Lens pour interpréter les features des autoencodeurs creux en analysant conjointement les clés (encoder) et valeurs (decoder). La méthode capture les effets indirects via les modules aval, révélant des signatures de tokens cohérentes pour des features opaques sous Logit Lens. Hypothèse : les modules aval lisent les features via des sous-espaces spécifiques par couche.

ÉvaluationsPapersRaisonnement
SIG
72
HYP
18
arXiv cs.LG·

Structured Neuron Pruning in Deep Neural Networks Using Multi-Armed Bandits

Cadre de pruning structuré utilisant des algorithmes de bandits multi-bras (MAB) pour supprimer des neurones complets dans les réseaux de neurones profonds. Évalue UCB1, Thompson Sampling, Epsilon-Greedy et autres politiques sur tâches de classification, régression et apprentissage profond. UCB1 et Thompson Sampling surpassent le pruning basé sur la magnitude et le modèle non élagué.

BenchmarksPapers
SIG
72
HYP
15
arXiv cs.LG·

Measuring Poverty and Inequality with Reduced Data: A Machine Learning Approach Using Nigerian Household Data

Étude appliquant Random Forest Recursive Feature Elimination aux données d'enquête ménagère nigériane (2018/19) pour identifier les prédicteurs minimaux de pauvreté, quintiles de bien-être et inégalités. RF-RFE atteint 90% de précision pour la pauvreté avec 5 variables de revenu, 80% pour quintiles saisonniers. Les méthodes ML réduisent les besoins en données tout en conservant l'information distributionnelle.

BenchmarksPapers
SIG
72
HYP
15
arXiv cs.LG·

LEAF: Growing Trees Without Branching for Speech-Aware Large Language Model Post-Training

LEAF est une méthode RL basée sur des arbres rétrospectifs pour l'entraînement post-training de LLM conscients de la parole. Elle améliore l'attribution de crédit en groupant les réponses par préfixes partagés et assignant des avantages au niveau des spans. LEAF surpasse GRPO sur les benchmarks de question-réponse et traduction vocale.

Reinforcement learningRaisonnementVoix
SIG
75
HYP
15
arXiv cs.LG·

QDSP: An Interpretable Structured Learning Framework for Predicting Death or Cerebral Palsy in Very Low Birth Weight Infants

QDSP est un framework d'apprentissage structuré pour prédire la mortalité ou paralysie cérébrale chez les nourrissons de très faible poids à la naissance. Sur une cohorte de 51 patients, il atteint 92% d'accuracy et 0.9714 AUC, surpassant XGBoost, TabNet et TabPFN. L'interprétabilité via SHAP identifie des prédicteurs cliniques pertinents comme la leucomalacie périventriculaire kystique.

BenchmarksÉvaluationsSécurité IA
SIG
72
HYP
15
arXiv cs.LG·

Reachability and asymptotics of Gaussian Transformer dynamics

Étude théorique formalisent la propagation de données dans les Transformers comme système de contrôle non-linéaire. Pour le modèle mean-field avec self-attention et couches feed-forward affines, les distributions gaussiennes restent gaussiennes. Cela réduit la dynamique à un système de contrôle bilinéaire fini gouvernant moyenne et covariance, reliant l'expressivité des Transformers à des équations de Riccati.

PapersRaisonnementBenchmarks
SIG
78
HYP
15
arXiv cs.LG·

A Topological Characterization of Graph Neural Networks via Stochastic Block Model Embeddings on the n-Sphere

Framework topologique pour comparer les GNNs entraînés en mappant les Stochastic Block Models sur la sphère n-dimensionnelle. Utilise la compacité de l'espace graphon, le lemme de régularité faible de Frieze-Kannan et la continuité Lipschitz des MPNNs. Produit une « empreinte » de faible dimension pour la recherche de candidats de transfer-learning sans réentraînement.

BenchmarksPapers
SIG
72
HYP
15
arXiv cs.LG·

Repetition Mismatch: Why Data Mixture Experiments Don't Scale and How to Fix Them

Les expériences de mélange de données pré-entraînement échouent souvent lors du passage à l'échelle car le taux de répétition des données de haute qualité change avec le budget de tokens. Une procédure de sous-échantillonnage contrôlant la répétition permet de récupérer le mélange optimal avec 1/16 des tokens cibles (757M paramètres), réduisant l'erreur de 0.75 à 0.05.

BenchmarksPapers
SIG
78
HYP
15
arXiv cs.LG·

UNIQ: Conformal Calibration for Adaptive Conservatism in Offline Reinforcement Learning

UNIQ introduit une calibration conforme pour adapter la conservatisme dans l'apprentissage par renforcement hors ligne. Basé sur IQL, la méthode utilise un ensemble multi-expectile et la prédiction conforme pour estimer l'incertitude sans distribution, ajustant dynamiquement la pénalité selon la couverture locale des données. Sur D4RL MuJoCo, UNIQ surpasse IQL avec 10× moins de mémoire qu'EDAC.

Reinforcement learningPapersBenchmarks
SIG
78
HYP
15
arXiv cs.LG·

The Routing Plateau: Understanding and Breaking the Accuracy Limits of LLM Routers

Étude de 21 méthodes de routage LLM sur 5 benchmarks révélant un plateau d'accuracy : la plupart convergent vers une performance similaire loin de l'oracle. Le goulot d'étranglement provient d'une prédictibilité insuffisante — les routeurs apprennent des tendances globales plutôt que des signaux spécifiques par requête. Datasets plus larges, encodeurs plus forts et fine-tuning bout-à-bout améliorent les résultats.

Agents IABenchmarksÉvaluations
SIG
78
HYP
15
arXiv cs.LG·

Training-Inference Kernel Contracts: Bounding Divergence in Post-Training and Deployment

Article théorique proposant des « contrats de kernel » pour borner la divergence entre les kernels d'entraînement et d'inférence en post-training. Framework spécifiant les écarts acceptables en précision finie, avec clauses numériques, statistiques et de routage. Dérive des bornes de dérive logit à distance de variation totale et applique à l'RL.

Reinforcement learningPapersAlignement
SIG
45
HYP
15
arXiv cs.LG·

When Should an AI Scientist Stop? Verifiable Experiment Steering and Refusal for Autonomous Discovery

CARTOGRAPH est une couche de vérification pour scientifiques IA autonomes, combinant sélection d'expériences, fermeture d'ambiguïté et détection d'insuffisance de bibliothèque. Sur cinq benchmarks, CARTOGRAPH-A surpasse la projection brute (129W/0T/15L, p<10^-21). Le système refuse correctement 4/4 réclamations jugées inconcluses en réanalyse manuelle du système A-Lab.

Agents IARaisonnementÉvaluations
SIG
78
HYP
15
arXiv cs.LG·

Emergence via Phase Transitions: Mechanism Landscapes and Universal Convergence Across Complex Systems

Framework mathématique (HEF) modélisant l'émergence comme transition de phase dans un paysage de mécanismes. Étude empirique sur 111 expériences de grokking dans transformers : convergence vers 0.9745±0.014 indépendamment de l'initialisation, pic de norme des poids avant grokking dans 92% des cas, courbes d'accuracy s'effondrant sur tanh (R²=0.93).

PapersRaisonnementBenchmarks
SIG
72
HYP
28
arXiv cs.LG·

SPIN: Decentralized Swarm Control via Tensorized Policy Coordination

SPIN est un framework de coordination décentralisée pour essaims multi-agents sur plateformes edge. Il modélise les topologies d'essaim comme réseaux tensoriels compressés, réduisant la complexité de O(n^m) à O(m·n·χ²). Une pipeline neuro-symbolique hybride combine encodeurs de coordination neuraux pré-entraînés hors ligne avec filtres de rééchantillonnage zéro-shot basés sur la dérivée de Radon-Nikodým.

Multi-agentsReinforcement learningRaisonnement
SIG
72
HYP
18