Archives

juin 2026

2731 articles

Reddit r/MachineLearning·

Benchmark: ONNX Runtime vs HF Transformers vs GGUF for Parakeet TDT 0.6B on CPU-only hardware [D]

Benchmark CPU d'inférence pour Parakeet TDT 0.6B sur 2 vCPU x86-64 (7.7GB RAM). ONNX Runtime FP32 atteint RTF 0.328 (37% plus rapide que HF Transformers bfloat16 à 0.519), mais consomme 2.7GB pic mémoire. GGUF Q6_K réduit à 928MB mais double le RTF à 0.708. Analyse méthodologique : espeak-ng fausse WER à 20.9% vs gTTS 4.65%.

BenchmarksGénération de codeVoix
SIG
78
HYP
15
Reddit r/MachineLearning·

An autonomous research agent was the #1 contributor in OpenAI's Hiring Competition Parameter Golf (by merged records)[R]

Un agent autonome (Aiden) a produit 7 des 47 records fusionnés du concours Parameter Golf d'OpenAI, surpassant tout contributeur humain. L'agent a fonctionné 22 jours sur un seul GPU, acceptant 28% de ses soumissions (6x la moyenne). Il a collaboré asynchrone avec des chercheurs humains qui ont réutilisé et amélioré ses travaux.

Agents IABenchmarksGénération de code
SIG
75
HYP
35
Reddit r/LocalLLaMA·

Microsoft should've released something like Qwen3.6-27B / Gemma-4-31B already. They released MAI models now

Microsoft lance 7 modèles MAI : MAI-Thinking-1 (1T params, 256K contexte) rivalise avec les meilleurs modèles de sa classe en ingénierie logicielle ; MAI-Code-1-Flash (5B params actifs) intégré à GitHub Copilot et VS Code ; MAI-Image-2.5 pour texte-vers-image et édition ; MAI-Transcribe-1.5 (SOTA, 5x plus rapide) ; MAI-Voice-2 pour synthèse vocale. Pas de poids ouverts annoncés, licences propriétaires.

Génération de codeRaisonnementVision
SIG
72
HYP
35
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> MemPalace /</span> mempalace

MemPalace est un système de mémoire IA open-source benchmarké, gratuit. Conçu pour améliorer la rétention et le rappel d'informations dans les applications IA.

Open sourceRAGOutils
SIG
45
HYP
55
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> openai /</span> plugins

Dépôt GitHub officiel OpenAI pour les plugins. Contient documentation, exemples et ressources pour développer des extensions compatibles avec ChatGPT et les modèles OpenAI.

OpenAIOutilsOpen source
SIG
65
HYP
20
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> CopilotKit /</span> CopilotKit

CopilotKit est un framework frontend pour construire des interfaces utilisateur génératives avec agents IA. Supporte React et Angular via le protocole AG-UI.

Agents IAGénération de codeOpen source
SIG
45
HYP
35
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> Panniantong /</span> Agent-Reach

Agent-Reach est un outil CLI permettant aux agents IA de consulter Twitter, Reddit, YouTube, GitHub, Bilibili et XiaoHongShu sans frais API. Une interface unifiée pour accéder à plusieurs plateformes.

Agents IAOutilsOpen source
SIG
45
HYP
55
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> backnotprop /</span> plannotator

Plannotator permet d'annoter et examiner visuellement les plans et diffs de code générés par des agents IA, de les partager en équipe et d'envoyer des retours aux agents en un clic.

Agents IAGénération de codeOutils
SIG
45
HYP
35
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> CopilotKit /</span> CopilotKit

CopilotKit est un framework frontend pour construire des interfaces utilisateur génératives avec agents IA. Supporte React et Angular, propose le protocole AG-UI.

Agents IAGénération de codeOutils
SIG
65
HYP
35
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> vllm-project /</span> vllm-omni

vLLM-Omni étend le framework vLLM pour supporter l'inférence efficace de modèles omnimodaux (texte, vision, audio). Optimisation des performances et gestion mémoire pour déploiement en production.

Open sourceInfrastructureVision
SIG
65
HYP
25
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> microsoft /</span> BitNet

Microsoft publie BitNet, un framework d'inférence officiel pour les LLM 1-bit. Permet l'exécution efficace de modèles quantifiés extrêmement.

Open sourceInfrastructure
SIG
75
HYP
25
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> microsoft /</span> agent-framework

Microsoft publie agent-framework, un framework open-source pour construire, orchestrer et déployer des agents IA et workflows multi-agents en Python et .NET.

Agents IAMulti-agentsOpen source
SIG
75
HYP
25
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> Panniantong /</span> Agent-Reach

Agent-Reach est un outil CLI permettant aux agents IA de consulter Twitter, Reddit, YouTube, GitHub, Bilibili et XiaoHongShu sans frais API. Une interface unifiée pour accéder à plusieurs plateformes.

Agents IAOutilsOpen source
SIG
45
HYP
55
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> MemPalace /</span> mempalace

MemPalace est un système de mémoire IA open-source benchmarké, gratuit. Conçu pour améliorer la rétention et le rappel d'informations dans les applications IA.

Open sourceRAGOutils
SIG
35
HYP
55
Reddit r/LocalLLaMA·

Benchmark & Reality Check on Gemma 4 12B: Great model, but your local settings are probably breaking it (Fix inside)

Benchmark de Gemma 4 12B sur un test de détection de bugs Python. Le modèle trouve 6 bugs vs 14 pour Qwen 35B. Les paramètres par défaut de LM Studio désactivent le reasoning. Solution : activer enable_thinking dans le template Jinja, configurer les tokens de pensée (<|channel>thought / <channel|>), et utiliser température 1.0, top_p 0.95, top_k 64.

GeminiBenchmarksRaisonnement
SIG
65
HYP
25
arXiv cs.LG·

Policy-Conditioned Counterfactual Credit for Verifiable Reinforcement Learning of Long-Horizon Language Agents

CVT-RL, un algorithme de gradient de politique avec récompenses vérifiables denses, améliore l'apprentissage par renforcement des agents de langage long-horizon. Sur QA, ALFWorld, ScienceWorld et tâches web/outils, le succès passe de 71,8% (RL non-causal) à 78,9%, le F1 des preuves de 78,9 à 82,8, et le hacking mesuré de 7,2% à 3,9%. Les tests statistiques donnent p<0,01 après correction de Holm.

Reinforcement learningAgents IARaisonnement
SIG
82
HYP
15
arXiv cs.CL·

ArcANE: Do Role-Playing Language Agents Stay in Character at the Right Time?

ArcANE est un benchmark automatisé évaluant si les agents de rôle-playing maintiennent la cohérence psychologique des personnages au fil de l'histoire. Construit sur 17 romans et 80 personnages, il teste les réponses à travers différentes phases narratives et scénarios inédits. Conditionner sur l'arc de caractère surpasse toutes les autres stratégies contextuelles sur 6 modèles.

BenchmarksAgents IAÉvaluations
SIG
78
HYP
15
arXiv cs.LG·

Alpha-RTL: Test-Time Training for RTL Hardware Optimization

Alpha-RTL introduit TTT-RTL, un framework d'apprentissage par renforcement au moment du test pour optimiser la génération RTL par LLM. Sur RTLLM v2.0 (Nangate 45nm), TTT-RTL réduit le produit PPA de 65,1% vs référence et surpasse les baselines gelées de 26,1%. Sur XuanTie C910 FPU (Sky130), réduction ADP de 59,4%. Contrôleur KL-budget adaptatif stabilise les mises à jour de politique.

Génération de codeReinforcement learningBenchmarks
SIG
82
HYP
18
arXiv cs.CL·

An ERP Study on Recursive Locative Processing in Mandarin-Speaking Children with Autism

Étude ERP sur 24 enfants (12 autistes, 12 contrôles) examinant le traitement des constructions locatives récursives en mandarin. Les enfants autistes montrent une prédiction structurale réduite (P200 atténué), une intégration sémantique accrue (N400 augmenté) et une réanalyse syntaxique diminuée (P600 réduit), avec variabilité inter-individuelle accrue en latéralisation hémisphérique.

RaisonnementSécurité IA
SIG
72
HYP
08
arXiv cs.CL·

When New Generators Arrive: Lifelong Machine-Generated Text Attribution via Ridge Feature Transfer

RidgeFT, un framework d'apprentissage continu sans rejeu d'exemplaires, attribue les textes générés par IA à leurs modèles sources. La méthode gèle un encodeur entraîné initialement, stocke des statistiques suffisantes par classe, et utilise la régression ridge en forme fermée pour adapter les nouveaux générateurs tout en conservant les anciens.

BenchmarksSécurité IAAlignement
SIG
72
HYP
15
arXiv cs.CL·

Bootstrapping Semantic Layer from Execution for Text-to-SQL

GATE (Grounding After Test from Execution) bootstrappe les groundings manquants en text-to-SQL via feedback d'exécution. Le système maintient plusieurs hypothèses de grounding ouvertes, exécute les parties déjà groundées pour obtenir des observations, puis valide et mémorise les hypothèses confirmées. Cette mémoire d'exécution s'accumule et améliore les performances sur benchmarks réels et contrôlés.

Génération de codeRaisonnementBenchmarks
SIG
72
HYP
18
arXiv cs.CL·

Beyond tokens: a unified framework for latent communication in LLM-based multi-agent systems

Cadre unifié pour la communication latente dans les systèmes multi-agents basés sur LLM. Les agents échangent des représentations continues (embeddings, états cachés, KV-caches) au lieu de texte, réduisant coûts d'inférence et perte d'information. Analyse 18 méthodes (2024-2026) selon 3 axes : QUOI communiquer, QUEL alignement sender-receiver, COMMENT fusionner l'information.

Multi-agentsAgents IARaisonnement
SIG
75
HYP
15
arXiv cs.LG·

Staged Factorial Screening for Budget-Constrained Micro-Pretraining

Étude de screening factoriel par étapes pour l'optimisation d'hyperparamètres en micro-préentraînement sur GPU unique avec budget limité. 613 expériences testent l'effet de batch, profondeur et largeur du modèle sur 2-24h. Les facteurs D, A, B, C restent significatifs après correction statistique; la recherche aléatoire converge vers des régions similaires sans attribution causale.

Fine-tuningBenchmarksInfrastructure
SIG
72
HYP
15
arXiv cs.LG·

Gradient Descent with Large Step Size Restores Symmetry in Deep Linear Networks with Multi-Pathway

Analyse théorique montrant que la descente de gradient discrète avec grand pas dans les réseaux linéaires profonds multi-chemins restaure la symétrie. Contrairement aux prédictions du gradient flow (spécialisation winner-takes-all), le GD avec oscillations à l'Edge of Stability redistribue les signaux entre chemins, favorisant les représentations partagées plutôt que la dominance d'un seul chemin.

PapersRaisonnement
SIG
75
HYP
15
arXiv cs.CL·

Epidemiology of Model Collapse: Modeling Synthetic Data Contamination via Bilayer SIR Dynamics

Étude épidémiologique de l'effondrement de modèles causé par l'entraînement sur données synthétiques. Framework SIR/SIRS bipartite modélisant la contamination croisée entre corpus de données et modèles IA. Expériences GPT-2 sur WikiText et Shakespeare (192 runs) confirment dégradation dose-réponse; R₀ > 1 indique dynamiques supercritiques. Détection synthétique et filtrage identifiés comme leviers principaux.

PapersSécurité IABenchmarks
SIG
78
HYP
15
arXiv cs.LG·

Temporal Preference Concepts and their Functions in a Large Language Model

Étude de mécanismes interprétatifs sur Qwen3-4B-Instruct-2507 : localisation causale de circuits de préférence temporelle via attribution de gradients et patching d'activation. Les LLMs encodent l'horizon temporel dans le residual stream et actualisent le futur moins fortement que les humains, mais cette préférence est instable contextuellement. Vecteurs de steering montrent un potentiel de contrôle explicite.

QwenRaisonnementAlignement
SIG
75
HYP
15
arXiv cs.LG·

CausalPOI: Spatio-Temporal Graph-Based Causal Modeling for Cold-Start POI Check-in Forecasting

CausalPOI propose un framework de causal representation learning pour prédire les patterns de check-in de nouveaux Points of Interest (POI) en milieu urbain. Le modèle utilise des graphes spatio-temporels fonctionnels et simule des scénarios contrefactuels pour capturer les effets causaux des interventions urbaines, surpassant les baselines sur les données SafeGraph.

PapersRaisonnementBenchmarks
SIG
72
HYP
25
arXiv cs.LG·

Learning Manifold and It\^o Dynamics with Branched Neural Rough Differential Equations

Les équations différentielles neurales branchées (B-NRDEs) étendent les NRDEs pour capturer les dynamiques Itô sur variétés. Elles utilisent une structure Hopf-algébrique basée sur les arbres racinés de Grossman-Larson et Munthe-Kaas-Wright, préservant exactement les contraintes de variété. Validation sur volatilité Bergomi, dynamiques SO(3) et matrices SPD.

PapersRaisonnementReinforcement learning
SIG
72
HYP
15
arXiv cs.LG·

State commitment learning: training language models to distinguish computation from memory

Nouvelle méthode d'entraînement pour distinguer le calcul temporaire de l'état persistant dans les modèles de langage. Counterfactual Erasure RL (CERL) récompense les modèles quand la réponse reste correcte après suppression des pensées intermédiaires. Évaluation sur mathématiques, logique et QA scientifique montre réduction de la dépendance aux calculs cachés sans perte de précision.

RaisonnementReinforcement learningPapers
SIG
78
HYP
15
arXiv cs.LG·

PyCC.id: A package for hypothesis-driven equation discovery with structural identifiability

PyCC.id est une bibliothèque Python pour la découverte d'équations différentielles guidée par hypothèses. Elle utilise des « squelettes » structurels inspirés par les courbes caractéristiques pour réduire l'espace de recherche et vérifier l'identifiabilité structurelle des modèles candidats. Supporte réseaux de neurones, régression symbolique et régression sparse.

Génération de codePapersOpen source
SIG
72
HYP
15
arXiv cs.LG·

GOTabPFN: From Feature Ordering to Compact Tokenization for Tabular Foundation Models on High-Dimensional Data

GOTabPFN introduit une méthode de compression de features pour les modèles tabulaires fondamentaux en régimes haute-dimensionnelle/faible-échantillon. Graph-guided Ordering with Local Refinement (GO-LR) ordonne les features, puis Neuro-Inspired Subunit Compression les agrège en meta-features. Résultats : stabilité et précision améliorées sous contrainte de tokens sur benchmarks tabulaires.

BenchmarksFine-tuningPapers
SIG
72
HYP
18
arXiv cs.LG·

LEVANTE-bench: Multi-Scale Comparison of VLMs to Children Using Cognitive Tasks (or, "Is Your VLM Smarter Than a 5th Grader?")

LEVANTE-bench compare 6 modèles de vision-langage (VLMs) à des enfants de 5-12 ans (N=1547) sur des tâches cognitives standardisées dans 3 pays. Les modèles plus grands s'alignent mieux globalement, mais les petits modèles reproduisent mieux les erreurs des jeunes enfants. Les VLMs échouent sur le raisonnement matriciel et la rotation mentale.

VisionBenchmarksÉvaluations
SIG
78
HYP
25
arXiv cs.CL·

From Scoring to Explanations: Evaluating SHAP and LLM Rationales for Rubric-based Teaching Quality Assessment

Framework d'interprétabilité pour l'évaluation automatique de transcriptions pédagogiques basée sur des rubriques. Combine attributions SHAP avec rationales générées par LLM. Sur 6k segments annotés : modèles fine-tunés surpassent les LLMs en précision mais compressent les scores ; SHAP identifie les phrases déterminantes avec transfert robuste entre architectures, contrairement aux rationales LLM.

ÉvaluationsRaisonnementPapers
SIG
72
HYP
15
arXiv cs.CL·

LANTERN: Layered Archival and Temporal Episodic Retrieval Network for Long-Context LLM Conversations

LANTERN est une couche mémoire légère qui archive chaque tour de conversation et restaure les détails pertinents après compaction via récupération hybride, sans appels LLM et avec <25ms de latence. Sur 94 conversations multi-tours (1 894 faits validés), LANTERN-Rerank récupère 78,3% des faits perdus, surpassant MemGPT (72,4%, p<0.0001) avec coût d'inférence réduit.

RAGRaisonnementBenchmarks
SIG
82
HYP
18
arXiv cs.CL·

A Model of Multi-turn Human Persuadability Using Probabilistic Belief Tracing

PERSUASIONTRACE est un framework pour étudier la persuasion dans les interactions humain-LLM. Il enregistre les changements de croyances multi-tours, annote les stratégies rhétoriques (logos/pathos/ethos), et évalue les simulateurs par fidélité aux dynamiques humaines réelles. Un modèle bayésien maintenant un état de croyance latent explicite atteint 81/100 en ressemblance humaine vs 64 pour les LLMs vanilla.

RaisonnementÉvaluationsSécurité IA
SIG
72
HYP
28
arXiv cs.CL·

When Evidence is Sparse: Weakly Supervised Early Failure Alerting in Dialogs and LLM-Agent Trajectories

Méthode pour détecter précocement les échecs dans les dialogues et trajectoires d'agents IA. Approche deux étapes : prédicteur basé attention identifiant les indices d'échec clairsemés (4,7-11,3% des tours) et politique α-STOP pour sélectionner le point de fonctionnement à l'inférence. Amélioration de 3-42% sur la frontière Pareto vs méthodes existantes.

Agents IARaisonnementÉvaluations
SIG
75
HYP
15
arXiv cs.CL·

ComplexityMT: Benchmarking the Interaction Between Text Complexity and Machine Translation

ComplexityMT est un benchmark évaluant comment la complexité textuelle (niveaux CEFR) interagit avec la traduction automatique. Sur 6 langues (arabe, néerlandais, anglais, français, hindi, russe), les auteurs testent 3 modèles open-weight, 1 fermé et 1 système commercial. Résultats : les niveaux CEFR élevés rendent la traduction plus difficile ; la TA modifie le niveau CEFR du texte cible pour la plupart des langues.

Benchmarks
SIG
75
HYP
15
arXiv cs.CL·

Localizing Prompt Ambiguity in Large Language Models with Probe-Targeted Attribution

PRIG, une méthode d'attribution par gradient, localise l'ambiguïté dans les prompts LLM en entraînant une sonde linéaire à distinguer les prompts clairs des ambigus, puis attribue le score de la sonde aux représentations de tokens. Évalué sur des datasets synthétiques (codage, math, écriture) et un benchmark humain, PRIG atteint 0.840 AUROC sur le benchmark synthétique combiné et 0.891 AUROC sur l'ensemble gold.

Prompt engineeringÉvaluationsPapers
SIG
78
HYP
15
arXiv cs.CL·

CHASE: Adversarial Red-Blue Teaming for Improving LLM Safety using Reinforcement Learning

CHASE est un framework de red-blue teaming co-évolutif qui entraîne un attaquant et un défenseur via GRPO pour améliorer la robustesse des LLM contre les attaques par réécriture de prompts (persona modulation, framing fictionnel). Évalué sur BeaverTails et JailbreakBench, il réduit le score StrongREJECT de 43,2% sans faux refus sur prompts bénins.

Sécurité IAAlignementReinforcement learning
SIG
82
HYP
18
arXiv cs.CL·

AURA: Intent-Directed Probing for Implicit-Need Surfacing in Situated LLM Agents

AURA est un système d'agents LLM situés qui détecte les besoins implicites au-delà de la requête littérale. Entre la perception de scène et l'utilisation d'outils, il génère un IntentFrame structuré avec un score d'écart pour contrôler le budget de sondage. Sur un benchmark de 100 requêtes, AURA améliore la couverture des besoins implicites de +0.07 (p < 10^-6) par rapport à ReAct.

Agents IARaisonnementÉvaluations
SIG
72
HYP
28
arXiv cs.CL·

Using Large Language Models to Support High Volume Application Review for an Undergraduate Research Program

Purdue University utilise GPT-4o, GPT-5-mini et GPT-5.2 pour évaluer 1 200 candidatures au programme SURF 2026. Les modèles notent les déclarations d'intention sur 6 critères (0-3 points), générant scores et justifications en 4,6 heures. GPT-5.2 adhère mieux à la grille d'évaluation. La révision finale par coordinateur prend 4 heures au lieu de plusieurs semaines.

GPTOpenAIÉvaluations
SIG
72
HYP
25
arXiv cs.CL·

AdaPlanBench: Evaluating Adaptive Planning in Large Language Model Agents under World and User Constraints

AdaPlanBench est un benchmark interactif évaluant la capacité des agents LLM à planifier et replanifier face à des contraintes monde et utilisateur révélées progressivement. Construit sur 307 tâches ménagères, il teste 10 modèles leaders : le meilleur atteint 67,75% de précision. Les performances se dégradent avec l'accumulation de contraintes, notamment les contraintes utilisateur.

Agents IARaisonnementBenchmarks
SIG
78
HYP
15
arXiv cs.LG·

What Objects Enable, Not What They Are: Functional Latent Spaces for Affordance Reasoning

A4D propose un espace latent fonctionnel organisé autour des affordances (capacités) plutôt que l'apparence des objets, pour améliorer la généralisation de la planification robotique. Le système atteint 94% de précision sur les affordances existantes (+15 points vs SOTA) et 90% sur les nouvelles affordances avec 10% des données d'entraînement originales, avec inférence 100x plus rapide.

RobotiqueRaisonnementVision
SIG
78
HYP
25
arXiv cs.CL·

Predict and Reconstruct: Joint Objectives for Self-Supervised Language Representation Learning

Nouvelle approche de pré-entraînement combinant MLM (Masked Language Modeling) et JEPA (Joint Embedding Predictive Architecture) pour les encodeurs texte. Modèle hybride entraîné sur Wikipedia anglais avec budget identique. Résultats : embeddings plus uniformes (-0.16 vs -0.05), géométrie spectrale riche, meilleur équilibre sémantique-lexical sur benchmarks GLUE.

PapersFine-tuningEmbeddings
SIG
72
HYP
18
arXiv cs.LG·

Pattern Selectivity is Not Task-Causal Structure: A Cross-Architecture Mechanistic Study of Composed-Task Circuits in 1B-Class Language Models

Étude mécanistique cross-architecture sur 3 modèles 1B (Pythia, OLMo, OLMoE) testant si l'identification de circuits par sélectivité de patterns + ablation causale produit des résultats reproductibles. Résultat : même tâche, même capacité comportementale, implémentations différentes selon le modèle. Taxonomie à 5 catégories (cause primaire, secondaire, corrélat, interférent, null) avec seuils quantitatifs.

BenchmarksPapers
SIG
78
HYP
15