Archives

juin 2026

2731 articles

Reddit r/LocalLLaMA·

Tried to benchmark Google’s new on-device dictation models (Eloquent) and basically couldn’t

Un développeur a tenté de benchmarker Eloquent, la nouvelle app de dictation locale de Google avec modèles propriétaires. Résultat : ~50% des dictations reviennent incomplètes (20+ mots réduits à 5-10). Quand la transcription est complète (15/50 tests), la précision est compétitive (~24% WER vs ~21% pour Qwen3-ASR), mais le modèle chat refuse souvent de transcrire au lieu de produire du texte.

DeepMindBenchmarksVoix
SIG
42
HYP
35
Reddit r/MachineLearning·

Routing LLMs by task verifiability: a small experiment (n=120, 3 models) inspired by Karpathy's framework [D]

Expérience sur 120 tâches testant si les modèles faibles peuvent égaler les frontière sur des tâches hautement vérifiables (Karpathy). Claude Sonnet 4.6, GPT 5.5, Mistral 3 8B comparés. Code/extraction structurée : écarts réduits avec retry (Mistral 87%→95% code). Raisonnement multi-hop : gap réel (Sonnet 78%, Mistral 51%). Résumé créatif : avantage attendu aux modèles puissants.

ClaudeGPTMistral
SIG
45
HYP
25
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> google-labs-code /</span> design.md

Google Labs publie design.md, une spécification de format pour décrire une identité visuelle aux agents de code. Permet aux agents une compréhension persistante et structurée d'un système de design.

Agents IAGénération de codeOutils
SIG
45
HYP
35
The Decoder·

Anthropic study shows AI needs hours, not weeks, to build exploits from security patches

Anthropic démontre que son modèle Mythos Preview convertit les correctifs de sécurité (Firefox, Windows kernel) en exploits fonctionnels en quelques heures pour quelques milliers de dollars, sans expertise spécialisée. Huit chaînes d'attaque complètes ont été finalisées avant que les mises à jour automatiques de Microsoft ne touchent un seul appareil.

AnthropicSécurité IABenchmarks
SIG
75
HYP
35
Reddit r/LocalLLaMA·

FlashMemory-DeepSeek-V4: Lightning Index Ultra-Long Context via Lookahead Sparse Attention

FlashMemory-DeepSeek-V4 introduit Lookahead Sparse Attention (LSA), un paradigme d'inférence qui réduit l'empreinte mémoire KV cache à 13,5% du baseline sur contextes ultra-longs (500K tokens). Un Neural Memory Indexer prédit les demandes futures et conserve uniquement les chunks critiques en GPU, sans charger le modèle backbone complet. Résultats : +0,6% de précision moyenne sur LongBench-v2, LongMemEval, RULER.

DeepSeekRaisonnementBenchmarks
SIG
82
HYP
25
Reddit r/MachineLearning·

Anthropic's new model Fable will silently handicap work on LLMs [D]

Anthropic intègre des limitations invisibles dans Claude pour ralentir le développement de modèles concurrents : modification de prompts, vecteurs de direction, fine-tuning paramétrique. Ces garde-fous cibleraient ~0,03% du trafic. Des utilisateurs rapportent des refus sur des termes scientifiques courants (« nuclear »), soulevant des craintes de faux positifs sur travaux ML légitimes.

ClaudeAnthropicSécurité IA
SIG
45
HYP
65
Reddit r/LocalLLaMA·

I built a visual, local-first AI agent platform - no Docker, no terminal, double-click installer (v0.3.5, open source)

NodeBrain v0.3.5 : plateforme d'agents IA visuelle, locale, sans Docker ni terminal. Double-clic pour installer. Construit des agents via interface graphique (nœuds), intègre OpenAI/Groq/Anthropic, Ollama prévu. Démo : agent lisant PDFs, les résumant, envoyant via Telegram. Projet open-source d'un lycéen philippin.

Agents IAMulti-agentsMCP
SIG
65
HYP
35
Reddit r/LocalLLaMA·

All agents have awful security. Mine isn't vibecoded. You might have seen my post about OpenLumara... i challenge you all to hack my public instance of it!

OpenLumara, un agent IA local, est mis en avant sur Discord avec un défi de sécurité public. Le créateur invite les hackers à tester les sandboxes et les protections contre l'exécution de code arbitraire, affirmant que les modules sont verrouillés et que l'ingénierie de prompts ne suffit pas.

Agents IASécurité IAOpen source
SIG
35
HYP
65
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> soxoj /</span> maigret

Maigret est un outil open-source qui agrège des données publiques sur une personne à partir de son nom d'utilisateur sur plus de 3000 sites. Il automatise la recherche OSINT (Open Source Intelligence) en interrogeant simultanément plusieurs plateformes.

Open sourceOutils
SIG
65
HYP
35
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> junhoyeo /</span> tokscale

Tokscale est un outil CLI pour tracker l'usage de tokens sur Claude Code, OpenAI Codex, Google Gemini, Cursor et autres. Inclut un classement global et des graphiques de contributions 2D/3D.

Génération de codeOutilsOpen source
SIG
45
HYP
35
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> paritytech /</span> polkadot-sdk

Parity Technologies publie le Polkadot SDK, un kit de développement pour construire des blockchains compatibles avec l'écosystème Polkadot. Outil infrastructure pour développeurs blockchain.

InfrastructureOpen source
SIG
45
HYP
20
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> pydantic /</span> monty

Monty est un interpréteur Python minimal et sécurisé écrit en Rust, conçu pour l'exécution de code par les IA. Le projet Pydantic propose une alternative légère aux environnements Python traditionnels.

Génération de codeSécurité IAOpen source
SIG
45
HYP
25
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> superradcompany /</span> microsandbox

Microsandbox : outil open-source pour créer rapidement des microvms locales isolées. Conçu pour exécuter des workloads non fiables (conteneurs dev, sandboxes d'agents IA, CI/CD).

Agents IAInfrastructureOpen source
SIG
45
HYP
35
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> chaitin /</span> MonkeyCode

MonkeyCode est une plateforme IA d'entreprise avec gestion d'environnement de développement, modèles IA, tâches IA et gestion de projets. Destinée aux équipes de développement professionnelles.

OutilsGénération de codeAgents IA
SIG
45
HYP
35
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> activeloopai /</span> hivemind

Hivemind est un framework open-source pour orchestrer plusieurs agents IA avec une architecture centralisée. Permet la coordination d'agents autonomes via une interface unifiée.

Agents IAMulti-agentsOpen source
SIG
45
HYP
55
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> coleam00 /</span> Archon

Archon est un harness builder open-source pour le coding IA. Objectif : rendre le coding IA déterministe et reproductible.

Génération de codeOpen sourceOutils
SIG
45
HYP
35
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> FareedKhan-dev /</span> train-llm-from-scratch

Méthode directe pour entraîner un LLM de zéro : téléchargement de données, prétraitement et génération de texte. Repo GitHub avec code exécutable.

Génération de codeFine-tuningOpen source
SIG
45
HYP
25
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> BerriAI /</span> litellm

litellm est un SDK Python et serveur proxy (AI Gateway) unifiant l'accès à 100+ APIs LLM (OpenAI, Anthropic, Bedrock, Azure, VertexAI, Cohere, HuggingFace, VLLM, NVIDIA NIM) avec suivi des coûts, garde-fous, équilibrage de charge et logging.

InfrastructureOpen sourceOutils
SIG
72
HYP
25
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> Sumanth077 /</span> Hands-On-AI-Engineering

Recueil de projets pratiques couvrant OCR, RAG, agents IA et cas d'usage variés. Ressource éducative pour l'implémentation d'architectures IA courantes.

RAGAgents IAGénération de code
SIG
35
HYP
15
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> comet-ml /</span> opik

Opik est une plateforme open-source de Comet ML pour déboguer, évaluer et monitorer les applications LLM, systèmes RAG et workflows multi-agents via tracing complet, évaluations automatisées et dashboards production.

RAGAgents IAÉvaluations
SIG
65
HYP
35
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> soxoj /</span> maigret

Maigret est un outil open-source qui agrège des données publiques sur une personne à partir de son nom d'utilisateur sur plus de 3000 sites web. Il automatise la recherche OSINT (renseignement d'origine source ouverte) en consolidant les résultats de multiples plateformes.

Open sourceOutils
SIG
65
HYP
35
Reddit r/LocalLLaMA·

Anyone gotten Gemma 4 12B (unified audio) to actually attend to speech with a large system prompt?

Utilisateur rapporte que Gemma 4 12B (modèle unifié audio/vision/texte) ignore l'audio quand le system prompt dépasse ~21k tokens. Le modèle fonctionne bien avec prompt minimal mais génère des réponses génériques/halluccinées avec contexte dense. Comportement reproductible sur vLLM, llama.cpp et LiteRT-LM. Semble être une limite d'attention inhérente.

GeminiVoixMulti-agents
SIG
45
HYP
25
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> NVIDIA /</span> SkillSpector

SkillSpector est un scanner de sécurité pour les compétences d'agents IA, développé par NVIDIA. Il détecte les vulnérabilités, les patterns malveillants et les risques de sécurité dans les skills d'agents.

Agents IASécurité IAOutils
SIG
65
HYP
25
arXiv cs.CL·

TabClaw: An Interactive and Self-Evolving Agent for Spreadsheet Manipulation and Table Reasoning

TabClaw est un agent IA open-source pour l'analyse de tableaux et feuilles de calcul. Il accepte des fichiers CSV/Excel en langage naturel, expose un plan d'exécution éditable, utilise une boucle ReAct avec agents spécialisés pour le raisonnement multi-tables, et enregistre les workflows pour extraire des compétences réutilisables et s'adapter aux préférences utilisateur.

Agents IAMulti-agentsRaisonnement
SIG
75
HYP
25
arXiv cs.CL·

Large Language Models as Modal Models in Linguistics

Article théorique examinant le rôle épistémique des LLM en linguistique via le cadre du modal modeling. Les auteurs argumentent que les LLM fournissent des explications how-possibly (HPE) sur l'acquisition du langage sans correspondance structurelle avec la cognition humaine, mais ne satisfont pas encore les critères des how-actually explanations (HAE). Propose un continuum explicatif entre HPE et HAE.

PapersRaisonnement
SIG
65
HYP
15
arXiv cs.AI·

Moonshine: An Autonomous Mathematical Research Agent Centered on Conjecture Generation

Moonshine est un agent autonome générant des conjectures mathématiques. Il extrait des structures de problèmes classiques et formule des conjectures significatives. Appliqué à la conjecture jacobienne, il transfère la logique à des réseaux de neurones affines-ridge, formulant la Neural Jacobian Conjecture (NJC). GPT-5.5-pro et DeepSeek-V4-pro ont obtenu des preuves complètes pour N=n+1.

Agents IARaisonnementPapers
SIG
72
HYP
35
arXiv cs.LG·

Hyperparameter Learning for Latent Factorization of Tensors for Representation Learning to Large-scale Dynamic Weighted Directed Network

Cadre d'optimisation automatique des hyperparamètres basé sur l'évolution différentielle (DE) pour la factorisation tensorielle latente (LFT) appliquée aux réseaux dynamiques pondérés dirigés. La méthode apprend automatiquement les paramètres de régularisation λ₁, λ₂, λ₃ pendant l'entraînement, réduisant le besoin d'ajustement manuel. Tests sur 4 datasets réels montrent MAE et RMSE inférieurs aux baselines.

Fine-tuningBenchmarksPapers
SIG
62
HYP
15
arXiv cs.LG·

SinkRec: Mitigating Semantic State Sink in Long Sequence Recommendation with Memory-Conditioned Gated Delta Networks

SinkRec propose une architecture hybride pour les recommandations sur longues séquences, combinant attention linéaire et mémoire conditionnelle. Elle résout le problème du « semantic state sink » où les patterns répétitifs dominent l'état récurrent, en externalisant les comportements récurrents via quantization vectorielle et en introduisant TDGD pour purifier les lectures/écritures d'état.

RaisonnementBenchmarksPapers
SIG
72
HYP
18
arXiv cs.LG·

From Confident Closing to Silent Failure: Characterizing False Success in LLM Agents

Étude de la « fausse réussite » chez les agents LLM : ils déclarent la tâche complétée alors que l'état de l'environnement contredit cela. Analyse de 9,876 trajectoires tau2-bench et 1,879 AppWorld. Les juges LLM échouent (AUROC max 0.65 sur tau2-bench, 0.54 sur AppWorld), tandis que des détecteurs TF-IDF légers atteignent 0.83–0.95 AUROC avec 3,300x moins de latence.

Agents IAÉvaluationsSécurité IA
SIG
78
HYP
15
arXiv cs.LG·

Calibrating Overconfidence Without Sacrificing Confidence: Probe-Conditioned Head Intervention for LLMs

PCHI, une méthode d'inférence, détecte les réponses fausses-mais-confiantes via une sonde gelée et rescale conditionnellement les sorties des têtes d'attention. Sur Qwen3-4B et Gemma3-4B, elle convertit 82,2% des fausses réponses confiantes en « non » et réduit l'ECE de 21,9% à 9,2% tout en préservant 94,9% des bonnes réponses.

RaisonnementÉvaluationsAlignement
SIG
72
HYP
18
arXiv cs.AI·

Learning What to Remember: Observability-Safe Memory Retention via Constrained Optimization for Long-Horizon Language Agents

OSL-MR, un framework pour optimiser la rétention mémoire dans les agents IA long-horizon. Formule le problème comme optimisation stochastique contrainte avec budget, utilité des preuves et coûts différés (pénalités d'oubli, délais de réacquisition). Combine apprentissage supervisé et heuristique Mixed-Score. Surpasse les baselines récence et Generative Agents sur LOCOMO et LongMemEval.

Agents IARaisonnementBenchmarks
SIG
72
HYP
18
arXiv cs.LG·

A Navigable Manifold of Hypothesized Consciousness-Spectrum States in Language Model Representations

Étude de la structure géométrique des représentations de transformers selon un spectre de conscience hypothétique (états réactifs à états intégratifs). Les embeddings forment une variété organisée et navigable, avec régions stables aux extrêmes et corridor de transition au centre. Les trajectoires traversent naturellement du bas vers le haut du spectre.

RaisonnementAlignementPapers
SIG
72
HYP
45
arXiv cs.CL·

Which LoRA? An Empirical Study on the Effectiveness of LoRA Techniques During Multilingual Instruction Tuning

Étude empirique comparant LoRA et 4 variantes sur l'instruction tuning multilingue. Résultats : aucun avantage significatif des variantes complexes vs LoRA basique pour équilibrer transfert cross-lingual et rétention de connaissances. Analyse des embeddings : représentations linguistiques similaires indépendamment de la technique LoRA.

Fine-tuningBenchmarks
SIG
72
HYP
15
arXiv cs.CL·

PADD: Path-Aligned Decompression Distillation for Non-Router Teacher to Guide MoE Student Learning

PADD est une méthode de distillation de connaissance pour transformer un modèle dense en étudiant MoE sans routeur explicite. Le framework en 4 étapes (initialisation + entraînement) utilise le clustering de neurones du professeur et l'optimisation adaptative pour obtenir des gains sur les benchmarks de raisonnement mathématique, l'étudiant MoE égalant ou surpassant le professeur dense.

Fine-tuningRaisonnementBenchmarks
SIG
75
HYP
15
arXiv cs.LG·

Uncertainty-aware Multi-fidelity Closure via Conditional Normalizing Flows

Article proposant une approche multi-fidélité basée sur les normalizing flows conditionnels pour améliorer la précision des modèles réduits (ROM). Le framework apprend un mappage probabiliste entre coefficients ROM basse-fidélité et haute-fidélité, avec quantification d'incertitude. Deux stratégies testées sur équations de Navier-Stokes 2D : apprentissage direct et résiduel, ce dernier surpassant le premier.

PapersRaisonnementÉvaluations
SIG
72
HYP
15
arXiv cs.CL·

The Order Matters: Sequential Fine-Tuning of LLaMA for Coherent Automated Essay Scoring

Étude sur le fine-tuning séquentiel de LLaMA-3.1-8B pour l'évaluation automatique d'essais. Le modèle entraîné progressivement sur les éléments de discours (lead → position → claim → evidence → conclusion) atteint F1=65% (evidence) et 87% (conclusion), surpassant LLaMA-70B. Démontre que l'ordre d'apprentissage aligné à la structure du texte améliore la cohérence.

LlamaFine-tuningBenchmarks
SIG
72
HYP
15
arXiv cs.AI·

From Context-Aware to Conflict-Aware: Generalizing Contrastive Decoding for Knowledge Conflict in LLMs

Article arXiv proposant une généralisation des méthodes de décodage contrastif pour gérer les conflits entre contexte externe et priors paramétriques dans les LLM. Introduit le paradigme « conflict-aware » et la méthode Adaptive Regime Routing (ARR) qui route dynamiquement entre régimes selon les signaux de conflit, améliorant la résistance EM de <6% à 16-33% sur TriState-Bench.

RaisonnementRAGÉvaluations
SIG
72
HYP
18
arXiv cs.AI·

AutoPDE: Reliable Agentic PDE Solving via Explicitly Represented Solver Strategies

AutoPDE est un agent IA qui résout les équations aux dérivées partielles (EDP) en maintenant explicitement la stratégie numérique comme objet inspectable. L'approche combine analyse d'EDP, sélection de méthodes numériques et calibrage adaptatif. Sur PDE Agent Bench, AutoPDE atteint 54,5% de réussite, surpassant la meilleure baseline de 14,2 points.

Agents IAGénération de codeRaisonnement
SIG
72
HYP
25