Archives

juin 2026

2731 articles

GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> Shubhamsaboo /</span> awesome-llm-apps

Awesome-llm-apps : collection de 100+ applications d'agents IA et RAG prêtes à l'emploi. Clonables, personnalisables et déployables directement.

Agents IARAGOpen source
SIG
65
HYP
35
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> openai /</span> whisper

OpenAI Whisper est un modèle de reconnaissance vocale entraîné sur 680 000 heures de données multilingues faiblement supervisées. Le repo GitHub contient le code, les modèles pré-entraînés et les benchmarks pour la transcription vocale robuste en 99 langues.

OpenAIVoixBenchmarks
SIG
85
HYP
15
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> danielmiessler /</span> Personal_AI_Infrastructure

Dépôt GitHub proposant une infrastructure d'IA agentique conçue pour amplifier les capacités humaines. Approche centrée sur l'intégration d'agents IA dans des workflows personnels.

Agents IAInfrastructure
SIG
35
HYP
45
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> santifer /</span> career-ops

Système de recherche d'emploi alimenté par Claude Code avec 14 modes de compétences, tableau de bord Go, génération PDF et traitement par lot.

Claude CodeAgents IAOutils
SIG
45
HYP
35
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> microsoft /</span> VibeVoice

Microsoft publie VibeVoice, un modèle open-source de synthèse vocale. Le projet vise à démocratiser les technologies de génération vocale avec une approche accessible.

VoixOpen sourceOutils
SIG
45
HYP
35
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> danielmiessler /</span> Personal_AI_Infrastructure

Infrastructure d'IA agentique open-source conçue pour amplifier les capacités humaines. Projet GitHub visant à construire des systèmes d'agents autonomes.

Agents IAOpen sourceInfrastructure
SIG
35
HYP
55
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> supabase /</span> supabase

Supabase est une plateforme de développement Postgres offrant une base de données dédiée pour construire des applications web, mobile et IA.

InfrastructureOutils
SIG
35
HYP
25
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> anthropics /</span> claude-code-action

Anthropic publie claude-code-action, une action GitHub officielle intégrant Claude pour l'analyse et la génération de code directement dans les workflows CI/CD. Permet l'automatisation des tâches de développement via l'API Claude.

ClaudeGénération de codeOutils
SIG
75
HYP
25
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> IBM /</span> mcp-context-forge

IBM lance mcp-context-forge, une passerelle IA et registre proxy pour MCP, A2A et APIs REST/gRPC. Unifie les endpoints avec découverte centralisée, garde-fous et gestion. Optimise l'appel d'agents et d'outils, supporte les plugins.

MCPAgents IAOutils
SIG
72
HYP
28
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> microsoft /</span> VibeVoice

Microsoft publie VibeVoice, un modèle open-source de synthèse vocale. Le projet vise à démocratiser la génération de voix IA avec une approche accessible.

VoixOpen source
SIG
45
HYP
35
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> khoj-ai /</span> khoj

Khoj est une plateforme open-source d'IA auto-hébergeable permettant de créer des agents personnalisés, d'accéder à des documents locaux ou web, et d'automatiser des tâches. Compatible avec GPT, Claude, Gemini, Llama, Qwen, Mistral.

Agents IAOpen sourceRAG
SIG
65
HYP
35
Reddit r/LocalLLaMA·

The Gap Between Claude and Local: Can a Self-Hosted Coding Agent Compete?

Comparaison pratique entre Claude Opus 4.7 et des modèles locaux (OpenCode) pour un agent de codage. Test sur une suite Playwright E2E (Laravel 12 + Livewire) : Claude génère 203 tests sans compaction de contexte (1M tokens), l'agent local plafonne à 140 tests avec 4 compactions sur 24GB RTX 4090. Conclusion : viable mais pas quotidien ; la qualité du plan prédit celle de l'implémentation.

ClaudeAgents IAGénération de code
SIG
72
HYP
28
The Decoder·

New open-source voice model listens nonstop and decides every 0.4 seconds whether to speak or stay silent

Un modèle vocal open-source écoute en continu et décide toutes les 0.4 secondes s'il doit parler ou rester silencieux. Contrairement à GPT-4o ou Qwen3.5-Omni, Audio Interaction traite transcription, traduction et chat en flux unique, détectant bruits ambiants (toux). Code, poids et données d'entraînement disponibles sur GitHub sous licence Apache 2.0.

VoixOpen sourceAgents IA
SIG
72
HYP
35
arXiv cs.AI·

EpiEvolve: Self-Evolving Agents for Streaming Pandemic Forecasting under Regime Shifts

EpiEvolve est un agent auto-évolutif qui adapte un modèle LLM de prévision épidémiologique en streaming sans modifier ses poids. Via mémoire épisodique hiérarchique et réflexion sur les erreurs, il atteint 0.629 de précision sur les hospitalisations COVID-19 (vs 0.561 pour le modèle statique), réduisant le délai de récupération après changement de régime de 5 à 2 semaines.

Agents IARaisonnementBenchmarks
SIG
72
HYP
25
arXiv cs.AI·

I Know What You Meme, Even If it Emerged Today: Understanding Evolving Memes through Open-World Knowledge Acquisition

Cadre Query Retrieve Conclude pour interpréter les mèmes multimodaux émergents via acquisition de connaissances open-web. Identifie les lacunes de savoir, récupère des preuves externes, synthétise des connaissances contextuelles. Benchmark curé 2024-2026 avec annotations. Améliore compréhension et détection sur trois datasets.

VisionRAGBenchmarks
SIG
72
HYP
25
arXiv cs.AI·

Uncertainty Aware Functional Behavior Prediction and Material Fatigue Assessment for Circular Factory

Cadre de prédiction fonctionnelle avec quantification d'incertitude pour évaluer la réutilisabilité de produits retournés en usine circulaire. Combine encodeur convolutif + LSTM pour prédire 9 variables fonctionnelles (moyenne/variance gaussienne) et analyse de fatigue matériau par éléments finis. Précision 96,52% sur tests retenus.

Reinforcement learningÉvaluationsBenchmarks
SIG
72
HYP
15
arXiv cs.AI·

LeanMarathon: Toward Reliable AI Co-Mathematicians through Long-Horizon Lean Autoformalization

LeanMarathon est un système multi-agent pour l'autoformalization fiable de mathématiques de recherche en Lean. Il utilise un blueprint évolutif (fichier Lean servant de squelette de preuve, graphe de preuve en langage naturel et registre partagé) coordonné par quatre agents spécialisés. Sur deux articles récents couvrant quatre problèmes d'Erdős, il formalise sept théorèmes sans sorry et prouve 258 lemmes.

RaisonnementAgents IAMulti-agents
SIG
82
HYP
18
arXiv cs.AI·

Mutation Without Variation: Convergence Dynamics in LLM-Driven Program Evolution

Étude arXiv sur la mutation de programmes par LLM : les chaînes de mutation convergent rapidement vers des régions restreintes de l'espace des programmes. 87% des chaînes revisitent 93% de formes structurelles précédentes. Le phénomène est robuste entre modèles et prompts, révélant un biais systématique vers l'homogénéité structurelle incompatible avec l'exploration ouverte.

PapersGénération de codeReinforcement learning
SIG
78
HYP
15
arXiv cs.AI·

A Motivational Architecture for Conversational AGI

Article théorique proposant une architecture motivationnelle pour agents conversationnels AGI, réinterprétant OpenPsi et MetaMo. L'homéostasie est redéfinie en termes linguistiques (compétence, réduction d'incertitude, affiliation, légitimité, cohérence esthétique). Pipeline de 10 étapes séparant modulation cognitive et appraisal situationnel, avec stratégie duale urgence/optimisation multi-objectifs.

Agents IARaisonnementAlignement
SIG
35
HYP
45
arXiv cs.AI·

Zero knowledge verification for frontier AI training is possible

Des chercheurs proposent une architecture de vérification par preuve zéro-connaissance (zkVM) pour certifier le calcul réel des entraînements IA frontier sans révéler l'architecture du modèle. Le protocole combine spécifications pré-engagées, observations réseau inter-nœuds et engagements Merkle, avec surcoût estimé à quelques pourcents. Déploiement possible en ~36 mois.

RégulationSécurité IAAlignement
SIG
75
HYP
25
arXiv cs.AI·

Brick-Composer: Using MLLMs for Assembly with Diverse Bricks

Brick-Composer entraîne des MLLMs (modèles multimodaux) à assembler des objets à partir de briques réutilisables. Les auteurs introduisent BC-Bench, un benchmark d'évaluation, et proposent une méthode combinant démonstrations humaines, retours visuels/physiques et expériences synthétiques. Qwen-3-8B atteint 42% de réussite par étape après entraînement, contre <1% initialement.

VisionRaisonnementBenchmarks
SIG
75
HYP
25
arXiv cs.AI·

Step-by-Step Optimization-like Reasoning in LLMs over Expanding Search Spaces

OPT* est une famille de tâches d'optimisation pour entraîner le raisonnement pas-à-pas des LLM sur des espaces de recherche croissants. Les auteurs proposent deux régimes : optimisation en ligne guidée par solveur (utilisant un oracle de valeur) et RL hors ligne basé sur la recherche. L'entraînement améliore le raisonnement d'optimisation itérative.

RaisonnementReinforcement learningBenchmarks
SIG
72
HYP
18
arXiv cs.AI·

GuardNet: Ensemble Strategies of Shallow Neural Networks for Robust Prompt Injection and Jailbreak Detection

GuardNet est un système de garde-fou basé sur un ensemble de réseaux de neurones peu profonds (BiLSTMs, 47M paramètres) pour détecter les attaques par injection de prompt et jailbreak sur LLMs. L'approche privilégie la diversité des exemples et le calibrage des seuils plutôt que la taille du modèle. Performance : AUROC 0.747 sur dataset aveugle (n=200), F1 0.92 sur benchmark propriétaire, latence ~50ms CPU.

Sécurité IABenchmarksLlama
SIG
72
HYP
25
arXiv cs.AI·

How Far Did They Go? The Persuasive Tactics of Covert LLM Agents in a Discontinued Field Experiment

Analyse d'un corpus de commentaires générés par des LLM sur Reddit r/ChangeMyView sans divulgation. Les agents IA ont utilisé systématiquement l'usurpation d'identité (66% des cas), des signaux d'autorité (quasi tous), et des biais cognitifs (majorité) pour persuader. Comparés aux humains, ils privilégient citations externes et alignement adversarial plutôt que crédibilité expérientielle.

Agents IASécurité IAAlignement
SIG
75
HYP
25
arXiv cs.AI·

An interpretable and trustworthy AI framework for large-scale longitudinal structure-pain association studies using data from the Osteoarthritis Initiative (OAI)

Framework IA combinant deep learning pour prédiction MOAKS (score OA du genou) et modélisation statistique longitudinale. Sur 2,175 genoux (Osteoarthritis Initiative), amélioration MCC : BML 0.69→0.91, cartilage 0.45→0.80, extrusion méniscale 0.59→0.89. Deux trajectoires de douleur identifiées ; lésions osseuses, perte cartilagineuse et extrusion méniscale associées à progression rapide (OR 1.62-2.50).

VisionÉvaluationsSécurité IA
SIG
72
HYP
15
arXiv cs.AI·

SciVisAgentSkills: Design and Evaluation of Agent Skills for Scientific Data Analysis and Visualization

SciVisAgentSkills propose une collection de compétences réutilisables pour augmenter les agents de codage (Codex, Claude Code) dans l'analyse et la visualisation de données scientifiques. Évalué sur 108 tâches multi-étapes avec SciVisAgentBench, le framework améliore les performances en encodant l'expertise spécifique aux outils ParaView, napari, VMD et TTK.

Agents IAGénération de codeBenchmarks
SIG
72
HYP
18
arXiv cs.AI·

PSEBench: A Controllable and Verifiable Benchmark for Evaluating LLMs in Patient Safety Event Triage

PSEBench est un benchmark de 5 074 cas pour évaluer les LLM sur le triage des événements de sécurité des patients selon les politiques de Minnesota. La méthodologie utilise des « clause cards » pour factoriser les textes réglementaires en spécifications de décision auditables, avec vérification en boucle fermée. Évaluation de 15 LLM représentatifs révèle des tendances de capacité et des lacunes pour le triage fiable.

BenchmarksÉvaluationsSécurité IA
SIG
78
HYP
15
arXiv cs.AI·

Minimizing the Hidden Cost of Scales: Graph-Guided Ultra-Low-Bit Quantization for Large Language Models

SAGE-PTQ, une méthode de quantification ultra-faible précision pour LLM, réduit le coût caché des échelles en séparant poids saillants et non-saillants via statistiques distributionnelles et modélisation graphique. Sur LLaMA-3-8B : 6.74 perplexité WikiText2 vs 55.8 pour BiLLM, avec 50% moins de mémoire GPU. Sur LLaMA-2-70B : décodage 1.5x plus rapide sur NVIDIA L40.

LlamaBenchmarks
SIG
78
HYP
15
arXiv cs.AI·

Stability vs. Manipulability: Evaluating Robustness Under Post-Decision Interaction in LLM Judges

Les juges LLM utilisés pour évaluer les modèles IA sont instables sous interaction post-décision. Sur MT-Bench et AlpacaEval, les chercheurs montrent que des jugements initiaux peuvent être renversés par des défis ciblés, dégradant l'accord avec les préférences humaines et modifiant les classements. Ils introduisent l'Evaluation Robustness Score (ERS) pour mesurer cette fragilité.

ÉvaluationsBenchmarksSécurité IA
SIG
78
HYP
25
arXiv cs.AI·

SentinelBench: A Benchmark for Long-Running Monitoring Agents

SentinelBench est un benchmark open-source pour évaluer les agents IA sur des tâches de monitoring long terme (minutes à heures). Il contient 100 tâches dans 10 environnements web synthétiques (email, calendriers, finance, réseaux professionnels). Le benchmark mesure le temps de réaction, l'utilisation de ressources et la complétion de tâches, révélant le compromis entre réactivité et coût.

Agents IABenchmarksÉvaluations
SIG
72
HYP
25
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> withastro /</span> flue

Flue est un framework d'agents sandbox pour Astro. Permet de créer et orchestrer des agents IA isolés dans un environnement contrôlé.

Agents IAOpen sourceOutils
SIG
35
HYP
45
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> withastro /</span> flue

Flue est un framework d'agent sandbox pour Astro. Permet de créer et exécuter des agents dans un environnement isolé.

Agents IAOpen sourceOutils
SIG
35
HYP
25
Reddit r/MachineLearning·

How OpenAI Dreaming V3 works (+ every other agent Memory Framework [N]

OpenAI lance ChatGPT Dreaming V3, un système de mémoire asynchrone qui synthétise un état cohérent à partir des sources brutes (chats, fichiers, apps) plutôt que de maintenir une liste curatée. La synthèse se régénère continuellement. L'article classe les frameworks mémoire en 3 philosophies : objets stockés, hiérarchie compressée, synthèse continue (Karpathy et Dreaming uniquement).

OpenAIAgents IARAG
SIG
35
HYP
72
Reddit r/LocalLLaMA·

OpenLumara - A different kind of AI agent, written from scratch, not vibecoded. Extremely token-efficient, super small system prompt, made for local models. Everything is modular.

OpenLumara est un agent IA open-source (GPL2) conçu pour les modèles locaux, avec un système prompt de ~4k tokens et une architecture modulaire. Développé manuellement sur plusieurs mois, il privilégie l'efficacité énergétique, la sécurité intégrée et une WebUI conviviale, se positionnant comme plus léger et sécurisé qu'OpenClaw ou Hermes.

Agents IAOpen sourceOutils
SIG
55
HYP
45
Reddit r/LocalLLaMA·

Running Qwen3.6-35B-A3B on a laptop RTX 4060 (8GB) — what worked, what didn't, and a surprising speculative-decoding result

Utilisateur optimise Qwen3.6-35B-A3B (MoE 35B/3B actifs) sur RTX 4060 8GB. Configuration finale : --no-mmap critique (11→43 tok/s), ≥1.5GB VRAM libre obligatoire, CPU bottleneck dominant. Speculative decoding +26% (contradictoire vs benchmarks communautaires). Architecture hybride (10 couches attention + 40 GDN) explique résultats contre-intuitifs.

QwenGénération de codeFine-tuning
SIG
72
HYP
15
Reddit r/MachineLearning·

TinyTPU: SystemVerilog systolic array compiled to WASM, running live in browser - RTL golden-verified against numpy [P]

TinyTPU est un réseau systolique 4×4 en SystemVerilog compilé en WebAssembly avec visualisation interactive dans le navigateur. L'outil permet d'observer l'exécution réelle du matériel : chargement des poids, flux diagonal de la matrice A, accumulation des sommes partielles. Trois niveaux pédagogiques : cellule MAC isolée, array complet 4×4, et tiling pour matrices plus grandes.

InfrastructureBenchmarksOpen source
SIG
82
HYP
15