Page 34 sur 192

ToutHaut signalRécent
7679 articles
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> trycua /</span> cua

Infrastructure open-source pour agents d'utilisation informatique. Propose des bacs à sable, SDKs et benchmarks pour entraîner et évaluer des agents IA capables de contrôler des bureaux complets (macOS, Linux, Windows).

Agents IAOpen sourceBenchmarks
SIG
75
HYP
25
arXiv cs.AI·

StreamMemBench: Streaming Evaluation of Agent Memory for Future-Oriented Assistance

StreamMemBench est un benchmark d'évaluation pour tester la mémoire des agents IA dans des scénarios réalistes. Il construit des séquences de deux tâches autour d'observations vidéo (EgoLife) pour mesurer si l'agent utilise les preuves stockées et réutilise les retours utilisateur. Tests sur 8 systèmes de mémoire montrent que les agents échouent souvent à transformer le feedback en comportement fiable.

Agents IABenchmarksÉvaluations
SIG
75
HYP
15
arXiv cs.CL·

QIAS 2026: Overview of the Shared Task on Islamic Inheritance Reasoning

QIAS 2026 est un défi partagé évaluant la capacité des LLM à raisonner sur l'héritage islamique. Basé sur MAWARITH (12 500 cas arabes annotés), il requiert calcul complet : identification des héritiers et attribution des parts. 16 équipes ont testé prompting, RAG et fine-tuning. Les résultats montrent que l'interprétation légale précise et le raisonnement numérique structuré restent très difficiles.

BenchmarksRaisonnementRAG
SIG
75
HYP
15
arXiv cs.AI·

HarnessX: A Composable, Adaptive, and Evolvable Agent Harness Foundry

HarnessX est une plateforme pour créer des harnesses d'agents IA composables et adaptatifs. Elle utilise AEGIS, un moteur d'évolution multi-agent piloté par les traces d'exécution, pour optimiser les prompts, outils et flux de contrôle. Sur 5 benchmarks (ALFWorld, GAIA, WebShop, tau³-Bench, SWE-bench), HarnessX atteint +14,5% de gain moyen (+44% max), sans augmenter la taille du modèle.

Agents IAMulti-agentsPrompt engineering
SIG
75
HYP
25
arXiv cs.AI·

GitOfThoughts: Version-Controlled Reasoning and Agent Memory You Can Replay, Diff, and Merge

GitOfThoughts stocke le raisonnement des agents LLM sous forme de dépôt git : chaque pensée est un commit, les scores sont des notes, les résultats sont des tags. Étude empirique sur 5 substrats de mémoire (aucun, markdown, vecteur, graphe, git) : la mémoire n'améliore la précision que si le cas récupéré est quasi-identique au problème actuel (similarité >0,8). Le gain principal reste l'échantillonnage au test-time.

Agents IARaisonnementÉvaluations
SIG
75
HYP
25
arXiv cs.LG·

Contract-Based Compositional Shielding for Safe Multi-Agent Reinforcement Learning

Méthode de shielding décentralisé pour l'apprentissage par renforcement multi-agent garantissant la sécurité globale sans contrôle centralisé. Les agents partagent une spécification LTL_safe globale et sélectionnent des obligations locales dont la conjonction implique la spécification globale, via un bandit multi-armé non-stationnaire. Évaluation sur 6 environnements et 15 variantes algorithmiques.

Multi-agentsReinforcement learningSécurité IA
SIG
75
HYP
15
arXiv cs.AI·

When Sample Selection Bias Precipitates Model Collapse

L'entraînement récursif sur données synthétiques risque l'effondrement du modèle : la sélection de données basée sur des références locales fragmentées élimine les modes de queue globalement pertinents. Les auteurs prouvent théoriquement que cette sélection en silos accélère l'effondrement et proposent des références proxy Wasserstein multi-silos sans partage de données brutes.

PapersBenchmarksSécurité IA
SIG
75
HYP
15
arXiv cs.LG·

Neural Slack Variables for Shape Constraints

Nouvelle méthode pour imposer des contraintes d'inégalité (monotonie, convexité) dans les réseaux de neurones via des variables slack neurales. Approche couplant un réseau principal avec un réseau auxiliaire appris conjointement, convertissant l'application de contraintes en problème de régression. Atteint zéro violation mesurée sur tests de monotonie/convexité, surpassant méthodes de pénalité et primal-dual.

PapersRaisonnementFine-tuning
SIG
75
HYP
15
arXiv cs.AI·

SkillAudit: Ground-Truth-Free Skill Evolution via Paired Trajectory Auditing

SkillAudit est un framework pour faire évoluer les compétences d'agents LLM sans feedback ground-truth. Via l'audit de trajectoires appariées, le système exécute la même tâche avec et sans la compétence candidate, puis utilise Process-Aligned Contrastive Evaluation pour isoler les changements de comportement. Sur 89 tâches, SkillAudit atteint 73,9% de récompense moyenne vs 56,7% pour la compétence expert statique.

Agents IARaisonnementÉvaluations
SIG
75
HYP
25
The Decoder·

KPMG fabricated AI case studies in a report designed to sell clients on AI adoption

KPMG a publié un rapport sur l'IA en entreprise contenant des études de cas fictives impliquant UBS, le NHS et d'autres organisations. Edward Tian (GPTZero) a aidé à découvrir les erreurs et alerte sur les « hallucinations secondaires » : des affirmations erronées de cabinets de conseil de confiance qui se propagent sans vérification. KPMG a retiré le rapport.

Sécurité IABusinessÉvaluations
SIG
75
HYP
45
Reddit r/MachineLearning·

The Verifier Tax: Horizon-Dependent Safety–Success Tradeoffs in Tool-Using LLM Agents [R]

Papier présenté à ACM CAIS 2026 sur l'évaluation de sécurité des agents LLM utilisant des outils. Les auteurs distinguent succès sûr, succès non sûr et échec, et montrent que la vérification réduit les succès non sûrs mais diminue aussi la complétude des tâches avec l'augmentation de l'horizon (« Verifier Tax »). Architecture à deux niveaux : vérifications déterministes puis vérificateur basé LLM.

Agents IASécurité IAÉvaluations
SIG
75
HYP
25
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> vercel /</span> ai

Vercel lance AI SDK, une librairie open-source TypeScript pour construire des applications et agents IA. Outil gratuit des créateurs de Next.js.

Agents IAGénération de codeOpen source
SIG
75
HYP
25
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> NVIDIA /</span> physicsnemo

NVIDIA publie PhysicsNeMo, framework open-source pour construire et entraîner des modèles deep learning avec des méthodes Physics-ML. Disponible sur GitHub.

Open sourceInfrastructureFine-tuning
SIG
75
HYP
20
Simon Willison·

Statement on the US government directive to suspend access to Fable 5 and Mythos 5

Le gouvernement américain a ordonné à Anthropic de suspendre l'accès à Fable 5 et Mythos 5 pour tous les utilisateurs, citant des raisons de sécurité nationale. La directive invoque un risque de « jailbreak » permettant de contourner les protections du modèle. Anthropic conteste : les vulnérabilités identifiées sont mineures et disponibles sur d'autres modèles publics comme GPT-5.5.

AnthropicRégulationSécurité IA
SIG
75
HYP
45
arXiv cs.CL·

SkillChain: Closing the Loop on Skill Evolution for Image-Based E-Commerce AI Assistants

SkillChain automatise l'évolution des compétences pour assistants IA multimodaux en e-commerce. Le système gère trois étapes : création de Skills à partir de specs, optimisation du routage, et raffinement itératif via évaluation LLM. Déployé en production, il améliore la conformité structurelle et la qualité du contenu, confirmé par A/B test sur l'engagement utilisateur.

Agents IAMulti-agentsVision
SIG
75
HYP
25
arXiv cs.CL·

SafeLLM: Extraction as a Hallucination-Resistant Alternative to Rewriting in Safety-Critical Settings

SafeLLM compare l'extraction de lignes à la réécriture libre pour les systèmes RAG en contexte critique (SOPs, politiques HR, guidelines médicales). L'extraction basée sur numéros de ligne surpasse la copie directe et les stratégies orientées sécurité, atteignant 95% de rappel de termes sur documents NHS et NICE, avec meilleure fidélité au texte source.

RAGSécurité IAÉvaluations
SIG
75
HYP
15
arXiv cs.AI·

APCyc: Property-Informed Design of Cyclic Peptides via Automated Cyclization

APCyc est un framework de génération de novo de peptides cycliques qui modélise explicitement la cyclisation et optimise simultanément plusieurs propriétés physicochimiques. Le modèle utilise un vocabulaire de résidus étendu et un guidage bayésien pour générer des peptides cycliques adaptés à des cibles thérapeutiques spécifiques.

Génération de codeReinforcement learningPapers
SIG
75
HYP
15
arXiv cs.CL·

Shopping Reasoning Bench: An Expert-Authored Benchmark for Multi-Turn Conversational Shopping Assistants

Shopping Reasoning Bench : benchmark expert de 525 missions (232 single-turn, 293 multi-turn) avec 10863 rubriques binaires pondérées pour évaluer les assistants conversationnels de shopping. Évaluation de 9 modèles (GPT, Claude, Gemini) : taux de réussite 57-77%, dégradation de 4-18 points au fil de la conversation, écart de 13-29 points entre critères obligatoires et optionnels.

BenchmarksGPTClaude
SIG
75
HYP
25