Page 43 sur 192

ToutHaut signalRécent
7679 articles
arXiv cs.AI·

Design and Report Benchmarks for Knowledge Work

Article arXiv proposant une méthodologie pour concevoir des benchmarks d'IA adaptés au travail de connaissance (coding, recherche, santé). Les auteurs critiquent les évaluations actuelles qui ne reflètent pas les conditions réelles et proposent un cadre en 3 étapes : définir l'activité, spécifier le contexte (outils, rôles, contraintes), scorer le produit final. Analyse de 3 cas : GDPval, OfficeQA Pro, APEX-SWE.

BenchmarksAgents IAGénération de code
SIG
75
HYP
15
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> github /</span> copilot-sdk

GitHub publie un SDK multi-plateforme pour intégrer l'agent Copilot dans des applications et services tiers. Permet aux développeurs d'accéder aux capacités d'IA de Copilot via API standardisée.

Agents IAGénération de codeOutils
SIG
75
HYP
25
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> google-research /</span> timesfm

TimesFM est un modèle fondation préentraîné développé par Google Research pour la prévision de séries temporelles. Le repo GitHub propose une implémentation open-source de ce modèle spécialisé.

DeepMindOpen sourceBenchmarks
SIG
75
HYP
20
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> microsoft /</span> agent-governance-toolkit

Microsoft publie un toolkit de gouvernance pour agents IA autonomes. Inclut application de politiques, identité zero-trust, sandboxing d'exécution et ingénierie de fiabilité. Couvre les 10/10 risques OWASP Agentic Top 10.

Agents IASécurité IAOutils
SIG
75
HYP
25
Simon Willison·

FTC to Require Cox Media Group, Two Other Firms to Pay Nearly $1 Million to Settle Charges They Deceived Customers About “Active Listening” AI-Powered Marketing Service

La FTC condamne Cox Media Group et deux autres entreprises à payer près d'1 million de dollars pour avoir trompé les clients sur un service marketing IA appelé « Active Listening ». Le service prétendait écouter les conversations via les appareils intelligents pour cibler les publicités, mais n'utilisait en réalité aucune donnée vocale.

RégulationSécurité IABusiness
SIG
75
HYP
25
arXiv cs.LG·

Calibration, Uncertainty Communication, and Deployment Readiness in CKD Risk Prediction: A Framework Evaluation Study

Étude comparative de 5 classifieurs (régression logistique, random forest, XGBoost, SVM, naive Bayes) sur prédiction du risque de maladie rénale chronique. Tous atteignent AUROC 1.00 en interne (UCI, 400 patients), mais s'effondrent sur MIMIC-IV externe (AUROC 0.48-0.58). Calibration et couverture conforme dégradées drastiquement. Aucun modèle ne satisfait les critères de déploiement clinique.

ÉvaluationsSécurité IA
SIG
75
HYP
15
arXiv cs.CL·

Psy-Chronicle:A Structured Pipeline for Synthesizing Long-Horizon Campus Psychological Counseling Dialogues

Psy-Chronicle est un framework de génération de données pour synthétiser des dialogues de conseil psychologique sur long horizon. Les auteurs créent CPCD, un dataset chinois de 90 000 dialogues couvrant 100 profils d'étudiants sur un semestre, avec un benchmark évaluant la mémoire long-horizon et le raisonnement causal. Code et données open-sourcés.

PapersBenchmarksOpen source
SIG
75
HYP
25
arXiv cs.CL·

Faithful-MR1: Faithful Multimodal Reasoning via Anchoring and Reinforcing Visual Attention

Faithful-MR1 est un framework d'entraînement pour MLLMs qui améliore le raisonnement multimodal via apprentissage par renforcement. Il ancre l'attention visuelle directement sur les régions d'image (pas via descriptions textuelles) et renforce l'utilisation fidèle de cette attention par intervention contrefactuelle. Résultats sur Qwen2.5-VL-Instruct 3B/7B avec moins de données.

Reinforcement learningVisionRaisonnement
SIG
75
HYP
25
arXiv cs.LG·

Value-Gradient Hypothesis of RL for LLMs

Étude théorique de pourquoi les méthodes RL sans critique (PPO, GRPO) améliorent les LLM. Les auteurs montrent que les mises à jour d'acteur sont de type value-gradient en espérance, et que l'autodifférenciation à travers l'attention produit des costates empiriques approximant le signal de valeur. Décomposition de l'impact RL en signal value-gradient et marge de récompense atteignable.

Reinforcement learningRaisonnementPapers
SIG
75
HYP
15
arXiv cs.CL·

FlyRoute: Self-Evolving Agent Profiling via Data Flywheel for Adaptive Task Routing

FlyRoute est un framework d'auto-évolution de profils d'agents qui améliore le routage de requêtes en entreprise. Via un mécanisme de flywheel, il collecte des preuves de capacités depuis le trafic réel, distille des descriptions apprises et les injecte dans un routeur LLM avec des succès récupérés par BM25. Sur un dataset propriétaire, FlyRoute passe de 72,57% (zero-shot) à 89,83% de précision après 7,211 requêtes.

Agents IAMulti-agentsPrompt engineering
SIG
75
HYP
25
Reddit r/LocalLLaMA·

LLM planner - pick a rig for your use-case/model/budget, or pick models for your rig. 60+ builds, 50+ models, 130+ cited t/s sources, 150+ reviewer YouTube videos, idle+active watts, multi-region prices, regular updates.

LLM Planner est un guide interactif pour choisir du matériel ou des modèles open-weights. 60+ configurations, 50+ modèles, tokens/sec sourcés, consommation électrique, prix multi-régions, 150+ vidéos YouTube de reviewers. Modes bidirectionnels : « quel rig pour ce modèle/budget » ou « quels modèles sur mon GPU ». Données mises à jour hebdomadairement, repo GitHub public.

Open sourceOutilsBenchmarks
SIG
75
HYP
25
arXiv cs.LG·

LEAP: A closed-loop framework for perovskite precursor additive discovery

LEAP couple un LLM spécialisé en chimie des pérovskites avec l'apprentissage actif pour découvrir des additifs précurseurs optimisant les cellules solaires. Le modèle extrait des connaissances mécanistiques de la littérature et génère des descripteurs interprétables intégrés dans une optimisation bayésienne. Validation expérimentale : PCE de 20,13-20,87% vs 19,25% contrôle, champion 21,32%.

Agents IARaisonnementBenchmarks
SIG
75
HYP
25
arXiv cs.LG·

Automated Kernel Discovery Towards Understanding High-dimensional Bayesian Optimization

Kernel Discovery, un framework évolutionnaire piloté par LLM, automatise la conception de noyaux Gaussiens pour l'optimisation bayésienne haute-dimensionnelle. La méthode génère des formes mathématiques nouvelles via LLM, les convertit en code validé, et utilise un critère LOO-CRPS pour éviter le surapprentissage. Sur 5 benchmarks, elle atteint un rang moyen de 1,2/17.

RaisonnementBenchmarksPapers
SIG
75
HYP
25
arXiv cs.LG·

CP-MoE: Consistency-Preserving Mixture-of-Experts for Continual Learning

CP-MoE propose un framework de continual learning pour LLMs et VLMs utilisant une architecture Mixture-of-Experts. Un expert transient capture les mises à jour initiales spécifiques aux tâches et guide leur intégration dans des experts stables via un routing bias et une régularisation. Validé sur SuperNI et VQA v2, CP-MoE réduit l'oubli catastrophique tout en préservant le transfert de connaissances cross-task.

Papers
SIG
75
HYP
20
arXiv cs.CL·

MedicalBench: Evaluating Large Language Models Toward Improved Medical Concept Extraction

MedicalBench est un benchmark pour l'extraction de concepts médicaux implicites à partir de dossiers médicaux (MIMIC-IV). Il formule la tâche comme vérification de paires note-concept avec identification d'évidences au niveau phrase. Les LLM actuels obtiennent des performances modestes, révélant la difficulté du raisonnement médical implicite.

BenchmarksRaisonnementÉvaluations
SIG
75
HYP
15