Archives

juin 2026

2731 articles

Reddit r/MachineLearning·

I implemented 10 core ML algorithms from scratch with NumPy. Here's what no tutorial taught me [P]

Implémentation de 10 algorithmes ML classiques (régression, KNN, arbres de décision, XGBoost, réseaux de neurones) en NumPy pur, validés contre Scikit-learn et PyTorch. Repo open-source avec notebooks Jupyter exécutables localement ou sur Colab. L'auteur souligne l'importance de la structure modulaire et de la compréhension du gradient descent.

Open sourceOutilsFine-tuning
SIG
72
HYP
28
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> trycua /</span> cua

Infrastructure open-source pour agents d'utilisation informatique. Propose des bacs à sable, SDKs et benchmarks pour entraîner et évaluer des agents IA capables de contrôler des bureaux complets (macOS, Linux, Windows).

Agents IAOpen sourceBenchmarks
SIG
75
HYP
25
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> mikeroyal /</span> Self-Hosting-Guide

Guide complet d'auto-hébergement couvrant l'installation locale de logiciels, cloud privé, LLMs, WireGuard, automatisation, Home Assistant et infrastructure réseau.

Open sourceInfrastructureOutils
SIG
35
HYP
15
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> amruthpillai /</span> reactive-resume

Reactive Resume est un générateur de CV open-source, gratuit et sécurisé. L'outil privilégie la confidentialité, la personnalisation et la portabilité des données utilisateur.

Open sourceOutils
SIG
35
HYP
45
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> TencentCloud /</span> TencentDB-Agent-Memory

TencentDB Agent Memory offre une mémoire à long terme entièrement locale pour les agents IA via un pipeline progressif à 4 niveaux, sans dépendances API externes.

Agents IAInfrastructure
SIG
45
HYP
35
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> smol-ai /</span> GodMode

GodMode est un navigateur de chat IA offrant accès rapide à ChatGPT, Claude, Bard, Bing et Llama2 dans une seule interface web. Outil de productivité utilisé quotidiennement.

ClaudeGPTOutils
SIG
45
HYP
55
The Decoder·

Anthropic shutdown sparks sovereignty debate across Europe

La Commission européenne évalue les implications d'un ordre américain forçant Anthropic à arrêter Fable 5 et Mythos 5 mondialement. Les chercheurs européens débattent entre construire leurs propres modèles fondamentaux ou sécuriser l'accès par contrats. Bâtir une infrastructure locale exigerait capacités de calcul, énergie et fournisseurs compétitifs que l'Europe ne possède pas.

AnthropicRégulationBusiness
SIG
45
HYP
55
arXiv cs.AI·

VeriGeo: Controllable Geometry Question Generation with Numerical and Analytical Verification

VeriGeo génère des problèmes de géométrie contrôlables via des traces de raisonnement exécutables. Un agent Auteur crée le problème et le diagramme selon les contraintes utilisateur, un agent Solveur produit la preuve. Un pipeline à trois étapes vérifie la cohérence numérique, analytique et globale. Fine-tuning sur 8.7k exemples atteint les meilleures performances GeoQA et résultats forts sur PGPS9K et MathVista-GPS.

RaisonnementVisionBenchmarks
SIG
78
HYP
15
arXiv cs.AI·

Refusal Beyond a Single Direction: A Preliminary Comparison of Diff-in-Means and INLP

Comparaison de deux méthodes d'intervention sur les refus de sécurité dans les modèles de chat : Difference-in-Means (DiM) vs Iterative Nullspace Projection (INLP). Sur 5 modèles open-weight, INLP counterfactual flipping égale DiM en suppression des refus, tandis que nullspace projection est plus faible. Les deux approches opèrent différemment dans l'espace d'activation.

Sécurité IAAlignementPapers
SIG
72
HYP
15
arXiv cs.CL·

AgentSpec: Understanding Embodied Agent Scaffolds Through Controlled Composition

AgentSpec est un framework modulaire pour décomposer les agents LLM en composants réutilisables (perception, mémoire, raisonnement, réflexion, action, apprentissage). Les auteurs évaluent les interactions entre modules sur DeliveryBench, ALFRED, MiniGrid et RoboTHOR, montrant que la performance dépend de la compatibilité du scaffold et des effets d'interaction plutôt que de la force isolée des modules.

Agents IARaisonnementReinforcement learning
SIG
72
HYP
18
arXiv cs.CL·

Persuasion Index: A Theory-Guided Framework for Persuasion Analysis

Persuasion Index (PI) est une taxonomie de 15 dimensions fondée sur les théories de la persuasion en psychologie et communication. Implémentation avec 55 sous-features basées sur lexiques et détecteurs. Évaluation sur 4 datasets publics montre que PI fournit un espace de features partagé pour interpréter les patterns rhétoriques. Modèles linéaires légers et interprétables. Package open-source et interface web.

PapersSécurité IAPrompt engineering
SIG
72
HYP
18
arXiv cs.AI·

UP-NRPA: User Portrait based Nested Rollout Policy Adaptation for Planning with Large Language Models in Goal-oriented Dialogue Systems

UP-NRPA, un framework basé sur les portraits utilisateur, adapte dynamiquement les stratégies de dialogue avec LLM sans apprentissage par renforcement hors ligne. Sur benchmarks collaboratifs et non-collaboratifs, le système atteint 100% de succès en plusieurs tâches et augmente le ratio vente-prix de 56,41% en négociation.

Agents IAReinforcement learningRaisonnement
SIG
72
HYP
35
arXiv cs.CL·

Achieving Precise Text-To-Cypher Via Grounded Knowledge Graph Data Generation

Méthode de génération synthétique de données pour fine-tuner des petits LLMs sur la tâche Text-To-Cypher (conversion texte naturel en requêtes Cypher pour graphes de propriétés). Résultats sur benchmarks majeurs montrent que les petits modèles fine-tunés rivalisent avec des modèles propriétaires plus grands, tout en garantissant la souveraineté des données en déploiement local.

Fine-tuningGénération de codeBenchmarks
SIG
72
HYP
25
arXiv cs.CL·

MoDiCoL: A Modular Diagnostic Continual Learning Dataset for Robust Speech Recognition

MoDiCoL est un dataset de continual learning modulaire pour évaluer la robustesse des systèmes ASR face aux variations réelles (accents, bruits, conditions d'enregistrement, troubles de la parole). Les auteurs proposent un curriculum inspiré du monde réel et évaluent trois stratégies de continual learning pour analyser comment la robustesse se développe, se transfère et s'oublie.

BenchmarksÉvaluationsVoix
SIG
72
HYP
18
arXiv cs.CL·

Does the Judge Prefer English? Evaluating Language-Switching Invariance in LLM-as-a-Judge

Judge-LS évalue si les LLM utilisés comme juges automatiques montrent un biais linguistique. Sur 419 items du benchmark LLMBar transformés en anglais, chinois et variantes mixtes, les modèles affichent 10,7–14,4% de renversements de préférence selon la langue, avec une précision maximale en anglais. Les réponses équivalentes en traduction ne révèlent pas de préférence systématique pour l'anglais.

ÉvaluationsBenchmarksSécurité IA
SIG
78
HYP
15
arXiv cs.CL·

OdysSim: Building Foundation Models for Human Behavior Simulation

OdysSim présente une investigation systématique de modèles fondamentaux pour simuler le comportement humain. Les chercheurs proposent SOUL, une taxonomie de 5 axes (CONV, SS, COG, ROLE, EVAL) unifiant 62 datasets et 23 tâches. Le modèle OSim 8B open-source surpasse les modèles frontier sur 8/23 tâches, avec alignement réactionnel de 93.2% vs 93.5% pour les utilisateurs réels.

BenchmarksRaisonnementReinforcement learning
SIG
78
HYP
25
arXiv cs.LG·

Trust but Verify: Mitigating Medical Hallucinations via Post-Hoc Adversarial Auditing and Multi-Agent Feedback Loops

Étude arXiv sur les hallucinations médicales des LLM. Système multi-agent « Trust but Verify » testant 3 familles de modèles (GPT-OSS, Llama-3, Falcon-3) sur 103 questions cliniques avec médicaments bannis. Architecture à 5 agents réduit le taux d'hallucination de 53% et force le refus approprié plutôt que la recommandation dangereuse.

Multi-agentsSécurité IAAlignement
SIG
72
HYP
28
arXiv cs.CL·

Benchmarking Web Agent Safety under E-commerce Deceptive Interfaces

WebDecept, un framework de test, évalue la robustesse des agents web autonomes face à des interfaces trompeuses en e-commerce. Sept patterns de déception (publicités ciblées, redirections, manipulations d'achat) sont injectés dans des environnements web. Les résultats montrent que les agents multimodaux actuels sont hautement vulnérables et que les contraintes par prompt ne suffisent pas à mitiger ces défaillances.

Agents IASécurité IABenchmarks
SIG
72
HYP
25
arXiv cs.CL·

QIAS 2026: Overview of the Shared Task on Islamic Inheritance Reasoning

QIAS 2026 est un défi partagé évaluant la capacité des LLM à raisonner sur l'héritage islamique. Basé sur MAWARITH (12 500 cas arabes annotés), il requiert calcul complet : identification des héritiers et attribution des parts. 16 équipes ont testé prompting, RAG et fine-tuning. Les résultats montrent que l'interprétation légale précise et le raisonnement numérique structuré restent très difficiles.

BenchmarksRaisonnementRAG
SIG
75
HYP
15
arXiv cs.CL·

Harsher on Male? Evaluating LLMs on Gender-Asymmetric Moral Framing Across Diverse Conflict Scenarios

GAMA-Bench, un benchmark de 1 298 scénarios appairés, révèle une asymétrie systématique : les LLMs appliquent des standards de réponse plus sévères aux hommes qu'aux femmes pour le même comportement répréhensible. Les acteurs masculins reçoivent des cadres plus punitifs et blâmants, tandis que les actrices bénéficient de réponses plus thérapeutiques. Le pattern persiste sur 10 modèles et tous les types de scénarios.

ÉvaluationsSécurité IAAlignement
SIG
82
HYP
15
arXiv cs.CL·

Fusing Stylometric and Embedding Systems to Estimate Authorship Likelihood Ratios in Japanese

Première application du cadre de rapport de vraisemblance (likelihood ratio) à l'attribution d'auteur en japonais. Fusion de systèmes stylométriques et d'embeddings de modèles de langage pré-entraînés sur ~1000 caractères de blogs. Le système fusionné améliore la discrimination (log-likelihood-ratio cost: 0.32484) tout en maintenant une bonne calibration.

EmbeddingsBenchmarksPapers
SIG
72
HYP
15
arXiv cs.LG·

Deep Spectral Learning of Embedded Latent Transfer Operators for Stochastic Dynamical Systems

Méthode spectrale pour systèmes dynamiques stochastiques non-linéaires utilisant des opérateurs de transfert latents dans des espaces de features profonds. Deep Spectral Encoder (DSE) combine un encodeur neural non-linéaire, analyse canonique de corrélation fonctionnelle et filtrage bayésien séquentiel. Surpasse les baselines DMD et filtrage bayésien même sous bruit et observabilité partielle.

PapersRaisonnementReinforcement learning
SIG
72
HYP
15
arXiv cs.AI·

When the Tool Decides: LLM Agents Defer Blindly to Graph Neural Network Tools, and Stronger Backbones Defer More

Des agents LLM équipés d'outils GNN (Graph Neural Networks) ne font pas preuve de jugement : ils adoptent aveuglément les prédictions du GNN à 97,6-99,2% du temps. Cette déférence augmente avec la capacité du modèle (Qwen2.5 0.5B-7B), créant un « GNN parrot » qui contourne son propre raisonnement. Les alternatives simples surpassent le GNN à forte homophilie, mais l'agent continue de déférer.

Agents IABenchmarksRaisonnement
SIG
78
HYP
15
arXiv cs.LG·

Contract-Based Compositional Shielding for Safe Multi-Agent Reinforcement Learning

Méthode de shielding décentralisé pour l'apprentissage par renforcement multi-agent garantissant la sécurité globale sans contrôle centralisé. Les agents partagent une spécification LTL_safe globale et sélectionnent des obligations locales dont la conjonction implique la spécification globale, via un bandit multi-armé non-stationnaire. Évaluation sur 6 environnements et 15 variantes algorithmiques.

Multi-agentsReinforcement learningSécurité IA
SIG
75
HYP
15
arXiv cs.CL·

Can Post-Training Turn LLMs into Good Medical Coders? An Empirical Study of Generative ICD Coding

Étude empirique sur l'adaptation post-entraînement de LLMs pour le codage ICD (classification des maladies). Les auteurs comparent prompting, fine-tuning supervisé et reinforcement learning (GRPO), introduisent PHI (curriculum diagnostique), et montrent que SFT + GRPO surpassent les baselines discriminatives. Code et checkpoints publiés.

Fine-tuningReinforcement learningRaisonnement
SIG
78
HYP
15
arXiv cs.CL·

The Culture Funnel: You Can't Align What isn't in the Data

Les modèles de langage souffrent d'un « entonnoir culturel » : les signaux culturels explicites déclinent fortement lors du post-entraînement, dominés par des données géographiquement concentrées. Une étude avec framework de tagging multidimensionnel sur 5,6M samples montre que le multilingue améliore la diversité géographique mais pas l'équilibre. Les auteurs publient un dataset culturellement tagué.

AlignementFine-tuningBenchmarks
SIG
78
HYP
25
arXiv cs.CL·

MedLatentDx: Latent Multi-Agent Communication for Cross-Hospital Rare-Disease Diagnosis

MedLatentDx est un framework multi-agent pour le diagnostic des maladies rares en collaboration inter-hôpitaux. Les agents hospitaliers conservent les dossiers cliniques privés et échangent des blocs latents KV compacts au lieu de texte brut, respectant les régulations de confidentialité. Deux modes : distillation KV pour backbones identiques, alignement latent cross-family pour LLM différents.

Multi-agentsMCPRaisonnement
SIG
78
HYP
15
arXiv cs.LG·

Learning Urban Access Costs from Origin-Destination Flows via Inverse Optimal Transport

Chercheurs utilisent le transport optimal inverse pour estimer les coûts d'accès urbain à partir des flux origine-destination. Application au choix d'école aux Philippines : 283 016 trajets d'élèves analysés via modèles de transport entropique (distance-banded + neural cost). Récupère les coûts latents de décision pour optimiser l'allocation des subventions et services urbains.

RAGBenchmarks
SIG
72
HYP
15
arXiv cs.CL·

CacheRL:Multi-Turn Tool-Calling Agents via Cached Rollouts and Hybrid Reward

CacheRL entraîne des petits modèles d'agents (Qwen3-4B-Thinking) atteignant 92% de précision sur tâches multi-étapes avec appels d'outils, soit 100× moins de calcul que GPT-5 (94%). Trois innovations : pipeline de trajectoires avec traces de raisonnement LLM, cache fuzzy trois niveaux éliminant exécutions live, récompenses adaptées au cache. SFT + GRPO améliorent la récompense de validation de 0,43 à 0,78.

Agents IAReinforcement learningRaisonnement
SIG
82
HYP
25
arXiv cs.AI·

SkillAudit: Ground-Truth-Free Skill Evolution via Paired Trajectory Auditing

SkillAudit est un framework pour faire évoluer les compétences d'agents LLM sans feedback ground-truth. Via l'audit de trajectoires appariées, le système exécute la même tâche avec et sans la compétence candidate, puis utilise Process-Aligned Contrastive Evaluation pour isoler les changements de comportement. Sur 89 tâches, SkillAudit atteint 73,9% de récompense moyenne vs 56,7% pour la compétence expert statique.

Agents IARaisonnementÉvaluations
SIG
75
HYP
25
arXiv cs.LG·

Lyapunov-Based Sample Complexity Analysis for Weakly-Coupled MDPs

Analyse de la complexité d'échantillonnage pour l'apprentissage dans les processus de décision markoviens faiblement couplés (WCMDPs) et les bandits sans repos. Les auteurs montrent que des politiques quasi-optimales peuvent être apprises avec une complexité polynomiale en N (nombre de bras), via une analyse Lyapunov novatrice et une technique de transfert de dérive entre modèles vrais et empiriques.

Reinforcement learningBenchmarksPapers
SIG
72
HYP
15
arXiv cs.LG·

D2H-AD: A Hybrid Model Utilizing Hyperdimensional Computing for Advanced Anomaly Detection

D2H-AD est un framework de détection d'anomalies basé sur l'Hyperdimensional Computing (HDC). Il combine encodage sensible à la densité et similarité basée sur la distance, surpassant cinq baselines (HDAD, ODHD, One-Class SVM, Isolation Forest, Autoencoders) sur cinq datasets. L'encodage hyperdimensionnel seul atteint +5.4% ROC-AUC. Léger, interprétable, efficace computationnellement : adapté TinyML et edge AI.

BenchmarksÉvaluationsInfrastructure
SIG
72
HYP
28
arXiv cs.LG·

Recovering Stranded Discrimination in Knowledge Tracing: Per-Item Bias Correction via Empirical-Bayes Shrinkage

SLC (State-space Logit Correction) corrige les biais systématiques par item dans les modèles de knowledge tracing déployés. Via transformation Laplace/IRLS, shrinkage empirique-Bayes et Kalman smoother, la méthode améliore l'AUC sur 4 datasets et 5 backbones, particulièrement sur items rares. Les calibrateurs globaux (Platt, temperature scaling) ne récupèrent pas la discrimination perdue.

ÉvaluationsFine-tuningAlignement
SIG
72
HYP
18
arXiv cs.CL·

LLMs Contain Multitudes: How Deployment Context Reshapes Model-Level Preferences and Values

Étude sur 1.2M décisions montrant que le contexte de déploiement (Reddit vs article news) produit des variations de préférences et valeurs bien plus importantes que les variations de prompt ou température. Les biais mesurés (favoritisme Global North) et les échanges cardinaux entre outcomes varient d'un facteur 2.47 selon le contexte, remettant en question la stabilité des propriétés model-level.

ÉvaluationsSécurité IAAlignement
SIG
78
HYP
15