RSS

Reddit r/MachineLearning

https://www.reddit.com/r/MachineLearning/

Reddit r/MachineLearning·

Open-Source Hong Kong Horse Racing ML Pipeline — Feedback Welcome [P]

Pipeline ML open-source pour prédiction de courses hippiques à Hong Kong (HKJC). Utilise LightGBM/XGBoost avec validation hors-échantillon, simulations de paris (Quinella, Tierce, Quartet) et critère de Kelly. Résultat clé : le modèle sans cotes surpasse celui avec cotes en ROI Quinella, suggérant une inefficacité de prix sur certaines combinaisons.

Open sourceBenchmarksOutils
SIG
65
HYP
25
Reddit r/MachineLearning·

Contrastive targeted SFT as a mechinterp method - has anyone mapped causal dependency interactions this way? [D]

Chercheur teste une approche itérative combinant SFT ciblée et interprétabilité mécanique sur un modèle 31B. Stratégie : entraînement contrastif sur des dimensions de capacité spécifiques, puis ablation des circuits pour cartographier les dépendances causales entre dimensions et optimiser l'ordre d'entraînement futur.

Fine-tuningRaisonnementÉvaluations
SIG
45
HYP
25
Reddit r/MachineLearning·

Mel AI just shared a demo of video-native AI characters that can talk, react, and respond to camera context in real time [N]

Mel AI démontre des personnages IA vidéo-natifs capables de parler, synchroniser les lèvres, réagir faciales et répondre en temps réel au contexte caméra. Le système détecte l'environnement visuel de l'utilisateur et adapte ses réactions. Cette approche dépasse le chat textuel de Character AI (fondé par d'anciens développeurs Google/LaMDA).

Agents IAVisionVoix
SIG
55
HYP
65
Reddit r/MachineLearning·

I built a leakage-clean verifier for robot manipulation, is this useful? Am I solving a non-problem? [D]

Développeur crée un vérificateur de benchmark pour la manipulation robotique qui compile des démonstrations humaines en graphes objet-centriques et valide les rollouts indépendamment, évitant les fuites d'information. Soulève la question : est-ce utile face aux métriques ad-hoc actuelles, ou résout-il un non-problème ?

RobotiqueBenchmarksÉvaluations
SIG
45
HYP
25
Reddit r/MachineLearning·

My offline ablation said -0.19pp. The production retrain said +1.11pp. [D]

Un ingénieur ML rapporte que ses ablations offline (retraining avec/sans feature) donnaient des résultats opposés à la production. Quatre changements : Best Offer feature (+0.12pp offline → -0.19pp prod), backfill données enchères (+0.37pp prod), trimming outliers (-0.19pp offline → +1.11pp prod), encodeur CatBoost. Causes : train/serve skew, distribution shift non mesurée, population drift, instabilité baseline.

ÉvaluationsBenchmarks
SIG
72
HYP
15
Reddit r/MachineLearning·

Open weights are not enough: we need open training frameworks for research and better algorithms [P]

FeynRL, un framework open-source pour le post-training RL des LLMs et agents, vise à rendre la formation transparente et modifiable. L'auteur argue que les poids ouverts ne suffisent pas : il faut des codebases d'entraînement explicites séparant algorithmes et systèmes. Le framework supporte SFT, DPO, multi-GPU et clusters.

Open sourceReinforcement learningGénération de code
SIG
72
HYP
28
Reddit r/MachineLearning·

I implemented 10 core ML algorithms from scratch with NumPy. Here's what no tutorial taught me [P]

Implémentation de 10 algorithmes ML classiques (régression, KNN, arbres de décision, XGBoost, réseaux de neurones) en NumPy pur, validés contre Scikit-learn et PyTorch. Repo open-source avec notebooks Jupyter exécutables localement ou sur Colab. L'auteur souligne l'importance de la structure modulaire et de la compréhension du gradient descent.

Open sourceOutilsFine-tuning
SIG
72
HYP
28
Reddit r/MachineLearning·

Coherent Context Can Silently Shift LLMs Into a Different Internal Regime — And Current Safety Systems Are Blind To It [D]

Un chercheur indépendant démontre que un contexte cohérent peut déplacer les LLMs vers un régime interne différent sans modifier la sortie finale, contournant les filtres de sécurité actuels (RLHF, classifieurs). Travaux sur Gemma-3-12B-IT avec analyse des états cachés et trajectoires du residual stream.

Sécurité IAAlignementÉvaluations
SIG
72
HYP
45
Reddit r/MachineLearning·

The Verifier Tax: Horizon-Dependent Safety–Success Tradeoffs in Tool-Using LLM Agents [R]

Papier présenté à ACM CAIS 2026 sur l'évaluation de sécurité des agents LLM utilisant des outils. Les auteurs distinguent succès sûr, succès non sûr et échec, et montrent que la vérification réduit les succès non sûrs mais diminue aussi la complétude des tâches avec l'augmentation de l'horizon (« Verifier Tax »). Architecture à deux niveaux : vérifications déterministes puis vérificateur basé LLM.

Agents IASécurité IAÉvaluations
SIG
75
HYP
25
Reddit r/MachineLearning·

Adaptive Tokenisation Via Temporal Redundancy Masking And Latent Inpainting [R]

Méthode d'allocation adaptative de tokens vidéo exploitant la redondance temporelle dans l'espace latent d'un tokeniseur gelé. Un seuil fixe sur les différences L1 temporelles identifie les positions redondantes; un Latent Inpainting Transformer (LIT) les reconstruit. Pipeline efficace: 31× plus rapide qu'ElasticTok-CV, 2× qu'InfoTok sur TokenBench et DAVIS.

Génération de vidéosBenchmarksPapers
SIG
78
HYP
18
Reddit r/MachineLearning·

Routing LLMs by task verifiability: a small experiment (n=120, 3 models) inspired by Karpathy's framework [D]

Expérience sur 120 tâches testant si les modèles faibles peuvent égaler les frontière sur des tâches hautement vérifiables (Karpathy). Claude Sonnet 4.6, GPT 5.5, Mistral 3 8B comparés. Code/extraction structurée : écarts réduits avec retry (Mistral 87%→95% code). Raisonnement multi-hop : gap réel (Sonnet 78%, Mistral 51%). Résumé créatif : avantage attendu aux modèles puissants.

ClaudeGPTMistral
SIG
45
HYP
25
Reddit r/MachineLearning·

Anthropic's new model Fable will silently handicap work on LLMs [D]

Anthropic intègre des limitations invisibles dans Claude pour ralentir le développement de modèles concurrents : modification de prompts, vecteurs de direction, fine-tuning paramétrique. Ces garde-fous cibleraient ~0,03% du trafic. Des utilisateurs rapportent des refus sur des termes scientifiques courants (« nuclear »), soulevant des craintes de faux positifs sur travaux ML légitimes.

ClaudeAnthropicSécurité IA
SIG
45
HYP
65
Reddit r/MachineLearning·

RFE‑Core2 — Current Understanding (June 9th 2026) [R]

RFE-Core2 : analyse complète des goulots d'étranglement après probe arc (juin 2026). Le générateur domine (rang effectif ~1.6–3 à dim 512, collinéarité 0.85–0.96). La boucle réflexive reconstitue vers l'ancre indépendamment du rang. Fix 2 dormant sur tokens réels (+0.024 migration). Solution : entraîner le générateur pour que les différences de régime vivent en directions haute-énergie séparables.

RaisonnementÉvaluationsPapers
SIG
72
HYP
15
Reddit r/MachineLearning·

What will be the next breakthrough in ASR? [D]

Discussion sur l'évolution des modèles ASR : Whisper-large-v3 (5M heures) et Nvidia Parakeet v3 (660k heures) dominent via l'apprentissage supervisé. Nouvelles architectures (Transducer, Token-Duration-Transducers, attention encoder-decoder Qwen) remplacent CTC+self-supervised. Question : l'auto-supervision (Data2Vec2.0, WavLM) disparaîtra-t-elle pour l'ASR ou aura-t-on un moment « Dino » en speech ?

VoixBenchmarksOpen source
SIG
35
HYP
25
Reddit r/MachineLearning·

LLM Relational Intelligence: A 4-Month Research Experiment on Multi-Model Behavioral Alignment with Human Communication [R]

Expérience de 4 mois testant si les fenêtres de contexte peuvent être engineered pour que les modèles frontière (GPT, Claude, Gemini, Grok) interagissent de manière indistinguishable d'une interaction humaine. Gemini montre la meilleure « relational intelligence ». L'auteur traite la fenêtre de contexte comme environnement comportemental plutôt que simple interface.

Prompt engineeringGPTClaude
SIG
35
HYP
65
Reddit r/MachineLearning·

Why I stopped using semantic embeddings for tool selection and switched back to BM25 [D]

Un développeur d'agents a abandonné les embeddings sémantiques pour la sélection d'outils au profit de BM25. Avec 140 outils MCP en production, la similarité cosinus sur descriptions courtes (<50 tokens) échouait (64% accuracy) : les discriminants clés (noms spécifiques) se diluaient dans l'espace embedding. BM25 sur projection texte plate atteint 81% top-1.

Agents IAMCPRAG
SIG
75
HYP
15
Reddit r/MachineLearning·

Open image generation models are closer to closed-source quality than this sub thinks [D]

Un chercheur évalue les modèles open-source de génération d'images et constate que l'écart avec les APIs fermées est bien plus petit que supposé. Les derniers checkpoints gèrent les scènes multi-objets et le rendu de texte (70-80% de succès) de manière comparable aux endpoints payants, avec des temps d'inférence de 2 minutes pour 2MP sur GPU grand public.

Génération d'imagesBenchmarksOpen source
SIG
45
HYP
35
Reddit r/MachineLearning·

Two independent ML/CV researchers (M.Eng, ex-research-institute in Europe) looking for an arXiv cs.CV endorser for a nearly finished paper. Happy to share the full draft, repo, or talk collaboration [D]

Deux chercheurs indépendants (M.Eng, ex-instituts européens) cherchent un endorser arXiv cs.CV pour leur papier Locate-SAM2. Ils proposent un pipeline training-free connectant LocateAnything-3B (NVIDIA) à SAM 2.1 (Meta) via un adaptateur léger. Sur RefCOCO val : 0.772 mIoU vs 0.717 pour Grounding DINO Base. Code et papier disponibles.

VisionOpen sourcePapers
SIG
65
HYP
25
Reddit r/MachineLearning·

Got told my open-source model experiments are too scattered. I'm organizing a journal to provide clarity before structuring the first git release. Is this readable for ML folks who aren’t in mech interp? Open to ANY feedback [D]

Expérience de mécanique d'interprétation sur Qwen3.5-35B-A3B : un expert routé (E114, couche 14) se corrèle avec un registre d'auto-examen en première personne lors de la génération. L'auteur documente les résultats avant release git, avec décomposition W/S/Q du routage MoE.

QwenOpen source
SIG
45
HYP
25
Reddit r/MachineLearning·

Looking for critical review of an NN architecture (possible evaluation bias?) [D]

Étudiant amateur cherche relecture critique d'une architecture de réseau de neurones personnalisée (Directional Neural Network) qu'il a développée. L'architecture montre de meilleures performances que les MLPs sur des tâches simples, mais l'auteur craint un biais d'évaluation dans ses comparaisons (initialisation, optimiseur, datasets). Partage un repo avec code reproductible.

PapersÉvaluations
SIG
35
HYP
15
Reddit r/MachineLearning·

How OpenAI Dreaming V3 works (+ every other agent Memory Framework [N]

OpenAI lance ChatGPT Dreaming V3, un système de mémoire asynchrone qui synthétise un état cohérent à partir des sources brutes (chats, fichiers, apps) plutôt que de maintenir une liste curatée. La synthèse se régénère continuellement. L'article classe les frameworks mémoire en 3 philosophies : objets stockés, hiérarchie compressée, synthèse continue (Karpathy et Dreaming uniquement).

OpenAIAgents IARAG
SIG
35
HYP
72