RSS

Reddit r/LocalLLaMA

https://www.reddit.com/r/LocalLLaMA/

Reddit r/LocalLLaMA·

I released Inflect-Nano, an ultra-extreme tiny 4.63m parameter TTS model.

Inflect-Nano-v1, modèle TTS de 4.63M paramètres, est le 2e plus petit modèle de synthèse vocale public. Composé d'un modèle acoustique (3.46M) et d'un vocoder (1.17M), il génère de l'audio 24 kHz en anglais. ~17x plus petit que Kokoro, ~108x plus petit que Chatterbox. Exécutable localement en PyTorch, adapté aux appareils embarqués et assistants vocaux hors ligne.

VoixOpen sourceOutils
SIG
72
HYP
25
Reddit r/LocalLLaMA·

Get in here: Community model build thread

Un thread Reddit propose de créer un modèle communautaire via calcul distribué en utilisant une approche Mixture-of-Experts (MoE). La stratégie « Branch-Train-Stitch » distribue un modèle prototype dense à des participants qui l'entraînent indépendamment sur leur matériel, puis fusionnent les sous-modèles en MoE. Les décisions clés incluent la taille du prototype (2B ou 7B) selon la VRAM disponible.

Open sourceFine-tuning
SIG
35
HYP
45
Reddit r/LocalLLaMA·

A benchmark for tiny LLMs based on a real world problem: natural language file search (using monkeSearch)

Benchmark pour petits LLM (<3B paramètres) évaluant la capacité à parser du langage naturel en JSON structuré pour la recherche de fichiers. 9 modèles testés (Gemma-3 270M à DeepSeek R1 Distill 1.5B) sur 80 requêtes couvrant types de fichiers, contexte temporel et spécificité. Résultats : modèles 0.8B–1.5B surpassent les sub-0.5B.

BenchmarksOpen sourceGénération de code
SIG
72
HYP
25
Reddit r/LocalLLaMA·

Why might DiffusionGemma be better at tool calls than its benchmark quality suggests

DiffusionGemma génère 256 tokens en parallèle avec attention bidirectionnelle, permettant l'auto-correction avant finalisation. Contrairement aux modèles autorégressifs figés après chaque token, cette architecture pourrait améliorer les appels d'outils structurés malgré une qualité de base inférieure à Gemma 4. Reste à tester si la correction bidirectionnelle compense la qualité plus faible.

GeminiGénération de codeRaisonnement
SIG
35
HYP
45
Reddit r/LocalLLaMA·

Be wary of Qwen/Claude distillations - they're often worse than the base model

Les distillations Qwen/Claude circulant sur r/LocalLLaMA (Qwopus, Fable 5 sur Qwen 3.6) utilisent 4k-10k samples d'entraînement, insuffisant pour améliorer les performances. Comparé aux 700k samples des distillations DeepSeek-R1 officielles, ces modèles ne dépassent pas le Qwen de base et dégradent légèrement la qualité malgré un style de raisonnement différent.

QwenClaudeFine-tuning
SIG
72
HYP
45