Topic

#Voix

En IA, la voix désigne les technologies de synthèse et de reconnaissance vocale permettant à une machine de parler ou de comprendre la parole humaine. ElevenLabs, par exemple, génère des voix synthétiques réalistes à partir de texte.

40Articles
8Sources
65Signal moyen
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> Open-LLM-VTuber /</span> Open-LLM-VTuber

Open-LLM-VTuber permet d'interagir avec n'importe quel LLM via voix sans mains libres, interruption vocale et avatar Live2D animé en local sur plusieurs plateformes.

VoixOpen sourceOutils
SIG
45
HYP
00
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> Open-LLM-VTuber /</span> Open-LLM-VTuber

Open-LLM-VTuber permet d'interagir avec n'importe quel LLM via voix sans mains libres, interruption vocale et animation Live2D faciale en local sur plusieurs plateformes.

VoixOpen sourceOutils
SIG
45
HYP
00
Reddit r/MachineLearning·

Real-time multilingual ASR using rolling buffers and monolingual models [P]

Système ASR multilingue temps réel utilisant un routage entre modèles monolingues spécialisés (~100M paramètres chacun) plutôt qu'un seul modèle massif. Détecte les changements de langue via SpeechBrain et re-transcrit avec le bon modèle. Atteint 13% WER sur code-switching inter-énoncé, surpassant les APIs cloud. Repo open-source disponible.

VoixGénération de codeOpen source
SIG
78
HYP
00
Reddit r/LocalLLaMA·

A lightweight, real-time multilingual ASR router that runs on local hardware

Système de routage ASR multilingue léger pour matériel local, utilisant Zipformer, Silero VAD et SpeechBrain. Dirige l'audio entre modèles monolingues spécialisés (~100M paramètres) plutôt qu'un seul modèle massif. Atteint 13% WER sur code-switching inter-énoncés, surpassant les APIs cloud. Limitation connue : 41% WER en intra-énoncés. Repo open-source disponible.

VoixOpen sourceOutils
SIG
78
HYP
00
arXiv cs.CL·

Transcribing Children's Speech: ASR Performance and Obtaining Reliable Orthographic Transcriptions

Étude comparative de 9 modèles ASR (Whisper, Parakeet, Wav2Vec2) sur la parole enfantine en néerlandais. Whisper-medium fine-tuné atteint 5,54% WER sur JASMIN et 70,37% sur DART. Une méthode de sélection au niveau des énoncés identifie 42% (JASMIN) et 18,1% (DART) des utterances comme correctement prononcées avec précision ≥98,3%, réduisant le besoin de vérification manuelle.

BenchmarksVoixÉvaluations
SIG
72
HYP
00
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> OpenMOSS /</span> MOSS-TTS

MOSS-TTS est une famille de modèles open-source de génération vocale et sonore développée par MOSI.AI et OpenMOSS. Elle couvre la synthèse vocale longue durée, le dialogue multi-locuteur, la conception de voix, les effets sonores et le TTS en temps réel.

VoixOpen sourceOutils
SIG
65
HYP
00
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> OpenMOSS /</span> MOSS-TTS

MOSS-TTS est une famille de modèles open-source de génération vocale et sonore développée par MOSI.AI et OpenMOSS. Elle couvre la synthèse vocale longue durée, le dialogue multi-locuteur, la conception de voix/personnages, les effets sonores environnementaux et le TTS en temps réel.

Open sourceVoixOutils
SIG
65
HYP
00
arXiv cs.CL·

Unlocking Fine-Grained and Within-Utterance Speaking Style Control in Prompt-Based Text-to-Speech Models

Méthode pour contrôler finement le style vocal dans les modèles TTS basés sur prompts. Interpolation entre styles via vecteurs directionnels dans l'espace d'embedding (99-100% succès conversion genre, variation pitch 36 Hz). Transitions intra-énoncé via KV-cache swapping et sliding-window attention masking (similarité locuteur 0.81-0.91).

VoixPrompt engineeringPapers
SIG
72
HYP
00
arXiv cs.CL·

Bridging the Stability-Expressivity Gap: Synthetic Data Scaling and Preference Alignment for Low-Resource Spoken Language Models

Les modèles de langage parlé (SLM) pour la synthèse vocale en langues peu dotées souffrent d'un compromis : les données synthétiques améliorent la précision phonétique mais suppriment la variabilité prosodique (Synthetic Erosion). Les auteurs proposent deux cadres d'auto-alignement (DGSA et TDSC) pour récupérer l'expressivité, surpassant ElevenLabs et Gemini Pro, avec clonage vocal zéro-shot pour le lao.

VoixPapersRaisonnement
SIG
72
HYP
00
Reddit r/MachineLearning·

noisekit - CLI for generating realistic degraded speech datasets for ASR benchmarking [P]

noisekit est un CLI open-source pour générer des datasets de parole dégradée annotés, permettant de benchmarker les modèles STT sur des conditions réalistes (télécom G.711, bruit ambiant, réverbération). Résout le problème : les datasets publics (FLEURS, CommonVoice) sont trop propres pour évaluer la performance en production. Compatible HuggingFace AudioFolder, inclut métriques PESQ/SNR/NISQA.

VoixÉvaluationsBenchmarks
SIG
72
HYP
00
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> cjpais /</span> Handy

Handy est une application open-source de reconnaissance vocale fonctionnant entièrement hors ligne, sans dépendances cloud.

VoixOpen sourceOutils
SIG
65
HYP
00
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> modelscope /</span> FunASR

FunASR est un toolkit de reconnaissance vocale industriel supportant 170x temps réel, 50+ langues, diarisation de locuteur, détection d'émotion, streaming et API compatible OpenAI.

VoixOpen sourceOutils
SIG
75
HYP
00
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> dograh-hq /</span> dograh

Dograh est une plateforme vocale IA open-source auto-hébergée, alternative à Vapi et Retell. Supporte Speech-to-Speech, LLM/STT/TTS, workflow visuel, MCP natif et téléphonie.

VoixOpen sourceMCP
SIG
65
HYP
00
arXiv cs.CL·

Direct Preference Optimization for English-Mandarin Code-Switching Speech Recognition in Audio LLMs

Des chercheurs appliquent Direct Preference Optimization (DPO) pour améliorer la transcription code-switching anglais-mandarin dans les Audio LLMs. Trois modes d'échec identifiés : omission de langue, traduction au lieu de transcription, hallucination. Entraînement sur 100K paires (570 heures) réduit le MER jusqu'à 89,6% (in-distribution) et 20,0% (out-of-distribution).

Reinforcement learningAlignementVoix
SIG
78
HYP
00
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> moeru-ai /</span> airi

Airi est un compagnon IA auto-hébergé open-source capable de conversation vocale temps réel, jeu Minecraft et Factorio. Supporte Web, macOS et Windows. Inspiré par Neuro-sama.

Agents IAVoixOpen source
SIG
35
HYP
00
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> Zackriya-Solutions /</span> meetily

Meetily est un assistant de réunion open-source, auto-hébergé, basé sur Rust. Transcription 4x plus rapide que Whisper/Parakeet, diarisation des locuteurs, résumé via Ollama. Traitement 100% local, zéro cloud.

Open sourceVoixOutils
SIG
65
HYP
00
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> moeru-ai /</span> airi

Airi est un compagnon IA auto-hébergé capable de conversation vocale en temps réel, de jeu Minecraft et Factorio. Supporte Web, macOS et Windows. Projet open-source inspiré par Grok et Neuro-sama.

Open sourceVoixAgents IA
SIG
35
HYP
00
Reddit r/LocalLLaMA·

I shipped a windows desktop app for running local LLMs with a button that turns your "no thats wrong" into actual LoRA training data

SEELS, une app desktop Windows pour LLMs locaux, permet de corriger les réponses du modèle via un bouton « Teach » qui accumule les corrections en corpus JSONL, puis lance un fine-tuning LoRA sans terminal. Inclut STT/TTS locaux (Whisper/Piper), dashboard matériel, modèle 0.6B pré-entraîné sur 110 exemples. Version gratuite stable ; tiers pro (génération image/vidéo, MCP) et max (workflows, multi-GPU) en roadmap.

Fine-tuningOpen sourceOutils
SIG
72
HYP
00
Reddit r/LocalLLaMA·

Open source: cloned Rocky's voice from Project Hail Mary in two days, full pipeline + 2:10 of training audio + trained RVC v2 model

Clonage de la voix de Rocky (Project Hail Mary) en deux jours via pipeline open-source. Extraction audio (ffmpeg + demucs), transcription (Whisper), diarization (pyannote), puis entraînement RVC v2 sur 2:10 min audio. Modèle .pth (55MB) et code publics. Comparaison XTTS v2 / YourTTS / RVC v2 / OpenVoice v2.

VoixOpen sourceGénération de code
SIG
72
HYP
00
Voix — actualité IA · Signal IA