Topic

#Voix

En IA, la voix désigne les technologies de synthèse et de reconnaissance vocale permettant à une machine de parler ou de comprendre la parole humaine. ElevenLabs, par exemple, génère des voix synthétiques réalistes à partir de texte.

40Articles
8Sources
71Signal moyen
arXiv cs.CL·

Continuous Audio Thinking for Large Audio Language Models

Continuous Audio Thinking (CoAT) ajoute un espace latent continu aux modèles audio-langage pour préserver les informations acoustiques (phonétique, prosodie, affect, pitch) avant génération de texte. Testé sur Qwen2-Audio, Qwen2.5-Omni-7B et Audio Flamingo, CoAT améliore les performances en raisonnement audio, classification musicale et transcription sans coût de décodage supplémentaire.

RaisonnementVoixQwen
SIG
72
HYP
00
arXiv cs.LG·

ASTRA: A Scalable Next-Generation ATCO Training Simulator with Autonomous Simpilots

ASTRA est un simulateur de formation pour contrôleurs aériens qui automatise les rôles de pilotes via une pipeline de reconnaissance vocale, interprétation et génération de réponses. Le système réduit le taux d'erreur de reconnaissance vocale de 107,80% à 23,45% sur l'accent singapourien, et évalue les communications radio avec scores de 91,7% (précision), 88,2% (brièveté), 86,9% (complétude).

VoixFine-tuningÉvaluations
SIG
75
HYP
00
Reddit r/LocalLLaMA·

I released Inflect-Nano, an ultra-extreme tiny 4.63m parameter TTS model.

Inflect-Nano-v1, modèle TTS de 4.63M paramètres, est le 2e plus petit modèle de synthèse vocale public. Composé d'un modèle acoustique (3.46M) et d'un vocoder (1.17M), il génère de l'audio 24 kHz en anglais. ~17x plus petit que Kokoro, ~108x plus petit que Chatterbox. Exécutable localement en PyTorch, adapté aux appareils embarqués et assistants vocaux hors ligne.

VoixOpen sourceOutils
SIG
72
HYP
00
Reddit r/MachineLearning·

Mel AI just shared a demo of video-native AI characters that can talk, react, and respond to camera context in real time [N]

Mel AI démontre des personnages IA vidéo-natifs capables de parler, synchroniser les lèvres, réagir faciales et répondre en temps réel au contexte caméra. Le système détecte l'environnement visuel de l'utilisateur et adapte ses réactions. Cette approche dépasse le chat textuel de Character AI (fondé par d'anciens développeurs Google/LaMDA).

Agents IAVisionVoix
SIG
55
HYP
00
arXiv cs.AI·

SpeechDx: A Multi-Task Benchmark for Clinical Speech AI

SpeechDx est un benchmark multi-tâches pour l'IA clinique basée sur la parole, couvrant 12 datasets et 27 tâches sur diverses conditions de santé. Les tâches sont structurées par étapes de production vocale (conceptualisation, formulation, articulation). L'évaluation de 12 encodeurs audio montre que les modèles de parole à grande échelle surpassent les modèles spécialisés, mais aucun ne généralise fiablement.

BenchmarksVoixÉvaluations
SIG
78
HYP
00
arXiv cs.CL·

Perceptual compensation for tonal context in self-supervised speech models

Étude sur wav2vec2.0 examinant la compensation perceptuelle pour le contexte tonal en mandarin. Les modèles pré-entraînés non supervisés ne montrent pas de compensation dans les similarités d'embeddings. Les classifieurs de probing révèlent une compensation partielle mais ne répliquent pas les performances humaines. Les objectifs supervisés semblent nécessaires pour abstraire certaines régularités phonologiques.

PapersÉvaluationsVoix
SIG
72
HYP
00
arXiv cs.CL·

Learning task-specific subspaces via interventional post-training of speech foundation models

Méthode de post-entraînement pour les modèles de fondation vocale via apprentissage contrastif interventionnel. Transforme les représentations enchevêtrées en sous-espaces séparés (contenu/locuteur) en utilisant un dataset interventionnel et une perte contrastive multi-parties. Améliore la vérification de locuteur hors-domaine et la détection de mots-clés.

VoixFine-tuningPapers
SIG
72
HYP
00
arXiv cs.CL·

Evaluating Large Language Models Abilities for Addressee, Turn-change, and Next Speaker Prediction in Meetings

Étude comparative des capacités des LLM pour prédire le locuteur suivant, les changements de tour et l'adressataire dans des conversations multi-parties. Sur le corpus AMI, les LLM surpassent les modèles supervisés et les humains en prédiction du locuteur suivant sans accès audio-visuel. Les MM-LLM dépassent les LLM textuels mais restent sous la performance humaine pour l'adressataire et les changements de tour.

BenchmarksÉvaluationsVision
SIG
72
HYP
00
arXiv cs.CL·

Improving low-resource ASR using bilingual fine-tuning with language identification: a cross-linguistic evaluation

Étude sur le fine-tuning bilingue pour la reconnaissance vocale en langues peu dotées. Évaluation sur 9 paires linguistiques avec tokens d'identification de langue en entrée. Résultat : le fine-tuning bilingue améliore les performances quand l'identification de langue est précise ; fournir le token à l'inférence compense les erreurs d'identification.

VoixFine-tuningBenchmarks
SIG
72
HYP
00
arXiv cs.CL·

A Practical Evaluation Method for Long-Form Simultaneous Speech-to-Speech Translation

Nouvelle méthode d'évaluation pratique pour la traduction simultanée parole-à-parole (SimulS2ST) sur longs énoncés continus. Utilise ASR, alignement forcé et embeddings de phrases pour récupérer timestamps et aligner texte cible aux phrases source, puis calcule latence et qualité (YAAL, xCOMET) au niveau phrase. Révèle accumulation substantielle de latence sur longs discours.

VoixÉvaluationsBenchmarks
SIG
75
HYP
00
arXiv cs.CL·

Evaluating and Preserving Lexical Stress in English-to-Chinese Speech-to-Speech Translation

Étude sur le transfert de l'accent lexical en traduction parole-à-parole anglais-chinois. Les auteurs créent un dataset annoté en chinois mandarin, développent un détecteur d'accent basé XLS-R et proposent une métrique d'évaluation objective. Un système S2ST affiné sur CosyVoice3 surpasse les systèmes existants en préservant l'accent tout en maintenant la qualité de traduction.

VoixBenchmarksÉvaluations
SIG
72
HYP
00
arXiv cs.CL·

MoDiCoL: A Modular Diagnostic Continual Learning Dataset for Robust Speech Recognition

MoDiCoL est un dataset de continual learning modulaire pour évaluer la robustesse des systèmes ASR face aux variations réelles (accents, bruits, conditions d'enregistrement, troubles de la parole). Les auteurs proposent un curriculum inspiré du monde réel et évaluent trois stratégies de continual learning pour analyser comment la robustesse se développe, se transfère et s'oublie.

BenchmarksÉvaluationsVoix
SIG
72
HYP
00
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> NVIDIA-NeMo /</span> NeMo

NVIDIA NeMo est un framework open-source pour construire des modèles IA génératifs : LLM, multimodal, ASR et TTS. Conçu pour chercheurs et développeurs, il offre une base scalable pour l'entraînement et le déploiement.

Open sourceInfrastructureGénération de code
SIG
72
HYP
00
arXiv cs.CL·

PRISM: Prosody-Integrated Multi-Agent Reasoning Framework for Empathetic Spoken Dialogue

PRISM est un framework multi-agent pour le dialogue parlé empathique qui découple perception vocale, génération de réponse et synthèse vocale. Il introduit un mécanisme de traduction prosody-to-language pour stabiliser le raisonnement des LLM et intègre des outils de connaissance externes. Résultats : amélioration de l'empathie, de l'adéquation prosodique et de la qualité des réponses.

Multi-agentsVoixAgents IA
SIG
72
HYP
00
arXiv cs.AI·

MA-DLE: Speech-based Automatic Depression Level Estimation via Memory Augmentation

MA-DLE propose une méthode d'augmentation mémoire pour estimer automatiquement les niveaux de dépression à partir de la parole. Le système utilise un GRU enrichi par une banque mémoire sélective (features temporelles historiques + features dynamiques basées sur la variabilité) et un module Hierarchical Attention Fusion. Évalué sur DAIC-WOZ et E-DAIC, il atteint l'état de l'art.

VoixRaisonnementBenchmarks
SIG
72
HYP
00
arXiv cs.CL·

Afrispeech Semantics: Evaluating Audio Semantic Reasoning in Spoken Language Models Across Domains and Accents

Afrispeech Semantics évalue le raisonnement sémantique audio dans les modèles de langage parlé sur cinq tâches : inférence, cohérence, plausibilité, dérive d'accent et retenue d'accent. L'étude révèle des limitations critiques dans l'évaluation du raisonnement audio au-delà de la transcription, notamment face aux variations d'accent et aux changements de domaine.

BenchmarksVoixÉvaluations
SIG
72
HYP
00
Reddit r/LocalLLaMA·

I wired a fully offline voice loop to Ollama + LM Studio — 100% CPU, no GPU, nothing leaves your machine (Silero VAD + Parakeet STT + Supertonic TTS 3)

Développeur crée une boucle vocale entièrement hors ligne pour Ollama + LM Studio. Stack : Silero VAD (détection activité vocale), Parakeet TDT 0.6B (STT ONNX INT8, 25 langues), Supertonic TTS 3 (synthèse ONNX multilingue). CPU uniquement, zéro données quittent la machine. Cross-platform (macOS/Linux/Windows), testé sur ThinkPad 4 ans.

VoixOpen sourceOutils
SIG
75
HYP
00
Reddit r/LocalLLaMA·

Tried to benchmark Google’s new on-device dictation models (Eloquent) and basically couldn’t

Un développeur a tenté de benchmarker Eloquent, la nouvelle app de dictation locale de Google avec modèles propriétaires. Résultat : ~50% des dictations reviennent incomplètes (20+ mots réduits à 5-10). Quand la transcription est complète (15/50 tests), la précision est compétitive (~24% WER vs ~21% pour Qwen3-ASR), mais le modèle chat refuse souvent de transcrire au lieu de produire du texte.

DeepMindBenchmarksVoix
SIG
42
HYP
00
Reddit r/LocalLLaMA·

Anyone gotten Gemma 4 12B (unified audio) to actually attend to speech with a large system prompt?

Utilisateur rapporte que Gemma 4 12B (modèle unifié audio/vision/texte) ignore l'audio quand le system prompt dépasse ~21k tokens. Le modèle fonctionne bien avec prompt minimal mais génère des réponses génériques/halluccinées avec contexte dense. Comportement reproductible sur vLLM, llama.cpp et LiteRT-LM. Semble être une limite d'attention inhérente.

GeminiVoixMulti-agents
SIG
45
HYP
00