Voxtral
Voxtral : famille de modèles audio de Mistral AI (transcription, compréhension vocale et synthèse de parole) utilisée pour parler aux agents IA et se faire répondre à voix haute.
Voxtral est la famille de modèles audio de Mistral AI : elle couvre la transcription (speech-to-text), la compréhension de l'audio (question-réponse, résumé, traduction) et la synthèse de parole (text-to-speech). Lancée en juillet 2025 avec deux modèles de compréhension vocale open weights — Voxtral Small 24B pour la production et Voxtral Mini 3B pour le local et l'edge, sous licence Apache 2.0 — la gamme s'est complétée en mars 2026 par Voxtral TTS, un modèle de génération vocale de 4 milliards de paramètres.
Définition technique
Trois cas d'usage, une même famille
Transcription (Voxtral Mini Transcribe). Le point d'entrée API pour convertir la parole en texte. Avec un contexte de 32k tokens, les modèles avalent jusqu'à 30 minutes d'audio pour la transcription (40 minutes pour la compréhension) en une requête, avec détection automatique de langue parmi les langues les plus parlées — français, anglais, espagnol, portugais, hindi, allemand, néerlandais, italien, arabe. Particularité utile pour les agents : le function calling déclenchable à la voix — une intention parlée peut appeler directement un outil ou une API, sans étape de parsing intermédiaire.
Compréhension audio. Au-delà de la transcription, Voxtral répond à des questions posées sur le contenu d'un enregistrement ou en produit des résumés structurés — sans chaîner un ASR séparé puis un modèle de langage. Le modèle conserve par ailleurs les capacités texte de son backbone (Mistral Small 3.1).
Synthèse vocale (Voxtral TTS, mars 2026). Un modèle autoregressif flow-matching de 4B paramètres (décodeur transformer 3,4B + transformer acoustique flow-matching 390M + codec audio neuronal 300M), bâti sur Ministral 3B. Il génère une parole expressive en 9 langues, avec une latence modèle de 70 ms (échantillon de 10 s, 500 caractères), une adaptation de voix à partir de 3 secondes de référence, et une adaptation cross-linguale zero-shot — générer de l'anglais avec une voix française, par exemple. Des voix préréglées sont fournies dans les dialectes américain, britannique et français (dont Marie et Jane, celles qu'utilise Mistral Vibe).
Pourquoi c'est structurant pour les agents
Un agent IA codeur comme Mistral Vibe peut ainsi fermer la boucle vocale : dictée transcrite par Voxtral en entrée, réponse lue à voix haute par le TTS en sortie. Le clavier et l'écran cessent d'être les seules interfaces de l'agent — ce qui est la condition du pilotage à distance, loin du poste. Et parce que les poids sont ouverts (Apache 2.0 côté compréhension), la brique audio reste auditable et déployable sur son infrastructure — un point de souveraineté numérique rare sur le marché vocal, dominé par des API propriétaires fermées.
Questions fréquentes
Qu'est-ce que Voxtral ?
Voxtral est la famille de modèles audio de Mistral AI. Lancée en juillet 2025 côté compréhension vocale (Voxtral Small 24B et Voxtral Mini 3B, licence Apache 2.0), elle couvre la transcription (speech-to-text), la compréhension de l'audio (questions-réponses et résumés directement sur un enregistrement) et, depuis mars 2026, la synthèse de parole (Voxtral TTS, 4 milliards de paramètres). Les modèles gèrent nativement le français, l'anglais et sept autres langues.
Quelle est la différence entre Voxtral Transcribe et Voxtral TTS ?
Voxtral Transcribe convertit la parole en texte (speech-to-text) : jusqu'à 30 minutes d'audio par requête, avec détection automatique de langue et fonction calling déclenchable à la voix. Voxtral TTS fait l'inverse : il génère une parole réaliste et expressive à partir de texte, avec une adaptation de voix possible à partir de 3 secondes de référence et une latence modèle de 70 ms. Les deux combinés permettent de construire des agents vocaux de bout en bout.
Comment Mistral Vibe utilise-t-il Voxtral ?
L'agent codeur Mistral Vibe s'appuie sur Voxtral pour la boucle vocale : la dictée (push-to-talk) est transcrite par Voxtral, et la réponse finale de l'agent peut être lue à voix haute par le client TTS embarqué (modèle voxtral-mini-tts-latest, voix Marie en français et Jane en anglais). C'est le mécanisme qu'exploite le projet vibe-m5stack pour transformer un M5Stack Fire en talkie-walkie d'agent.