# Voxtral

> Voxtral : famille de modèles audio de Mistral AI (transcription, compréhension vocale et synthèse de parole) utilisée pour parler aux agents IA et se faire répondre à voix haute.

- **Catégorie** : IA
- **URL** : https://www.romaindelfosse.fr/glossary/voxtral/

---

**Voxtral** est la famille de modèles audio de Mistral AI : elle couvre la **transcription** (speech-to-text), la **compréhension de l'audio** (question-réponse, résumé, traduction) et la **synthèse de parole** (text-to-speech). Lancée en juillet 2025 avec deux modèles de compréhension vocale open weights — Voxtral Small 24B pour la production et Voxtral Mini 3B pour le local et l'edge, sous licence Apache 2.0 — la gamme s'est complétée en mars 2026 par **Voxtral TTS**, un modèle de génération vocale de 4 milliards de paramètres.

## Définition technique

### Trois cas d'usage, une même famille

**Transcription (Voxtral Mini Transcribe).** Le point d'entrée API pour convertir la parole en texte. Avec un contexte de 32k tokens, les modèles avalent jusqu'à **30 minutes d'audio pour la transcription** (40 minutes pour la compréhension) en une requête, avec détection automatique de langue parmi les langues les plus parlées — français, anglais, espagnol, portugais, hindi, allemand, néerlandais, italien, arabe. Particularité utile pour les agents : le **function calling déclenchable à la voix** — une intention parlée peut appeler directement un outil ou une API, sans étape de parsing intermédiaire.

**Compréhension audio.** Au-delà de la transcription, Voxtral répond à des questions posées sur le contenu d'un enregistrement ou en produit des résumés structurés — sans chaîner un ASR séparé puis un modèle de langage. Le modèle conserve par ailleurs les capacités texte de son backbone (Mistral Small 3.1).

**Synthèse vocale (Voxtral TTS, mars 2026).** Un modèle autoregressif flow-matching de 4B paramètres (décodeur transformer 3,4B + transformer acoustique flow-matching 390M + codec audio neuronal 300M), bâti sur Ministral 3B. Il génère une parole expressive en 9 langues, avec une **latence modèle de 70 ms** (échantillon de 10 s, 500 caractères), une **adaptation de voix à partir de 3 secondes de référence**, et une adaptation cross-linguale zero-shot — générer de l'anglais avec une voix française, par exemple. Des voix préréglées sont fournies dans les dialectes américain, britannique et français (dont *Marie* et *Jane*, celles qu'utilise Mistral Vibe).

### Pourquoi c'est structurant pour les agents

Un [agent IA](/glossary/agent-ia/) codeur comme [Mistral Vibe](/blog/m5stack-vibe-talkie-walkie-voxtral/) peut ainsi fermer la boucle vocale : dictée transcrite par Voxtral en entrée, réponse lue à voix haute par le TTS en sortie. Le clavier et l'écran cessent d'être les seules interfaces de l'agent — ce qui est la condition du pilotage à distance, loin du poste. Et parce que les poids sont ouverts (Apache 2.0 côté compréhension), la brique audio reste auditable et déployable sur son infrastructure — un point de [souveraineté numérique](/glossary/souverainete-numerique/) rare sur le marché vocal, dominé par des API propriétaires fermées.


## Chiffres clés

- Latence modèle de Voxtral TTS pour un échantillon de voix de 10 secondes et 500 caractères, avec un facteur temps réel (RTF) d&#39;environ 9,7x *(Mistral AI — Speaking of Voxtral (annonce Voxtral TTS) — 23 mars 2026)*

- Tarif API de la transcription Voxtral par minute d&#39;audio, avec Voxtral Mini Transcribe qui surpasse OpenAI Whisper pour moins de la moitié du prix *(Mistral AI — Voxtral (annonce) — 15 juillet 2025)*

- Préférence moyenne des auditeurs pour Voxtral TTS face à ElevenLabs en test comparatif de personnalisation de voix zero-shot *(Mistral AI — Speaking of Voxtral (annonce Voxtral TTS) — 23 mars 2026)*



## Questions fréquentes

### Qu&#39;est-ce que Voxtral ?

Voxtral est la famille de modèles audio de Mistral AI. Lancée en juillet 2025 côté compréhension vocale (Voxtral Small 24B et Voxtral Mini 3B, licence Apache 2.0), elle couvre la transcription (speech-to-text), la compréhension de l'audio (questions-réponses et résumés directement sur un enregistrement) et, depuis mars 2026, la synthèse de parole (Voxtral TTS, 4 milliards de paramètres). Les modèles gèrent nativement le français, l'anglais et sept autres langues.

### Quelle est la différence entre Voxtral Transcribe et Voxtral TTS ?

Voxtral Transcribe convertit la parole en texte (speech-to-text) : jusqu'à 30 minutes d'audio par requête, avec détection automatique de langue et fonction calling déclenchable à la voix. Voxtral TTS fait l'inverse : il génère une parole réaliste et expressive à partir de texte, avec une adaptation de voix possible à partir de 3 secondes de référence et une latence modèle de 70 ms. Les deux combinés permettent de construire des agents vocaux de bout en bout.

### Comment Mistral Vibe utilise-t-il Voxtral ?

L'agent codeur Mistral Vibe s'appuie sur Voxtral pour la boucle vocale : la dictée (push-to-talk) est transcrite par Voxtral, et la réponse finale de l'agent peut être lue à voix haute par le client TTS embarqué (modèle voxtral-mini-tts-latest, voix Marie en français et Jane en anglais). C'est le mécanisme qu'exploite le projet vibe-m5stack pour transformer un M5Stack Fire en talkie-walkie d'agent.



## Ressources

- [Voxtral — annonce des modèles de compréhension vocale](https://mistral.ai/news/voxtral) — Mistral AI

- [Speaking of Voxtral — annonce de Voxtral TTS](https://mistral.ai/news/voxtral-tts/) — Mistral AI

- [Voxtral — paper de recherche](https://arxiv.org/abs/2507.13264) — Mistral AI (arXiv)

