Mistral, l'entreprise française d'IA, a publié Voxtral, sa première famille de modèles à poids ouverts pour la transcription et la compréhension audio. Les benchmarks officiels montrent une reconnaissance vocale multilingue solide et des questions-réponses audio, tandis que les deux tailles de modèle ont des exigences matérielles très différentes. Voici ce que cette publication prend réellement en charge et pourquoi Whisper Notes utilise toujours des modèles plus petits, dédiés à la transcription, sur du matériel Apple grand public.
Deux modèles
Mistral a publié deux checkpoints sous licence Apache 2.0 en juillet 2025 :
Voxtral Small 24B
- •24 milliards de paramètres
- •Transcription, traduction, questions-réponses audio et résumé
- •Fenêtre de contexte de 32k
- •Environ 55 Go de RAM GPU en bf16/fp16
Voxtral Mini 3B
- •3 milliards de paramètres
- •La même famille de tâches audio et texte dans un checkpoint plus petit
- •Officiellement positionné pour le déploiement local et edge
- •Environ 9,5 Go de RAM GPU en bf16/fp16
Poids ouverts et licence
Les deux checkpoints de 2025 sont à poids ouverts sous licence Apache 2.0. Vous pouvez les télécharger et les exécuter vous-même :
- ✓ Poids complets du modèle disponibles
- ✓ Auto-hébergez-les ou adaptez-les dans le cadre de la licence Apache 2.0
- ✓ Aucun frais d'API Mistral en auto-hébergement ; vous payez toujours votre propre calcul
- ✓ Traitez l'audio sur vos propres serveurs
Sources : l'annonce de Voxtral par Mistral, la fiche officielle du modèle Voxtral Small et la fiche officielle du modèle Voxtral Mini.
Benchmarks
La publication de Mistral compare le taux d'erreur de mots (WER) en macro-moyenne sur des jeux de données anglais courts et longs, Mozilla Common Voice, FLEURS et Multilingual LibriSpeech. Dans les résultats FLEURS rapportés par Mistral, Voxtral Small bat Whisper sur chaque tâche évaluée. Un WER plus bas est meilleur :
WER FLEURS des benchmarks de lancement de Mistral, tracé face au prix API estimé ; les résultats comme les prix peuvent changer
FLEURS n'est qu'une facette de la qualité de transcription. Ce sont des résultats rapportés par l'éditeur : comparez les définitions des benchmarks publiés et testez vos propres langues, microphones et conditions d'enregistrement avant de choisir un modèle.
Voxtral vs Whisper : lequel utiliser ?
Les benchmarks ne racontent qu'une partie de l'histoire. Voici comment les deux familles de modèles se comparent sur les critères qui comptent si vous voulez réellement en exécuter un vous-même :
| Voxtral Small | Voxtral Mini | Whisper Large v3 | Whisper Large-v3 Turbo | |
|---|---|---|---|---|
| Langues | 8 langues principales | 8 langues principales | Plus de 100 | Plus de 100 |
| Open source | Oui | Oui | Oui | Oui |
| Taille du modèle | 24B paramètres ; ~55 Go de RAM GPU en bf16/fp16 | 3B paramètres ; ~9,5 Go de RAM GPU en bf16/fp16 | 1,55B paramètres | 809M paramètres (~1,6 Go) |
| Utilisable sur un Mac grand public | Pas en pleine précision sur du matériel typique | Possible avec un runtime compatible ; plus lourd que Turbo | Oui | Oui |
Le verdict : Voxtral Small rapporte de solides résultats WER et ajoute une compréhension audio que Whisper ne tente même pas. Voxtral Mini est le checkpoint que Mistral positionne pour le déploiement local et edge, mais sa fiche officielle indique toujours environ 9,5 Go de RAM GPU en bf16/fp16. Pour une app de transcription grand public, Whisper Large-v3 Turbo reste plus facile à livrer et couvre bien plus de langues. C'est pourquoi Whisper Notes combine actuellement Whisper Turbo avec Parakeet V3 et SenseVoice plutôt que Voxtral.
Coût de l'API et de l'auto-hébergement
Vérifié le 10 juillet 2026 : la fiche du modèle de Mistral indique l'entrée audio de Voxtral Small à 0,004 $ par minute. L'entrée texte et le texte généré sont facturés séparément pour les requêtes de compréhension audio. Si vous auto-hébergez les poids Apache 2.0, il n'y a aucun frais d'API Mistral, mais vous payez le matériel et l'exploitation.
API Mistral
Poids auto-hébergés
Comment ça fonctionne
La fiche officielle décrit Voxtral comme un socle de modèle de langage doté d'un encodeur audio et d'un mode de transcription dédié. Les limites produit importantes sont concrètes :
1. Architecture multimodale
Voxtral accepte l'audio et le texte dans la même conversation au lieu d'agir uniquement comme un décodeur de parole vers texte :
- •Mode dédié pour la transcription directe
- •Questions-réponses audio et résumé structuré
- •Entrées audio multiples et conversations audio multi-tours
Limite sur les contenus longs
La fenêtre de contexte de 32k prend en charge jusqu'à 30 minutes d'audio pour la transcription, ou 40 minutes pour la compréhension audio au sens large.
2. Langues et évaluation
Mistral liste huit langues principales avec détection automatique :
- •Anglais, espagnol, français, portugais, hindi, allemand, néerlandais et italien
- •Les benchmarks incluent FLEURS, Mozilla Common Voice et Multilingual LibriSpeech
- •La publication évalue aussi séparément l'audio anglais court et long
3. Exigences de déploiement
Des poids ouverts ne signifient pas que chaque checkpoint est assez petit pour chaque appareil :
- •Voxtral Small nécessite environ 55 Go de RAM GPU en bf16/fp16 selon sa fiche de modèle
- •Voxtral Mini est le checkpoint 3B destiné au déploiement local et edge
- •Mistral recommande vLLM pour servir les checkpoints publiés
4. Fonctionnalités clés
Compréhension contextuelle
Peut répondre à des questions et produire des résumés directement à partir de l'audio, dans la limite du contexte de 32k.
Multilingue
Détecte et transcrit automatiquement huit langues principales : anglais, espagnol, français, portugais, hindi, allemand, néerlandais et italien.
Gestion du bruit
L'évaluation officielle inclut des jeux de données vocaux variés, mais Mistral ne publie pas de garantie générale pour chaque enregistrement bruyant.
Déploiement edge
Voxtral Mini est l'option locale et edge. Sa fiche officielle indique environ 9,5 Go de RAM GPU en bf16/fp16.
5. Architecture
Trois composants principaux :
- 1. Encodeur audio : Convertit la forme d'onde en représentations audio apprises
- 2. Projecteur : Projette les représentations audio dans l'espace caché du modèle de langage
- 3. Socle de modèle de langage : Génère transcriptions, réponses, résumés ou appels d'outils
Cette conception explique pourquoi Voxtral peut faire plus que de la transcription, mais elle embarque aussi des poids de modèle de langage bien plus lourds qu'un modèle dédié à la transcription comme Whisper Turbo.
Pourquoi Whisper Notes garde tout son sens
Voxtral et Whisper Notes résolvent des problèmes différents. Voxtral combine transcription et compréhension audio ; Whisper Notes se concentre sur une transcription privée, facile à exécuter sur du matériel Apple grand public.
Ce qu'offre Whisper Notes
Confidentialité
- •Traitement 100 % hors ligne
- •Aucune transmission de données
- •Aucune dépendance cloud
Performance
- •Technologie Whisper, précision éprouvée
- •Optimisé pour Apple Silicon
- •Résultats fiables
Coût
- •achat unique ; prix affiché dans le canal d’achat ; le Mac inclut un essai de 10 000 mots
- •Aucune facturation à la minute
- •Transcription illimitée
Expérience utilisateur
- •Interface simple
- •Mises à jour régulières
- •Améliorations continues
Exigences de stockage
Voxtral Small est un modèle de classe serveur en pleine précision : sa fiche officielle indique environ 55 Go de RAM GPU. Voxtral Mini est spécifiquement destiné à l'usage local et edge, mais sa fiche indique toujours environ 9,5 Go de RAM GPU en bf16/fp16. Le téléchargement de Whisper Turbo dans l'app pèse environ 1,6 Go, ce qui convient mieux au produit Whisper Notes actuel.
Whisper Notes utilise Whisper Large-v3 Turbo — il équilibre performance, vitesse et besoins en VRAM pour un usage quotidien. Nous adopterons de meilleurs modèles quand ils seront disponibles avec des besoins en ressources raisonnables.
Voxtral est attrayant quand les questions-réponses audio, le résumé ou le déploiement serveur auto-hébergé comptent. Whisper Notes s'adresse aux utilisateurs individuels qui veulent une transcription privée et aucun abonnement récurrent.
Ce que cela signifie
Voxtral est une étape importante à poids ouverts au-delà de la simple reconnaissance vocale, car il peut raisonner sur l'audio en plus de le transcrire.
Pour la transcription privée hors ligne sur Mac et iPhone, des moteurs spécialisés plus petits restent plus faciles à empaqueter et à exécuter de façon constante.
Vous comparez toutes les options locales ? Chaque modèle de reconnaissance vocale sur appareil — les variantes de Whisper, Parakeet V3, SenseVoice et Voxtral — est comparé côte à côte sur notre page de comparaison des modèles Whisper.
Questions fréquentes
Qu'est-ce que Mistral Voxtral ?
Voxtral est la famille de modèles à poids ouverts de Mistral pour la transcription vocale et la compréhension audio. La publication de juillet 2025 comprend Voxtral Small 24B pour les charges de travail de classe serveur et Voxtral Mini 3B pour le déploiement local et edge. Les deux checkpoints utilisent la licence Apache 2.0.
Voxtral peut-il tourner localement sur un Mac ?
Les poids téléchargeables peuvent être auto-hébergés, mais les deux tailles ont des exigences différentes. Voxtral Small nécessite environ 55 Go de RAM GPU en bf16/fp16, c'est donc un choix de classe serveur. Voxtral Mini est le checkpoint local et edge ; sa fiche indique environ 9,5 Go en bf16/fp16, et la vitesse et la consommation mémoire réelles sur Mac dépendent du runtime et de la quantification.
Whisper Notes utilise-t-il Voxtral ?
Non. Whisper Notes exécute Parakeet V3 (le modèle par défaut sur Mac), Whisper Large-v3 Turbo et SenseVoice — des modèles choisis parce qu'ils équilibrent performance, vitesse et besoins en VRAM pour un usage quotidien sur Apple Silicon. Nous adopterons de meilleurs modèles dès qu'ils deviendront pratiques à exécuter sur du matériel grand public.
Combien de langues Voxtral prend-il en charge ?
Les fiches officielles listent huit langues principales avec détection automatique : anglais, espagnol, français, portugais, hindi, allemand, néerlandais et italien. Mistral évalue aussi l'arabe dans FLEURS, mais il ne figure pas dans la liste des langues principales de la fiche du modèle.
Quand Mistral Voxtral est-il sorti ?
Mistral a publié Voxtral le 15 juillet 2025. Les premiers checkpoints Apache 2.0 étaient Voxtral Small 24B et Voxtral Mini 3B.