Mistral heeft Voxtral uitgebracht, zijn eerste open-weight-familie voor transcriptie en audiobegrip. De officiële benchmarks tonen sterke meertalige spraakherkenning en audio-Q&A, terwijl de twee modelgroottes zeer verschillende hardware-eisen hebben. Dit is wat de release daadwerkelijk ondersteunt en waarom Whisper Notes nog steeds kleinere, op transcriptie gerichte modellen gebruikt op consumenten-hardware van Apple.
Twee modellen
Mistral bracht in juli 2025 twee Apache 2.0-checkpoints uit:
Voxtral Small 24B
- •24 miljard parameters
- •Transcriptie, vertaling, audio-Q&A en samenvatten
- •Contextvenster van 32k
- •Ongeveer 55 GB GPU-RAM in bf16/fp16
Voxtral Mini 3B
- •3 miljard parameters
- •Dezelfde audio-en-tekst-taken in een kleiner checkpoint
- •Officieel gepositioneerd voor lokale en edge-inzet
- •Ongeveer 9,5 GB GPU-RAM in bf16/fp16
Open gewichten en licentie
Beide checkpoints uit 2025 zijn open weights onder de Apache 2.0-licentie. Je kunt ze zelf downloaden en draaien:
- ✓ Volledige modelgewichten beschikbaar
- ✓ Zelf hosten of aanpassen binnen de Apache 2.0-licentie
- ✓ Geen Mistral-API-kosten bij zelf hosten; je betaalt wel je eigen rekenkracht
- ✓ Verwerk audio op je eigen servers
Bronnen: Mistrals Voxtral-release, de officiële modelkaart van Voxtral Small en de officiële modelkaart van Voxtral Mini.
Benchmarks
Mistrals release vergelijkt de macro-gemiddelde word error rate over Engelse short-form- en long-form-sets, Mozilla Common Voice, FLEURS en Multilingual LibriSpeech. In de door Mistral gerapporteerde FLEURS-resultaten verslaat Voxtral Small Whisper op elke geëvalueerde taak. Lagere WER is beter:
FLEURS-WER uit Mistrals lanceringsbenchmarks, afgezet tegen de geschatte API-prijs; zowel benchmarkresultaten als prijzen kunnen veranderen
FLEURS is maar één facet van transcriptiekwaliteit. Dit zijn door de leverancier gerapporteerde resultaten; vergelijk dus de gepubliceerde benchmarkdefinities en test je eigen talen, microfoons en opnameomstandigheden voordat je een model kiest.
Voxtral vs. Whisper: welke moet je gebruiken?
Benchmarks vertellen maar een deel van het verhaal. Zo verhouden de twee modelfamilies zich op de punten die ertoe doen als je er daadwerkelijk zelf een wilt draaien:
| Voxtral Small | Voxtral Mini | Whisper Large v3 | Whisper Large-v3 Turbo | |
|---|---|---|---|---|
| Talen | 8 primaire talen | 8 primaire talen | 100+ | 100+ |
| Open source | Ja | Ja | Ja | Ja |
| Modelgrootte | 24B parameters; ~55 GB GPU-RAM in bf16/fp16 | 3B parameters; ~9,5 GB GPU-RAM in bf16/fp16 | 1,55B parameters | 809M parameters (~1,6 GB) |
| Praktisch op een consumenten-Mac | Niet in volledige precisie op gangbare hardware | Mogelijk met een compatibele runtime; zwaarder dan Turbo | Ja | Ja |
Het oordeel: Voxtral Small rapporteert sterke WER-resultaten en voegt audiobegrip toe dat Whisper niet eens probeert. Voxtral Mini is het checkpoint dat Mistral positioneert voor lokale en edge-inzet, maar de officiële modelkaart vermeldt nog steeds ongeveer 9,5 GB GPU-RAM in bf16/fp16. Voor een consumenten-transcriptie-app blijft Whisper Large-v3 Turbo makkelijker uit te leveren en dekt het veel meer talen. Daarom combineert Whisper Notes op dit moment Whisper Turbo met Parakeet V3 en SenseVoice in plaats van Voxtral.
API- en zelfhost-kosten
Zoals gecontroleerd op 10 juli 2026 vermeldt Mistrals modelkaart voor Voxtral Small een audio-invoerprijs van $0.004 per minuut. Tekstinvoer en gegenereerde tekst worden bij audio-understanding-verzoeken apart gefactureerd. Host je de Apache 2.0-gewichten zelf, dan zijn er geen Mistral-API-kosten, maar betaal je voor de hardware en het beheer.
Mistral API
Zelf gehoste gewichten
Hoe het werkt
De officiële modelkaart beschrijft Voxtral als een language-model-backbone met een audio-encoder en een speciale transcriptiemodus. De belangrijke productgrenzen zijn concreet:
1. Multimodale architectuur
Voxtral accepteert audio en tekst in hetzelfde gesprek, in plaats van alleen als speech-to-text-decoder te fungeren:
- •Speciale modus voor directe transcriptie
- •Audio-Q&A en gestructureerd samenvatten
- •Meerdere audio-invoeren en audiogesprekken over meerdere beurten
Limiet voor lange opnames
Het contextvenster van 32k ondersteunt tot 30 minuten audio voor transcriptie of 40 minuten voor breder audiobegrip.
2. Talen en evaluatie
Mistral noemt acht primaire talen met automatische detectie:
- •Engels, Spaans, Frans, Portugees, Hindi, Duits, Nederlands en Italiaans
- •Benchmarks omvatten FLEURS, Mozilla Common Voice en Multilingual LibriSpeech
- •De release evalueert Engelse short-form- en long-form-audio ook apart
3. Inzet-eisen
Open gewichten betekenen niet dat elk checkpoint klein genoeg is voor elk apparaat:
- •Voxtral Small vereist volgens zijn modelkaart ongeveer 55 GB GPU-RAM in bf16/fp16
- •Voxtral Mini is het 3B-checkpoint dat is bedoeld voor lokale en edge-inzet
- •Mistral raadt vLLM aan voor het serveren van de uitgebrachte checkpoints
4. Belangrijkste eigenschappen
Contextueel begrip
Kan vragen beantwoorden en samenvattingen maken rechtstreeks vanuit audio, binnen de 32k-contextlimiet.
Meertalig
Detecteert en transcribeert automatisch acht primaire talen: Engels, Spaans, Frans, Portugees, Hindi, Duits, Nederlands en Italiaans.
Omgaan met ruis
De officiële evaluatie omvat gevarieerde spraakdatasets, maar Mistral publiceert geen algemene garantie voor elke opname met achtergrondgeluid.
Edge-inzet
Voxtral Mini is de lokale en edge-optie. Zijn officiële modelkaart vermeldt ongeveer 9,5 GB GPU-RAM in bf16/fp16.
5. Architectuur
Drie hoofdcomponenten:
- 1. Audio-encoder: Zet de golfvorm om in geleerde audiorepresentaties
- 2. Projector: Beeldt audiorepresentaties af op de verborgen ruimte van het taalmodel
- 3. Language-model-backbone: Genereert transcripten, antwoorden, samenvattingen of tool-aanroepen
Dat ontwerp verklaart waarom Voxtral meer kan dan transcriberen, maar het draagt ook veel grotere taalmodel-gewichten mee dan een puur transcriptiemodel zoals Whisper Turbo.
Waarom Whisper Notes nog steeds logisch is
Voxtral en Whisper Notes lossen verschillende problemen op. Voxtral combineert transcriptie met audiobegrip; Whisper Notes richt zich op private transcriptie die makkelijk draait op consumenten-hardware van Apple.
Wat Whisper Notes biedt
Privacy
- •100% offline verwerking
- •Geen dataverzending
- •Geen cloud-afhankelijkheden
Prestaties
- •Whisper-technologie, bewezen nauwkeurigheid
- •Geoptimaliseerd voor Apple Silicon
- •Betrouwbare resultaten
Kosten
- •Eenmalige aankoop; prijs volgens aankoopkanaal; Mac bevat een proefversie van 10.000 woorden
- •Geen kosten per minuut
- •Onbeperkte transcriptie
Gebruikerservaring
- •Eenvoudige interface
- •Regelmatige updates
- •Continue verbeteringen
Opslagvereisten
Voxtral Small is in volledige precisie een model van serverklasse: de officiële kaart vermeldt ongeveer 55 GB GPU-RAM. Voxtral Mini is specifiek bedoeld voor lokaal en edge-gebruik, maar de kaart vermeldt nog steeds ongeveer 9,5 GB GPU-RAM in bf16/fp16. De app-download van Whisper Turbo is ongeveer 1,6 GB, wat beter past bij het huidige Whisper Notes-product.
Whisper Notes gebruikt Whisper Large-v3 Turbo — het balanceert prestaties, snelheid en VRAM-eisen voor dagelijks gebruik. We stappen over op betere modellen zodra die beschikbaar komen met redelijke resource-eisen.
Voxtral is aantrekkelijk wanneer audio-Q&A, samenvatten of zelf gehoste server-inzet belangrijk is. Whisper Notes richt zich op individuele gebruikers die private transcriptie willen en geen terugkerend abonnement.
Wat dit betekent
Voxtral is een belangrijke open-weight-stap voorbij kale spraakherkenning, omdat het niet alleen kan transcriberen maar ook over audio kan redeneren.
Voor private offline transcriptie op Mac en iPhone blijven kleinere gespecialiseerde engines makkelijker te verpakken en consistent te draaien.
Alle lokale opties vergelijken? Elk on-device speech-to-text-model — Whisper-varianten, Parakeet V3, SenseVoice en Voxtral — staat zij aan zij op onze vergelijkingspagina voor Whisper-modellen.
Veelgestelde vragen
Wat is Mistral Voxtral?
Voxtral is Mistrals open-weight-familie voor spraaktranscriptie en audiobegrip. De release van juli 2025 omvat Voxtral Small 24B voor workloads van serverklasse en Voxtral Mini 3B voor lokale en edge-inzet. Beide checkpoints gebruiken de Apache 2.0-licentie.
Kan Voxtral lokaal op een Mac draaien?
De downloadbare gewichten kun je zelf hosten, maar de twee groottes stellen verschillende eisen. Voxtral Small heeft ongeveer 55 GB GPU-RAM nodig in bf16/fp16 en is dus een keuze van serverklasse. Voxtral Mini is het lokale en edge-checkpoint; zijn modelkaart vermeldt ongeveer 9,5 GB in bf16/fp16, en de werkelijke snelheid en het geheugengebruik op een Mac hangen af van de runtime en kwantisatie.
Gebruikt Whisper Notes Voxtral?
Nee. Whisper Notes draait Parakeet V3 (de Mac-standaard), Whisper Large-v3 Turbo en SenseVoice — modellen die zijn gekozen omdat ze prestaties, snelheid en VRAM-eisen balanceren voor dagelijks gebruik op Apple Silicon. We nemen betere modellen over zodra ze praktisch te draaien zijn op consumentenhardware.
Hoeveel talen ondersteunt Voxtral?
De officiële modelkaarten noemen acht primaire talen met automatische detectie: Engels, Spaans, Frans, Portugees, Hindi, Duits, Nederlands en Italiaans. Mistral evalueert in FLEURS ook Arabisch, maar dat staat niet in de lijst met primaire talen op de modelkaart.
Wanneer is Mistral Voxtral uitgebracht?
Mistral bracht Voxtral uit op 15 juli 2025. De eerste Apache 2.0-checkpoints waren Voxtral Small 24B en Voxtral Mini 3B.