Mistral har släppt Voxtral, sin första familj med öppna vikter för transkribering och ljudförståelse. De officiella benchmarken visar stark flerspråkig taligenkänning och ljudbaserade frågor och svar, men de två modellstorlekarna har väldigt olika hårdvarukrav. Här är vad lanseringen faktiskt stöder och varför Whisper Notes fortfarande använder mindre, transkriberingsfokuserade modeller på vanlig Apple-hårdvara.
Två modeller
Mistral släppte två Apache 2.0-checkpoints i juli 2025:
Voxtral Small 24B
- •24 miljarder parametrar
- •Transkribering, översättning, ljudbaserade frågor och svar samt sammanfattning
- •Kontextfönster på 32k
- •Cirka 55 GB GPU-minne i bf16/fp16
Voxtral Mini 3B
- •3 miljarder parametrar
- •Samma familj av ljud- och textuppgifter i en mindre checkpoint
- •Officiellt positionerad för lokal drift och edge-driftsättning
- •Cirka 9,5 GB GPU-minne i bf16/fp16
Öppna vikter och licens
Båda 2025-checkpointsen har öppna vikter under Apache 2.0-licensen. Du kan ladda ner och köra dem själv:
- ✓ Fullständiga modellvikter finns tillgängliga
- ✓ Självhosta eller anpassa dem inom ramen för Apache 2.0-licensen
- ✓ Ingen Mistral-API-avgift vid självhostning; du betalar fortfarande för din egen beräkningskraft
- ✓ Bearbeta ljud på dina egna servrar
Källor: Mistrals Voxtral-lansering, det officiella modellkortet för Voxtral Small och det officiella modellkortet för Voxtral Mini.
Benchmarker
Mistrals lansering jämför makrogenomsnittlig ordfelfrekvens (WER) på engelska kort- och långformatstester samt Mozilla Common Voice, FLEURS och Multilingual LibriSpeech. I Mistrals redovisade FLEURS-resultat slår Voxtral Small Whisper på varje utvärderad uppgift. Lägre WER är bättre:
FLEURS-WER från Mistrals lanseringsbenchmarker plottad mot uppskattat API-pris; både benchmarkresultat och priser kan ändras
FLEURS är bara en del av transkriberingskvaliteten. Det här är resultat som leverantören själv rapporterar, så jämför de publicerade benchmarkdefinitionerna och testa dina egna språk, mikrofoner och inspelningsförhållanden innan du väljer modell.
Voxtral eller Whisper: vilken ska du använda?
Benchmarker berättar bara en del av historien. Så här står sig de två modellfamiljerna på de punkter som spelar roll om du faktiskt vill köra en själv:
| Voxtral Small | Voxtral Mini | Whisper Large v3 | Whisper Large-v3 Turbo | |
|---|---|---|---|---|
| Språk | 8 primära språk | 8 primära språk | 100+ | 100+ |
| Öppen källkod | Ja | Ja | Ja | Ja |
| Modellstorlek | 24B parametrar; ~55 GB GPU-minne i bf16/fp16 | 3B parametrar; ~9,5 GB GPU-minne i bf16/fp16 | 1,55B parametrar | 809M parametrar (~1,6 GB) |
| Praktisk på en vanlig Mac | Inte i full precision på typisk hårdvara | Möjligt med en kompatibel runtime; tyngre än Turbo | Ja | Ja |
Slutsatsen: Voxtral Small rapporterar starka WER-resultat och lägger till ljudförståelse som Whisper inte ens försöker sig på. Voxtral Mini är den checkpoint som Mistral positionerar för lokal drift och edge, men dess officiella modellkort anger fortfarande cirka 9,5 GB GPU-minne i bf16/fp16. För en konsumentapp för transkribering är Whisper Large-v3 Turbo fortfarande enklare att leverera och täcker betydligt fler språk. Det är därför Whisper Notes i dag kombinerar Whisper Turbo med Parakeet V3 och SenseVoice i stället för Voxtral.
API-pris och kostnad för självhostning
Vid kontroll den 10 juli 2026 anger Mistrals modellkort priset för ljudindata till Voxtral Small till 0,004 USD per minut. Textindata och genererad text faktureras separat för förfrågningar om ljudförståelse. Om du självhostar Apache 2.0-vikterna tillkommer ingen Mistral-API-avgift, men du betalar för hårdvara och drift.
Mistral API
Självhostade vikter
Så fungerar det
Det officiella modellkortet beskriver Voxtral som en språkmodellsstomme med en ljudkodare och ett dedikerat transkriberingsläge. De viktiga produktbegränsningarna är konkreta:
1. Multimodal arkitektur
Voxtral tar emot ljud och text i samma konversation i stället för att bara fungera som en tal-till-text-avkodare:
- •Dedikerat läge för direkt transkribering
- •Ljudbaserade frågor och svar samt strukturerad sammanfattning
- •Flera ljudindata och ljudkonversationer i flera turer
Gräns för långt material
Kontextfönstret på 32k stöder upp till 30 minuter ljud för transkribering eller 40 minuter för bredare ljudförståelse.
2. Språk och utvärdering
Mistral listar åtta primära språk med automatisk identifiering:
- •Engelska, spanska, franska, portugisiska, hindi, tyska, nederländska och italienska
- •Benchmarken omfattar FLEURS, Mozilla Common Voice och Multilingual LibriSpeech
- •Lanseringen utvärderar dessutom engelskt kort- och långformatsljud separat
3. Krav för driftsättning
Öppna vikter betyder inte att varje checkpoint är liten nog för varje enhet:
- •Voxtral Small kräver cirka 55 GB GPU-minne i bf16/fp16 enligt sitt modellkort
- •Voxtral Mini är 3B-checkpointen som är avsedd för lokal drift och edge-driftsättning
- •Mistral rekommenderar vLLM för att servera de släppta checkpointsen
4. Viktiga funktioner
Kontextuell förståelse
Kan besvara frågor och ta fram sammanfattningar direkt från ljud, inom kontextgränsen på 32k.
Flerspråkig
Identifierar och transkriberar automatiskt åtta primära språk: engelska, spanska, franska, portugisiska, hindi, tyska, nederländska och italienska.
Brushantering
Den officiella utvärderingen omfattar varierade taldatamängder, men Mistral publicerar ingen generell garanti för varje brusig inspelning.
Edge-driftsättning
Voxtral Mini är alternativet för lokal drift och edge. Dess officiella modellkort anger cirka 9,5 GB GPU-minne i bf16/fp16.
5. Arkitektur
Tre huvudkomponenter:
- 1. Ljudkodare: Omvandlar vågformen till inlärda ljudrepresentationer
- 2. Projektor: Mappar ljudrepresentationerna till språkmodellens dolda rum
- 3. Språkmodellsstomme: Genererar transkript, svar, sammanfattningar eller verktygsanrop
Den designen förklarar varför Voxtral kan göra mer än att transkribera, men den bär också på mycket större språkmodellsvikter än en renodlad transkriberingsmodell som Whisper Turbo.
Därför är Whisper Notes fortfarande ett vettigt val
Voxtral och Whisper Notes löser olika problem. Voxtral kombinerar transkribering med ljudförståelse; Whisper Notes fokuserar på privat transkribering som är enkel att köra på vanlig Apple-hårdvara.
Det här erbjuder Whisper Notes
Integritet
- •100 % offline-bearbetning
- •Ingen dataöverföring
- •Inga molnberoenden
Prestanda
- •Whisper-teknik med beprövad noggrannhet
- •Optimerad för Apple Silicon
- •Tillförlitliga resultat
Kostnad
- •engångsköp till priset som visas i respektive köpkanal; Mac har en gratis provperiod på 10 000 ord
- •Inga minutavgifter
- •Obegränsad transkribering
Användarupplevelse
- •Enkelt gränssnitt
- •Regelbundna uppdateringar
- •Kontinuerliga förbättringar
Lagringskrav
Voxtral Small är en modell i serverklass i full precision: dess officiella kort anger cirka 55 GB GPU-minne. Voxtral Mini är specifikt avsedd för lokal drift och edge, men kortet anger fortfarande cirka 9,5 GB GPU-minne i bf16/fp16. Whisper Turbos nedladdning i appen är ungefär 1,6 GB, vilket passar den nuvarande Whisper Notes-produkten bättre.
Whisper Notes använder Whisper Large-v3 Turbo — den balanserar prestanda, hastighet och VRAM-krav för vardagsbruk. Vi uppgraderar till bättre modeller när de blir tillgängliga med rimliga resurskrav.
Voxtral är attraktivt när ljudbaserade frågor och svar, sammanfattning eller självhostad serverdrift spelar roll. Whisper Notes riktar sig till enskilda användare som vill ha privat transkribering och slippa återkommande prenumerationer.
Vad det här betyder
Voxtral är ett viktigt steg med öppna vikter bortom ren taligenkänning, eftersom modellen både kan resonera kring ljud och transkribera det.
För privat offline-transkribering på Mac och iPhone är mindre specialiserade motorer fortfarande enklare att paketera och köra konsekvent.
Jämför du alla lokala alternativ? Varje tal-till-text-modell som körs på enheten — Whisper-varianter, Parakeet V3, SenseVoice och Voxtral — jämförs sida vid sida på vår jämförelsesida för Whisper-modeller.
Vanliga frågor
Vad är Mistral Voxtral?
Voxtral är Mistrals familj med öppna vikter för taltranskribering och ljudförståelse. Lanseringen i juli 2025 omfattar Voxtral Small 24B för arbetslaster i serverklass och Voxtral Mini 3B för lokal drift och edge-driftsättning. Båda checkpointsen använder Apache 2.0-licensen.
Kan Voxtral köras lokalt på en Mac?
De nedladdningsbara vikterna kan självhostas, men de två storlekarna har olika krav. Voxtral Small behöver cirka 55 GB GPU-minne i bf16/fp16 och är därmed ett val i serverklass. Voxtral Mini är checkpointen för lokal drift och edge; dess modellkort anger cirka 9,5 GB i bf16/fp16, och faktisk hastighet och minnesanvändning på en Mac beror på runtime och kvantisering.
Använder Whisper Notes Voxtral?
Nej. Whisper Notes kör Parakeet V3 (standardmodellen på Mac), Whisper Large-v3 Turbo och SenseVoice — modeller som valts för att de balanserar prestanda, hastighet och VRAM-krav för vardagsbruk på Apple Silicon. Vi tar in bättre modeller så snart de blir praktiska att köra på konsumenthårdvara.
Hur många språk stöder Voxtral?
De officiella modellkorten listar åtta primära språk med automatisk identifiering: engelska, spanska, franska, portugisiska, hindi, tyska, nederländska och italienska. Mistral utvärderar även arabiska i FLEURS, men det ingår inte i modellkortets lista över primära språk.
När släpptes Mistral Voxtral?
Mistral släppte Voxtral den 15 juli 2025. De första Apache 2.0-checkpointsen var Voxtral Small 24B och Voxtral Mini 3B.