Mistral Voxtral vs GPT-4o | Tal-AI Benchmark

2 augusti 2025
·
8 min read
·Whisper Notes Team

Mistral har släppt Voxtral, sin första familj med öppna vikter för transkribering och ljudförståelse. De officiella benchmarken visar stark flerspråkig taligenkänning och ljudbaserade frågor och svar, men de två modellstorlekarna har väldigt olika hårdvarukrav. Här är vad lanseringen faktiskt stöder och varför Whisper Notes fortfarande använder mindre, transkriberingsfokuserade modeller på vanlig Apple-hårdvara.

Prestandabenchmarker för Mistral Voxtral

Två modeller

Mistral släppte två Apache 2.0-checkpoints i juli 2025:

Voxtral Small 24B

  • 24 miljarder parametrar
  • Transkribering, översättning, ljudbaserade frågor och svar samt sammanfattning
  • Kontextfönster på 32k
  • Cirka 55 GB GPU-minne i bf16/fp16

Voxtral Mini 3B

  • 3 miljarder parametrar
  • Samma familj av ljud- och textuppgifter i en mindre checkpoint
  • Officiellt positionerad för lokal drift och edge-driftsättning
  • Cirka 9,5 GB GPU-minne i bf16/fp16

Öppna vikter och licens

Båda 2025-checkpointsen har öppna vikter under Apache 2.0-licensen. Du kan ladda ner och köra dem själv:

  • Fullständiga modellvikter finns tillgängliga
  • Självhosta eller anpassa dem inom ramen för Apache 2.0-licensen
  • Ingen Mistral-API-avgift vid självhostning; du betalar fortfarande för din egen beräkningskraft
  • Bearbeta ljud på dina egna servrar

Källor: Mistrals Voxtral-lansering, det officiella modellkortet för Voxtral Small och det officiella modellkortet för Voxtral Mini.

Benchmarker

Mistrals lansering jämför makrogenomsnittlig ordfelfrekvens (WER) på engelska kort- och långformatstester samt Mozilla Common Voice, FLEURS och Multilingual LibriSpeech. I Mistrals redovisade FLEURS-resultat slår Voxtral Small Whisper på varje utvärderad uppgift. Lägre WER är bättre:

Voxtral WER-benchmarkjämförelse mellan alla modeller

FLEURS-WER från Mistrals lanseringsbenchmarker plottad mot uppskattat API-pris; både benchmarkresultat och priser kan ändras

FLEURS är bara en del av transkriberingskvaliteten. Det här är resultat som leverantören själv rapporterar, så jämför de publicerade benchmarkdefinitionerna och testa dina egna språk, mikrofoner och inspelningsförhållanden innan du väljer modell.

Voxtral eller Whisper: vilken ska du använda?

Benchmarker berättar bara en del av historien. Så här står sig de två modellfamiljerna på de punkter som spelar roll om du faktiskt vill köra en själv:

Voxtral Small Voxtral Mini Whisper Large v3 Whisper Large-v3 Turbo
Språk 8 primära språk 8 primära språk 100+ 100+
Öppen källkod Ja Ja Ja Ja
Modellstorlek 24B parametrar; ~55 GB GPU-minne i bf16/fp16 3B parametrar; ~9,5 GB GPU-minne i bf16/fp16 1,55B parametrar 809M parametrar (~1,6 GB)
Praktisk på en vanlig Mac Inte i full precision på typisk hårdvara Möjligt med en kompatibel runtime; tyngre än Turbo Ja Ja

Slutsatsen: Voxtral Small rapporterar starka WER-resultat och lägger till ljudförståelse som Whisper inte ens försöker sig på. Voxtral Mini är den checkpoint som Mistral positionerar för lokal drift och edge, men dess officiella modellkort anger fortfarande cirka 9,5 GB GPU-minne i bf16/fp16. För en konsumentapp för transkribering är Whisper Large-v3 Turbo fortfarande enklare att leverera och täcker betydligt fler språk. Det är därför Whisper Notes i dag kombinerar Whisper Turbo med Parakeet V3 och SenseVoice i stället för Voxtral.

API-pris och kostnad för självhostning

Vid kontroll den 10 juli 2026 anger Mistrals modellkort priset för ljudindata till Voxtral Small till 0,004 USD per minut. Textindata och genererad text faktureras separat för förfrågningar om ljudförståelse. Om du självhostar Apache 2.0-vikterna tillkommer ingen Mistral-API-avgift, men du betalar för hårdvara och drift.

Mistral API

$0.004
per ljudminut för Voxtral Small

Självhostade vikter

Apache 2.0
ingen API-avgift; beräkningskraften är ditt ansvar

Så fungerar det

Det officiella modellkortet beskriver Voxtral som en språkmodellsstomme med en ljudkodare och ett dedikerat transkriberingsläge. De viktiga produktbegränsningarna är konkreta:

1. Multimodal arkitektur

Voxtral tar emot ljud och text i samma konversation i stället för att bara fungera som en tal-till-text-avkodare:

  • Dedikerat läge för direkt transkribering
  • Ljudbaserade frågor och svar samt strukturerad sammanfattning
  • Flera ljudindata och ljudkonversationer i flera turer

Gräns för långt material

Kontextfönstret på 32k stöder upp till 30 minuter ljud för transkribering eller 40 minuter för bredare ljudförståelse.

2. Språk och utvärdering

Mistral listar åtta primära språk med automatisk identifiering:

  • Engelska, spanska, franska, portugisiska, hindi, tyska, nederländska och italienska
  • Benchmarken omfattar FLEURS, Mozilla Common Voice och Multilingual LibriSpeech
  • Lanseringen utvärderar dessutom engelskt kort- och långformatsljud separat

3. Krav för driftsättning

Öppna vikter betyder inte att varje checkpoint är liten nog för varje enhet:

  • Voxtral Small kräver cirka 55 GB GPU-minne i bf16/fp16 enligt sitt modellkort
  • Voxtral Mini är 3B-checkpointen som är avsedd för lokal drift och edge-driftsättning
  • Mistral rekommenderar vLLM för att servera de släppta checkpointsen

4. Viktiga funktioner

Kontextuell förståelse

Kan besvara frågor och ta fram sammanfattningar direkt från ljud, inom kontextgränsen på 32k.

Flerspråkig

Identifierar och transkriberar automatiskt åtta primära språk: engelska, spanska, franska, portugisiska, hindi, tyska, nederländska och italienska.

Brushantering

Den officiella utvärderingen omfattar varierade taldatamängder, men Mistral publicerar ingen generell garanti för varje brusig inspelning.

Edge-driftsättning

Voxtral Mini är alternativet för lokal drift och edge. Dess officiella modellkort anger cirka 9,5 GB GPU-minne i bf16/fp16.

5. Arkitektur

Tre huvudkomponenter:

  1. 1. Ljudkodare: Omvandlar vågformen till inlärda ljudrepresentationer
  2. 2. Projektor: Mappar ljudrepresentationerna till språkmodellens dolda rum
  3. 3. Språkmodellsstomme: Genererar transkript, svar, sammanfattningar eller verktygsanrop

Den designen förklarar varför Voxtral kan göra mer än att transkribera, men den bär också på mycket större språkmodellsvikter än en renodlad transkriberingsmodell som Whisper Turbo.

Därför är Whisper Notes fortfarande ett vettigt val

Voxtral och Whisper Notes löser olika problem. Voxtral kombinerar transkribering med ljudförståelse; Whisper Notes fokuserar på privat transkribering som är enkel att köra på vanlig Apple-hårdvara.

Det här erbjuder Whisper Notes

Integritet

Prestanda

  • Whisper-teknik med beprövad noggrannhet
  • Optimerad för Apple Silicon
  • Tillförlitliga resultat

Kostnad

  • engångsköp till priset som visas i respektive köpkanal; Mac har en gratis provperiod på 10 000 ord
  • Inga minutavgifter
  • Obegränsad transkribering

Användarupplevelse

  • Enkelt gränssnitt
  • Regelbundna uppdateringar
  • Kontinuerliga förbättringar

Lagringskrav

Voxtral Small är en modell i serverklass i full precision: dess officiella kort anger cirka 55 GB GPU-minne. Voxtral Mini är specifikt avsedd för lokal drift och edge, men kortet anger fortfarande cirka 9,5 GB GPU-minne i bf16/fp16. Whisper Turbos nedladdning i appen är ungefär 1,6 GB, vilket passar den nuvarande Whisper Notes-produkten bättre.

Whisper Notes använder Whisper Large-v3 Turbo — den balanserar prestanda, hastighet och VRAM-krav för vardagsbruk. Vi uppgraderar till bättre modeller när de blir tillgängliga med rimliga resurskrav.

Voxtral är attraktivt när ljudbaserade frågor och svar, sammanfattning eller självhostad serverdrift spelar roll. Whisper Notes riktar sig till enskilda användare som vill ha privat transkribering och slippa återkommande prenumerationer.

Vad det här betyder

Voxtral är ett viktigt steg med öppna vikter bortom ren taligenkänning, eftersom modellen både kan resonera kring ljud och transkribera det.

För privat offline-transkribering på Mac och iPhone är mindre specialiserade motorer fortfarande enklare att paketera och köra konsekvent.

Jämför du alla lokala alternativ? Varje tal-till-text-modell som körs på enheten — Whisper-varianter, Parakeet V3, SenseVoice och Voxtral — jämförs sida vid sida på vår jämförelsesida för Whisper-modeller.

Vanliga frågor

Vad är Mistral Voxtral?

Voxtral är Mistrals familj med öppna vikter för taltranskribering och ljudförståelse. Lanseringen i juli 2025 omfattar Voxtral Small 24B för arbetslaster i serverklass och Voxtral Mini 3B för lokal drift och edge-driftsättning. Båda checkpointsen använder Apache 2.0-licensen.

Kan Voxtral köras lokalt på en Mac?

De nedladdningsbara vikterna kan självhostas, men de två storlekarna har olika krav. Voxtral Small behöver cirka 55 GB GPU-minne i bf16/fp16 och är därmed ett val i serverklass. Voxtral Mini är checkpointen för lokal drift och edge; dess modellkort anger cirka 9,5 GB i bf16/fp16, och faktisk hastighet och minnesanvändning på en Mac beror på runtime och kvantisering.

Använder Whisper Notes Voxtral?

Nej. Whisper Notes kör Parakeet V3 (standardmodellen på Mac), Whisper Large-v3 Turbo och SenseVoice — modeller som valts för att de balanserar prestanda, hastighet och VRAM-krav för vardagsbruk på Apple Silicon. Vi tar in bättre modeller så snart de blir praktiska att köra på konsumenthårdvara.

Hur många språk stöder Voxtral?

De officiella modellkorten listar åtta primära språk med automatisk identifiering: engelska, spanska, franska, portugisiska, hindi, tyska, nederländska och italienska. Mistral utvärderar även arabiska i FLEURS, men det ingår inte i modellkortets lista över primära språk.

När släpptes Mistral Voxtral?

Mistral släppte Voxtral den 15 juli 2025. De första Apache 2.0-checkpointsen var Voxtral Small 24B och Voxtral Mini 3B.