Mistral Voxtral vs GPT-4o | Benchmark Řečové AI

2. srpna 2025
·
8 min read
·Whisper Notes Team

Mistral vydal Voxtral, svou první rodinu modelů s otevřenými vahami pro přepis a porozumění zvuku. Oficiální benchmarky ukazují silné vícejazyčné rozpoznávání řeči a zvukové Q&A, obě velikosti modelu ale mají velmi odlišné hardwarové nároky. Zde je přehled toho, co vydání skutečně umí a proč Whisper Notes na spotřebitelském hardwaru Apple nadále používá menší modely zaměřené na přepis.

Výkonnostní benchmarky Mistral Voxtral

Dva modely

Mistral vydal v červenci 2025 dva checkpointy pod licencí Apache 2.0:

Voxtral Small 24B

  • 24 miliard parametrů
  • Přepis, překlad, zvukové Q&A a sumarizace
  • Kontextové okno 32k
  • Přibližně 55 GB GPU RAM v bf16/fp16

Voxtral Mini 3B

  • 3 miliardy parametrů
  • Stejná rodina zvukových a textových úloh v menším checkpointu
  • Oficiálně určený pro lokální a edge nasazení
  • Přibližně 9,5 GB GPU RAM v bf16/fp16

Otevřené váhy a licence

Oba checkpointy z roku 2025 mají otevřené váhy pod licencí Apache 2.0. Můžete si je stáhnout a provozovat sami:

  • K dispozici jsou kompletní váhy modelu
  • Můžete je sami hostovat nebo upravovat v rámci licence Apache 2.0
  • Při vlastním hostování neplatíte žádný poplatek za Mistral API; platíte ale za vlastní výpočetní výkon
  • Zvuk můžete zpracovávat na vlastních serverech

Zdroje: oznámení Voxtralu od Mistralu, oficiální karta modelu Voxtral Small a oficiální karta modelu Voxtral Mini.

Benchmarky

Vydání Mistralu porovnává makroprůměrnou chybovost slov (WER) napříč anglickými krátkými a dlouhými nahrávkami, Mozilla Common Voice, FLEURS a Multilingual LibriSpeech. Ve výsledcích FLEURS, které Mistral uvádí, poráží Voxtral Small model Whisper v každé hodnocené úloze. Nižší WER je lepší:

Srovnání benchmarku WER modelu Voxtral napříč všemi modely

WER na FLEURS z benchmarků zveřejněných Mistralem při vydání, vynesený proti odhadované ceně API; výsledky benchmarků i ceny se mohou měnit

FLEURS je jen jedním výsekem kvality přepisu. Jde o výsledky uváděné výrobcem, proto si před výběrem modelu porovnejte zveřejněné definice benchmarků a otestujte vlastní jazyky, mikrofony a podmínky nahrávání.

Voxtral vs Whisper: Který si vybrat?

Benchmarky vyprávějí jen část příběhu. Takto si obě rodiny modelů stojí ve faktorech, na kterých záleží, pokud chcete některý z nich skutečně provozovat sami:

Voxtral Small Voxtral Mini Whisper Large v3 Whisper Large-v3 Turbo
Jazyky 8 hlavních jazyků 8 hlavních jazyků 100+ 100+
Open source Ano Ano Ano Ano
Velikost modelu 24 mld. parametrů; ~55 GB GPU RAM v bf16/fp16 3 mld. parametrů; ~9,5 GB GPU RAM v bf16/fp16 1,55 mld. parametrů 809 mil. parametrů (~1,6 GB)
Prakticky použitelný na běžném Macu V plné přesnosti na typickém hardwaru ne Možné s kompatibilním runtime; náročnější než Turbo Ano Ano

Verdikt: Voxtral Small vykazuje silné hodnoty WER a přidává porozumění zvuku, o které se Whisper vůbec nepokouší. Voxtral Mini je checkpoint, který Mistral určuje pro lokální a edge nasazení, jeho oficiální karta modelu ale stále uvádí přibližně 9,5 GB GPU RAM v bf16/fp16. Pro spotřebitelskou přepisovací aplikaci zůstává Whisper Large-v3 Turbo snazší na nasazení a pokrývá mnohem více jazyků. Proto Whisper Notes v současnosti kombinuje Whisper Turbo s Parakeet V3 a SenseVoice namísto Voxtralu.

Cena API a vlastního hostování

Ke dni ověření 10. července 2026 uvádí karta modelu od Mistralu u zvukového vstupu Voxtral Small cenu 0,004 $ za minutu. Textový vstup a generovaný text se u požadavků na porozumění zvuku účtují zvlášť. Pokud si váhy pod licencí Apache 2.0 hostujete sami, žádný poplatek za Mistral API neplatíte, hradíte ale hardware a provoz.

Mistral API

$0.004
za minutu zvuku u Voxtral Small

Váhy hostované u vás

Apache 2.0
žádný poplatek za API; výpočetní výkon je na vás

Jak to funguje

Oficiální karta modelu popisuje Voxtral jako jazykový model doplněný o zvukový enkodér a vyhrazený režim přepisu. Důležité produktové limity jsou konkrétní:

1. Multimodální architektura

Voxtral přijímá zvuk i text v jedné konverzaci, místo aby fungoval jen jako dekodér řeči na text:

  • Vyhrazený režim pro přímý přepis
  • Zvukové Q&A a strukturovaná sumarizace
  • Více zvukových vstupů a vícekolové zvukové konverzace

Limit dlouhých nahrávek

Kontextové okno 32k zvládne až 30 minut zvuku pro přepis, nebo 40 minut pro širší porozumění zvuku.

2. Jazyky a vyhodnocení

Mistral uvádí osm hlavních jazyků s automatickou detekcí:

  • Angličtina, španělština, francouzština, portugalština, hindština, němčina, nizozemština a italština
  • Benchmarky zahrnují FLEURS, Mozilla Common Voice a Multilingual LibriSpeech
  • Vydání navíc vyhodnocuje anglické krátké a dlouhé nahrávky zvlášť

3. Nároky na nasazení

Otevřené váhy neznamenají, že je každý checkpoint dost malý pro každé zařízení:

  • Voxtral Small vyžaduje podle své karty modelu přibližně 55 GB GPU RAM v bf16/fp16
  • Voxtral Mini je checkpoint se 3 miliardami parametrů určený pro lokální a edge nasazení
  • Pro servírování vydaných checkpointů doporučuje Mistral vLLM

4. Klíčové funkce

Kontextové porozumění

Dokáže odpovídat na otázky a vytvářet shrnutí přímo ze zvuku, v rámci limitu 32k kontextu.

Vícejazyčnost

Automaticky detekuje a přepisuje osm hlavních jazyků: angličtinu, španělštinu, francouzštinu, portugalštinu, hindštinu, němčinu, nizozemštinu a italštinu.

Práce s hlukem

Oficiální vyhodnocení zahrnuje rozmanité řečové datasety, Mistral ale nezveřejňuje žádnou plošnou záruku pro každou hlučnou nahrávku.

Edge nasazení

Voxtral Mini je varianta pro lokální a edge použití. Jeho oficiální karta modelu uvádí přibližně 9,5 GB GPU RAM v bf16/fp16.

5. Architektura

Tři hlavní komponenty:

  1. 1. Zvukový enkodér: Převádí zvukovou vlnu na naučené zvukové reprezentace
  2. 2. Projektor: Mapuje zvukové reprezentace do skrytého prostoru jazykového modelu
  3. 3. Jazykový model jako páteř: Generuje přepisy, odpovědi, shrnutí nebo volání nástrojů

Tento návrh vysvětluje, proč Voxtral umí víc než jen přepis, zároveň ale nese mnohem větší váhy jazykového modelu než model zaměřený čistě na přepis, jako je Whisper Turbo.

Proč Whisper Notes stále dává smysl

Voxtral a Whisper Notes řeší různé problémy. Voxtral kombinuje přepis s porozuměním zvuku; Whisper Notes se soustředí na soukromý přepis, který se snadno provozuje na spotřebitelském hardwaru Apple.

Co Whisper Notes nabízí

Soukromí

Výkon

  • Technologie Whisper, prověřená přesnost
  • Optimalizováno pro Apple Silicon
  • Spolehlivé výsledky

Cena

  • jednorázový nákup za cenu uvedenou v příslušném kanálu; Mac zahrnuje zkušební verzi na 10 000 slov
  • Žádné poplatky za minutu
  • Neomezený přepis

Uživatelský zážitek

  • Jednoduché rozhraní
  • Pravidelné aktualizace
  • Průběžná vylepšení

Nároky na úložiště

Voxtral Small je v plné přesnosti model serverové třídy: jeho oficiální karta uvádí přibližně 55 GB GPU RAM. Voxtral Mini je určen přímo pro lokální a edge použití, jeho karta ale stále uvádí přibližně 9,5 GB GPU RAM v bf16/fp16. Whisper Turbo se v aplikaci stahuje jako zhruba 1,6 GB, což současnému produktu Whisper Notes sedí mnohem lépe.

Whisper Notes používá Whisper Large-v3 Turbo — vyvažuje výkon, rychlost a nároky na VRAM pro každodenní použití. Jakmile budou k dispozici lepší modely s rozumnými nároky na zdroje, přejdeme na ně.

Voxtral je lákavý tam, kde záleží na zvukovém Q&A, sumarizaci nebo serverovém nasazení ve vlastní režii. Whisper Notes míří na jednotlivé uživatele, kteří chtějí soukromý přepis a žádné opakující se předplatné.

Co z toho plyne

Voxtral je důležitý krok otevřených vah za hranice prostého rozpoznávání řeči, protože umí nad zvukem uvažovat, nejen ho přepisovat.

Pro soukromý offline přepis na Macu a iPhonu zůstávají menší specializované enginy snazší na zabalení a konzistentní provoz.

Porovnáváte všechny lokální možnosti? Každý on-device model pro převod řeči na text — varianty Whisperu, Parakeet V3, SenseVoice i Voxtral — najdete vedle sebe na naší srovnávací stránce modelů Whisper.

Často kladené otázky

Co je Mistral Voxtral?

Voxtral je rodina modelů Mistralu s otevřenými vahami pro přepis řeči a porozumění zvuku. Vydání z července 2025 zahrnuje Voxtral Small 24B pro serverové úlohy a Voxtral Mini 3B pro lokální a edge nasazení. Oba checkpointy používají licenci Apache 2.0.

Může Voxtral běžet lokálně na Macu?

Stažitelné váhy si můžete hostovat sami, obě velikosti ale mají odlišné nároky. Voxtral Small potřebuje přibližně 55 GB GPU RAM v bf16/fp16, jde tedy o volbu serverové třídy. Voxtral Mini je checkpoint pro lokální a edge použití; jeho karta modelu uvádí přibližně 9,5 GB v bf16/fp16 a skutečná rychlost i spotřeba paměti na Macu závisejí na runtime a kvantizaci.

Používá Whisper Notes Voxtral?

Ne. Whisper Notes provozuje Parakeet V3 (výchozí model na Macu), Whisper Large-v3 Turbo a SenseVoice — modely zvolené proto, že vyvažují výkon, rychlost a nároky na VRAM pro každodenní použití na Apple Silicon. Jakmile bude praktické provozovat na spotřebitelském hardwaru lepší modely, přejdeme na ně.

Kolik jazyků Voxtral podporuje?

Oficiální karty modelu uvádějí osm hlavních jazyků s automatickou detekcí: angličtinu, španělštinu, francouzštinu, portugalštinu, hindštinu, němčinu, nizozemštinu a italštinu. Mistral vyhodnocuje ve FLEURS také arabštinu, ta ale v seznamu hlavních jazyků na kartě modelu není.

Kdy byl Mistral Voxtral vydán?

Mistral vydal Voxtral 15. července 2025. Prvními checkpointy pod licencí Apache 2.0 byly Voxtral Small 24B a Voxtral Mini 3B.