Mistral Voxtral vs GPT-4o | Benchmark Govornog AI

2. kolovoza 2025.
·
8 min read
·Whisper Notes Team

Mistral je objavio Voxtral, svoju prvu open-weight obitelj modela za transkripciju i razumijevanje zvuka. Službeni benchmarkovi pokazuju snažno višejezično prepoznavanje govora i dobre rezultate u odgovaranju na pitanja o zvuku, no dvije veličine modela imaju vrlo različite hardverske zahtjeve. Evo što ovo izdanje zapravo podržava i zašto Whisper Notes i dalje koristi manje modele usmjerene na transkripciju na potrošačkom Apple hardveru.

Benchmarkovi performansi Mistral Voxtrala

Dva modela

Mistral je u srpnju 2025. objavio dva checkpointa pod licencom Apache 2.0:

Voxtral Small 24B

  • 24 milijarde parametara
  • Transkripcija, prijevod, pitanja i odgovori o zvuku te sažimanje
  • Kontekstni prozor od 32k
  • Oko 55 GB GPU RAM-a u bf16/fp16

Voxtral Mini 3B

  • 3 milijarde parametara
  • Ista obitelj audio-tekstualnih zadataka u manjem checkpointu
  • Službeno pozicioniran za lokalnu i edge implementaciju
  • Oko 9,5 GB GPU RAM-a u bf16/fp16

Otvorene težine i licenca

Oba checkpointa iz 2025. imaju otvorene težine pod licencom Apache 2.0. Možete ih sami preuzeti i pokrenuti:

  • Dostupne su potpune težine modela
  • Možete ih sami hostati ili prilagoditi u okviru licence Apache 2.0
  • Bez naknade za Mistralov API pri self-hostingu; vlastite računalne resurse i dalje plaćate sami
  • Obrađujte zvuk na vlastitim poslužiteljima

Izvori: Mistralova objava Voxtrala, službena model card Voxtrala Small i službena model card Voxtrala Mini.

Benchmarkovi

Mistralova objava uspoređuje makroprosječnu stopu pogreške riječi (WER) na engleskim short-form i long-form skupovima, Mozilla Common Voiceu, FLEURS-u i Multilingual LibriSpeechu. U FLEURS rezultatima koje Mistral navodi, Voxtral Small pobjeđuje Whisper u svakom ocijenjenom zadatku. Niži WER je bolji:

Usporedba WER benchmarkova Voxtrala sa svim modelima

FLEURS WER iz Mistralovih benchmarkova pri objavi, prikazan u odnosu na procijenjenu cijenu API-ja; i rezultati benchmarkova i cijene mogu se promijeniti

FLEURS je samo jedan isječak kvalitete transkripcije. Riječ je o rezultatima koje navodi sam proizvođač, pa prije odabira modela usporedite objavljene definicije benchmarkova i isprobajte vlastite jezike, mikrofone i uvjete snimanja.

Voxtral ili Whisper: koji odabrati?

Benchmarkovi pričaju samo dio priče. Evo kako se dvije obitelji modela uspoređuju po čimbenicima koji su važni ako neki od njih doista želite sami pokrenuti:

Voxtral Small Voxtral Mini Whisper Large v3 Whisper Large-v3 Turbo
Jezici 8 primarnih jezika 8 primarnih jezika Više od 100 Više od 100
Otvoreni kod Da Da Da Da
Veličina modela 24B parametara; ~55 GB GPU RAM-a u bf16/fp16 3B parametara; ~9,5 GB GPU RAM-a u bf16/fp16 1,55B parametara 809M parametara (~1,6 GB)
Praktičan na potrošačkom Macu Ne u punoj preciznosti na tipičnom hardveru Moguće s kompatibilnim runtimeom; zahtjevniji od Turba Da Da

Presuda: Voxtral Small navodi izvrsne WER rezultate i dodaje razumijevanje zvuka koje Whisper niti ne pokušava. Voxtral Mini je checkpoint koji Mistral pozicionira za lokalnu i edge implementaciju, no njegova službena model card i dalje navodi oko 9,5 GB GPU RAM-a u bf16/fp16. Za potrošačku aplikaciju za transkripciju, Whisper Large-v3 Turbo ostaje jednostavniji za isporuku i pokriva daleko više jezika. Zato Whisper Notes trenutačno kombinira Whisper Turbo s Parakeetom V3 i SenseVoiceom umjesto Voxtrala.

Troškovi API-ja i self-hostinga

Prema provjeri od 10. srpnja 2026., Mistralova model card navodi cijenu audioulaza za Voxtral Small od $0.004 po minuti. Kod zahtjeva za razumijevanje zvuka, tekstualni ulaz i generirani tekst naplaćuju se zasebno. Ako sami hostate težine pod licencom Apache 2.0, nema naknade za Mistralov API, ali plaćate hardver i održavanje.

Mistral API

$0.004
po minuti zvuka za Voxtral Small

Self-hostane težine

Apache 2.0
bez naknade za API; računalni resursi su vaša odgovornost

Kako radi

Službena model card opisuje Voxtral kao okosnicu jezičnog modela s audio enkoderom i namjenskim načinom rada za transkripciju. Važna produktna ograničenja sasvim su konkretna:

1. Multimodalna arhitektura

Voxtral prihvaća zvuk i tekst u istom razgovoru, umjesto da bude samo speech-to-text dekoder:

  • Namjenski način rada za izravnu transkripciju
  • Pitanja i odgovori o zvuku te strukturirano sažimanje
  • Više audioulaza i audiorazgovori u više krugova

Ograničenje za dugi sadržaj

Kontekstni prozor od 32k podržava do 30 minuta zvuka za transkripciju ili 40 minuta za šire razumijevanje zvuka.

2. Jezici i evaluacija

Mistral navodi osam primarnih jezika s automatskim prepoznavanjem:

  • Engleski, španjolski, francuski, portugalski, hindski, njemački, nizozemski i talijanski
  • Benchmarkovi uključuju FLEURS, Mozilla Common Voice i Multilingual LibriSpeech
  • Izdanje uz to zasebno ocjenjuje engleski short-form i long-form zvuk

3. Zahtjevi za implementaciju

Otvorene težine ne znače da je svaki checkpoint dovoljno malen za svaki uređaj:

  • Voxtral Small prema svojoj model card zahtijeva oko 55 GB GPU RAM-a u bf16/fp16
  • Voxtral Mini je 3B checkpoint namijenjen lokalnoj i edge implementaciji
  • Mistral za posluživanje objavljenih checkpointa preporučuje vLLM

4. Ključne značajke

Kontekstualno razumijevanje

Može odgovarati na pitanja i izrađivati sažetke izravno iz zvuka, unutar kontekstnog ograničenja od 32k.

Višejezičnost

Automatski prepoznaje i transkribira osam primarnih jezika: engleski, španjolski, francuski, portugalski, hindski, njemački, nizozemski i talijanski.

Rad s bukom

Službena evaluacija uključuje raznolike govorne skupove podataka, ali Mistral ne objavljuje opće jamstvo za svaku bučnu snimku.

Edge implementacija

Voxtral Mini je opcija za lokalno i edge okruženje. Njegova službena model card navodi oko 9,5 GB GPU RAM-a u bf16/fp16.

5. Arhitektura

Tri glavne komponente:

  1. 1. Audio enkoder: pretvara zvučni val u naučene audioreprezentacije
  2. 2. Projektor: preslikava audioreprezentacije u skriveni prostor jezičnog modela
  3. 3. Okosnica jezičnog modela: generira transkripte, odgovore, sažetke ili pozive alata

Taj dizajn objašnjava zašto Voxtral može više od transkripcije, ali zato nosi i znatno veće težine jezičnog modela nego model namijenjen isključivo transkripciji poput Whisper Turba.

Zašto Whisper Notes i dalje ima smisla

Voxtral i Whisper Notes rješavaju različite probleme. Voxtral spaja transkripciju s razumijevanjem zvuka; Whisper Notes usredotočen je na privatnu transkripciju koju je lako pokrenuti na potrošačkom Apple hardveru.

Što nudi Whisper Notes

Privatnost

Performanse

  • Whisper tehnologija, dokazana točnost
  • Optimiziran za Apple Silicon
  • Pouzdani rezultati

Cijena

  • jednokratna kupnja; cijena prema kanalu kupnje; Mac uključuje probno razdoblje od 10.000 riječi
  • Bez naplate po minuti
  • Neograničena transkripcija

Korisničko iskustvo

  • Jednostavno sučelje
  • Redovita ažuriranja
  • Stalna poboljšanja

Zahtjevi za pohranu

Voxtral Small je u punoj preciznosti model poslužiteljske klase: njegova službena kartica navodi oko 55 GB GPU RAM-a. Voxtral Mini izričito je namijenjen lokalnoj i edge upotrebi, no njegova kartica i dalje navodi oko 9,5 GB GPU RAM-a u bf16/fp16. Preuzimanje Whisper Turba u aplikaciji iznosi otprilike 1,6 GB, što je bolji izbor za trenutačni proizvod Whisper Notes.

Whisper Notes koristi Whisper Large-v3 Turbo — on uravnotežuje performanse, brzinu i zahtjeve za VRAM-om za svakodnevnu upotrebu. Prijeći ćemo na bolje modele kad postanu dostupni s razumnim zahtjevima za resursima.

Voxtral je privlačan kad su važni pitanja i odgovori o zvuku, sažimanje ili self-hosted implementacija na poslužitelju. Whisper Notes namijenjen je pojedinačnim korisnicima koji žele privatnu transkripciju bez ponavljajuće pretplate.

Što ovo znači

Voxtral je važan open-weight iskorak izvan običnog prepoznavanja govora jer, osim što zvuk transkribira, može i rasuđivati o njemu.

Za privatnu izvanmrežnu transkripciju na Macu i iPhoneu manji specijalizirani motori i dalje se lakše pakiraju i dosljednije rade.

Uspoređujete sve lokalne opcije? Svaki on-device model za pretvaranje govora u tekst — varijante Whispera, Parakeet V3, SenseVoice i Voxtral — uspoređen je jedan uz drugi na našoj stranici za usporedbu Whisper modela.

Često postavljana pitanja

Što je Mistral Voxtral?

Voxtral je Mistralova open-weight obitelj modela za transkripciju govora i razumijevanje zvuka. Izdanje iz srpnja 2025. uključuje Voxtral Small 24B za poslužiteljska radna opterećenja i Voxtral Mini 3B za lokalnu i edge implementaciju. Oba checkpointa koriste licencu Apache 2.0.

Može li Voxtral raditi lokalno na Macu?

Preuzete težine mogu se sami hostati, ali dvije veličine imaju različite zahtjeve. Voxtral Small treba oko 55 GB GPU RAM-a u bf16/fp16, pa je to izbor poslužiteljske klase. Voxtral Mini je lokalni i edge checkpoint; njegova model card navodi oko 9,5 GB u bf16/fp16, a stvarna brzina i potrošnja memorije na Macu ovise o runtimeu i kvantizaciji.

Koristi li Whisper Notes Voxtral?

Ne. Whisper Notes pokreće Parakeet V3 (zadani model na Macu), Whisper Large-v3 Turbo i SenseVoice — modele odabrane zato što uravnotežuju performanse, brzinu i zahtjeve za VRAM-om za svakodnevnu upotrebu na Apple Siliconu. Bolje modele usvojit ćemo čim ih postane praktično pokretati na potrošačkom hardveru.

Koliko jezika podržava Voxtral?

Službene model card navode osam primarnih jezika s automatskim prepoznavanjem: engleski, španjolski, francuski, portugalski, hindski, njemački, nizozemski i talijanski. Mistral u FLEURS-u ocjenjuje i arapski, no on nije uvršten na popis primarnih jezika u model card.

Kada je Mistral Voxtral objavljen?

Mistral je objavio Voxtral 15. srpnja 2025. Početni checkpointi pod licencom Apache 2.0 bili su Voxtral Small 24B i Voxtral Mini 3B.