Mistral Voxtral vs GPT-4o | Beszéd AI Benchmark

2025. augusztus 2.
·
8 min read
·Whisper Notes Team

A Mistral kiadta a Voxtralt, első nyílt súlyú modellcsaládját átiratkészítéshez és hangértelmezéshez. A hivatalos benchmarkok erős többnyelvű beszédfelismerést és hangalapú kérdés-válasz képességeket mutatnak, a két modellméret hardverigénye azonban nagyon eltérő. Íme, mit tud valójában a kiadás, és miért használ a Whisper Notes továbbra is kisebb, átírásra szakosodott modelleket fogyasztói Apple-hardveren.

A Mistral Voxtral teljesítmény-benchmarkjai

Két modell

A Mistral 2025 júliusában két Apache 2.0 licencű checkpointot adott ki:

Voxtral Small 24B

  • 24 milliárd paraméter
  • Átírás, fordítás, hangalapú kérdés-válasz és összefoglalás
  • 32k tokenes kontextusablak
  • Körülbelül 55 GB GPU-memória bf16/fp16 módban

Voxtral Mini 3B

  • 3 milliárd paraméter
  • Ugyanaz a hang- és szövegfeladat-család egy kisebb checkpointban
  • Hivatalosan helyi és edge-telepítésre pozicionálva
  • Körülbelül 9,5 GB GPU-memória bf16/fp16 módban

Nyílt súlyok és licenc

Mindkét 2025-ös checkpoint nyílt súlyú, Apache 2.0 licenc alatt. A modelleket letöltheti és saját maga futtathatja:

  • A teljes modellsúlyok elérhetők
  • Saját üzemeltetés és testreszabás az Apache 2.0 licenc keretein belül
  • Saját üzemeltetés esetén nincs Mistral API-díj; a saját számítási kapacitásért továbbra is fizetnie kell
  • A hanganyagot a saját szerverein dolgozhatja fel

Források: a Mistral Voxtral-bejelentése, a hivatalos Voxtral Small modellkártya és a hivatalos Voxtral Mini modellkártya.

Benchmarkok

A Mistral kiadási anyaga a makroátlagolt szóhibaarányt (WER) hasonlítja össze angol rövid és hosszú formátumú tesztkészleteken, valamint a Mozilla Common Voice, a FLEURS és a Multilingual LibriSpeech adathalmazokon. A Mistral által közölt FLEURS-eredményekben a Voxtral Small minden kiértékelt feladatban veri a Whispert. Az alacsonyabb WER a jobb:

A Voxtral WER-benchmark-összehasonlítása az összes modellel

A FLEURS WER a Mistral bevezető benchmarkjaiból, a becsült API-ár függvényében ábrázolva; a benchmark-eredmények és az árak egyaránt változhatnak

A FLEURS csak egy szelete az átírási minőségnek. Ezek a gyártó által közölt eredmények, ezért modellválasztás előtt nézze meg a közzétett benchmark-definíciókat, és tesztelje a saját nyelveit, mikrofonjait és felvételi körülményeit.

Voxtral vagy Whisper: melyiket érdemes választania?

A benchmarkok csak a történet egy részét mesélik el. Így viszonyul egymáshoz a két modellcsalád azokban a szempontokban, amelyek akkor számítanak, ha valóban saját maga szeretné futtatni valamelyiket:

Voxtral Small Voxtral Mini Whisper Large v3 Whisper Large-v3 Turbo
Nyelvek 8 elsődleges nyelv 8 elsődleges nyelv 100+ 100+
Nyílt forráskód Igen Igen Igen Igen
Modellméret 24B paraméter; ~55 GB GPU-memória bf16/fp16 módban 3B paraméter; ~9,5 GB GPU-memória bf16/fp16 módban 1,55B paraméter 809M paraméter (~1,6 GB)
Praktikus egy átlagos Macen Teljes pontossággal tipikus hardveren nem Kompatibilis futtatókörnyezettel lehetséges; nehezebb, mint a Turbo Igen Igen

A lényeg: a Voxtral Small erős WER-eredményekről számol be, és olyan hangértelmezéssel egészíti ki, amellyel a Whisper meg sem próbálkozik. A Voxtral Mini az a checkpoint, amelyet a Mistral helyi és edge-telepítésre szán, hivatalos modellkártyája azonban így is körülbelül 9,5 GB GPU-memóriát ír bf16/fp16 módban. Egy fogyasztói átíróalkalmazás számára a Whisper Large-v3 Turbo továbbra is könnyebben szállítható, és jóval több nyelvet fed le. Ezért kombinálja a Whisper Notes jelenleg a Whisper Turbót a Parakeet V3-mal és a SenseVoice-szal a Voxtral helyett.

API-ár és a saját üzemeltetés költsége

A 2026. július 10-i ellenőrzés szerint a Mistral modellkártyája a Voxtral Small hangbemenetét audiopercenként 0,004 dollárért listázza. A hangértelmezési kéréseknél a szövegbemenetet és a generált szöveget külön számlázzák. Ha az Apache 2.0 súlyokat saját maga üzemelteti, nincs Mistral API-díj, a hardvert és az üzemeltetést azonban Ön fizeti.

Mistral API

$0.004
audiopercenként a Voxtral Small esetében

Saját üzemeltetésű súlyok

Apache 2.0
nincs API-díj; a számítási kapacitás az Ön felelőssége

Hogyan működik

A hivatalos modellkártya a Voxtralt nyelvi modellre épülő gerincként írja le, hangkódolóval és dedikált átírási móddal. A termék szempontjából fontos korlátok konkrétak:

1. Multimodális architektúra

A Voxtral ugyanabban a beszélgetésben fogad hangot és szöveget, ahelyett hogy csak beszéd-szöveg dekóderként működne:

  • Dedikált mód a közvetlen átíráshoz
  • Hangalapú kérdés-válasz és strukturált összefoglalás
  • Több hangbemenet és többkörös hangalapú beszélgetések

Hosszú felvételek korlátja

A 32k kontextusablak átíráshoz legfeljebb 30 perc, szélesebb körű hangértelmezéshez legfeljebb 40 perc hanganyagot támogat.

2. Nyelvek és kiértékelés

A Mistral nyolc elsődleges nyelvet sorol fel automatikus felismeréssel:

  • Angol, spanyol, francia, portugál, hindi, német, holland és olasz
  • A benchmarkok között szerepel a FLEURS, a Mozilla Common Voice és a Multilingual LibriSpeech
  • A kiadás az angol rövid és hosszú formátumú hanganyagokat külön is kiértékeli

3. Telepítési követelmények

A nyílt súlyok nem jelentik azt, hogy minden checkpoint elég kicsi minden eszközhöz:

  • A Voxtral Small a modellkártyája szerint körülbelül 55 GB GPU-memóriát igényel bf16/fp16 módban
  • A Voxtral Mini a helyi és edge-telepítésre szánt 3B checkpoint
  • A Mistral a vLLM-et ajánlja a kiadott checkpointok kiszolgálásához

4. Fő funkciók

Kontextuális megértés

Közvetlenül a hanganyagból tud kérdésekre válaszolni és összefoglalókat készíteni, a 32k kontextuskorláton belül.

Többnyelvűség

Automatikusan felismeri és átírja a nyolc elsődleges nyelvet: angol, spanyol, francia, portugál, hindi, német, holland és olasz.

Zajkezelés

A hivatalos kiértékelés változatos beszédadathalmazokat tartalmaz, de a Mistral nem ad általános garanciát minden zajos felvételre.

Edge-telepítés

A Voxtral Mini a helyi és edge-megoldás. Hivatalos modellkártyája körülbelül 9,5 GB GPU-memóriát ír bf16/fp16 módban.

5. Architektúra

Három fő komponens:

  1. 1. Hangkódoló: A hullámformát tanult hangreprezentációkká alakítja
  2. 2. Projektor: A hangreprezentációkat a nyelvi modell rejtett terébe képezi le
  3. 3. Nyelvi modell gerinc: Átiratokat, válaszokat, összefoglalókat vagy eszközhívásokat generál

Ez a felépítés magyarázza, miért tud a Voxtral többet a puszta átírásnál, ugyanakkor jóval nagyobb nyelvimodell-súlyokat is cipel, mint egy kizárólag átírásra készült modell, például a Whisper Turbo.

Miért marad jó választás a Whisper Notes

A Voxtral és a Whisper Notes más-más problémát old meg. A Voxtral az átírást hangértelmezéssel kombinálja; a Whisper Notes a privát átírásra összpontosít, amely könnyen futtatható fogyasztói Apple-hardveren.

Amit a Whisper Notes kínál

Adatvédelem

Teljesítmény

  • Whisper-technológia, bizonyított pontosság
  • Apple Silicon chipekre optimalizálva
  • Megbízható eredmények

Költségek

  • Egyszeri vásárlás; az App Store az iPhone-, iPad- és Mac App Store-verziót is tartalmazza, a próbát kínáló DMG külön kapható
  • Nincs percalapú díj
  • Korlátlan átírás

Felhasználói élmény

  • Egyszerű kezelőfelület
  • Rendszeres frissítések
  • Folyamatos fejlesztések

Tárhelyigény

A Voxtral Small teljes pontossággal szerverosztályú modell: hivatalos kártyája körülbelül 55 GB GPU-memóriát ír. A Voxtral Mini kifejezetten helyi és edge-használatra készült, kártyája azonban így is körülbelül 9,5 GB GPU-memóriát jelez bf16/fp16 módban. A Whisper Turbo alkalmazáson belüli letöltése nagyjából 1,6 GB, ami jobban illik a jelenlegi Whisper Notes termékhez.

A Whisper Notes a Whisper Large-v3 Turbót használja – ez a modell a mindennapi használathoz egyensúlyoz a teljesítmény, a sebesség és a VRAM-igény között. Amint jobb modellek válnak elérhetővé észszerű erőforrásigénnyel, frissítünk rájuk.

A Voxtral akkor vonzó, ha a hangalapú kérdés-válasz, az összefoglalás vagy a saját szerveren futó telepítés a fontos. A Whisper Notes azoknak az egyéni felhasználóknak szól, akik privát átírást szeretnének, ismétlődő előfizetés nélkül.

Mit jelent mindez

A Voxtral fontos nyílt súlyú lépés a puszta beszédfelismerésen túl, mert a hanganyagot nemcsak átírni tudja, hanem következtetni is képes belőle.

A privát, offline átíráshoz Macen és iPhone-on a kisebb, specializált motorok továbbra is könnyebben csomagolhatók és futtathatók megbízhatóan.

Az összes helyi lehetőséget összehasonlítaná? Minden eszközön futó beszéd-szöveg modell — a Whisper-változatok, a Parakeet V3, a SenseVoice és a Voxtral — egymás mellett szerepel a Whisper-modellek összehasonlító oldalán.

Gyakran ismételt kérdések

Mi az a Mistral Voxtral?

A Voxtral a Mistral nyílt súlyú modellcsaládja beszédátíráshoz és hangértelmezéshez. A 2025. júliusi kiadás a szerverosztályú munkaterhelésekre szánt Voxtral Small 24B-t és a helyi, illetve edge-telepítésre szánt Voxtral Mini 3B-t tartalmazza. Mindkét checkpoint Apache 2.0 licencet használ.

Futtatható a Voxtral helyben egy Macen?

A letölthető súlyok saját üzemeltetésben futtathatók, de a két méret követelményei eltérnek. A Voxtral Smallnak körülbelül 55 GB GPU-memóriára van szüksége bf16/fp16 módban, tehát szerverosztályú választás. A Voxtral Mini a helyi és edge checkpoint; modellkártyája körülbelül 9,5 GB-ot ír bf16/fp16 módban, a tényleges sebesség és memóriahasználat Macen pedig a futtatókörnyezettől és a kvantálástól függ.

Használja a Whisper Notes a Voxtralt?

Nem. A Whisper Notes a Parakeet V3-at (a Mac alapértelmezett modelljét), a Whisper Large-v3 Turbót és a SenseVoice-ot futtatja — ezeket a modelleket azért választottuk, mert a mindennapi Apple Silicon használathoz jól egyensúlyoznak a teljesítmény, a sebesség és a VRAM-igény között. Amint jobb modellek válnak praktikusan futtathatóvá fogyasztói hardveren, átvesszük őket.

Hány nyelvet támogat a Voxtral?

A hivatalos modellkártyák nyolc elsődleges nyelvet sorolnak fel automatikus felismeréssel: angol, spanyol, francia, portugál, hindi, német, holland és olasz. A Mistral a FLEURS-ben az arabot is kiértékeli, de az nem szerepel a modellkártya elsődleges nyelveinek listáján.

Mikor jelent meg a Mistral Voxtral?

A Mistral 2025. július 15-én adta ki a Voxtralt. Az első Apache 2.0 checkpointok a Voxtral Small 24B és a Voxtral Mini 3B voltak.