A Mistral kiadta a Voxtralt, első nyílt súlyú modellcsaládját átiratkészítéshez és hangértelmezéshez. A hivatalos benchmarkok erős többnyelvű beszédfelismerést és hangalapú kérdés-válasz képességeket mutatnak, a két modellméret hardverigénye azonban nagyon eltérő. Íme, mit tud valójában a kiadás, és miért használ a Whisper Notes továbbra is kisebb, átírásra szakosodott modelleket fogyasztói Apple-hardveren.
Két modell
A Mistral 2025 júliusában két Apache 2.0 licencű checkpointot adott ki:
Voxtral Small 24B
- •24 milliárd paraméter
- •Átírás, fordítás, hangalapú kérdés-válasz és összefoglalás
- •32k tokenes kontextusablak
- •Körülbelül 55 GB GPU-memória bf16/fp16 módban
Voxtral Mini 3B
- •3 milliárd paraméter
- •Ugyanaz a hang- és szövegfeladat-család egy kisebb checkpointban
- •Hivatalosan helyi és edge-telepítésre pozicionálva
- •Körülbelül 9,5 GB GPU-memória bf16/fp16 módban
Nyílt súlyok és licenc
Mindkét 2025-ös checkpoint nyílt súlyú, Apache 2.0 licenc alatt. A modelleket letöltheti és saját maga futtathatja:
- ✓ A teljes modellsúlyok elérhetők
- ✓ Saját üzemeltetés és testreszabás az Apache 2.0 licenc keretein belül
- ✓ Saját üzemeltetés esetén nincs Mistral API-díj; a saját számítási kapacitásért továbbra is fizetnie kell
- ✓ A hanganyagot a saját szerverein dolgozhatja fel
Források: a Mistral Voxtral-bejelentése, a hivatalos Voxtral Small modellkártya és a hivatalos Voxtral Mini modellkártya.
Benchmarkok
A Mistral kiadási anyaga a makroátlagolt szóhibaarányt (WER) hasonlítja össze angol rövid és hosszú formátumú tesztkészleteken, valamint a Mozilla Common Voice, a FLEURS és a Multilingual LibriSpeech adathalmazokon. A Mistral által közölt FLEURS-eredményekben a Voxtral Small minden kiértékelt feladatban veri a Whispert. Az alacsonyabb WER a jobb:
A FLEURS WER a Mistral bevezető benchmarkjaiból, a becsült API-ár függvényében ábrázolva; a benchmark-eredmények és az árak egyaránt változhatnak
A FLEURS csak egy szelete az átírási minőségnek. Ezek a gyártó által közölt eredmények, ezért modellválasztás előtt nézze meg a közzétett benchmark-definíciókat, és tesztelje a saját nyelveit, mikrofonjait és felvételi körülményeit.
Voxtral vagy Whisper: melyiket érdemes választania?
A benchmarkok csak a történet egy részét mesélik el. Így viszonyul egymáshoz a két modellcsalád azokban a szempontokban, amelyek akkor számítanak, ha valóban saját maga szeretné futtatni valamelyiket:
| Voxtral Small | Voxtral Mini | Whisper Large v3 | Whisper Large-v3 Turbo | |
|---|---|---|---|---|
| Nyelvek | 8 elsődleges nyelv | 8 elsődleges nyelv | 100+ | 100+ |
| Nyílt forráskód | Igen | Igen | Igen | Igen |
| Modellméret | 24B paraméter; ~55 GB GPU-memória bf16/fp16 módban | 3B paraméter; ~9,5 GB GPU-memória bf16/fp16 módban | 1,55B paraméter | 809M paraméter (~1,6 GB) |
| Praktikus egy átlagos Macen | Teljes pontossággal tipikus hardveren nem | Kompatibilis futtatókörnyezettel lehetséges; nehezebb, mint a Turbo | Igen | Igen |
A lényeg: a Voxtral Small erős WER-eredményekről számol be, és olyan hangértelmezéssel egészíti ki, amellyel a Whisper meg sem próbálkozik. A Voxtral Mini az a checkpoint, amelyet a Mistral helyi és edge-telepítésre szán, hivatalos modellkártyája azonban így is körülbelül 9,5 GB GPU-memóriát ír bf16/fp16 módban. Egy fogyasztói átíróalkalmazás számára a Whisper Large-v3 Turbo továbbra is könnyebben szállítható, és jóval több nyelvet fed le. Ezért kombinálja a Whisper Notes jelenleg a Whisper Turbót a Parakeet V3-mal és a SenseVoice-szal a Voxtral helyett.
API-ár és a saját üzemeltetés költsége
A 2026. július 10-i ellenőrzés szerint a Mistral modellkártyája a Voxtral Small hangbemenetét audiopercenként 0,004 dollárért listázza. A hangértelmezési kéréseknél a szövegbemenetet és a generált szöveget külön számlázzák. Ha az Apache 2.0 súlyokat saját maga üzemelteti, nincs Mistral API-díj, a hardvert és az üzemeltetést azonban Ön fizeti.
Mistral API
Saját üzemeltetésű súlyok
Hogyan működik
A hivatalos modellkártya a Voxtralt nyelvi modellre épülő gerincként írja le, hangkódolóval és dedikált átírási móddal. A termék szempontjából fontos korlátok konkrétak:
1. Multimodális architektúra
A Voxtral ugyanabban a beszélgetésben fogad hangot és szöveget, ahelyett hogy csak beszéd-szöveg dekóderként működne:
- •Dedikált mód a közvetlen átíráshoz
- •Hangalapú kérdés-válasz és strukturált összefoglalás
- •Több hangbemenet és többkörös hangalapú beszélgetések
Hosszú felvételek korlátja
A 32k kontextusablak átíráshoz legfeljebb 30 perc, szélesebb körű hangértelmezéshez legfeljebb 40 perc hanganyagot támogat.
2. Nyelvek és kiértékelés
A Mistral nyolc elsődleges nyelvet sorol fel automatikus felismeréssel:
- •Angol, spanyol, francia, portugál, hindi, német, holland és olasz
- •A benchmarkok között szerepel a FLEURS, a Mozilla Common Voice és a Multilingual LibriSpeech
- •A kiadás az angol rövid és hosszú formátumú hanganyagokat külön is kiértékeli
3. Telepítési követelmények
A nyílt súlyok nem jelentik azt, hogy minden checkpoint elég kicsi minden eszközhöz:
- •A Voxtral Small a modellkártyája szerint körülbelül 55 GB GPU-memóriát igényel bf16/fp16 módban
- •A Voxtral Mini a helyi és edge-telepítésre szánt 3B checkpoint
- •A Mistral a vLLM-et ajánlja a kiadott checkpointok kiszolgálásához
4. Fő funkciók
Kontextuális megértés
Közvetlenül a hanganyagból tud kérdésekre válaszolni és összefoglalókat készíteni, a 32k kontextuskorláton belül.
Többnyelvűség
Automatikusan felismeri és átírja a nyolc elsődleges nyelvet: angol, spanyol, francia, portugál, hindi, német, holland és olasz.
Zajkezelés
A hivatalos kiértékelés változatos beszédadathalmazokat tartalmaz, de a Mistral nem ad általános garanciát minden zajos felvételre.
Edge-telepítés
A Voxtral Mini a helyi és edge-megoldás. Hivatalos modellkártyája körülbelül 9,5 GB GPU-memóriát ír bf16/fp16 módban.
5. Architektúra
Három fő komponens:
- 1. Hangkódoló: A hullámformát tanult hangreprezentációkká alakítja
- 2. Projektor: A hangreprezentációkat a nyelvi modell rejtett terébe képezi le
- 3. Nyelvi modell gerinc: Átiratokat, válaszokat, összefoglalókat vagy eszközhívásokat generál
Ez a felépítés magyarázza, miért tud a Voxtral többet a puszta átírásnál, ugyanakkor jóval nagyobb nyelvimodell-súlyokat is cipel, mint egy kizárólag átírásra készült modell, például a Whisper Turbo.
Miért marad jó választás a Whisper Notes
A Voxtral és a Whisper Notes más-más problémát old meg. A Voxtral az átírást hangértelmezéssel kombinálja; a Whisper Notes a privát átírásra összpontosít, amely könnyen futtatható fogyasztói Apple-hardveren.
Amit a Whisper Notes kínál
Adatvédelem
- •100%-ban offline feldolgozás
- •Nincs adattovábbítás
- •Nincs felhőfüggőség
Teljesítmény
- •Whisper-technológia, bizonyított pontosság
- •Apple Silicon chipekre optimalizálva
- •Megbízható eredmények
Költségek
- •Egyszeri vásárlás; az App Store az iPhone-, iPad- és Mac App Store-verziót is tartalmazza, a próbát kínáló DMG külön kapható
- •Nincs percalapú díj
- •Korlátlan átírás
Felhasználói élmény
- •Egyszerű kezelőfelület
- •Rendszeres frissítések
- •Folyamatos fejlesztések
Tárhelyigény
A Voxtral Small teljes pontossággal szerverosztályú modell: hivatalos kártyája körülbelül 55 GB GPU-memóriát ír. A Voxtral Mini kifejezetten helyi és edge-használatra készült, kártyája azonban így is körülbelül 9,5 GB GPU-memóriát jelez bf16/fp16 módban. A Whisper Turbo alkalmazáson belüli letöltése nagyjából 1,6 GB, ami jobban illik a jelenlegi Whisper Notes termékhez.
A Whisper Notes a Whisper Large-v3 Turbót használja – ez a modell a mindennapi használathoz egyensúlyoz a teljesítmény, a sebesség és a VRAM-igény között. Amint jobb modellek válnak elérhetővé észszerű erőforrásigénnyel, frissítünk rájuk.
A Voxtral akkor vonzó, ha a hangalapú kérdés-válasz, az összefoglalás vagy a saját szerveren futó telepítés a fontos. A Whisper Notes azoknak az egyéni felhasználóknak szól, akik privát átírást szeretnének, ismétlődő előfizetés nélkül.
Mit jelent mindez
A Voxtral fontos nyílt súlyú lépés a puszta beszédfelismerésen túl, mert a hanganyagot nemcsak átírni tudja, hanem következtetni is képes belőle.
A privát, offline átíráshoz Macen és iPhone-on a kisebb, specializált motorok továbbra is könnyebben csomagolhatók és futtathatók megbízhatóan.
Az összes helyi lehetőséget összehasonlítaná? Minden eszközön futó beszéd-szöveg modell — a Whisper-változatok, a Parakeet V3, a SenseVoice és a Voxtral — egymás mellett szerepel a Whisper-modellek összehasonlító oldalán.
Gyakran ismételt kérdések
Mi az a Mistral Voxtral?
A Voxtral a Mistral nyílt súlyú modellcsaládja beszédátíráshoz és hangértelmezéshez. A 2025. júliusi kiadás a szerverosztályú munkaterhelésekre szánt Voxtral Small 24B-t és a helyi, illetve edge-telepítésre szánt Voxtral Mini 3B-t tartalmazza. Mindkét checkpoint Apache 2.0 licencet használ.
Futtatható a Voxtral helyben egy Macen?
A letölthető súlyok saját üzemeltetésben futtathatók, de a két méret követelményei eltérnek. A Voxtral Smallnak körülbelül 55 GB GPU-memóriára van szüksége bf16/fp16 módban, tehát szerverosztályú választás. A Voxtral Mini a helyi és edge checkpoint; modellkártyája körülbelül 9,5 GB-ot ír bf16/fp16 módban, a tényleges sebesség és memóriahasználat Macen pedig a futtatókörnyezettől és a kvantálástól függ.
Használja a Whisper Notes a Voxtralt?
Nem. A Whisper Notes a Parakeet V3-at (a Mac alapértelmezett modelljét), a Whisper Large-v3 Turbót és a SenseVoice-ot futtatja — ezeket a modelleket azért választottuk, mert a mindennapi Apple Silicon használathoz jól egyensúlyoznak a teljesítmény, a sebesség és a VRAM-igény között. Amint jobb modellek válnak praktikusan futtathatóvá fogyasztói hardveren, átvesszük őket.
Hány nyelvet támogat a Voxtral?
A hivatalos modellkártyák nyolc elsődleges nyelvet sorolnak fel automatikus felismeréssel: angol, spanyol, francia, portugál, hindi, német, holland és olasz. A Mistral a FLEURS-ben az arabot is kiértékeli, de az nem szerepel a modellkártya elsődleges nyelveinek listáján.
Mikor jelent meg a Mistral Voxtral?
A Mistral 2025. július 15-én adta ki a Voxtralt. Az első Apache 2.0 checkpointok a Voxtral Small 24B és a Voxtral Mini 3B voltak.