Whisper Large-v3 Turbo od OpenAI ořezává dekodér z 32 vrstev na 4 a snižuje počet parametrů z 1,55 miliardy na 809 milionů. V našich testech na Apple Siliconu přepsal stejný zvuk přibližně 5× rychleji s téměř totožnou přesností. Whisper Notes ho dodává na Macu i iPhonu.
V3 Turbo vs V3: Co se změnilo
Turbo není nová architektura. Jde o přesně stejný model Whisper Large-v3, jen s dekodérem ořezaným z 32 vrstev na 4 a následně doladěným, aby se obnovila přesnost. Enkodér zůstal nedotčený.
| Large-v3 Turbo | Large-v3 | |
|---|---|---|
| Parametry | 809M | 1 550M |
| Vrstvy dekodéru | 4 | 32 |
| Jazyky | 100+ | 100+ |
| Úloha překladu | Nepodporováno | Podporováno |
| Licence | MIT | Apache 2.0 |
Metodika: stejný desetiminutový zvukový soubor byl přepsán ve stejném sestavení Whisper Notes na každém z uvedených zařízení. Časy jsou reálné sekundy od spuštění přepisu po finální text; mezi V3 a Turbem se měnil pouze model.
Úloha překladu byla z trénovacích dat Turba výslovně vyloučena. Plný model Large-v3 ji podporuje, Whisper Notes ale dodává pouze Turbo — překlad se řeší samostatně přes Apple Intelligence.
Základní model: Co je Whisper Large-v3?
Whisper Large-v3 je vlajkový open-source model OpenAI pro rozpoznávání řeči, vydaný v listopadu 2023. Má 1,55 miliardy parametrů, na vstupu používá spektrogram se 128 mel pásmy, byl natrénován na 5 milionech hodin zvuku (1 milion slabě anotovaných + 4 miliony pseudoanotovaných) a podporuje 100+ jazyků včetně kantonštiny. Na žebříčku Hugging Face Open ASR Leaderboard dosahuje průměrné chybovosti slov ~7,4 % — to je strop přesnosti, se kterým se Turbo v celém tomto článku poměřuje. Jak si Large-v3 stojí proti všem ostatním on-device modelům, najdete v našem srovnání modelů Whisper.
Benchmark rychlosti: Whisper Notes na Apple Siliconu
Ve Whisper Notes pro Mac běží Turbo přes CoreML na Neural Enginu. Zpracování 10 minut zvuku:
| Zařízení | Whisper V3 | V3 Turbo | Zrychlení |
|---|---|---|---|
| iPhone 15 Pro | 425 s | 82 s | 5,2× |
| iPad Pro M2 | 380 s | 71 s | 5,4× |
| MacBook Pro M2 | 316 s | 63 s | 5,0× |
Pětinásobné zrychlení je specifické pro Whisper Notes na Apple Siliconu, kde menší dekodér těží z optimalizace pro Neural Engine. Na GPU s frameworky jako faster-whisper se rozdíl zmenšuje na ~2,7× (viz komunitní benchmarky níže).
Přesnost: Srovnání WER
Hugging Face Open ASR Leaderboard testuje oba modely na stejných anglických datasetech. Chybovost slov (WER) Turba je ve všech benchmarcích do půl procentního bodu od V3:
| Dataset | V3 Turbo WER | V3 WER |
|---|---|---|
| LibriSpeech Clean | 2.10% | 2.01% |
| LibriSpeech Other | 4.24% | 3.91% |
| GigaSpeech | 10.14% | 10.02% |
| Earnings22 | 11.63% | 11.29% |
| AMI | 16.13% | 15.95% |
| Průměrný WER | 7.83% | 7.44% |
V3 je na každém datasetu o něco přesnější, rozdíl je ale malý — v průměru 0,39 procentního bodu. U většiny reálných přepisů rozdíl nepoznáte.
Na evaluaci dlouhých nahrávek YouTube-commons (jeden z největších open-source ASR benchmarků) dosahuje Turbo 13,40 % WER oproti 13,20 % u V3 — a běží s real-time faktorem 129,5× oproti 55,3×. To je 2,3× vyšší rychlost s téměř totožnou přesností na reálném zvuku.
Jak přesné je Turbo v korejštině, ruštině a dalších jazycích?
Výše uvedené benchmarky jsou anglické. Podle model card od OpenAI stojí ořezaný čtyřvrstvý dekodér Turba o něco více přesnosti v neanglických jazycích než v angličtině, přičemž největší propad se týká jazyků s menším množstvím dat. V ruštině a většině evropských jazyků se Turbo drží blízko plného Large-v3 — a pokud používáte Whisper Notes, Parakeet V3 pokrývá ruštinu a 24 dalších evropských jazyků při desetinásobku rychlosti Whisperu.
Pro korejštinu, japonštinu, čínštinu a kantonštinu je specializovaný model rychlejší a lépe si poradí i s interpunkcí: SenseVoice přepisuje CJK jazyky rychlostí 52× reálného času. Whisper Notes dodává SenseVoice vedle Turba na Macu i iOS, takže si pro každý jazyk vyberete ten správný model, místo abyste všechno hnali přes jediný.
Komunitní benchmarky: GPU a CPU
Nezávislé benchmarky z komunit faster-whisper a whisper.cpp ukazují konzistentní výsledky napříč hardwarem. Přepis 13 minut zvuku pomocí faster-whisper na GPU:
| Model | Přesnost | Čas | Paměť GPU | WER |
|---|---|---|---|---|
| Large-v3 Turbo | fp16 | 19.2 s | 2 537 MB | 1.92% |
| Large-v3 | fp16 | 52.0 s | 4 521 MB | 2.88% |
| Large-v3 Turbo | int8 | 19.6 s | 1 545 MB | 1.92% |
| Distil-Large-v3 | fp16 | 26.1 s | 2 409 MB | 2.39% |
Zdroj: benchmark faster-whisper na GPU NVIDIA, validační sada LibriSpeech clean. Turbo v int8 využívá jen 1,5 GB VRAM — vejde se i na GPU s 2 GB paměti.
Dávková inference na RTX 3060 Laptop (6 GB VRAM, přesnost int8) posouvá náskok ještě dál:
| Model | Sekvenčně | Dávkově (10) | Dávkový WER |
|---|---|---|---|
| Large-v3 Turbo | 46.1 s | 18.7 s | 7.7% |
| Large-v3 | 230.8 s | 43.0 s | 7.9% |
| Large-v2 | 178.3 s | 43.2 s | 8.8% |
| Medium | 113.3 s | 26.3 s | 8.9% |
Zdroj: benchmark NilaierMusic, Intel i7-12650H + RTX 3060 Laptop 6 GB, francouzský zvuk, přesnost int8.
Při dávkovém zpracování dosahuje Turbo nejlepšího WER ze všech testovaných modelů (7,7 %) a zároveň je nejrychlejší. Pro produkční nasazení je to jednoznačný sweet spot.
Turbo vs Medium vs všechny velikosti modelů Whisper
Před příchodem Turba býval obvyklým kompromisem Medium: přijatelná přesnost při snesitelné rychlosti. Turbo tento kompromis odsunulo do minulosti — s 809 miliony parametrů je jen o málo větší než Medium (769M), a přitom nabízí přesnost třídy large při několikanásobné rychlosti. Tady je celá rodina modelů vedle sebe:
| Model | Parametry | Velikost na disku | Relativní rychlost | Třída přesnosti |
|---|---|---|---|---|
| tiny | 39M | ~75 MB | ~10× | Nejnižší |
| base | 74M | ~142 MB | ~7× | Nízká |
| small | 244M | ~466 MB | ~4× | Střední |
| medium | 769M | ~1,5 GB | ~2× | Vysoká |
| large-v3 | 1 550M | ~2,9 GB | 1× (základ) | Nejvyšší |
| large-v3-turbo | 809M | ~1,6 GB | ~5× na Apple Siliconu | Téměř nejvyšší |
Turbo vyšlo 30. září 2024 a má 809 milionů parametrů. Pokud jste dosud volili Medium kvůli místu na disku nebo rychlosti, Turbo ho teď poráží v přesnosti i rychlosti při zhruba stejné velikosti.
Známá omezení (a jak je Whisper Notes řeší)
Bez vestavěného překladu
Turbo bylo trénováno bez překladových dat. Přepisuje pouze ve zdrojovém jazyce — na rozdíl od Large-v3, který podporuje překlad zvuku do angličtiny.
Whisper Notes — Apple Intelligence automaticky překládá přepisy do zvoleného jazyka, takže dvojjazyčný výstup získáte bez ohledu na použitý model.
Více halucinací na hlučném zvuku
Podle hlášení z komunity Turbo halucinuje více na velmi krátkých klipech a hlučných nahrávkách než V3. Vzhledem ke zmenšenému dekodéru (4 vrstvy oproti 32) se to dá čekat.
Whisper Notes — před přepisem spouští Pyannote VAD, který rozpozná řečové segmenty a odstraní ticho i šum, takže model zpracovává jen skutečný hlas.
Který model byste měli použít?
| Angličtina / evropské jazyky | Parakeet V3 — 10× rychlejší než Whisper, lepší přesnost |
| Čínština / japonština / korejština | SenseVoice — stavěný přímo pro CJK, rychlost 52× |
| Ostatní jazyky | Whisper Large V3 Turbo — 100+ jazyků, vysoká přesnost, pomalejší |
Whisper Large-v3 Turbo: Časté dotazy
Jaký je rozdíl mezi Whisper Large-v3 a Large-v3 Turbo?
Large-v3 Turbo si ponechává enkodér z Large-v3, ale zmenšuje dekodér z 32 vrstev na 4. Proto je výrazně rychlejší a při přepisu se přesností drží blízko Large-v3. Daní je, že Turbo nepodporuje vestavěnou úlohu překladu Whisperu.
Podporuje faster-whisper model Large-v3 Turbo?
Ano. faster-whisper podporuje Large-v3 Turbo přes konverze CTranslate2 a komunitní benchmarky ukazují, že Turbo je silná volba při omezené VRAM. V benchmarku výše použilo Turbo v int8 zhruba 1,5 GB VRAM.
Podporuje whisper.cpp model Large-v3 Turbo?
Ano. whisper.cpp umí spouštět konvertované verze Whisper Large-v3 Turbo ve formátech GGML/GGUF. Pokud si stavíte vlastní lokální pipeline pro přepis, Turbo se na běžný hardware vejde snáz než plný Large-v3.
Kde stáhnu openai/whisper-large-v3-turbo?
Oficiální váhy modelu jsou k dispozici od OpenAI na Hugging Face. Uživatelé Whisper Notes je ale nemusí stahovat ručně: aplikace pro Mac vyřídí nastavení lokálního modelu přímo ve svém rozhraní.
Srovnáváte všechny lokální možnosti? Každý on-device model pro převod řeči na text — varianty Whisperu, Parakeet V3, SenseVoice i Voxtral — najdete vedle sebe na naší stránce se srovnáním modelů Whisper. S Whisperem teprve začínáte? Začněte průvodcem přepisem pomocí Whisperu — co je to za model, jaké jsou všechny způsoby, jak ho spustit, a kolik to stojí.