Whisper Large V3 Turbo vs V3: 5× Rychlejší na Mac (Benchmark)

6. listopadu 2024
·
6 min read
·Whisper Notes Team

Whisper Large-v3 Turbo od OpenAI ořezává dekodér z 32 vrstev na 4 a snižuje počet parametrů z 1,55 miliardy na 809 milionů. V našich testech na Apple Siliconu přepsal stejný zvuk přibližně 5× rychleji s téměř totožnou přesností. Whisper Notes ho dodává na Macu i iPhonu.

Porovnání architektury Whisper Large V3 Turbo a V3

V3 Turbo vs V3: Co se změnilo

Turbo není nová architektura. Jde o přesně stejný model Whisper Large-v3, jen s dekodérem ořezaným z 32 vrstev na 4 a následně doladěným, aby se obnovila přesnost. Enkodér zůstal nedotčený.

Large-v3 Turbo Large-v3
Parametry 809M 1 550M
Vrstvy dekodéru 4 32
Jazyky 100+ 100+
Úloha překladu Nepodporováno Podporováno
Licence MIT Apache 2.0

Metodika: stejný desetiminutový zvukový soubor byl přepsán ve stejném sestavení Whisper Notes na každém z uvedených zařízení. Časy jsou reálné sekundy od spuštění přepisu po finální text; mezi V3 a Turbem se měnil pouze model.

Úloha překladu byla z trénovacích dat Turba výslovně vyloučena. Plný model Large-v3 ji podporuje, Whisper Notes ale dodává pouze Turbo — překlad se řeší samostatně přes Apple Intelligence.

Základní model: Co je Whisper Large-v3?

Whisper Large-v3 je vlajkový open-source model OpenAI pro rozpoznávání řeči, vydaný v listopadu 2023. Má 1,55 miliardy parametrů, na vstupu používá spektrogram se 128 mel pásmy, byl natrénován na 5 milionech hodin zvuku (1 milion slabě anotovaných + 4 miliony pseudoanotovaných) a podporuje 100+ jazyků včetně kantonštiny. Na žebříčku Hugging Face Open ASR Leaderboard dosahuje průměrné chybovosti slov ~7,4 % — to je strop přesnosti, se kterým se Turbo v celém tomto článku poměřuje. Jak si Large-v3 stojí proti všem ostatním on-device modelům, najdete v našem srovnání modelů Whisper.

Benchmark rychlosti: Whisper Notes na Apple Siliconu

Ve Whisper Notes pro Mac běží Turbo přes CoreML na Neural Enginu. Zpracování 10 minut zvuku:

Zařízení Whisper V3 V3 Turbo Zrychlení
iPhone 15 Pro 425 s 82 s 5,2×
iPad Pro M2 380 s 71 s 5,4×
MacBook Pro M2 316 s 63 s 5,0×

Pětinásobné zrychlení je specifické pro Whisper Notes na Apple Siliconu, kde menší dekodér těží z optimalizace pro Neural Engine. Na GPU s frameworky jako faster-whisper se rozdíl zmenšuje na ~2,7× (viz komunitní benchmarky níže).

Přesnost: Srovnání WER

Hugging Face Open ASR Leaderboard testuje oba modely na stejných anglických datasetech. Chybovost slov (WER) Turba je ve všech benchmarcích do půl procentního bodu od V3:

Dataset V3 Turbo WER V3 WER
LibriSpeech Clean 2.10% 2.01%
LibriSpeech Other 4.24% 3.91%
GigaSpeech 10.14% 10.02%
Earnings22 11.63% 11.29%
AMI 16.13% 15.95%
Průměrný WER 7.83% 7.44%

V3 je na každém datasetu o něco přesnější, rozdíl je ale malý — v průměru 0,39 procentního bodu. U většiny reálných přepisů rozdíl nepoznáte.

Na evaluaci dlouhých nahrávek YouTube-commons (jeden z největších open-source ASR benchmarků) dosahuje Turbo 13,40 % WER oproti 13,20 % u V3 — a běží s real-time faktorem 129,5× oproti 55,3×. To je 2,3× vyšší rychlost s téměř totožnou přesností na reálném zvuku.

Jak přesné je Turbo v korejštině, ruštině a dalších jazycích?

Výše uvedené benchmarky jsou anglické. Podle model card od OpenAI stojí ořezaný čtyřvrstvý dekodér Turba o něco více přesnosti v neanglických jazycích než v angličtině, přičemž největší propad se týká jazyků s menším množstvím dat. V ruštině a většině evropských jazyků se Turbo drží blízko plného Large-v3 — a pokud používáte Whisper Notes, Parakeet V3 pokrývá ruštinu a 24 dalších evropských jazyků při desetinásobku rychlosti Whisperu.

Pro korejštinu, japonštinu, čínštinu a kantonštinu je specializovaný model rychlejší a lépe si poradí i s interpunkcí: SenseVoice přepisuje CJK jazyky rychlostí 52× reálného času. Whisper Notes dodává SenseVoice vedle Turba na Macu i iOS, takže si pro každý jazyk vyberete ten správný model, místo abyste všechno hnali přes jediný.

Komunitní benchmarky: GPU a CPU

Nezávislé benchmarky z komunit faster-whisper a whisper.cpp ukazují konzistentní výsledky napříč hardwarem. Přepis 13 minut zvuku pomocí faster-whisper na GPU:

Model Přesnost Čas Paměť GPU WER
Large-v3 Turbo fp16 19.2 s 2 537 MB 1.92%
Large-v3 fp16 52.0 s 4 521 MB 2.88%
Large-v3 Turbo int8 19.6 s 1 545 MB 1.92%
Distil-Large-v3 fp16 26.1 s 2 409 MB 2.39%

Zdroj: benchmark faster-whisper na GPU NVIDIA, validační sada LibriSpeech clean. Turbo v int8 využívá jen 1,5 GB VRAM — vejde se i na GPU s 2 GB paměti.

Dávková inference na RTX 3060 Laptop (6 GB VRAM, přesnost int8) posouvá náskok ještě dál:

Model Sekvenčně Dávkově (10) Dávkový WER
Large-v3 Turbo 46.1 s 18.7 s 7.7%
Large-v3 230.8 s 43.0 s 7.9%
Large-v2 178.3 s 43.2 s 8.8%
Medium 113.3 s 26.3 s 8.9%

Zdroj: benchmark NilaierMusic, Intel i7-12650H + RTX 3060 Laptop 6 GB, francouzský zvuk, přesnost int8.

Při dávkovém zpracování dosahuje Turbo nejlepšího WER ze všech testovaných modelů (7,7 %) a zároveň je nejrychlejší. Pro produkční nasazení je to jednoznačný sweet spot.

Turbo vs Medium vs všechny velikosti modelů Whisper

Před příchodem Turba býval obvyklým kompromisem Medium: přijatelná přesnost při snesitelné rychlosti. Turbo tento kompromis odsunulo do minulosti — s 809 miliony parametrů je jen o málo větší než Medium (769M), a přitom nabízí přesnost třídy large při několikanásobné rychlosti. Tady je celá rodina modelů vedle sebe:

Model Parametry Velikost na disku Relativní rychlost Třída přesnosti
tiny 39M ~75 MB ~10× Nejnižší
base 74M ~142 MB ~7× Nízká
small 244M ~466 MB ~4× Střední
medium 769M ~1,5 GB ~2× Vysoká
large-v3 1 550M ~2,9 GB 1× (základ) Nejvyšší
large-v3-turbo 809M ~1,6 GB ~5× na Apple Siliconu Téměř nejvyšší

Turbo vyšlo 30. září 2024 a má 809 milionů parametrů. Pokud jste dosud volili Medium kvůli místu na disku nebo rychlosti, Turbo ho teď poráží v přesnosti i rychlosti při zhruba stejné velikosti.

Známá omezení (a jak je Whisper Notes řeší)

Bez vestavěného překladu

Turbo bylo trénováno bez překladových dat. Přepisuje pouze ve zdrojovém jazyce — na rozdíl od Large-v3, který podporuje překlad zvuku do angličtiny.

Whisper Notes — Apple Intelligence automaticky překládá přepisy do zvoleného jazyka, takže dvojjazyčný výstup získáte bez ohledu na použitý model.

Více halucinací na hlučném zvuku

Podle hlášení z komunity Turbo halucinuje více na velmi krátkých klipech a hlučných nahrávkách než V3. Vzhledem ke zmenšenému dekodéru (4 vrstvy oproti 32) se to dá čekat.

Whisper Notes — před přepisem spouští Pyannote VAD, který rozpozná řečové segmenty a odstraní ticho i šum, takže model zpracovává jen skutečný hlas.

Který model byste měli použít?

Angličtina / evropské jazyky Parakeet V3 — 10× rychlejší než Whisper, lepší přesnost
Čínština / japonština / korejština SenseVoice — stavěný přímo pro CJK, rychlost 52×
Ostatní jazyky Whisper Large V3 Turbo — 100+ jazyků, vysoká přesnost, pomalejší

Whisper Large-v3 Turbo: Časté dotazy

Jaký je rozdíl mezi Whisper Large-v3 a Large-v3 Turbo?

Large-v3 Turbo si ponechává enkodér z Large-v3, ale zmenšuje dekodér z 32 vrstev na 4. Proto je výrazně rychlejší a při přepisu se přesností drží blízko Large-v3. Daní je, že Turbo nepodporuje vestavěnou úlohu překladu Whisperu.

Podporuje faster-whisper model Large-v3 Turbo?

Ano. faster-whisper podporuje Large-v3 Turbo přes konverze CTranslate2 a komunitní benchmarky ukazují, že Turbo je silná volba při omezené VRAM. V benchmarku výše použilo Turbo v int8 zhruba 1,5 GB VRAM.

Podporuje whisper.cpp model Large-v3 Turbo?

Ano. whisper.cpp umí spouštět konvertované verze Whisper Large-v3 Turbo ve formátech GGML/GGUF. Pokud si stavíte vlastní lokální pipeline pro přepis, Turbo se na běžný hardware vejde snáz než plný Large-v3.

Kde stáhnu openai/whisper-large-v3-turbo?

Oficiální váhy modelu jsou k dispozici od OpenAI na Hugging Face. Uživatelé Whisper Notes je ale nemusí stahovat ručně: aplikace pro Mac vyřídí nastavení lokálního modelu přímo ve svém rozhraní.

Srovnáváte všechny lokální možnosti? Každý on-device model pro převod řeči na text — varianty Whisperu, Parakeet V3, SenseVoice i Voxtral — najdete vedle sebe na naší stránce se srovnáním modelů Whisper. S Whisperem teprve začínáte? Začněte průvodcem přepisem pomocí Whisperu — co je to za model, jaké jsou všechny způsoby, jak ho spustit, a kolik to stojí.