Whisper Large V3 Turbo vs V3: 5× Brži na Macu (Benchmark)

6. studenoga 2024.
·
6 min read
·Whisper Notes Team

OpenAI-jev Whisper Large-v3 Turbo smanjuje dekoder s 32 sloja na 4, čime broj parametara pada s 1,55 milijardi na 809 milijuna. U našim testovima na Apple Siliconu isti je zvuk transkribirao oko 5× brže uz gotovo identičnu točnost. Whisper Notes isporučuje ga na Macu i iPhoneu.

Usporedba arhitekture Whisper Large V3 Turbo i V3

V3 Turbo vs V3: što se promijenilo

Turbo nije nova arhitektura. To je potpuno isti model Whisper Large-v3 s dekoderom skraćenim s 32 sloja na 4, a zatim fino podešenim kako bi povratio točnost. Enkoder je netaknut.

Large-v3 Turbo Large-v3
Parametri 809M 1.550M
Slojevi dekodera 4 32
Jezici 100+ 100+
Zadatak prijevoda Nije podržan Podržan
Licenca MIT Apache 2.0

Metoda: ista audiodatoteka od 10 minuta transkribirana je u istoj verziji aplikacije Whisper Notes na svakom navedenom uređaju. Vremena su stvarne sekunde od pokretanja transkripcije do konačnog teksta; između V3 i Turba mijenjao se samo model.

Zadatak prijevoda izričito je isključen iz Turbovih podataka za treniranje. Puni model Large-v3 podržava ga, ali Whisper Notes isporučuje samo Turbo — prijevod se obavlja zasebno putem Apple Intelligencea.

Osnovni model: što je Whisper Large-v3?

Whisper Large-v3 vodeći je OpenAI-jev open-source model za prepoznavanje govora, objavljen u studenom 2023. Ima 1,55 milijardi parametara, koristi ulazni spektrogram sa 128 mel-binova, treniran je na 5 milijuna sati zvuka (1 milijun slabo označenih + 4 milijuna pseudooznačenih) i podržava više od 100 jezika, uključujući kantonski. Na Hugging Faceovoj ljestvici Open ASR Leaderboard bilježi prosječnu stopu pogreške po riječi od oko 7,4% — gornju granicu točnosti s kojom se Turbo uspoređuje kroz cijeli ovaj članak. Kako Large-v3 stoji u odnosu na sve ostale on-device modele, pogledajte u našoj usporedbi Whisper modela.

Benchmark brzine: Whisper Notes na Apple Siliconu

U aplikaciji Whisper Notes za Mac Turbo radi putem CoreML-a na Neural Engineu. Obrada 10 minuta zvuka:

Uređaj Whisper V3 V3 Turbo Ubrzanje
iPhone 15 Pro 425 s 82 s 5.2×
iPad Pro M2 380 s 71 s 5.4×
MacBook Pro M2 316 s 63 s 5.0×

Ubrzanje od 5× specifično je za Whisper Notes na Apple Siliconu, gdje manji dekoder profitira od optimizacije za Neural Engine. Na GPU-u s okvirima poput faster-whispera razlika se smanjuje na ~2,7× (pogledajte benchmarkove zajednice u nastavku).

Točnost: usporedba WER-a

Hugging Faceova ljestvica Open ASR Leaderboard testira oba modela na istim engleskim skupovima podataka. Turbova stopa pogreške po riječi unutar je pola postotnog boda od V3 na svakom benchmarku:

Skup podataka V3 Turbo WER V3 WER
LibriSpeech Clean 2.10% 2.01%
LibriSpeech Other 4.24% 3.91%
GigaSpeech 10.14% 10.02%
Earnings22 11.63% 11.29%
AMI 16.13% 15.95%
Prosječni WER 7.83% 7.44%

V3 je neznatno točniji na svakom skupu podataka, ali razlika je mala — u prosjeku 0,39 postotnih bodova. U većini stvarnih transkripcija razliku nećete ni čuti.

Na evaluaciji dugih snimaka YouTube-commons (jednom od najvećih open-source ASR benchmarkova) Turbo postiže 13,40% WER naspram 13,20% kod V3 — a pritom radi s faktorom stvarnog vremena od 129,5× naspram 55,3×. To je 2,3× brže uz gotovo identičnu točnost na stvarnom zvuku.

Koliko je Turbo točan na korejskom, ruskom i drugim jezicima?

Gornji se benchmarkovi odnose na engleski. Prema OpenAI-jevoj kartici modela, Turbov skraćeni dekoder od 4 sloja košta nešto više točnosti u jezicima koji nisu engleski nego u engleskom, s najvećim padom kod jezika s malo resursa. Za ruski i većinu europskih jezika Turbo ostaje blizu punog Large-v3 — a ako koristite Whisper Notes, Parakeet V3 pokriva ruski i još 24 europska jezika uz 10× veću brzinu od Whispera.

Za korejski, japanski, kineski i kantonski namjenski je model istodobno brži i bolji u interpunkciji: SenseVoice transkribira CJK jezike brzinom 52× stvarnog vremena. Whisper Notes isporučuje SenseVoice uz Turbo i na Macu i na iOS-u, pa za svaki jezik možete odabrati pravi model umjesto da sve provlačite kroz jedan.

Benchmarkovi zajednice: GPU i CPU

Neovisni benchmarkovi iz zajednica faster-whispera i whisper.cpp-a pokazuju dosljedne rezultate na različitom hardveru. Transkripcija 13 minuta zvuka s faster-whisperom na GPU-u:

Model Preciznost Vrijeme GPU memorija WER
Large-v3 Turbo fp16 19.2 s 2.537 MB 1.92%
Large-v3 fp16 52.0 s 4.521 MB 2.88%
Large-v3 Turbo int8 19.6 s 1.545 MB 1.92%
Distil-Large-v3 fp16 26.1 s 2.409 MB 2.39%

Izvor: benchmark faster-whispera na NVIDIA GPU-u, LibriSpeech clean validacijski split. Turbo int8 koristi samo 1,5 GB VRAM-a — stane na GPU od 2 GB.

Skupna (batch) inferencija na RTX 3060 Laptopu (6 GB VRAM-a, int8 preciznost) dodatno povećava prednost:

Model Sekvencijalno Skupno (10) Skupni WER
Large-v3 Turbo 46.1 s 18.7 s 7.7%
Large-v3 230.8 s 43.0 s 7.9%
Large-v2 178.3 s 43.2 s 8.8%
Medium 113.3 s 26.3 s 8.9%

Izvor: benchmark NilaierMusic, Intel i7-12650H + RTX 3060 Laptop 6 GB, zvuk na francuskom, int8 preciznost.

Uz skupnu obradu Turbo postiže najbolji WER od svih testiranih modela (7,7%), a pritom je i najbrži. To je jasna optimalna točka za produkcijsku upotrebu.

Turbo vs Medium vs sve veličine Whisper modela

Prije Turba, Medium je bio uobičajeni kompromis: prihvatljiva točnost uz podnošljivu brzinu. Turbo taj kompromis čini zastarjelim — s 809 milijuna parametara jedva je veći od Mediuma (769M), a isporučuje točnost klase large uz višestruko veću brzinu. Evo cijele obitelji modela jedan uz drugi:

Model Parametri Veličina na disku Relativna brzina Razina točnosti
tiny 39M ~75 MB ~10× Najniža
base 74M ~142 MB ~7× Niska
small 244M ~466 MB ~4× Umjerena
medium 769M ~1,5 GB ~2× Visoka
large-v3 1.550M ~2,9 GB 1× (osnovica) Najviša
large-v3-turbo 809M ~1,6 GB ~5× na Apple Siliconu Gotovo najviša

Objavljen 30. rujna 2024., Turbo ima 809 milijuna parametara. Ako ste Medium birali radi uštede prostora na disku ili brzine, Turbo ga sada nadmašuje i po točnosti i po brzini uz otprilike jednak otisak.

Poznata ograničenja (i kako ih Whisper Notes rješava)

Bez ugrađenog prijevoda

Turbo je treniran bez podataka za prijevod. Transkribira samo na izvornom jeziku — za razliku od Large-v3, koji podržava prijevod zvuka na engleski.

Whisper Notes — Apple Intelligence automatski prevodi transkripte na jezik koji odaberete, pa dobivate dvojezični izlaz bez obzira na to koji model koristite.

Više halucinacija na bučnom zvuku

Izvještaji zajednice pokazuju da Turbo više halucinira na vrlo kratkim isječcima ili bučnim snimkama nego V3. Očekivano s obzirom na smanjeni dekoder (4 sloja naspram 32).

Whisper Notes — prije transkripcije pokreće Pyannote VAD, koji otkriva govorne segmente i uklanja tišinu i buku, pa model obrađuje samo stvarni glas.

Koji biste model trebali koristiti?

Engleski / europski jezici Parakeet V3 — 10× brži od Whispera, bolja točnost
Kineski / japanski / korejski SenseVoice — namjenski izrađen za CJK, brzina 52×
Ostali jezici Whisper Large V3 Turbo — više od 100 jezika, visoka točnost, sporiji

Česta pitanja o Whisper Large-v3 Turbu

Koja je razlika između Whisper Large-v3 i Large-v3 Turba?

Large-v3 Turbo zadržava enkoder Large-v3, ali smanjuje dekoder s 32 sloja na 4. Zato je znatno brži, a u transkripciji ostaje blizu točnosti Large-v3. Kompromis je taj što Turbo ne podržava Whisperov ugrađeni zadatak prijevoda.

Podržava li faster-whisper Large-v3 Turbo?

Da. faster-whisper podržava Large-v3 Turbo putem CTranslate2 konverzija, a benchmarkovi zajednice pokazuju da je Turbo odličan izbor kad je VRAM ograničen. U gornjem benchmarku Turbo int8 koristio je oko 1,5 GB VRAM-a.

Podržava li whisper.cpp Large-v3 Turbo?

Da. whisper.cpp može pokretati konvertirane GGML/GGUF verzije modela Whisper Large-v3 Turbo. Ako gradite vlastiti lokalni sustav za transkripciju, Turbo je često lakše smjestiti na potrošački hardver nego puni Large-v3.

Gdje mogu preuzeti openai/whisper-large-v3-turbo?

Službene težine modela OpenAI objavljuje na Hugging Faceu. Korisnici Whisper Notesa ne moraju ih preuzimati ručno: Mac aplikacija postavljanje lokalnog modela obavlja izravno kroz sučelje aplikacije.

Uspoređujete sve lokalne opcije? Svaki on-device model za pretvorbu govora u tekst — Whisper varijante, Parakeet V3, SenseVoice i Voxtral — uspoređen je jedan uz drugi na našoj stranici za usporedbu Whisper modela. Whisper vam je nov? Krenite od vodiča za transkripciju Whisperom — što je model, svi načini na koje ga možete pokrenuti i koliko to košta.