Whisper Large V3 Turbo vs V3: 5× Gyorsabb Mac-en (Benchmark)

2024. november 6.
·
6 min read
·Whisper Notes Team

Az OpenAI Whisper Large-v3 Turbo modellje a dekódert 32 rétegről 4-re csökkenti, így a paraméterszám 1,55 milliárdról 809 millióra esik. Apple Silicon tesztjeinkben ugyanazt a hanganyagot körülbelül 5× gyorsabban írta át, szinte azonos pontossággal. A Whisper Notes Macen és iPhone-on is szállítja.

A Whisper Large V3 Turbo és a V3 architektúrájának összehasonlítása

V3 Turbo vs V3: mi változott

A Turbo nem új architektúra. Pontosan ugyanaz a Whisper Large-v3 modell, amelynek dekóderét 32 rétegről 4-re metszették, majd finomhangolták, hogy visszanyerje a pontosságát. A kódoló érintetlen maradt.

Large-v3 Turbo Large-v3
Paraméterek 809M 1,550M
Dekóder-rétegek 4 32
Nyelvek 100+ 100+
Fordítási feladat Nem támogatott Támogatott
Licenc MIT Apache 2.0

Módszer: minden megnevezett eszközön ugyanazt a 10 perces hangfájlt írtuk át ugyanazzal a Whisper Notes builddel. Az időadatok az átírás indításától a kész szövegig eltelt valós másodpercek; a V3 és a Turbo között csak a modell változott.

A fordítási feladatot kifejezetten kihagyták a Turbo tanítóadataiból. A teljes Large-v3 modell támogatja, de a Whisper Notes csak a Turbót szállítja — a fordítást külön, az Apple Intelligence kezeli.

Az alapmodell: mi az a Whisper Large-v3?

A Whisper Large-v3 az OpenAI zászlóshajó nyílt forráskódú beszédfelismerő modellje, amely 2023 novemberében jelent meg. 1,55 milliárd paraméterrel rendelkezik, 128 mel-sávos spektrogramot kap bemenetként, 5 millió óra hanganyagon tanították (1 millió gyengén címkézett + 4 millió pszeudocímkézett), és több mint 100 nyelvet támogat. A Hugging Face Open ASR Leaderboardon átlagosan ~7,4% a szóhibaaránya — ez az a pontossági plafon, amelyhez a Turbót a cikkben végig mérjük. Arról, hogy a Large-v3 hogyan viszonyul az összes többi, eszközön futó modellhez, lásd a Whisper-modellek összehasonlítását.

Sebesség-benchmark: Whisper Notes Apple Siliconon

A Mac-es Whisper Notes alkalmazásban a Turbo CoreML-en keresztül fut a Neural Engine-en. 10 perc hanganyag feldolgozása:

Eszköz Whisper V3 V3 Turbo Gyorsulás
iPhone 15 Pro 425 s 82 s 5,2×
iPad Pro M2 380 s 71 s 5,4×
MacBook Pro M2 316 s 63 s 5,0×

Az 5×-ös gyorsulás kifejezetten a Whisper Notes Apple Siliconon mért eredménye, ahol a kisebb dekóder profitál a Neural Engine-optimalizációból. GPU-n, olyan keretrendszerekkel, mint a faster-whisper, a különbség ~2,7×-re szűkül (lásd lentebb a közösségi benchmarkokat).

Pontosság: WER-összehasonlítás

A Hugging Face Open ASR Leaderboard mindkét modellt ugyanazokon az angol adathalmazokon teszteli. A Turbo szóhibaaránya minden benchmarkon fél százalékponton belül marad a V3-hoz képest:

Adathalmaz V3 Turbo WER V3 WER
LibriSpeech Clean 2,10% 2,01%
LibriSpeech Other 4,24% 3,91%
GigaSpeech 10,14% 10,02%
Earnings22 11,63% 11,29%
AMI 16,13% 15,95%
Átlagos WER 7,83% 7,44%

A V3 minden adathalmazon valamivel pontosabb, de a különbség csekély — átlagosan 0,39 százalékpont. A legtöbb valós átírásnál nem fogja hallani a különbséget.

A YouTube-commons hosszú formátumú kiértékelésén (az egyik legnagyobb nyílt forráskódú ASR-benchmark) a Turbo 13,40%-os WER-t ér el a V3 13,20%-ával szemben — miközben 129,5×-ös valós idejű faktorral fut az 55,3×-össel szemben. Ez 2,3× gyorsabb, szinte azonos pontossággal, valós hanganyagon.

Mennyire pontos a Turbo koreaiul, oroszul és más nyelveken?

A fenti benchmarkok angol nyelvűek. Az OpenAI modellkártyája szerint a Turbo megnyirbált, 4 rétegű dekódere a nem angol nyelveknél valamivel több pontosságba kerül, mint az angolnál, a legnagyobb visszaesés pedig a kevés erőforrással rendelkező nyelveknél jelentkezik. Az orosz és a legtöbb európai nyelv esetében a Turbo közel marad a teljes Large-v3-hoz — és ha Ön a Whisper Notes-t használja, a Parakeet V3 az oroszt és 24 további európai nyelvet fedi le, a Whisper sebességének 10-szeresével.

Koreai, japán, kínai és kantoni nyelvhez egy célzottan épített modell gyorsabb és jobb központozású is: a SenseVoice 52×-es valós idejű sebességgel írja át a CJK nyelveket. A Whisper Notes a SenseVoice-t a Turbo mellett szállítja Macen és iOS-en is, így nyelvenként a megfelelő modellt választhatja, ahelyett hogy mindent egyetlen modellen erőltetne át.

Közösségi benchmarkok: GPU és CPU

A faster-whisper és a whisper.cpp közösségek független benchmarkjai konzisztens eredményeket mutatnak a különböző hardvereken. 13 perc hanganyag átírása faster-whisperrel GPU-n:

Modell Precizitás Idő GPU-memória WER
Large-v3 Turbo fp16 19,2 s 2537 MB 1,92%
Large-v3 fp16 52,0 s 4521 MB 2,88%
Large-v3 Turbo int8 19,6 s 1545 MB 1,92%
Distil-Large-v3 fp16 26,1 s 2409 MB 2,39%

Forrás: faster-whisper benchmark NVIDIA GPU-n, LibriSpeech clean validációs részhalmaz. A Turbo int8 mindössze 1,5 GB VRAM-ot használ — elfér egy 2 GB-os GPU-n.

A kötegelt következtetés egy RTX 3060 Laptopon (6 GB VRAM, int8 precizitás) tovább növeli az előnyt:

Modell Szekvenciális Kötegelt (10) Kötegelt WER
Large-v3 Turbo 46,1 s 18,7 s 7,7%
Large-v3 230,8 s 43,0 s 7,9%
Large-v2 178,3 s 43,2 s 8,8%
Medium 113,3 s 26,3 s 8,9%

Forrás: NilaierMusic benchmark, Intel i7-12650H + RTX 3060 Laptop 6 GB, francia hanganyag, int8 precizitás.

Kötegelt feldolgozással a Turbo éri el az összes tesztelt modell közül a legjobb WER-t (7,7%), miközben a leggyorsabb is. Éles használatra ez az egyértelmű arany középút.

Turbo vs Medium vs az összes Whisper-modellméret

A Turbo előtt a Medium volt a szokásos kompromisszum: elfogadható pontosság elviselhető sebességgel. A Turbo ezt az átváltást feleslegessé teszi — 809 millió paraméterével alig nagyobb a Mediumnál (769M), mégis large-kategóriás pontosságot nyújt többszörös sebességgel. Íme a teljes modellcsalád egymás mellett:

Modell Paraméterek Lemezméret Relatív sebesség Pontossági szint
tiny 39M ~75 MB ~10× Legalacsonyabb
base 74M ~142 MB ~7× Alacsony
small 244M ~466 MB ~4× Mérsékelt
medium 769M ~1,5 GB ~2× Magas
large-v3 1,550M ~2,9 GB 1× (alapérték) Legmagasabb
large-v3-turbo 809M ~1,6 GB ~5× Apple Siliconon Közel legmagasabb

A 2024. szeptember 30-án megjelent Turbo 809 millió paraméteres. Ha eddig a lemezterület vagy a sebesség miatt választotta a Mediumot, a Turbo mostantól pontosságban és sebességben is veri, nagyjából azonos helyigénnyel.

Ismert korlátok (és hogyan kezeli őket a Whisper Notes)

Nincs beépített fordítás

A Turbót fordítási adatok nélkül tanították. Kizárólag a forrásnyelven ír át — szemben a Large-v3-mal, amely támogatja a hang→angol fordítást.

Whisper Notes — az Apple Intelligence automatikusan lefordítja az átiratokat az Ön által választott nyelvre, így kétnyelvű kimenetet kap, függetlenül attól, melyik modellt használja.

Több hallucináció zajos hanganyagon

A közösségi visszajelzések szerint a Turbo a nagyon rövid klipeken vagy zajos felvételeken többet hallucinál, mint a V3. Ez a lecsökkentett dekóder (4 réteg a 32 helyett) mellett várható is.

Whisper Notes — az átírás előtt Pyannote VAD-ot futtat: felismeri a beszédszakaszokat, és eltávolítja a csendet és a zajt, így a modell csak valódi beszédet dolgoz fel.

Melyik modellt érdemes használnia?

Angol / európai Parakeet V3 — 10× gyorsabb a Whispernél, jobb pontosság
Kínai / japán / koreai SenseVoice — kifejezetten CJK-ra készült, 52× sebesség
Egyéb nyelvek Whisper Large V3 Turbo — 100+ nyelv, magas pontosság, lassabb

Whisper Large-v3 Turbo GYIK

Mi a különbség a Whisper Large-v3 és a Large-v3 Turbo között?

A Large-v3 Turbo megtartja a Large-v3 kódolóját, de a dekódert 32 rétegről 4-re csökkenti. Ezért sokkal gyorsabb, miközben átírásban közel marad a Large-v3 pontosságához. Az ára az, hogy a Turbo nem támogatja a Whisper beépített fordítási feladatát.

Támogatja a faster-whisper a Large-v3 Turbót?

Igen. A faster-whisper CTranslate2-konverziókon keresztül támogatja a Large-v3 Turbót, és a közösségi benchmarkok alapján a Turbo erős választás, ha kevés a VRAM. A fenti benchmarkban a Turbo int8 körülbelül 1,5 GB VRAM-ot használt.

Támogatja a whisper.cpp a Large-v3 Turbót?

Igen. A whisper.cpp képes futtatni a Whisper Large V3 Turbo konvertált GGML/GGUF változatait. Ha saját helyi átírási folyamatot épít, a Turbót gyakran könnyebb elhelyezni fogyasztói hardveren, mint a teljes Large-v3-at.

Honnan tölthető le az openai/whisper-large-v3-turbo?

A hivatalos modellsúlyok az OpenAI-tól érhetők el a Hugging Face-en. A Whisper Notes felhasználóinak nem kell kézzel letölteniük őket: a Mac-alkalmazás az alkalmazás felületén keresztül intézi a helyi modell beállítását.

Az összes helyi lehetőséget hasonlítaná össze? Minden eszközön futó beszédfelismerő modell — a Whisper-változatok, a Parakeet V3, a SenseVoice és a Voxtral — egymás mellett szerepel a Whisper-modellek összehasonlító oldalán. Most ismerkedik a Whisperrel? Kezdje a Whisper átírási útmutatóval — mi maga a modell, milyen módokon futtatható, és mennyibe kerül.