Az OpenAI Whisper Large-v3 Turbo modellje a dekódert 32 rétegről 4-re csökkenti, így a paraméterszám 1,55 milliárdról 809 millióra esik. Apple Silicon tesztjeinkben ugyanazt a hanganyagot körülbelül 5× gyorsabban írta át, szinte azonos pontossággal. A Whisper Notes Macen és iPhone-on is szállítja.
V3 Turbo vs V3: mi változott
A Turbo nem új architektúra. Pontosan ugyanaz a Whisper Large-v3 modell, amelynek dekóderét 32 rétegről 4-re metszették, majd finomhangolták, hogy visszanyerje a pontosságát. A kódoló érintetlen maradt.
| Large-v3 Turbo | Large-v3 | |
|---|---|---|
| Paraméterek | 809M | 1,550M |
| Dekóder-rétegek | 4 | 32 |
| Nyelvek | 100+ | 100+ |
| Fordítási feladat | Nem támogatott | Támogatott |
| Licenc | MIT | Apache 2.0 |
Módszer: minden megnevezett eszközön ugyanazt a 10 perces hangfájlt írtuk át ugyanazzal a Whisper Notes builddel. Az időadatok az átírás indításától a kész szövegig eltelt valós másodpercek; a V3 és a Turbo között csak a modell változott.
A fordítási feladatot kifejezetten kihagyták a Turbo tanítóadataiból. A teljes Large-v3 modell támogatja, de a Whisper Notes csak a Turbót szállítja — a fordítást külön, az Apple Intelligence kezeli.
Az alapmodell: mi az a Whisper Large-v3?
A Whisper Large-v3 az OpenAI zászlóshajó nyílt forráskódú beszédfelismerő modellje, amely 2023 novemberében jelent meg. 1,55 milliárd paraméterrel rendelkezik, 128 mel-sávos spektrogramot kap bemenetként, 5 millió óra hanganyagon tanították (1 millió gyengén címkézett + 4 millió pszeudocímkézett), és több mint 100 nyelvet támogat. A Hugging Face Open ASR Leaderboardon átlagosan ~7,4% a szóhibaaránya — ez az a pontossági plafon, amelyhez a Turbót a cikkben végig mérjük. Arról, hogy a Large-v3 hogyan viszonyul az összes többi, eszközön futó modellhez, lásd a Whisper-modellek összehasonlítását.
Sebesség-benchmark: Whisper Notes Apple Siliconon
A Mac-es Whisper Notes alkalmazásban a Turbo CoreML-en keresztül fut a Neural Engine-en. 10 perc hanganyag feldolgozása:
| Eszköz | Whisper V3 | V3 Turbo | Gyorsulás |
|---|---|---|---|
| iPhone 15 Pro | 425 s | 82 s | 5,2× |
| iPad Pro M2 | 380 s | 71 s | 5,4× |
| MacBook Pro M2 | 316 s | 63 s | 5,0× |
Az 5×-ös gyorsulás kifejezetten a Whisper Notes Apple Siliconon mért eredménye, ahol a kisebb dekóder profitál a Neural Engine-optimalizációból. GPU-n, olyan keretrendszerekkel, mint a faster-whisper, a különbség ~2,7×-re szűkül (lásd lentebb a közösségi benchmarkokat).
Pontosság: WER-összehasonlítás
A Hugging Face Open ASR Leaderboard mindkét modellt ugyanazokon az angol adathalmazokon teszteli. A Turbo szóhibaaránya minden benchmarkon fél százalékponton belül marad a V3-hoz képest:
| Adathalmaz | V3 Turbo WER | V3 WER |
|---|---|---|
| LibriSpeech Clean | 2,10% | 2,01% |
| LibriSpeech Other | 4,24% | 3,91% |
| GigaSpeech | 10,14% | 10,02% |
| Earnings22 | 11,63% | 11,29% |
| AMI | 16,13% | 15,95% |
| Átlagos WER | 7,83% | 7,44% |
A V3 minden adathalmazon valamivel pontosabb, de a különbség csekély — átlagosan 0,39 százalékpont. A legtöbb valós átírásnál nem fogja hallani a különbséget.
A YouTube-commons hosszú formátumú kiértékelésén (az egyik legnagyobb nyílt forráskódú ASR-benchmark) a Turbo 13,40%-os WER-t ér el a V3 13,20%-ával szemben — miközben 129,5×-ös valós idejű faktorral fut az 55,3×-össel szemben. Ez 2,3× gyorsabb, szinte azonos pontossággal, valós hanganyagon.
Mennyire pontos a Turbo koreaiul, oroszul és más nyelveken?
A fenti benchmarkok angol nyelvűek. Az OpenAI modellkártyája szerint a Turbo megnyirbált, 4 rétegű dekódere a nem angol nyelveknél valamivel több pontosságba kerül, mint az angolnál, a legnagyobb visszaesés pedig a kevés erőforrással rendelkező nyelveknél jelentkezik. Az orosz és a legtöbb európai nyelv esetében a Turbo közel marad a teljes Large-v3-hoz — és ha Ön a Whisper Notes-t használja, a Parakeet V3 az oroszt és 24 további európai nyelvet fedi le, a Whisper sebességének 10-szeresével.
Koreai, japán, kínai és kantoni nyelvhez egy célzottan épített modell gyorsabb és jobb központozású is: a SenseVoice 52×-es valós idejű sebességgel írja át a CJK nyelveket. A Whisper Notes a SenseVoice-t a Turbo mellett szállítja Macen és iOS-en is, így nyelvenként a megfelelő modellt választhatja, ahelyett hogy mindent egyetlen modellen erőltetne át.
Közösségi benchmarkok: GPU és CPU
A faster-whisper és a whisper.cpp közösségek független benchmarkjai konzisztens eredményeket mutatnak a különböző hardvereken. 13 perc hanganyag átírása faster-whisperrel GPU-n:
| Modell | Precizitás | Idő | GPU-memória | WER |
|---|---|---|---|---|
| Large-v3 Turbo | fp16 | 19,2 s | 2537 MB | 1,92% |
| Large-v3 | fp16 | 52,0 s | 4521 MB | 2,88% |
| Large-v3 Turbo | int8 | 19,6 s | 1545 MB | 1,92% |
| Distil-Large-v3 | fp16 | 26,1 s | 2409 MB | 2,39% |
Forrás: faster-whisper benchmark NVIDIA GPU-n, LibriSpeech clean validációs részhalmaz. A Turbo int8 mindössze 1,5 GB VRAM-ot használ — elfér egy 2 GB-os GPU-n.
A kötegelt következtetés egy RTX 3060 Laptopon (6 GB VRAM, int8 precizitás) tovább növeli az előnyt:
| Modell | Szekvenciális | Kötegelt (10) | Kötegelt WER |
|---|---|---|---|
| Large-v3 Turbo | 46,1 s | 18,7 s | 7,7% |
| Large-v3 | 230,8 s | 43,0 s | 7,9% |
| Large-v2 | 178,3 s | 43,2 s | 8,8% |
| Medium | 113,3 s | 26,3 s | 8,9% |
Forrás: NilaierMusic benchmark, Intel i7-12650H + RTX 3060 Laptop 6 GB, francia hanganyag, int8 precizitás.
Kötegelt feldolgozással a Turbo éri el az összes tesztelt modell közül a legjobb WER-t (7,7%), miközben a leggyorsabb is. Éles használatra ez az egyértelmű arany középút.
Turbo vs Medium vs az összes Whisper-modellméret
A Turbo előtt a Medium volt a szokásos kompromisszum: elfogadható pontosság elviselhető sebességgel. A Turbo ezt az átváltást feleslegessé teszi — 809 millió paraméterével alig nagyobb a Mediumnál (769M), mégis large-kategóriás pontosságot nyújt többszörös sebességgel. Íme a teljes modellcsalád egymás mellett:
| Modell | Paraméterek | Lemezméret | Relatív sebesség | Pontossági szint |
|---|---|---|---|---|
| tiny | 39M | ~75 MB | ~10× | Legalacsonyabb |
| base | 74M | ~142 MB | ~7× | Alacsony |
| small | 244M | ~466 MB | ~4× | Mérsékelt |
| medium | 769M | ~1,5 GB | ~2× | Magas |
| large-v3 | 1,550M | ~2,9 GB | 1× (alapérték) | Legmagasabb |
| large-v3-turbo | 809M | ~1,6 GB | ~5× Apple Siliconon | Közel legmagasabb |
A 2024. szeptember 30-án megjelent Turbo 809 millió paraméteres. Ha eddig a lemezterület vagy a sebesség miatt választotta a Mediumot, a Turbo mostantól pontosságban és sebességben is veri, nagyjából azonos helyigénnyel.
Ismert korlátok (és hogyan kezeli őket a Whisper Notes)
Nincs beépített fordítás
A Turbót fordítási adatok nélkül tanították. Kizárólag a forrásnyelven ír át — szemben a Large-v3-mal, amely támogatja a hang→angol fordítást.
Whisper Notes — az Apple Intelligence automatikusan lefordítja az átiratokat az Ön által választott nyelvre, így kétnyelvű kimenetet kap, függetlenül attól, melyik modellt használja.
Több hallucináció zajos hanganyagon
A közösségi visszajelzések szerint a Turbo a nagyon rövid klipeken vagy zajos felvételeken többet hallucinál, mint a V3. Ez a lecsökkentett dekóder (4 réteg a 32 helyett) mellett várható is.
Whisper Notes — az átírás előtt Pyannote VAD-ot futtat: felismeri a beszédszakaszokat, és eltávolítja a csendet és a zajt, így a modell csak valódi beszédet dolgoz fel.
Melyik modellt érdemes használnia?
| Angol / európai | Parakeet V3 — 10× gyorsabb a Whispernél, jobb pontosság |
| Kínai / japán / koreai | SenseVoice — kifejezetten CJK-ra készült, 52× sebesség |
| Egyéb nyelvek | Whisper Large V3 Turbo — 100+ nyelv, magas pontosság, lassabb |
Whisper Large-v3 Turbo GYIK
Mi a különbség a Whisper Large-v3 és a Large-v3 Turbo között?
A Large-v3 Turbo megtartja a Large-v3 kódolóját, de a dekódert 32 rétegről 4-re csökkenti. Ezért sokkal gyorsabb, miközben átírásban közel marad a Large-v3 pontosságához. Az ára az, hogy a Turbo nem támogatja a Whisper beépített fordítási feladatát.
Támogatja a faster-whisper a Large-v3 Turbót?
Igen. A faster-whisper CTranslate2-konverziókon keresztül támogatja a Large-v3 Turbót, és a közösségi benchmarkok alapján a Turbo erős választás, ha kevés a VRAM. A fenti benchmarkban a Turbo int8 körülbelül 1,5 GB VRAM-ot használt.
Támogatja a whisper.cpp a Large-v3 Turbót?
Igen. A whisper.cpp képes futtatni a Whisper Large V3 Turbo konvertált GGML/GGUF változatait. Ha saját helyi átírási folyamatot épít, a Turbót gyakran könnyebb elhelyezni fogyasztói hardveren, mint a teljes Large-v3-at.
Honnan tölthető le az openai/whisper-large-v3-turbo?
A hivatalos modellsúlyok az OpenAI-tól érhetők el a Hugging Face-en. A Whisper Notes felhasználóinak nem kell kézzel letölteniük őket: a Mac-alkalmazás az alkalmazás felületén keresztül intézi a helyi modell beállítását.
Az összes helyi lehetőséget hasonlítaná össze? Minden eszközön futó beszédfelismerő modell — a Whisper-változatok, a Parakeet V3, a SenseVoice és a Voxtral — egymás mellett szerepel a Whisper-modellek összehasonlító oldalán. Most ismerkedik a Whisperrel? Kezdje a Whisper átírási útmutatóval — mi maga a modell, milyen módokon futtatható, és mennyibe kerül.