OpenAI's Whisper Large-v3 Turbo verkleint de decoder van 32 lagen naar 4, waardoor de parameters dalen van 1,55B naar 809M. In onze tests op Apple Silicon transcribeerde het dezelfde audio ongeveer 5× sneller met nagenoeg identieke nauwkeurigheid. Whisper Notes levert het op Mac en iPhone.
V3 Turbo vs V3: Wat is er veranderd
Turbo is geen nieuwe architectuur. Het is exact hetzelfde Whisper Large-v3 model met de decoder teruggebracht van 32 naar 4 lagen, daarna gefinetuned om de nauwkeurigheid te herstellen. De encoder is ongewijzigd.
| Large-v3 Turbo | Large-v3 | |
|---|---|---|
| Parameters | 809M | 1,550M |
| Decoderlagen | 4 | 32 |
| Talen | 100+ | 100+ |
| Vertaaltaak | Niet ondersteund | Ondersteund |
| Licentie | MIT | Apache 2.0 |
Methode: hetzelfde audiobestand van 10 minuten is getranscribeerd in dezelfde Whisper Notes-build op elk genoemd apparaat. De tijden zijn kloktijd in seconden van start van de transcriptie tot de definitieve tekst; alleen het model wisselde tussen V3 en Turbo.
De vertaaltaak is expliciet uitgesloten van de trainingsdata van Turbo. Het volledige Large-v3 model ondersteunt dit wel, maar Whisper Notes levert alleen Turbo — vertaling wordt apart afgehandeld via Apple Intelligence.
Het basismodel: wat is Whisper Large-v3?
Whisper Large-v3 is OpenAI's open-source vlaggenschip voor spraakherkenning, uitgebracht in november 2023. Het heeft 1,55B parameters, gebruikt een spectrograminvoer met 128 mel-bins, is getraind op 5 miljoen uur audio (1M zwak gelabeld + 4M pseudo-gelabeld) en ondersteunt 100+ talen. Op het Hugging Face Open ASR Leaderboard scoort het gemiddeld ~7,4% word error rate — het nauwkeurigheidsplafond waaraan Turbo in dit artikel wordt afgemeten. Hoe Large-v3 zich verhoudt tot elk ander on-device model lees je in onze vergelijking van Whisper-modellen.
Snelheidsbenchmark: Whisper Notes op Apple Silicon
In Whisper Notes voor Mac draait Turbo via CoreML op de Neural Engine. Verwerking van 10 minuten audio:
| Apparaat | Whisper V3 | V3 Turbo | Versnelling |
|---|---|---|---|
| iPhone 15 Pro | 425 s | 82 s | 5.2× |
| iPad Pro M2 | 380 s | 71 s | 5.4× |
| MacBook Pro M2 | 316 s | 63 s | 5.0× |
De 5× versnelling is specifiek voor Whisper Notes op Apple Silicon, waar de kleinere decoder profiteert van Neural Engine-optimalisatie. Op GPU met frameworks zoals faster-whisper wordt het verschil kleiner tot ~2,7× (zie communitybenchmarks hieronder).
Nauwkeurigheid: WER-vergelijking
Het Hugging Face Open ASR Leaderboard test beide modellen op dezelfde Engelstalige datasets. De word error rate van Turbo ligt binnen een half punt van V3 op elke benchmark:
| Dataset | V3 Turbo WER | V3 WER |
|---|---|---|
| LibriSpeech Clean | 2.10% | 2.01% |
| LibriSpeech Other | 4.24% | 3.91% |
| GigaSpeech | 10.14% | 10.02% |
| Earnings22 | 11.63% | 11.29% |
| AMI | 16.13% | 15.95% |
| Gemiddelde WER | 7.83% | 7.44% |
V3 is iets nauwkeuriger op elke dataset, maar het verschil is klein — gemiddeld 0,39 procentpunten. Voor de meeste transcripties in de praktijk merk je het verschil niet.
Op de YouTube-commons long-form evaluatie (een van de grootste open-source ASR-benchmarks) scoort Turbo 13.40% WER tegenover 13.20% van V3 — terwijl het draait op 129.5× real-time factor vs 55.3×. Dat is 2,3× sneller met nagenoeg identieke nauwkeurigheid op real-world audio.
Hoe nauwkeurig is Turbo in het Koreaans, Russisch en andere talen?
De benchmarks hierboven zijn Engelstalig. Volgens OpenAI's modelkaart kost de tot 4 lagen gesnoeide decoder van Turbo iets meer nauwkeurigheid in niet-Engelse talen dan in het Engels, met de grootste achteruitgang bij talen met weinig trainingsdata. Voor Russisch en de meeste Europese talen blijft Turbo dicht bij het volledige Large-v3 — en gebruik je Whisper Notes, dan dekt Parakeet V3 Russisch en 24 andere Europese talen op 10× de snelheid van Whisper.
Voor Koreaans, Japans, Chinees en Kantonees is een speciaal daarvoor gebouwd model zowel sneller als beter geïnterpuncteerd: SenseVoice transcribeert CJK op 52× realtime. Whisper Notes levert SenseVoice naast Turbo op zowel Mac als iOS, zodat je per taal het juiste model kiest in plaats van alles door één model te forceren.
Communitybenchmarks: GPU & CPU
Onafhankelijke benchmarks van de faster-whisper en whisper.cpp communities tonen consistente resultaten op diverse hardware. Transcriptie van 13 minuten audio met faster-whisper op GPU:
| Model | Precisie | Tijd | GPU-geheugen | WER |
|---|---|---|---|---|
| Large-v3 Turbo | fp16 | 19.2 s | 2,537 MB | 1.92% |
| Large-v3 | fp16 | 52.0 s | 4,521 MB | 2.88% |
| Large-v3 Turbo | int8 | 19.6 s | 1,545 MB | 1.92% |
| Distil-Large-v3 | fp16 | 26.1 s | 2,409 MB | 2.39% |
Bron: faster-whisper benchmark op NVIDIA GPU, LibriSpeech clean validatiesplit. Turbo int8 gebruikt slechts 1.5 GB VRAM — het past op een 2 GB GPU.
Batch-inferentie op een RTX 3060 Laptop (6 GB VRAM, int8 precisie) vergroot het voordeel verder:
| Model | Sequentieel | Batch (10) | Batch WER |
|---|---|---|---|
| Large-v3 Turbo | 46.1 s | 18.7 s | 7.7% |
| Large-v3 | 230.8 s | 43.0 s | 7.9% |
| Large-v2 | 178.3 s | 43.2 s | 8.8% |
| Medium | 113.3 s | 26.3 s | 8.9% |
Bron: NilaierMusic benchmark, Intel i7-12650H + RTX 3060 Laptop 6 GB, Franse audio, int8 precisie.
Met batchverwerking behaalt Turbo de beste WER van alle geteste modellen (7,7%) en is tegelijkertijd het snelst. Het is duidelijk de sweet spot voor productiegebruik.
Turbo vs Medium vs elke Whisper-modelgrootte
Vóór Turbo was Medium het gebruikelijke compromis: acceptabele nauwkeurigheid bij een draaglijke snelheid. Turbo maakt die afweging overbodig — met 809M parameters is het nauwelijks groter dan Medium (769M), maar het levert nauwkeurigheid van large-klasse op een veelvoud van de snelheid. Hier staat de volledige modelfamilie zij aan zij:
| Model | Parameters | Schijfruimte | Relatieve snelheid | Nauwkeurigheidsklasse |
|---|---|---|---|---|
| tiny | 39M | ~75 MB | ~10× | Laagste |
| base | 74M | ~142 MB | ~7× | Laag |
| small | 244M | ~466 MB | ~4× | Matig |
| medium | 769M | ~1.5 GB | ~2× | Hoog |
| large-v3 | 1,550M | ~2.9 GB | 1× (basislijn) | Hoogste |
| large-v3-turbo | 809M | ~1.6 GB | ~5× op Apple Silicon | Bijna hoogste |
Uitgebracht op 30 september 2024, telt Turbo 809M parameters. Koos je voorheen Medium om schijfruimte of snelheid te sparen, dan verslaat Turbo het nu op zowel nauwkeurigheid als snelheid bij ongeveer dezelfde voetafdruk.
Bekende beperkingen (en hoe Whisper Notes ze aanpakt)
Geen ingebouwde vertaling
Turbo is getraind zonder vertaaldata. Het transcribeert alleen in de brontaal — in tegenstelling tot Large-v3, dat audio-naar-Engels vertaling ondersteunt.
Whisper Notes — Apple Intelligence vertaalt transcripten automatisch naar de taal van je keuze, waardoor je tweetalige uitvoer krijgt ongeacht welk model je gebruikt.
Meer hallucinatie bij ruisvolle audio
Communityrapportages wijzen erop dat Turbo meer hallucineert bij zeer korte clips of opnames met veel ruis in vergelijking met V3. Dit is te verwachten gezien de verkleinde decoder (4 lagen vs 32).
Whisper Notes — draait Pyannote VAD voor de transcriptie, detecteert spraaksegmenten en verwijdert stilte/ruis zodat het model alleen echte spraak verwerkt.
Welk model moet je gebruiken?
| Engels / Europees | Parakeet V3 — 10× sneller dan Whisper, betere nauwkeurigheid |
| Chinees / Japans / Koreaans | SenseVoice — speciaal gebouwd voor CJK, 52× snelheid |
| Andere talen | Whisper Large V3 Turbo — 100+ talen, hoge nauwkeurigheid, langzamer |
Whisper Large-v3 Turbo FAQ
Wat is het verschil tussen Whisper Large-v3 en Large-v3 Turbo?
Large-v3 Turbo behoudt de encoder van Large-v3, maar verkleint de decoder van 32 lagen naar 4. Daarom is het veel sneller terwijl het qua transcriptie dicht bij de nauwkeurigheid van Large-v3 blijft. De afweging is dat Turbo Whispers ingebouwde vertaaltaak niet ondersteunt.
Ondersteunt faster-whisper Large-v3 Turbo?
Ja. faster-whisper ondersteunt Large-v3 Turbo via CTranslate2-conversies, en communitybenchmarks laten zien dat Turbo een sterke keuze is wanneer VRAM beperkt is. In de benchmark hierboven gebruikte Turbo int8 ongeveer 1,5 GB VRAM.
Ondersteunt whisper.cpp Large-v3 Turbo?
Ja. whisper.cpp kan geconverteerde GGML/GGUF-versies van Whisper Large-v3 Turbo draaien. Bouw je je eigen lokale transcriptiepijplijn, dan past Turbo vaak makkelijker op consumentenhardware dan het volledige Large-v3.
Waar kan ik openai/whisper-large-v3-turbo downloaden?
De officiële modelgewichten zijn beschikbaar van OpenAI op Hugging Face. Whisper Notes-gebruikers hoeven ze niet handmatig te downloaden: de Mac-app regelt de lokale modelinstallatie via de app-interface.
Alle lokale opties vergelijken? Elk on-device speech-to-text-model — Whisper-varianten, Parakeet V3, SenseVoice en Voxtral — staat zij aan zij op onze vergelijkingspagina voor Whisper-modellen. Nieuw met Whisper zelf? Begin met de Whisper-transcriptiegids — wat het model is, elke manier om het te draaien en wat het kost.