OpenAIs Whisper Large-v3 Turbo reduziert den Decoder von 32 auf 4 Schichten und senkt die Parameterzahl von 1,55 Milliarden auf 809 Millionen. Bei unseren Tests auf Apple Silicon transkribierte es dieselbe Aufnahme rund fünfmal schneller und blieb bei der Genauigkeit nahe am vollständigen Modell. Whisper Notes bietet Turbo auf Mac und iPhone.
V3 Turbo vs V3: Was sich geaendert hat
Turbo ist keine neue Architektur, sondern exakt dasselbe Whisper Large-v3 Modell, bei dem der Decoder von 32 auf 4 Schichten beschnitten und anschliessend feingetunt wurde, um die Genauigkeit wiederherzustellen. Der Encoder ist unveraendert.
| Large-v3 Turbo | Large-v3 | |
|---|---|---|
| Parameter | 809M | 1,550M |
| Decoder-Schichten | 4 | 32 |
| Sprachen | 100+ | 100+ |
| Uebersetzungsaufgabe | Nicht unterstuetzt | Unterstuetzt |
| Lizenz | MIT | Apache 2.0 |
Methode: Auf jedem genannten Gerät wurde dieselbe zehnminütige Audiodatei mit demselben Whisper-Notes-Build transkribiert. Gemessen wurde die Zeit vom Start bis zum fertigen Text; zwischen V3 und Turbo änderte sich nur das Modell.
Die Uebersetzungsaufgabe wurde explizit aus Turbos Trainingsdaten ausgeschlossen. Das vollstaendige Large-v3 Modell unterstuetzt sie, aber Whisper Notes liefert nur Turbo -- die Uebersetzung wird separat ueber Apple Intelligence abgewickelt.
Das Basismodell: Was ist Whisper Large-v3?
Whisper Large-v3 ist OpenAIs größtes offenes Spracherkennungsmodell und erschien im November 2023. Es besitzt 1,55 Milliarden Parameter, verarbeitet Spektrogramme mit 128 Mel-Bins und wurde mit fünf Millionen Stunden Audio trainiert, davon eine Million Stunden mit schwachen Labels und vier Millionen Stunden mit Pseudo-Labels. Das Modell unterstützt 100+ Sprachen einschließlich Kantonesisch. Im Hugging Face Open ASR Leaderboard liegt die durchschnittliche Wortfehlerrate bei etwa 7,4 %; an diesem Genauigkeitsniveau wird Turbo im restlichen Artikel gemessen. Einen Vergleich mit weiteren lokalen Modellen bietet unsere Übersicht der Whisper-Modelle.
Geschwindigkeits-Benchmark: Whisper Notes auf Apple Silicon
In Whisper Notes fuer Mac laeuft Turbo ueber CoreML auf der Neural Engine. Verarbeitung von 10 Minuten Audio:
| Geraet | Whisper V3 | V3 Turbo | Beschleunigung |
|---|---|---|---|
| iPhone 15 Pro | 425 s | 82 s | 5.2× |
| iPad Pro M2 | 380 s | 71 s | 5.4× |
| MacBook Pro M2 | 316 s | 63 s | 5.0× |
Die 5-fache Beschleunigung gilt speziell fuer Whisper Notes auf Apple Silicon, wo der kleinere Decoder von der Neural Engine-Optimierung profitiert. Auf GPU mit Frameworks wie faster-whisper verringert sich der Abstand auf ca. 2,7× (siehe Community-Benchmarks unten).
Genauigkeit: WER-Vergleich
Das Hugging Face Open ASR Leaderboard testet beide Modelle auf denselben englischen Datensaetzen. Turbos Wortfehlerrate liegt bei jedem Benchmark innerhalb eines halben Prozentpunkts von V3:
| Datensatz | V3 Turbo WER | V3 WER |
|---|---|---|
| LibriSpeech Clean | 2.10% | 2.01% |
| LibriSpeech Other | 4.24% | 3.91% |
| GigaSpeech | 10.14% | 10.02% |
| Earnings22 | 11.63% | 11.29% |
| AMI | 16.13% | 15.95% |
| Durchschnittliche WER | 7.83% | 7.44% |
V3 ist bei jedem Datensatz etwas genauer, aber der Unterschied ist gering -- durchschnittlich 0,39 Prozentpunkte. Bei den meisten realen Transkriptionen ist der Unterschied nicht spuerbar.
Bei der YouTube-commons Langform-Evaluation (einem der groessten Open-Source-ASR-Benchmarks) erreicht Turbo 13,40% WER gegenueber 13,20% bei V3 -- bei einem Echtzeit-Faktor von 129,5× gegenueber 55,3×. Das ist 2,3× schneller bei nahezu identischer Genauigkeit auf realen Audiodaten.
Wie genau ist Turbo auf Koreanisch, Russisch und anderen Sprachen?
Die bisherigen Tabellen messen Englisch. Laut OpenAI-Modellkarte kostet der verkürzte Decoder bei nicht englischen und besonders bei ressourcenärmeren Sprachen etwas mehr Genauigkeit. Bei Russisch und den meisten europäischen Sprachen bleibt Turbo nahe an Large-v3; in Whisper Notes deckt Parakeet V3 Russisch und 24 weitere europäische Sprachen mit deutlich höherer Geschwindigkeit ab.
Für Koreanisch, Japanisch, Chinesisch und Kantonesisch ist ein spezialisiertes Modell schneller und besser auf die Zeichensetzung dieser Sprachen abgestimmt. SenseVoice transkribiert diese Sprachen mit bis zu 52-facher Echtzeit. Whisper Notes bietet SenseVoice neben Turbo auf Mac und iPhone, sodass du das Modell nach Sprache wählen kannst.
Community-Benchmarks: GPU & CPU
Unabhaengige Benchmarks aus den faster-whisper und whisper.cpp Communities zeigen konsistente Ergebnisse ueber verschiedene Hardware. Transkription von 13 Minuten Audio mit faster-whisper auf GPU:
| Modell | Praezision | Zeit | GPU-Speicher | WER |
|---|---|---|---|---|
| Large-v3 Turbo | fp16 | 19.2 s | 2,537 MB | 1.92% |
| Large-v3 | fp16 | 52.0 s | 4,521 MB | 2.88% |
| Large-v3 Turbo | int8 | 19.6 s | 1,545 MB | 1.92% |
| Distil-Large-v3 | fp16 | 26.1 s | 2,409 MB | 2.39% |
Quelle: faster-whisper Benchmark auf NVIDIA GPU, LibriSpeech clean Validierungssplit. Turbo int8 benoetigt nur 1,5 GB VRAM -- laeuft auch auf einer 2-GB-GPU.
Batch-Inferenz auf einem RTX 3060 Laptop (6 GB VRAM, int8 Praezision) verstaerkt den Vorteil weiter:
| Modell | Sequentiell | Batch (10) | Batch-WER |
|---|---|---|---|
| Large-v3 Turbo | 46.1 s | 18.7 s | 7.7% |
| Large-v3 | 230.8 s | 43.0 s | 7.9% |
| Large-v2 | 178.3 s | 43.2 s | 8.8% |
| Medium | 113.3 s | 26.3 s | 8.9% |
Quelle: NilaierMusic Benchmark, Intel i7-12650H + RTX 3060 Laptop 6 GB, franzoesisches Audio, int8 Praezision.
Mit Batch-Verarbeitung erzielt Turbo die beste WER aller getesteten Modelle (7,7%) und ist gleichzeitig das schnellste. Der klare Sweet Spot fuer den Produktionseinsatz.
Turbo, Medium und alle Whisper-Modellgrößen
Vor Turbo war Medium der übliche Kompromiss aus brauchbarer Genauigkeit und vertretbarer Geschwindigkeit. Turbo verändert diese Abwägung: Mit 809 Millionen Parametern ist es nur wenig größer als Medium mit 769 Millionen, erreicht aber nahezu die Genauigkeit der Large-Klasse und läuft deutlich schneller.
| Modell | Parameter | Größe auf dem Datenträger | Relative Geschwindigkeit | Genauigkeitsklasse |
|---|---|---|---|---|
| tiny | 39M | ca. 75 MB | ca. 10× | Niedrigste |
| base | 74M | ca. 142 MB | ca. 7× | Niedrig |
| small | 244M | ca. 466 MB | ca. 4× | Mittel |
| medium | 769M | ca. 1,5 GB | ca. 2× | Hoch |
| large-v3 | 1.550M | ca. 2,9 GB | 1× (Referenz) | Höchste |
| large-v3-turbo | 809M | ca. 1,6 GB | ca. 5× auf Apple Silicon | Nahe an der höchsten |
Turbo wurde am 30. September 2024 veröffentlicht und besitzt 809 Millionen Parameter. Wer Medium bisher wegen Speicherbedarf oder Geschwindigkeit gewählt hat, erhält mit Turbo bei ähnlicher Größe sowohl höhere Genauigkeit als auch mehr Tempo.
Bekannte Einschraenkungen (und wie Whisper Notes damit umgeht)
Keine integrierte Uebersetzung
Turbo wurde ohne Uebersetzungsdaten trainiert. Es transkribiert nur in der Ausgangssprache -- im Gegensatz zu Large-v3, das Audio-zu-Englisch-Uebersetzung unterstuetzt.
Whisper Notes -- Apple Intelligence uebersetzt Transkripte automatisch in Ihre gewaehlte Sprache und liefert zweisprachige Ausgabe, unabhaengig vom verwendeten Modell.
Mehr Halluzinationen bei verrauschtem Audio
Community-Berichte zeigen, dass Turbo bei sehr kurzen Clips oder verrauschten Aufnahmen mehr halluziniert als V3. Angesichts des reduzierten Decoders (4 Schichten vs 32) zu erwarten.
Whisper Notes -- fuehrt vor der Transkription Pyannote VAD aus, erkennt Sprachsegmente und entfernt Stille/Rauschen, damit das Modell nur echte Stimme verarbeitet.
Welches Modell sollten Sie verwenden?
| Englisch / Europaeisch | Parakeet V3 -- 10× schneller als Whisper, bessere Genauigkeit |
| Chinesisch / Japanisch / Koreanisch | SenseVoice -- speziell fuer CJK entwickelt, 52-fache Geschwindigkeit |
| Andere Sprachen | Whisper Large V3 Turbo -- 100+ Sprachen, hohe Genauigkeit, langsamer |
Whisper Large-v3 Turbo: Häufig gestellte Fragen
Was ist der Unterschied zwischen Whisper Large-v3 und Large-v3 Turbo?
Large-v3 Turbo behält den Encoder von Large-v3, reduziert den Decoder aber von 32 auf 4 Schichten. Dadurch läuft es deutlich schneller und bleibt bei Transkriptionen nahe an der Genauigkeit von Large-v3. Der Kompromiss: Turbo unterstützt Whispers eingebaute Übersetzungsaufgabe nicht.
Unterstützt faster-whisper Large-v3 Turbo?
Ja. faster-whisper unterstützt Large-v3 Turbo über CTranslate2-Konvertierungen. Community-Benchmarks zeigen, dass Turbo auch bei knappem Grafikspeicher gut passt; im oben genannten Test benötigte Turbo mit int8 etwa 1,5 GB VRAM.
Unterstützt whisper.cpp Large-v3 Turbo?
Ja. whisper.cpp kann konvertierte GGML- oder GGUF-Versionen von Whisper Large-v3 Turbo ausführen. Für eine selbst gebaute lokale Transkriptions-Pipeline passt Turbo meist leichter auf Consumer-Hardware als das vollständige Large-v3.
Wo kann ich openai/whisper-large-v3-turbo herunterladen?
Die offiziellen Modellgewichte stellt OpenAI auf Hugging Face bereit. Nutzer von Whisper Notes müssen sie nicht manuell laden; die App richtet das lokale Modell über ihre Oberfläche ein.
Einen direkten Vergleich aller lokalen Optionen finden Sie auf unserer Vergleichsseite für Whisper-Modelle: Whisper-Varianten, Parakeet V3, SenseVoice und Voxtral stehen dort nebeneinander. Wenn Sie Whisper selbst erst kennenlernen, beginnen Sie mit dem Leitfaden zur Whisper-Transkription, der Modellfamilie, Ausführungswege und Kosten erklärt.