Whisper Large V3 Turbo vs V3: 5× Schneller auf Mac (Benchmark)

6. November 2024
·
6 min read
·Whisper Notes Team

OpenAIs Whisper Large-v3 Turbo reduziert den Decoder von 32 auf 4 Schichten und senkt die Parameterzahl von 1,55 Milliarden auf 809 Millionen. Bei unseren Tests auf Apple Silicon transkribierte es dieselbe Aufnahme rund fünfmal schneller und blieb bei der Genauigkeit nahe am vollständigen Modell. Whisper Notes bietet Turbo auf Mac und iPhone.

Whisper Large V3 Turbo vs V3 Architekturvergleich

V3 Turbo vs V3: Was sich geaendert hat

Turbo ist keine neue Architektur, sondern exakt dasselbe Whisper Large-v3 Modell, bei dem der Decoder von 32 auf 4 Schichten beschnitten und anschliessend feingetunt wurde, um die Genauigkeit wiederherzustellen. Der Encoder ist unveraendert.

Large-v3 Turbo Large-v3
Parameter 809M 1,550M
Decoder-Schichten 4 32
Sprachen 100+ 100+
Uebersetzungsaufgabe Nicht unterstuetzt Unterstuetzt
Lizenz MIT Apache 2.0

Methode: Auf jedem genannten Gerät wurde dieselbe zehnminütige Audiodatei mit demselben Whisper-Notes-Build transkribiert. Gemessen wurde die Zeit vom Start bis zum fertigen Text; zwischen V3 und Turbo änderte sich nur das Modell.

Die Uebersetzungsaufgabe wurde explizit aus Turbos Trainingsdaten ausgeschlossen. Das vollstaendige Large-v3 Modell unterstuetzt sie, aber Whisper Notes liefert nur Turbo -- die Uebersetzung wird separat ueber Apple Intelligence abgewickelt.

Das Basismodell: Was ist Whisper Large-v3?

Whisper Large-v3 ist OpenAIs größtes offenes Spracherkennungsmodell und erschien im November 2023. Es besitzt 1,55 Milliarden Parameter, verarbeitet Spektrogramme mit 128 Mel-Bins und wurde mit fünf Millionen Stunden Audio trainiert, davon eine Million Stunden mit schwachen Labels und vier Millionen Stunden mit Pseudo-Labels. Das Modell unterstützt 100+ Sprachen einschließlich Kantonesisch. Im Hugging Face Open ASR Leaderboard liegt die durchschnittliche Wortfehlerrate bei etwa 7,4 %; an diesem Genauigkeitsniveau wird Turbo im restlichen Artikel gemessen. Einen Vergleich mit weiteren lokalen Modellen bietet unsere Übersicht der Whisper-Modelle.

Geschwindigkeits-Benchmark: Whisper Notes auf Apple Silicon

In Whisper Notes fuer Mac laeuft Turbo ueber CoreML auf der Neural Engine. Verarbeitung von 10 Minuten Audio:

Geraet Whisper V3 V3 Turbo Beschleunigung
iPhone 15 Pro 425 s 82 s 5.2×
iPad Pro M2 380 s 71 s 5.4×
MacBook Pro M2 316 s 63 s 5.0×

Die 5-fache Beschleunigung gilt speziell fuer Whisper Notes auf Apple Silicon, wo der kleinere Decoder von der Neural Engine-Optimierung profitiert. Auf GPU mit Frameworks wie faster-whisper verringert sich der Abstand auf ca. 2,7× (siehe Community-Benchmarks unten).

Genauigkeit: WER-Vergleich

Das Hugging Face Open ASR Leaderboard testet beide Modelle auf denselben englischen Datensaetzen. Turbos Wortfehlerrate liegt bei jedem Benchmark innerhalb eines halben Prozentpunkts von V3:

Datensatz V3 Turbo WER V3 WER
LibriSpeech Clean 2.10% 2.01%
LibriSpeech Other 4.24% 3.91%
GigaSpeech 10.14% 10.02%
Earnings22 11.63% 11.29%
AMI 16.13% 15.95%
Durchschnittliche WER 7.83% 7.44%

V3 ist bei jedem Datensatz etwas genauer, aber der Unterschied ist gering -- durchschnittlich 0,39 Prozentpunkte. Bei den meisten realen Transkriptionen ist der Unterschied nicht spuerbar.

Bei der YouTube-commons Langform-Evaluation (einem der groessten Open-Source-ASR-Benchmarks) erreicht Turbo 13,40% WER gegenueber 13,20% bei V3 -- bei einem Echtzeit-Faktor von 129,5× gegenueber 55,3×. Das ist 2,3× schneller bei nahezu identischer Genauigkeit auf realen Audiodaten.

Wie genau ist Turbo auf Koreanisch, Russisch und anderen Sprachen?

Die bisherigen Tabellen messen Englisch. Laut OpenAI-Modellkarte kostet der verkürzte Decoder bei nicht englischen und besonders bei ressourcenärmeren Sprachen etwas mehr Genauigkeit. Bei Russisch und den meisten europäischen Sprachen bleibt Turbo nahe an Large-v3; in Whisper Notes deckt Parakeet V3 Russisch und 24 weitere europäische Sprachen mit deutlich höherer Geschwindigkeit ab.

Für Koreanisch, Japanisch, Chinesisch und Kantonesisch ist ein spezialisiertes Modell schneller und besser auf die Zeichensetzung dieser Sprachen abgestimmt. SenseVoice transkribiert diese Sprachen mit bis zu 52-facher Echtzeit. Whisper Notes bietet SenseVoice neben Turbo auf Mac und iPhone, sodass du das Modell nach Sprache wählen kannst.

Community-Benchmarks: GPU & CPU

Unabhaengige Benchmarks aus den faster-whisper und whisper.cpp Communities zeigen konsistente Ergebnisse ueber verschiedene Hardware. Transkription von 13 Minuten Audio mit faster-whisper auf GPU:

Modell Praezision Zeit GPU-Speicher WER
Large-v3 Turbo fp16 19.2 s 2,537 MB 1.92%
Large-v3 fp16 52.0 s 4,521 MB 2.88%
Large-v3 Turbo int8 19.6 s 1,545 MB 1.92%
Distil-Large-v3 fp16 26.1 s 2,409 MB 2.39%

Quelle: faster-whisper Benchmark auf NVIDIA GPU, LibriSpeech clean Validierungssplit. Turbo int8 benoetigt nur 1,5 GB VRAM -- laeuft auch auf einer 2-GB-GPU.

Batch-Inferenz auf einem RTX 3060 Laptop (6 GB VRAM, int8 Praezision) verstaerkt den Vorteil weiter:

Modell Sequentiell Batch (10) Batch-WER
Large-v3 Turbo 46.1 s 18.7 s 7.7%
Large-v3 230.8 s 43.0 s 7.9%
Large-v2 178.3 s 43.2 s 8.8%
Medium 113.3 s 26.3 s 8.9%

Quelle: NilaierMusic Benchmark, Intel i7-12650H + RTX 3060 Laptop 6 GB, franzoesisches Audio, int8 Praezision.

Mit Batch-Verarbeitung erzielt Turbo die beste WER aller getesteten Modelle (7,7%) und ist gleichzeitig das schnellste. Der klare Sweet Spot fuer den Produktionseinsatz.

Turbo, Medium und alle Whisper-Modellgrößen

Vor Turbo war Medium der übliche Kompromiss aus brauchbarer Genauigkeit und vertretbarer Geschwindigkeit. Turbo verändert diese Abwägung: Mit 809 Millionen Parametern ist es nur wenig größer als Medium mit 769 Millionen, erreicht aber nahezu die Genauigkeit der Large-Klasse und läuft deutlich schneller.

Modell Parameter Größe auf dem Datenträger Relative Geschwindigkeit Genauigkeitsklasse
tiny 39M ca. 75 MB ca. 10× Niedrigste
base 74M ca. 142 MB ca. 7× Niedrig
small 244M ca. 466 MB ca. 4× Mittel
medium 769M ca. 1,5 GB ca. 2× Hoch
large-v3 1.550M ca. 2,9 GB 1× (Referenz) Höchste
large-v3-turbo 809M ca. 1,6 GB ca. 5× auf Apple Silicon Nahe an der höchsten

Turbo wurde am 30. September 2024 veröffentlicht und besitzt 809 Millionen Parameter. Wer Medium bisher wegen Speicherbedarf oder Geschwindigkeit gewählt hat, erhält mit Turbo bei ähnlicher Größe sowohl höhere Genauigkeit als auch mehr Tempo.

Bekannte Einschraenkungen (und wie Whisper Notes damit umgeht)

Keine integrierte Uebersetzung

Turbo wurde ohne Uebersetzungsdaten trainiert. Es transkribiert nur in der Ausgangssprache -- im Gegensatz zu Large-v3, das Audio-zu-Englisch-Uebersetzung unterstuetzt.

Whisper Notes -- Apple Intelligence uebersetzt Transkripte automatisch in Ihre gewaehlte Sprache und liefert zweisprachige Ausgabe, unabhaengig vom verwendeten Modell.

Mehr Halluzinationen bei verrauschtem Audio

Community-Berichte zeigen, dass Turbo bei sehr kurzen Clips oder verrauschten Aufnahmen mehr halluziniert als V3. Angesichts des reduzierten Decoders (4 Schichten vs 32) zu erwarten.

Whisper Notes -- fuehrt vor der Transkription Pyannote VAD aus, erkennt Sprachsegmente und entfernt Stille/Rauschen, damit das Modell nur echte Stimme verarbeitet.

Welches Modell sollten Sie verwenden?

Englisch / Europaeisch Parakeet V3 -- 10× schneller als Whisper, bessere Genauigkeit
Chinesisch / Japanisch / Koreanisch SenseVoice -- speziell fuer CJK entwickelt, 52-fache Geschwindigkeit
Andere Sprachen Whisper Large V3 Turbo -- 100+ Sprachen, hohe Genauigkeit, langsamer

Whisper Large-v3 Turbo: Häufig gestellte Fragen

Was ist der Unterschied zwischen Whisper Large-v3 und Large-v3 Turbo?

Large-v3 Turbo behält den Encoder von Large-v3, reduziert den Decoder aber von 32 auf 4 Schichten. Dadurch läuft es deutlich schneller und bleibt bei Transkriptionen nahe an der Genauigkeit von Large-v3. Der Kompromiss: Turbo unterstützt Whispers eingebaute Übersetzungsaufgabe nicht.

Unterstützt faster-whisper Large-v3 Turbo?

Ja. faster-whisper unterstützt Large-v3 Turbo über CTranslate2-Konvertierungen. Community-Benchmarks zeigen, dass Turbo auch bei knappem Grafikspeicher gut passt; im oben genannten Test benötigte Turbo mit int8 etwa 1,5 GB VRAM.

Unterstützt whisper.cpp Large-v3 Turbo?

Ja. whisper.cpp kann konvertierte GGML- oder GGUF-Versionen von Whisper Large-v3 Turbo ausführen. Für eine selbst gebaute lokale Transkriptions-Pipeline passt Turbo meist leichter auf Consumer-Hardware als das vollständige Large-v3.

Wo kann ich openai/whisper-large-v3-turbo herunterladen?

Die offiziellen Modellgewichte stellt OpenAI auf Hugging Face bereit. Nutzer von Whisper Notes müssen sie nicht manuell laden; die App richtet das lokale Modell über ihre Oberfläche ein.

Einen direkten Vergleich aller lokalen Optionen finden Sie auf unserer Vergleichsseite für Whisper-Modelle: Whisper-Varianten, Parakeet V3, SenseVoice und Voxtral stehen dort nebeneinander. Wenn Sie Whisper selbst erst kennenlernen, beginnen Sie mit dem Leitfaden zur Whisper-Transkription, der Modellfamilie, Ausführungswege und Kosten erklärt.