Wir wollten eine Frage beantworten: Gibt es ein lokales Modell, das deine Sprache genauer transkribiert als Whisper Large V3? Also haben wir diese Modelle auf dem Datensatz FLEURS getestet.
FLEURS ist ein Google-Datensatz mit vorgelesener Sprache in 102 Sprachen. Wir haben aus jeder Sprache rund 75 Sätze genommen und dieselben Clips in derselben Reihenfolge durch fünf Modelle laufen lassen:
- Parakeet V3
- Whisper Large V3 Turbo
- SenseVoice Small
- Whisper Small
- Qwen3-ASR 1.7B
Das Ergebnis sieht so aus.
Qwen3-ASR 1.7B gegen Whisper Large V3 Turbo — unser eigener FLEURS-Durchlauf, ein M5 MacBook Air, vorgelesene Sprache, kurze Clips.
| Qwen3-ASR 1.7B | Whisper Large V3 Turbo | |
|---|---|---|
| Unterstützte Sprachen | 30 | 101 |
| Klare Vorteile | Kantonesisch, Hindi, Thai, Vietnamesisch, Französisch (5) | Finnisch, Ungarisch, Griechisch und 8 weitere Sprachen (11) |
| Geschwindigkeit | 8,7× Echtzeit | 2,4× Echtzeit |
| Maximaler Speicherbedarf | 2,43 GiB | 1,87 GiB |
| Download | rund 2,5 GB | rund 1,6 GB |
Außerhalb der jeweiligen Stärken der beiden Modelle ist der Unterschied in der Genauigkeit gering.
Whisper Large V3 vs. Qwen3-ASR: der Genauigkeitsvergleich im Detail
Alle 30 Sprachen, sortiert vom größten Vorsprung für Qwen bis zum größten Rückstand. In beiden Spalten gilt: niedriger ist besser.
Unser eigener FLEURS-Durchlauf, ein M5 MacBook Air, vorgelesene Sprache. CER für Chinesisch, Kantonesisch, Japanisch, Koreanisch und Thai, WER für den Rest; grün markiert einen Vorsprung, der größer ist als die gepaarten 95-%-Fehlerbalken.
| Sprache | Qwen3-ASR 1.7B | Whisper Large V3 Turbo |
|---|---|---|
| Kantonesisch | 6,00 | 37,97 |
| Hindi | 13,67 | 30,42 |
| Thai | 5,92 | 12,95 |
| Vietnamesisch | 5,07 | 9,79 |
| Persisch | 26,98 | 30,03 |
| Arabisch | 14,14 | 15,75 |
| Indonesisch | 4,97 | 6,50 |
| Französisch | 3,98 | 5,39 |
| Chinesisch | 5,69 | 6,88 |
| Englisch | 5,07 | 5,92 |
| Deutsch | 3,51 | 4,10 |
| Japanisch | 5,39 | 5,71 |
| Koreanisch | 3,51 | 3,70 |
| Spanisch | 3,60 | 3,76 |
| Italienisch | 2,98 | 3,05 |
| Russisch | 5,98 | 5,51 |
| Portugiesisch | 5,64 | 4,91 |
| Mazedonisch | 17,81 | 16,64 |
| Malaiisch | 11,60 | 10,18 |
| Niederländisch | 7,65 | 5,63 |
| Türkisch | 8,34 | 5,53 |
| Dänisch | 20,12 | 14,92 |
| Polnisch | 12,78 | 5,32 |
| Rumänisch | 18,97 | 8,22 |
| Filipino | 20,44 | 9,37 |
| Schwedisch | 20,04 | 8,72 |
| Tschechisch | 23,92 | 11,15 |
| Griechisch | 30,20 | 12,97 |
| Finnisch | 26,08 | 6,54 |
| Ungarisch | 36,35 | 13,66 |
Unser eigener gepaarter Durchlauf auf dem FLEURS-Testsplit, Revision 70bb2e84, rund 75 Sätze pro Sprache, ein M5 MacBook Air.
Die fünf, die Qwen3-ASR 1.7B klar gewinnt. Fehlerrate in Prozent, Qwen gegen Turbo: Kantonesisch (6,0 gegen 38,0), Hindi (13,7 gegen 30,4), Thai (5,9 gegen 13,0), Vietnamesisch (5,1 gegen 9,8), Französisch (4,0 gegen 5,4). Kantonesisch und Thai werden pro Zeichen gewertet, der Rest pro Wort. Der Vorsprung liegt bei den zeichenweise gewerteten Sprachen: über Chinesisch, Kantonesisch, Japanisch, Koreanisch und Thai kam Qwen auf durchschnittlich 5,3 % gegenüber 13,4 % bei Turbo. Über die anderen fünfundzwanzig, wortweise gewertet, sind es 14,0 % gegenüber 10,2 %.
Die elf, die Whisper Large V3 Turbo klar gewinnt. Fehlerrate in Prozent, Qwen gegen Turbo, alles wortweise gewertet: Ungarisch (36,4 gegen 13,7), Griechisch (30,2 gegen 13,0), Finnisch (26,1 gegen 6,5), Tschechisch (23,9 gegen 11,2), Filipino (20,4 gegen 9,4), Dänisch (20,1 gegen 14,9), Schwedisch (20,0 gegen 8,7), Rumänisch (19,0 gegen 8,2), Polnisch (12,8 gegen 5,3), Türkisch (8,3 gegen 5,5), Niederländisch (7,7 gegen 5,6).
Die vierzehn, die dicht beieinander oder gleichauf liegen. Englisch (5,1 gegen 5,9), Deutsch (3,5 gegen 4,1), Spanisch (3,6 gegen 3,8), Italienisch (3,0 gegen 3,1), Russisch (6,0 gegen 5,5), Portugiesisch (5,6 gegen 4,9); Chinesisch (5,7 gegen 6,9), Japanisch (5,4 gegen 5,7) und Koreanisch (3,5 gegen 3,7) werden pro Zeichen gewertet. Dazu kommen Arabisch, Indonesisch, Persisch, Malaiisch und Mazedonisch. Jeder Abstand hier ist klein und liegt innerhalb des 95-%-Bands. Dieser Durchlauf kann die beiden Modelle also nicht trennen.
Kantonesisch ist die eine Zeile, die eine Entscheidung verändert: 6,00 % gegen 37,97 %. Und SenseVoice Small, das wir bisher als Antwort für Kantonesisch veröffentlicht hatten, kam auf denselben Clips auf 36,71 % CER. Auf diesem Material aus vorgelesener Sprache reicht keiner der beiden Werte aus, deshalb steht die ältere Empfehlung ab jetzt unter diesem Vorbehalt.
Wie schnell ist Qwen3-ASR 1.7B?
Alle fünf Engines, im selben Testaufbau auf einem Rechner gemessen (M5 MacBook Air). Untereinander sind die Zahlen damit zumindest vergleichbar.
Median des Echtzeitfaktors über die Sprachen der jeweiligen Engine, im selben FLEURS-Durchlauf, ein M5 MacBook Air, vorgelesene Sprache.
| Engine | Sprachen | Median-Geschwindigkeit in diesem Durchlauf (kurze Clips) |
|---|---|---|
| SenseVoice Small | 6 Sprachen | 161,0× |
| Parakeet TDT 0.6B v3 | 25 | 82,9× |
| Qwen3-ASR 1.7B | 30 genannte | 8,7× |
| Whisper Small | 101 | 6,4× |
| Whisper Large V3 Turbo | 101 | 2,4× |
Das sind Werte aus einem Testaufbau mit kurzen Clips, und sie liegen niedriger als das, was dieselben Engines auf einer langen Aufnahme schaffen. Diese Spalte taugt dazu, die Engines innerhalb dieses einen Durchlaufs miteinander zu vergleichen — sonst für nichts.
Parakeet V3 und SenseVoice Small sind im selben Testaufbau rund eine Größenordnung schneller als Qwen3-ASR. Auf langen Dateien statt kurzen Clips hat Parakeet 103× Echtzeit auf einem M4 Pro erreicht und SenseVoice 52× oder mehr — eine andere Messung auf anderem Audio, die in dieselbe Richtung zeigt.
Qwen3-ASR liegt dazwischen. In diesem Durchlauf mit kurzen Clips war es nicht die langsamste Engine, das war Whisper Large V3 Turbo. Dafür schwankt es zwischen den Sprachen stärker als die anderen: von 2,7× bei Griechisch bis 12,4× bei Japanisch.
Wie viel Speicher und Festplattenplatz kostet Qwen3-ASR?
Der maximale Speicherbedarf ist der höchste Prozessverbrauch, der im selben FLEURS-Durchlauf über die Einzelmessungen beobachtet wurde, ein M5 MacBook Air, vorgelesene Sprache, kurze Clips.
| Engine | Download | Maximaler Speicherbedarf in diesem Durchlauf |
|---|---|---|
| Parakeet TDT 0.6B v3 | 465 MB | 0,09 GiB |
| Whisper Small | 600 MB | 0,87 GiB |
| SenseVoice Small | 827 MB | 0,95 GiB |
| Whisper Large V3 Turbo | rund 1,6 GB | 1,87 GiB |
| Qwen3-ASR 1.7B | rund 2,5 GB | 2,43 GiB |
Auf beiden Achsen ist Qwen3-ASR das schwerste der fünf: rund 2,5 GB Download und 2,43 GiB Prozessspeicher im Maximum, gegenüber rund 1,6 GB und 1,87 GiB bei Whisper Large V3 Turbo.
Auf einem Rechner mit 8 GB gibt es einen leichteren Weg. Parakeet V3 deckt 25 Sprachen in 465 MB und 0,09 GiB ab, Whisper Small deckt 101 Sprachen in 600 MB und 0,87 GiB ab.
Wie wir gemessen haben: FLEURS, 30 Sprachen, ein Mac
Qwen3-ASR 1.7B lief als MLX-Build mit 8 Bit, Whisper Large V3 Turbo als ggml-Build von whisper.cpp auf Metal. Die Daten sind der Testsplit von Google FLEURS in Revision 70bb2e84 (CC-BY-4.0): 83 seiner 102 Sprachen, jeweils rund 75 Sätze und 15 Minuten, für jedes Modell dieselben Clips in derselben Reihenfolge; der gepaarte Vergleich sind die 30 Sprachen von Qwen. WER für Sprachen, die Wörter durch Leerzeichen trennen, CER für Chinesisch, Kantonesisch, Japanisch, Koreanisch und Thai, niemals zu einer einzigen Zahl zusammengefasst. Die Fehlerbalken stammen aus einem Bootstrap mit 10.000 Ziehungen auf Item-Ebene. Ein M5 MacBook Air, 32 GB, macOS 26.5, bei keinem der beiden Modelle leere Ausgaben oder Fehlschläge.
FLEURS ist vorgelesene Sprache, kein Meeting und kein Diktat. Ranglisten aus vorgelesener Sprache haben echtes Audio in unseren eigenen Tests schon zweimal nicht überstanden, deshalb rechnen wir sie nicht auf lange Aufnahmen hoch: Diese Tabellen sagen, ob ein Modell für deine Sprache plausibel ist, nicht welche Genauigkeit du bekommst. Die Auswertung von Qwen3-ASR 1.7B auf echten Meetings wird ein eigener Beitrag.
Solltest du Qwen3-ASR statt Whisper Large V3 nehmen?
Sprache für Sprache würden wir das in Whisper Notes für Mac so beantworten.
- Wenn du Kantonesisch, Hindi, Thai, Vietnamesisch oder Französisch transkribierst: nimm Qwen3-ASR 1.7B.
- Wenn du Chinesisch, Japanisch, Koreanisch, Englisch, Deutsch, Spanisch oder Italienisch transkribierst: Der Vorsprung ist hauchdünn, und mehr behaupten wir auch nicht. Beide Modelle sind in Ordnung, ebenso für Persisch, Arabisch, Indonesisch, Russisch, Portugiesisch, Mazedonisch und Malaiisch.
- Wenn du Finnisch, Ungarisch, Griechisch, Tschechisch, Schwedisch, Dänisch, Polnisch, Rumänisch, Filipino, Türkisch oder Niederländisch transkribierst: bleib bei Whisper Large V3 Turbo. Alle elf hat es klar gewonnen.
- Wenn es dir auf Geschwindigkeit oder Speicherplatz ankommt: dann nicht diese Engine. Parakeet V3 und SenseVoice Small waren eine Größenordnung schneller, bei einem Bruchteil des Downloads, und Whisper Small deckt 101 Sprachen in 600 MB bei 6,4× ab.
- Wenn du auf dem iPhone oder mit der Version aus dem Mac App Store arbeitest: Dort gibt es die Engine noch nicht. Für Kantonesisch ist SenseVoice auf diesen Kanälen die Wahl.
So bringt Whisper Notes für Mac Alibabas offenes Qwen3-ASR auf das Gerät: die offenen Gewichte, mit 8 Bit nach Apple MLX konvertiert; sie laufen auf der GPU deines eigenen Macs, ohne dass Audio an Alibabas Server geht. Es ist nicht dasselbe Modell wie das 0.6B, das SenseVoice in Version 1.5.0 (Direct Download / DMG) abgelöst hat.
So nutzt du es (Mac-Direktdownload, DMG 1.6.0 und neuer): Einstellungen, dann Transkriptionsmodell, dann Qwen3-ASR 1.7B. Das Modell wird beim ersten Einsatz in der App heruntergeladen und ist rund 2,5 GB groß. Es braucht macOS 15 oder neuer auf Apple Silicon, empfohlen sind 16 GB Arbeitsspeicher; der Rest der App läuft ab macOS 14. Welche Sprache zu welcher Engine gehört, steht auf unserer Seite zur Sprachunterstützung. Das lokale CLI und der MCP-Server akzeptieren „qwen“, „qwen3“ und „qwen3-asr“.
Wenn du lieber nicht wechseln willst, muss sich nichts ändern: Parakeet V3 ist weiterhin der Standard.
Häufig gestellte Fragen
Ist Qwen3-ASR genauer als Whisper Large V3 Turbo?
Das hängt von der Sprache ab, und es steht fast unentschieden. In unserem eigenen FLEURS-Durchlauf in Whisper Notes für Mac lag Qwen3-ASR 1.7B über die 30 Sprachen, die beide Modelle abdecken, in 15 vorn und Whisper Large V3 Turbo in 15. Klar vorn war Qwen bei Kantonesisch (6,00 % gegen 37,97 % CER), Hindi (13,67 % gegen 30,42 % WER), Thai, Vietnamesisch und Französisch. Klar vorn war Turbo bei Finnisch (6,54 % gegen 26,08 % WER), Ungarisch, Griechisch, Tschechisch, Schwedisch, Dänisch, Polnisch, Rumänisch, Filipino, Türkisch und Niederländisch. Vierzehn der dreißig Abstände liegen innerhalb der Fehlerbalken und sind als Gleichstand zu lesen. Nimm Qwen3-ASR, wenn deine Sprache in seiner Gewinnspalte steht und du den Mac-Direktdownload (DMG) von Whisper Notes nutzt; für alles andere und für jede Sprache außerhalb von Qwens 30 nimm Whisper Large V3 Turbo, denn Whisper deckt alle 101 Sprachen ab.
Kann ich Qwen3-ASR auf dem iPhone oder aus dem Mac App Store nutzen?
Heute steckt es im Mac-Direktdownload (DMG) von Whisper Notes, ab Version 1.6.0. Die Version aus dem Mac App Store soll die neueren Engines in späteren Releases bekommen, ein Datum haben wir dafür nicht. Bis dahin haben die iPhone-App und die Version aus dem Mac App Store drei Engine-Familien — Whisper, Parakeet V3 und SenseVoice — und jede Sprache, die Qwen erkennt, deckt dort auch Whisper ab. Nach Modellen gezählt bietet die Mac-App-Store-Version heute vier und der Direktdownload fünf, weil Whisper als Small und als Large V3 Turbo dabei ist. Wenn du Kantonesisch auf dem iPhone brauchst, ist SenseVoice dort die Engine der Wahl.
Qwen3-ASR oder SenseVoice für Chinesisch, Japanisch und Koreanisch?
Bei der Genauigkeit liegen beide dicht beieinander, bei der Geschwindigkeit weit auseinander. In unserem FLEURS-Durchlauf kam Qwen3-ASR auf 5,69 % CER für Chinesisch, 5,39 % für Japanisch und 3,51 % für Koreanisch; SenseVoice Small auf denselben Clips auf 7,06 %, 6,85 % und 7,82 %. SenseVoice lief in diesem Durchlauf im Median mit 161× Echtzeit gegenüber 8,7× bei Qwen, lädt 827 MB statt rund 2,5 GB und ist auf dem iPhone und in beiden Mac-Versionen verfügbar. Nimm SenseVoice, außer du transkribierst Kantonesisch: Dort kam Qwen3-ASR auf 6,00 % CER gegen 36,71 % bei SenseVoice, und dieser Abstand ist das Warten wert.
Was sind die Systemvoraussetzungen für Qwen3-ASR 1.7B?
Ein Mac mit Apple Silicon unter macOS 15 oder neuer, empfohlen 16 GB Arbeitsspeicher, dazu rund 2,5 GB Festplattenplatz für das Modell. Das liegt über dem Rest von Whisper Notes für Mac, der ab macOS 14 läuft. In unserem Benchmark-Durchlauf erreichte das Modell 2,43 GiB Prozessspeicher, der höchste Wert der fünf Engines. Auf einem Mac mit 8 GB deckt Whisper Small dieselbe Liste mit 101 Sprachen in 600 MB ab, und Parakeet V3 deckt 25 europäische Sprachen in 465 MB ab.
Verlässt das Audio meinen Mac, wenn ich Qwen3-ASR nutze?
Nein. Alibaba bietet Qwen3-ASR auch als Cloud-Dienst an, über die DashScope-APIs für Echtzeit und Dateitranskription, und dort wird Audio auf die Server von Alibaba hochgeladen. Whisper Notes nutzt diese Dienste nicht. Die App führt die offenen Gewichte lokal als MLX-Modell mit 8 Bit auf der GPU deines Macs aus, ohne Konto und ohne API-Key, und die Transkription funktioniert auch ohne Netz. Das gilt für jede Engine-Familie in der App, auf jedem Kanal.
Warum passen diese Zahlen nicht zu der Genauigkeit, die ich bei meinen Aufnahmen sehe?
Weil FLEURS aus kurzer, sauberer, vorgelesener Sprache besteht und deine Aufnahmen das nicht sind. Unser Durchlauf ist eine Kalibrierung auf einem öffentlichen Datensatz: rund 75 Sätze pro Sprache, ein M5 MacBook Air, für jedes Modell dieselben Clips. Er taugt für die Frage, ob ein Modell für eine Sprache plausibel ist. Er ist keine Vorhersage deiner Genauigkeit in einem Meeting, auf verrauschtem Audio, bei Akzent oder in einer zweistündigen Datei.
Probier es aus
Qwen3-ASR 1.7B steckt in Whisper Notes für Mac ab 1.6.0, nur im Direktdownload (DMG). Einstellungen, dann Transkriptionsmodell. Die kostenlose Testphase umfasst 10.000 Wörter, genug, um deine eigene Sprache durchlaufen zu lassen und den Tabellen oben zu widersprechen.
Wenn du eine Sprache findest, bei der unsere Zahlen nicht zu deiner Erfahrung passen, schreib an mac@whispernotes.app. Die vollständigen Versionshinweise: whispernotes.app/changelog.
Die Quellen für alles oben: unser FLEURS-Durchlauf auf dem Testsplit von Google FLEURS in Revision 70bb2e84, die Modellkarte zu Qwen3-ASR 1.7B und die Sprachtabelle nach Engine auf unserer Seite zur Sprachunterstützung, die aus dem Quellcode der App erzeugt wird.