Seit macOS 26 und iOS 26 bietet Apple eine neue Generation der Spracherkennung auf dem Gerät — SpeechAnalyzer und SpeechTranscriber, im Folgenden kurz Apple Speech. Sie ist deutlich genauer als die alte Diktier-Engine. Deshalb wollten wir wissen: Ist Apples integrierte Spracherkennung inzwischen gut genug, dass du ganz auf eine Transkriptions-App verzichten könntest? Und wie groß ist der Abstand zu den lokalen offenen Modellen in Whisper Notes — Whisper, Parakeet, SenseVoice und Qwen3-ASR? Wir haben einen strengen Test durchgeführt. Das sind die Ergebnisse. In den zehn getesteten Sprachen hatte Apple Speech nie die niedrigste Fehlerrate, lag bei Koreanisch, Japanisch und Chinesisch höchstens 1,5 Punkte hinter der besten Engine und hat für Niederländisch, Russisch und Polnisch überhaupt kein Modell.
Wie weit ist Apple Speech von den Modellen entfernt, die du herunterlädst?
| Sprache | Apple Speech | Qwen3-ASR | Whisper Large | Whisper Small | Parakeet | SenseVoice |
|---|---|---|---|---|---|---|
| Englisch | 8,80 | 4,49 | 5,49 | 7,04 | 6,89 | 8,46 |
| Deutsch | 6,26 | 2,85 | 4,05 | 8,67 | 6,26 | — |
| Niederländisch | — | 7,36 | 5,69 | 16,75 | 8,58 | — |
| Russisch | — | 5,65 | 5,13 | 11,37 | 7,12 | — |
| Polnisch | — | 12,59 | 5,45 | 15,81 | 8,30 | — |
| Japanisch | 6,36 | 5,74 | 5,30 | 11,37 | — | 6,78 |
| Koreanisch | 4,31 | 3,54 | 4,25 | 7,30 | — | 7,85 |
| Französisch | 7,61 | 4,57 | 5,97 | 13,24 | 5,83 | — |
| Chinesisch | 7,97 | 6,49 | 7,97 | 20,50 | — | 7,69 |
| Spanisch (Lateinamerika) | 5,41 | 3,38 | 3,62 | 6,22 | 4,86 | — |
Zehn der meistgenutzten Sprachen, eine Engine pro Spalte. Jede Zelle zeigt die Fehlerrate der Engine; niedriger ist besser. Grün markiert den niedrigsten Wert der Zeile, weiß den zweitniedrigsten. CER für Japanisch, Koreanisch und Chinesisch, WER für den Rest, nie zu einer einzigen Zahl zusammengefasst. Unser eigener FLEURS-Durchlauf, vom Team von Whisper Notes, auf einem M5 MacBook Air, vorgelesene Sprache.
Kurznamen: Qwen3-ASR = Qwen3-ASR 1.7B, Whisper Large = Whisper Large V3 Turbo, Parakeet = Parakeet V3, SenseVoice = SenseVoice Small. Ein Gedankenstrich bedeutet, dass die Engine kein Modell für diese Sprache hat.
Qwen3-ASR 1.7B hat in sechs der zehn Sprachen die niedrigste Fehlerrate, Whisper Large V3 Turbo in den übrigen vier. Apple Speech liegt bei Koreanisch 0,77 Punkte hinter dem Zeilensieger, bei Japanisch 1,06 und bei Chinesisch 1,48, wo es mit Whisper Large V3 Turbo bei 7,97 gleichauf liegt. In den sieben unterstützten Sprachen liegt es 0,8 bis 4,3 Punkte hinter dem Zeilensieger, am weitesten bei Englisch mit 8,80 gegenüber 4,49. Für Niederländisch, Polnisch und Russisch gibt es kein Ergebnis von Apple Speech.
Welche Sprachen unterstützt Apple Speech?
Apple Speech lieferte in diesem Durchlauf Ergebnisse für 21 der 83 Sprachkonfigurationen. Beide Whisper-Modelle decken alle 83 ab, Qwen3-ASR 1.7B 30 und Parakeet V3 25. Für Niederländisch, Polnisch und Russisch unter den zehn Sprachen oben hat es kein Modell. Eine feste Liste lässt sich nicht angeben: Die Sprachressourcen gehören zu macOS, deshalb fragt eine App zur Laufzeit ab, was auf einem bestimmten Computer vorhanden ist.
| Sprache | Apple Speech | Qwen3-ASR | Whisper Large | Whisper Small | Parakeet | SenseVoice |
|---|---|---|---|---|---|---|
| Italienisch | 4,39 | 2,58 | 2,58 | 7,64 | 3,43 | — |
| Kantonesisch | 8,69 | 6,44 | 36,75 | 119,01 | — | 37,23 |
| Portugiesisch (Brasilien) | 9,35 | 5,17 | 5,44 | 8,61 | 6,49 | — |
| Hindi | 101,50 | 13,19 | 29,64 | 61,26 | — | — |
| Telugu | 101,63 | — | 81,74 | 103,19 | — | — |
| Urdu | 101,69 | — | 23,39 | 38,83 | — | — |
| Punjabi | 101,75 | — | 92,05 | 103,40 | — | — |
| Bengalisch | 102,00 | — | 83,52 | 117,37 | — | — |
| Nepali | 102,13 | — | 88,59 | 118,84 | — | — |
| Malayalam | 102,18 | — | 107,34 | 167,16 | — | — |
| Marathi | 102,23 | — | 82,69 | 109,95 | — | — |
| Kannada | 103,83 | — | 72,07 | 116,10 | — | — |
| Gujarati | 104,52 | — | 75,31 | 108,91 | — | — |
| Tamil | 113,01 | — | 71,28 | 79,77 | — | — |
Die übrigen vierzehn Sprachen, für die Apple Speech ein Ergebnis lieferte, sortiert nach der eigenen Fehlerrate. Dieselben Spalten, Farben und Kurznamen wie oben; CER für Kantonesisch, WER für den Rest. Eine Fehlerrate kann über 100 % liegen, weil auch Einfügungen im Zähler zählen.
In den letzten elf Zeilen, von Hindi bis Tamil, gab Apple Speech eine lateinische Transliteration statt der jeweiligen einheimischen Schrift aus. Die Fehlerrate misst dort daher eine Abweichung der Schrift und nicht die Erkennungsgenauigkeit; diese Zellen bleiben bei der Rangfolge der Zeile unberücksichtigt. Die Werte der anderen Engines in diesen Zeilen sind gewöhnliche Messwerte.
So funktioniert SpeechAnalyzer
Apple bietet seit iOS 10 eine API zur Spracherkennung. Diese API, SFSpeechRecognizer, ist die Engine hinter dem alten Diktierpfad. SpeechAnalyzer löst sie ab, wurde mit macOS 26 und iOS 26 eingeführt und ist auf jeder Apple-Plattform außer watchOS verfügbar.
Die API ist um eine Sitzung herum aufgebaut. Du erstellst einen SpeechAnalyzer, gibst ihm ein oder mehrere Module und führst ihm Audio zu; SpeechTranscriber ist das Modul, das Sprache in Text umwandelt. Das Audio geht als asynchrone Sequenz hinein, die du selbst befüllst, die Ergebnisse kommen als zweite Sequenz zurück, und beide laufen normalerweise in verschiedenen Tasks. Der Analyzer verarbeitet jeweils eine Eingabesequenz. Jeder Puffer und jedes Ergebnis erhält einen Zeitcode zur eigenen Zeitachse des Audios, sodass sich ein Ergebnis wieder an seiner ursprünglichen Stelle einordnen lässt.
Eine Sitzung, drei Tasks: Audio geht als AsyncSequence hinein, SpeechAnalyzer und SpeechTranscriber analysieren es, und die Ergebnisse kommen als zweite AsyncSequence zurück, die die Benutzeroberfläche ausliest. Quelle: Apple, WWDC25 Session 277.
Ergebnisse treffen zweimal ein. Alles innerhalb des von Apple so genannten flüchtigen Bereichs kann noch durch ein besseres Ergebnis ersetzt werden; alles außerhalb ist endgültig. So kann eine App schon während des Sprechens ein vorläufiges Transkript anzeigen und es anschließend korrigieren.
Apple nennt fünf Entwicklungsziele für das SpeechTranscriber-Modell: lange Audioaufnahmen, gesprochene Unterhaltungen, weit entfernte Sprecher, geringe Latenz und Datenschutz, also die Ausführung auf dem Gerät. Notizen, Sprachmemos, Journal und Anrufzusammenfassungen bauen darauf auf.
Die fünf von Apple genannten Entwicklungsziele für das SpeechTranscriber-Modell. Quelle: Apple, WWDC25 Session 277.
Die Modelle sind nicht Bestandteil einer App. Sie werden über AssetInventory von Apples Servern heruntergeladen, vom System gespeichert und aktualisiert sowie zwischen Apps geteilt. Sie erhöhen weder die Downloadgröße der App noch den Speicherbedarf ihres Prozesses, und die Decodierung findet außerhalb des aufrufenden Prozesses statt. Wenn SpeechTranscriber für eine Sprache oder ein Gerät kein Modell hat, übernimmt DictationTranscriber mit denselben Modellen wie das Systemdiktat.
So haben wir gemessen
Jede Engine in diesem Beitrag transkribierte dieselben Clips in derselben Reihenfolge, einzeln nacheinander, auf einem M5 MacBook Air (32 GB, macOS 27.0). Das Audiomaterial ist der Google FLEURS Testsplit in Revision 70bb2e84 mit rund 150 Sätzen und 30 Minuten pro Sprache. Ein fester Hash der eigenen Element-IDs des Datensatzes bestimmt die Reihenfolge, und wir verwenden die kürzeste Folge vollständiger Elemente, die dreißig Minuten überschreitet; keine Modellausgabe hatte Einfluss auf diese Auswahl. Jede Zelle wurde anhand ihres eigenen Belegs neu erstellt und nochmals geprüft, alle 285 bestanden.
Die Werte sind die Wortfehlerrate, wenn Wörter durch Leerzeichen getrennt werden, und die Zeichenfehlerrate für Japanisch, Koreanisch, Chinesisch und Kantonesisch. FLEURS besteht aus vorgelesener Sprache, nicht aus Meetings und nicht aus Diktat. Diese Tabellen zeigen, ob eine Engine für deine Sprache infrage kommt, nicht welches Ergebnis du bei deinen eigenen Aufnahmen erhältst.
Wie viel besser ist es als das alte Apple Dictation?
Apple bietet zwei Betriebsarten für die Transkription, und wir haben beide gemessen. SpeechTranscriber ist die neue, die in diesem Beitrag Apple Speech heißt. DictationTranscriber ist die kompatible Betriebsart, also der bisherige Diktierpfad des Macs.
| Sprache | Apple Dictation | Apple Speech |
|---|---|---|
| Koreanisch | 7,11 | 4,31 |
| Italienisch | 6,93 | 4,39 |
| Spanisch (Lateinamerika) | 8,43 | 5,41 |
| Deutsch | 12,69 | 6,26 |
| Japanisch | 9,37 | 6,36 |
| Französisch | 17,10 | 7,61 |
| Chinesisch | 10,28 | 7,97 |
| Kantonesisch | 10,18 | 8,69 |
| Englisch | 13,83 | 8,80 |
| Portugiesisch (Brasilien) | 10,85 | 9,35 |
Alle Sprachen, die von beiden Apple-Betriebsarten sauber gemessen wurden, sortiert nach der Fehlerrate von Apple Speech; grün markiert den besseren Wert der Zeile. Derselbe Durchlauf, dieselben Clips, derselbe Mac. CER für Japanisch, Koreanisch, Chinesisch und Kantonesisch, WER für den Rest.
Apple Speech ist in allen zehn Sprachen genauer. Bei der Sprache in der Mitte fällt rund ein Drittel der Fehler weg, bei Französisch und Deutsch mehr als die Hälfte, bei brasilianischem Portugiesisch und Kantonesisch etwa einer von sieben Fehlern.
Das ist ein Vergleich mit Apples eigener Vergangenheit. Gegenüber den Modellen, die du herunterlädst, erreicht es in einer sauber gemessenen Sprache als beste Platzierung Rang zwei, bei Kantonesisch. Dictation deckt mehr Sprachen ab: 33 Konfigurationen gegenüber 21 in diesem Durchlauf, darunter alle drei, die der neuen Engine hier fehlen.
Was bringt dir die integrierte Engine?
| Engine | Geschwindigkeit | Maximaler Speicherbedarf | Download |
|---|---|---|---|
| SenseVoice Small | 162,3× Echtzeit | 0,95 GiB | 827 MB |
| Parakeet V3 | 75,6× Echtzeit | 0,09 GiB | 465 MB |
| Apple Speech | 30,8× Echtzeit | nicht ausgewiesen | Sprachpaket von macOS heruntergeladen, nicht von der App |
| Qwen3-ASR 1.7B | 11,1× Echtzeit | 2,43 GiB | rund 2,5 GB |
| Whisper Small | 7,9× Echtzeit | 0,87 GiB | 600 MB |
| Whisper Large V3 Turbo | 3,0× Echtzeit | 1,87 GiB | rund 1,6 GB |
Die Geschwindigkeit ist der Median jeder Engine über die dreizehn Sprachen, die dieser Beitrag sauber misst; gezählt werden nur die Sprachen, die sie tatsächlich verarbeitet hat. Es ist der Durchsatz bei isolierter Verarbeitung einzelner Elemente, ein Diagnosewert und keine Produktlatenz. Der maximale Speicherbedarf ist der Höchstwert der Prozessgruppe in diesem Durchlauf. Apple Speech decodiert in einem macOS-Dienst, der nicht der aufrufenden App gehört, deshalb wäre dort keine Zahl mit den anderen fünf vergleichbar.
Die Sprachressourcen von Apple Speech werden einmal vom System heruntergeladen und von allen Apps gemeinsam genutzt. In der App selbst ist kein Modell enthalten, und in ihrem eigenen Prozess wird dafür kein Speicher belegt. Der Systemdienst benötigt bei der Arbeit trotzdem Speicher, den wir nicht genau zuordnen können. Deshalb weisen wir dort keine Zahl aus, statt eine Null anzugeben. Die Geschwindigkeit betrug 30,8× Echtzeit, hinter Parakeet V3 und SenseVoice Small.
Whisper Large V3 Turbo gewinnt vier der zehn Zeilen und ist hier die langsamste Engine, rund zehnmal langsamer als Apple Speech, bei rund 1,6 GB auf der Festplatte. Qwen3-ASR 1.7B gewinnt die übrigen sechs, bei rund 2,5 GB und 2,43 GiB Speicher. Parakeet V3 benötigt 465 MB und 0,09 GiB, liegt bei Französisch vor Turbo, bei Polnisch dahinter und hat kein Japanisch, Koreanisch, Chinesisch oder Kantonesisch. Whisper Small ist mit 600 MB der nächste Vergleich; in acht der zehn Sprachen, die beide sauber gemessen haben, war Apple Speech genauer.
Solltest du Apple Speech statt eines heruntergeladenen Modells verwenden?
Sprache für Sprache:
- Englisch: keine gute Wahl. Apple Speech erreichte 8,80; Qwen3-ASR 1.7B (4,49) oder Whisper Large V3 Turbo (5,49) ist deutlich genauer.
- Deutsch: keine gute Wahl. Apple Speech erreichte 6,26; Qwen3-ASR 1.7B (2,85) oder Whisper Large V3 Turbo (4,05) ist deutlich genauer.
- Niederländisch, Russisch und Polnisch: Apple Speech hat für diese drei kein Modell. Whisper Large V3 Turbo war in allen drei am genauesten, mit 5,69, 5,13 und 5,45.
- Japanisch: brauchbar. Apple Speech erreichte 6,36, hinter Whisper Large V3 Turbo mit 5,30.
- Koreanisch: brauchbar. Apple Speech erreichte 4,31, hinter Qwen3-ASR 1.7B mit 3,54.
- Französisch: keine gute Wahl. Apple Speech erreichte 7,61; Qwen3-ASR 1.7B (4,57) oder Parakeet V3 (5,83) ist deutlich genauer.
- Chinesisch: brauchbar. Apple Speech erreichte 7,97 und liegt gleichauf mit Whisper Large V3 Turbo; am genauesten war Qwen3-ASR 1.7B mit 6,49.
- Spanisch: keine gute Wahl. Apple Speech erreichte 5,41; Qwen3-ASR 1.7B (3,38) oder Whisper Large V3 Turbo (3,62) ist deutlich genauer.
Apple Speech ist in diesem Beitrag die Kurzbezeichnung für Apples SpeechTranscriber, die lokale API, die jede Mac-App ab macOS 26 aufrufen kann. Es gehört nicht zu den Modellen, die Whisper Notes für Mac herunterlädt: In der Mac-Direktdownload-Version (DMG) sind das Whisper, Parakeet V3, SenseVoice und Qwen3-ASR, am iPhone und in der Version aus dem Mac App Store Whisper, Parakeet V3 und SenseVoice. Die Tabelle nach Engine steht auf unserer Seite zur Sprachunterstützung.
Nichts davon ändert, wie Whisper Notes für Mac heute arbeitet: Parakeet V3 ist weiterhin der Standard.
Häufig gestellte Fragen
Ist Apple Speech so genau wie Whisper?
Bei den meisten Sprachen, die beide abdecken, nicht. In unserem eigenen FLEURS-Durchlauf war Whisper Large V3 Turbo in sechs der sieben dieser zehn Sprachen genauer, die Apple Speech unterstützt; bei Chinesisch lagen beide mit jeweils 7,97 % CER exakt gleichauf. Gegen Whisper Small kehrt sich die Reihenfolge um: Apple Speech lag in sechs der sieben vorn und verlor nur bei Englisch, 8,80 % gegenüber 7,04 % WER. In diesem Durchlauf führt es bei keiner sauber gemessenen Sprache; am nächsten liegt es bei Koreanisch mit 4,31 % CER gegenüber 3,54 % des Zeilensiegers. Kantonesisch ist die eine sauber gemessene Sprache, in der es Whisper Large V3 Turbo schlug, mit 8,69 % gegenüber 36,75 % CER. Verwende die integrierte Engine, wenn sie deine Sprache abdeckt und du das Sprachpaket lieber von macOS verwalten lässt; für das genaueste Ergebnis oder wenn deine Sprache zu den drei gehört, die Apple Speech hier nicht unterstützt, verwende Whisper Large V3 Turbo.
Welche Sprachen unterstützt Apple Speech?
Die Liste wird von macOS bestimmt, nicht von einer App. In diesem Durchlauf lieferte Apple Speech Ergebnisse in 21 der 83 getesteten Sprachkonfigurationen, gegenüber 83 für beide Whisper-Versionen, 30 für Qwen3-ASR 1.7B und 25 für Parakeet V3. Von den zehn meistgenutzten Sprachen der Haupttabelle hat es Englisch, Deutsch, Japanisch, Koreanisch, Französisch, Chinesisch und Spanisch, aber kein Niederländisch, Polnisch oder Russisch. Die zweite Tabelle enthält die übrigen vierzehn Konfigurationen: Italienisch, Kantonesisch, brasilianisches Portugiesisch und elf Sprachen, bei denen es eine lateinische Transliteration statt der einheimischen Schrift ausgab. Eine App muss macOS zur Laufzeit fragen, welche Sprachen auf einem bestimmten Computer vorhanden sind. Fehlt deine Sprache, deckt Whisper auf jedem Kanal alle Sprachen der App-Liste ab.
Apple Speech oder Parakeet V3 — welche Engine?
Parakeet V3, bei jeder europäischen Sprache, die beide abdecken. Es erreichte 6,89 gegenüber 8,80 bei Englisch, 5,83 gegenüber 7,61 bei Französisch, 4,86 gegenüber 5,41 bei Spanisch, 3,43 gegenüber 4,39 bei Italienisch und 6,49 gegenüber 9,35 bei brasilianischem Portugiesisch; bei Deutsch liegen beide mit 6,26 gleichauf. Parakeet V3 hat kein Japanisch, Koreanisch, Chinesisch oder Kantonesisch, daher ist Apple Speech dort die einzige der beiden verfügbaren Engines und liegt bei Japanisch, Koreanisch und Chinesisch höchstens 1,5 Punkte hinter dem Zeilensieger. Parakeet V3 ist ein Download von 465 MB und lief mit 75,6× Echtzeit bei einem Höchstwert von 0,09 GiB; das Sprachpaket von Apple Speech wird von macOS heruntergeladen, und es lief mit 30,8× bei einem Speicherwert, den wir nicht ausweisen.
Was ist SpeechAnalyzer, und ist es dasselbe wie Apple Dictation?
SpeechAnalyzer ist die übergeordnete API, die Apple auf der WWDC 2025 vorstellte und mit macOS 26 und iOS 26 veröffentlichte. SpeechTranscriber ist die darin enthaltene Betriebsart für Transkription; sie haben wir gemessen und nennen sie in diesem Beitrag Apple Speech. Dictation ist die kompatible Betriebsart, die wir ebenfalls getestet haben: Apple Speech war in allen zehn Sprachen genauer, die beide sauber verarbeiteten. Bei der Sprache in der Mitte fiel rund ein Drittel der Fehler weg, bei Französisch und Deutsch mehr als die Hälfte. Dictation deckt mehr Sprachen ab, 33 Konfigurationen gegenüber 21. Damit ist es die System-Engine für Niederländisch, Polnisch oder Russisch, wenn du 17,34 %, 13,50 % und 13,13 % WER akzeptieren kannst. Whisper Large V3 Turbo erreichte bei denselben Clips 5,69 %, 5,45 % und 5,13 %.
Verlässt das Audio meinen Mac, wenn ich Apple Speech verwende?
Apple dokumentiert SpeechTranscriber als Spracherkennung auf dem Gerät: macOS lädt die Sprachressourcen einmal herunter, und die Erkennung läuft lokal. Wir haben Genauigkeit und Geschwindigkeit gemessen, nicht das Netzwerkverhalten, und geben diesen Teil deshalb so wieder, wie Apple ihn beschreibt. Die Engines, die Whisper Notes selbst herunterlädt — Whisper, Parakeet V3, SenseVoice und Qwen3-ASR — laufen auf der GPU oder Neural Engine deines eigenen Macs, ohne Konto und ohne API key. Die Transkription funktioniert auf jedem Kanal auch ohne Netzwerk.
Warum stimmen diese Zahlen nicht mit der Genauigkeit meiner Aufnahmen überein?
Weil FLEURS aus kurzer, sauberer, vorgelesener Sprache besteht und deine Aufnahmen nicht. Unser Durchlauf ist eine Kalibrierung auf einem öffentlichen Datensatz: rund 150 Sätze und 30 Minuten Audio pro Sprache, ein M5 MacBook Air und dieselben Clips für jede Engine. Er zeigt, ob eine Engine für eine Sprache infrage kommt. Er sagt nicht voraus, was du in einem Meeting, bei verrauschtem Audio, bei Akzent oder in einer zweistündigen Datei erhältst.
Warum sagen andere Benchmarks, Apple Speech sei besser als Whisper?
Sie vergleichen es mit Whisper Small, und nur bei Englisch. Für Whisper Small deckt sich das mit unserem Durchlauf: In den zehn Sprachen, die beide sauber gemessen haben, war Apple Speech in acht genauer. Englisch ist eine der beiden Ausnahmen, 8,80 gegenüber 7,04. Auf Whisper Large V3 Turbo überträgt sich das nicht: Dort lag Apple Speech in acht dieser zehn Sprachen zurück, bei Chinesisch mit 7,97 gleichauf und nur bei Kantonesisch vorn. Welches Whisper im Vergleich steht, entscheidet die Schlagzeile.
Probier es aus
Die fünf herunterladbaren Modelle hier — Whisper Small, Whisper Large V3 Turbo, Parakeet V3, SenseVoice Small und Qwen3-ASR 1.7B — sind alle in Whisper Notes für Mac als Direktdownload (DMG) enthalten, unter Einstellungen, dann Transkriptionsmodell.
Wenn unsere Zahlen nicht zu deiner Erfahrung mit einer Sprache passen, schreib an mac@whispernotes.app. Vollständige Versionshinweise: whispernotes.app/changelog.
Quellen: unser Durchlauf auf dem Google FLEURS Testsplit in Revision 70bb2e84, Apples SpeechAnalyzer-Dokumentation, sowie der Qwen3-ASR-Durchlauf über dreißig Sprachen davor.