Od macOS 26 a iOS 26 dodává Apple novou generaci rozpoznávání řeči v zařízení — SpeechAnalyzer a SpeechTranscriber, dál zkráceně Apple Speech. Je výrazně přesnější než starý engine diktování. Chtěli jsme tedy zjistit: je už vestavěné rozpoznávání řeči Apple natolik dobré, že se obejdeš úplně bez aplikace pro přepis? A jak daleko má k otevřeným modelům běžícím v zařízení ve Whisper Notes — Whisper, Parakeet, SenseVoice a Qwen3-ASR? Provedli jsme přísný test. Tady jsou výsledky. V deseti testovaných jazycích neměl Apple Speech ani jednou nejnižší chybovost, v korejštině, japonštině a čínštině byl do 1,5 bodu od vítěze a pro nizozemštinu, ruštinu a polštinu nemá model vůbec.
Jak daleko má Apple Speech k modelům, které stahuješ?
| Jazyk | Apple Speech | Qwen3-ASR | Whisper Large | Whisper Small | Parakeet | SenseVoice |
|---|---|---|---|---|---|---|
| Angličtina | 8,80 | 4,49 | 5,49 | 7,04 | 6,89 | 8,46 |
| Němčina | 6,26 | 2,85 | 4,05 | 8,67 | 6,26 | — |
| Nizozemština | — | 7,36 | 5,69 | 16,75 | 8,58 | — |
| Ruština | — | 5,65 | 5,13 | 11,37 | 7,12 | — |
| Polština | — | 12,59 | 5,45 | 15,81 | 8,30 | — |
| Japonština | 6,36 | 5,74 | 5,30 | 11,37 | — | 6,78 |
| Korejština | 4,31 | 3,54 | 4,25 | 7,30 | — | 7,85 |
| Francouzština | 7,61 | 4,57 | 5,97 | 13,24 | 5,83 | — |
| Čínština | 7,97 | 6,49 | 7,97 | 20,50 | — | 7,69 |
| Španělština (Latinská Amerika) | 5,41 | 3,38 | 3,62 | 6,22 | 4,86 | — |
Deset z nejpoužívanějších jazyků, jeden engine v každém sloupci. Každá buňka ukazuje chybovost daného enginu, nižší je lepší; zeleně je nejnižší hodnota v řádku, bíle druhá nejnižší. CER pro japonštinu, korejštinu a čínštinu, WER pro zbytek; nikdy je neslučujeme do jednoho čísla. Náš vlastní běh FLEURS, provedený týmem Whisper Notes, na jednom M5 MacBook Air, čtená řeč.
Zkrácené názvy: Qwen3-ASR = Qwen3-ASR 1.7B, Whisper Large = Whisper Large V3 Turbo, Parakeet = Parakeet V3, SenseVoice = SenseVoice Small. Pomlčka znamená, že engine nemá model pro daný jazyk.
Qwen3-ASR 1.7B má nejnižší chybovost v šesti z deseti jazyků, Whisper Large V3 Turbo ve zbývajících čtyřech. Apple Speech ztrácí na vítěze řádku 0,77 bodu v korejštině, 1,06 v japonštině a 1,48 v čínštině, kde se shoduje s Whisper Large V3 Turbo na 7,97. V sedmi podporovaných jazycích ztrácí na vítěze 0,8 až 4,3 bodu, nejvíc v angličtině: 8,80 proti 4,49. Pro nizozemštinu, polštinu a ruštinu výsledek Apple Speech není.
Které jazyky Apple Speech podporuje?
V tomto běhu vrátil Apple Speech výsledky pro 21 z 83 jazykových konfigurací. Oba modely Whisper pokrývají všech 83, Qwen3-ASR 1.7B jich pokrývá 30 a Parakeet V3 25. Z deseti jazyků výše nemá model pro nizozemštinu, polštinu ani ruštinu. Neexistuje pevný seznam, který by šlo citovat: jazykové prostředky patří macOS, takže se aplikace za běhu ptá, co je na daném stroji k dispozici.
| Jazyk | Apple Speech | Qwen3-ASR | Whisper Large | Whisper Small | Parakeet | SenseVoice |
|---|---|---|---|---|---|---|
| Italština | 4,39 | 2,58 | 2,58 | 7,64 | 3,43 | — |
| Kantonština | 8,69 | 6,44 | 36,75 | 119,01 | — | 37,23 |
| Portugalština (Brazílie) | 9,35 | 5,17 | 5,44 | 8,61 | 6,49 | — |
| Hindština | 101,50 | 13,19 | 29,64 | 61,26 | — | — |
| Telugština | 101,63 | — | 81,74 | 103,19 | — | — |
| Urdština | 101,69 | — | 23,39 | 38,83 | — | — |
| Paňdžábština | 101,75 | — | 92,05 | 103,40 | — | — |
| Bengálština | 102,00 | — | 83,52 | 117,37 | — | — |
| Nepálština | 102,13 | — | 88,59 | 118,84 | — | — |
| Malajálamština | 102,18 | — | 107,34 | 167,16 | — | — |
| Maráthština | 102,23 | — | 82,69 | 109,95 | — | — |
| Kannadština | 103,83 | — | 72,07 | 116,10 | — | — |
| Gudžarátština | 104,52 | — | 75,31 | 108,91 | — | — |
| Tamilština | 113,01 | — | 71,28 | 79,77 | — | — |
Dalších čtrnáct jazyků, pro které Apple Speech vrátil výsledek, seřazených podle jeho vlastní chybovosti. Sloupce, barvy a zkrácené názvy jsou stejné jako výše; CER pro kantonštinu, WER pro zbytek. Chybovost může překročit 100 %, protože se do čitatele započítávají i vložené prvky.
V posledních jedenácti řádcích, od hindštiny po tamilštinu, odpověděl Apple Speech latinskou transliterací místo původního písma. Jeho chybovost tam proto měří nesoulad písem, ne přesnost rozpoznávání, a tyto buňky se do pořadí v řádku nepočítají; hodnoty ostatních enginů v těchto řádcích jsou běžná měření.
Jak funguje SpeechAnalyzer
Apple má API pro rozpoznávání řeči už od iOS 10. To původní, SFSpeechRecognizer, je engine za starou cestou diktování. SpeechAnalyzer ho nahrazuje: byl uveden v macOS 26 a iOS 26 a je dostupný na každé platformě Apple kromě watchOS.
API je postavené kolem relace. Vytvoříš SpeechAnalyzer, předáš mu jeden nebo více modulů a přivádíš zvuk; SpeechTranscriber je modul, který převádí řeč na text. Zvuk přichází jako asynchronní sekvence, kterou sám plníš, výsledky se vracejí jako druhá sekvence a obě obvykle běží v různých úlohách. Analyzátor přijímá vždy jednu vstupní sekvenci. Každý buffer i výsledek má časový kód vůči vlastní časové ose zvuku, takže lze výsledek vrátit tam, odkud pochází.
Jedna relace, tři úlohy: zvuk přichází jako AsyncSequence, SpeechAnalyzer a SpeechTranscriber ho analyzují a výsledky se vracejí jako druhá AsyncSequence, kterou čte rozhraní. Zdroj: Apple, přednáška 277 z WWDC25.
Výsledky přicházejí dvakrát. Cokoli uvnitř oblasti, kterou Apple označuje jako proměnlivou, lze ještě nahradit lepším výsledkem; vše mimo ni je konečné. Aplikace tak ukazuje hrubý přepis, zatímco ještě mluvíš, a potom ho opraví.
Apple uvádí pět cílů návrhu modelu SpeechTranscriber: dlouhý zvuk, konverzační řeč, vzdálené mluvčí, nízkou latenci a soukromí, tedy běh v zařízení. Využívají ho Poznámky, Diktafon, Deník a shrnutí hovorů.
Pět cílů návrhu modelu SpeechTranscriber podle Apple. Zdroj: Apple, přednáška 277 z WWDC25.
Modely nejsou součástí žádné aplikace. Stahují se ze serverů Apple přes AssetInventory, systém je ukládá a aktualizuje a aplikace je sdílejí. Nezvětšují velikost stahované aplikace ani paměť jejího procesu a dekódování probíhá mimo volající proces. Kde SpeechTranscriber nemá model pro daný jazyk nebo zařízení, převezme práci DictationTranscriber se stejnými modely jako systémové diktování.
Jak jsme měřili
Každý engine v tomto článku přepsal stejné nahrávky, ve stejném pořadí, vždy po jedné, na M5 MacBook Air (32 GB, macOS 27.0). Zvuk pochází z testovacího splitu Google FLEURS v revizi 70bb2e84, přibližně 150 vět a 30 minut na jazyk. Pevný hash vlastních ID položek datasetu určuje jejich pořadí a my bereme nejkratší posloupnost celých položek, která překročí třicet minut; výstup žádného modelu tento výběr neovlivnil. Každou buňku jsme znovu sestavili z jejího vlastního dokladu a znovu zkontrolovali; všech 285 prošlo.
Skóre je WER tam, kde slova oddělují mezery, a CER pro japonštinu, korejštinu, čínštinu a kantonštinu. FLEURS je čtená řeč, ne porada ani diktování. Tyto tabulky říkají, zda je engine pro tvůj jazyk vůbec použitelný, ne jaký výsledek dostaneš na vlastních nahrávkách.
O kolik je lepší než staré diktování Apple?
Apple dodává dva pracovní režimy přepisu a změřili jsme oba. SpeechTranscriber je nový režim, který v tomto článku nazýváme Apple Speech. DictationTranscriber je režim kompatibility, cesta diktování, kterou Mac používal dřív.
| Jazyk | Diktování Apple | Apple Speech |
|---|---|---|
| Korejština | 7,11 | 4,31 |
| Italština | 6,93 | 4,39 |
| Španělština (Latinská Amerika) | 8,43 | 5,41 |
| Němčina | 12,69 | 6,26 |
| Japonština | 9,37 | 6,36 |
| Francouzština | 17,10 | 7,61 |
| Čínština | 10,28 | 7,97 |
| Kantonština | 10,18 | 8,69 |
| Angličtina | 13,83 | 8,80 |
| Portugalština (Brazílie) | 10,85 | 9,35 |
Všechny jazyky, které oba pracovní režimy Apple změřily bez zkreslení, seřazené podle chybovosti Apple Speech; zeleně je lepší hodnota v řádku. Stejný běh, stejné nahrávky, stejný Mac. CER pro japonštinu, korejštinu, čínštinu a kantonštinu, WER pro zbytek.
Apple Speech je přesnější ve všech deseti jazycích. U mediánového jazyka odstraní přibližně třetinu chyb, u francouzštiny a němčiny více než polovinu a u brazilské portugalštiny a kantonštiny asi jednu chybu ze sedmi.
To je srovnání s vlastní minulostí Apple. Proti modelům, které stahuješ, je jeho nejlepší umístění v jazyce změřeném bez zkreslení druhé místo v kantonštině. Diktování pokrývá víc jazyků: 33 konfigurací proti 21 v tomto běhu, včetně všech tří, které tu novému enginu chybějí.
Co získáš s vestavěným enginem?
| Engine | Rychlost | Špičková paměť | Stažení |
|---|---|---|---|
| SenseVoice Small | 162,3× rychleji než v reálném čase | 0,95 GiB | 827 MB |
| Parakeet V3 | 75,6× rychleji než v reálném čase | 0,09 GiB | 465 MB |
| Apple Speech | 30,8× rychleji než v reálném čase | neuvedeno | jazykový balíček stahuje macOS, ne aplikace |
| Qwen3-ASR 1.7B | 11,1× rychleji než v reálném čase | 2,43 GiB | asi 2,5 GB |
| Whisper Small | 7,9× rychleji než v reálném čase | 0,87 GiB | 600 MB |
| Whisper Large V3 Turbo | 3,0× rychleji než v reálném čase | 1,87 GiB | asi 1,6 GB |
Rychlost je medián každého enginu ve třinácti jazycích, které tento článek měří bez zkreslení, a počítají se jen ty, které spustil — propustnost zpracování jednotlivých položek, diagnostika, ne latence produktu. Špičková paměť je maximum skupiny procesů v tomto běhu. Apple Speech dekóduje uvnitř služby macOS, kterou volající aplikace nevlastní, takže by tam žádné číslo neznamenalo totéž jako u ostatních pěti.
Jazykové prostředky Apple Speech stáhne systém jednou a sdílí je každá aplikace. Nic není součástí aplikace a v jejím vlastním procesu se nic nealokuje. Systémová služba při práci paměť pořád používá, ale nedokážeme ji přesně přiřadit, proto tam místo nuly neuvádíme žádné číslo. Běžel 30,8× rychleji než v reálném čase, za Parakeet V3 a SenseVoice Small.
Whisper Large V3 Turbo vyhrává čtyři z deseti řádků a je tady nejpomalejším enginem, zhruba desetkrát pomalejším než Apple Speech, s asi 1,6 GB na disku. Qwen3-ASR 1.7B vyhrává zbývajících šest, za asi 2,5 GB a 2,43 GiB paměti. Parakeet V3 zabírá 465 MB a 0,09 GiB, poráží Turbo ve francouzštině, prohrává s ním v polštině a nemá japonštinu, korejštinu, čínštinu ani kantonštinu. Whisper Small je nejbližší srovnání při 600 MB a Apple Speech byl přesnější v osmi z deseti jazyků změřených bez zkreslení u obou.
Máš použít Apple Speech místo staženého modelu?
Jazyk po jazyku:
- Angličtina: není to dobrá volba. Apple Speech měl 8,80; Qwen3-ASR 1.7B (4,49) nebo Whisper Large V3 Turbo (5,49) je jednoznačně přesnější.
- Němčina: není to dobrá volba. Apple Speech měl 6,26; Qwen3-ASR 1.7B (2,85) nebo Whisper Large V3 Turbo (4,05) je jednoznačně přesnější.
- Nizozemština, ruština a polština: Apple Speech pro tyto tři jazyky nemá model. Whisper Large V3 Turbo byl v každém nejpřesnější, s 5,69, 5,13 a 5,45.
- Japonština: použitelná. Apple Speech měl 6,36, za Whisper Large V3 Turbo s 5,30.
- Korejština: použitelná. Apple Speech měl 4,31, za Qwen3-ASR 1.7B s 3,54.
- Francouzština: není to dobrá volba. Apple Speech měl 7,61; Qwen3-ASR 1.7B (4,57) nebo Parakeet V3 (5,83) je jednoznačně přesnější.
- Čínština: použitelná. Apple Speech měl 7,97, stejně jako Whisper Large V3 Turbo; nejpřesnější byl Qwen3-ASR 1.7B s 6,49.
- Španělština: není to dobrá volba. Apple Speech měl 5,41; Qwen3-ASR 1.7B (3,38) nebo Whisper Large V3 Turbo (3,62) je jednoznačně přesnější.
Apple Speech je zkrácený název pro SpeechTranscriber od Apple používaný v tomto článku, API v zařízení, které může každá aplikace pro Mac volat v macOS 26 nebo novějším. Není to jeden z modelů, které stahuje Whisper Notes pro Mac: ve verzi pro přímé stažení pro Mac (DMG) jsou to Whisper, Parakeet V3, SenseVoice a Qwen3-ASR, na iPhonu a ve verzi z Mac App Store pak Whisper, Parakeet V3 a SenseVoice. Tabulku podle enginů najdeš na naší stránce podpory jazyků.
Nic z toho nemění dnešní fungování Whisper Notes pro Mac: Parakeet V3 je stále výchozí.
Často kladené otázky
Je Apple Speech stejně přesný jako Whisper?
Ve většině jazyků, které pokrývají oba, ne. V našem vlastním běhu FLEURS byl mezi sedmi z těchto deseti jazyků podporovaných Apple Speech Whisper Large V3 Turbo přesnější v šesti a v čínštině se oba přesně shodly na 7,97 % CER. Proti Whisper Small se pořadí obrací: Apple Speech vedl v šesti ze sedmi a prohrál jen angličtinu, 8,80 % proti 7,04 % WER. V tomto běhu nevede v žádném jazyce změřeném bez zkreslení a nejblíž je v korejštině, 4,31 % CER proti 3,54 % vítěze řádku. Kantonština je jediný bez zkreslení změřený jazyk, kde porazil Whisper Large V3 Turbo, 8,69 % proti 36,75 % CER. Použij vestavěný engine, když pokrývá tvůj jazyk a raději necháš macOS spravovat jazykový balíček; pro nejpřesnější výsledek nebo když tvůj jazyk patří mezi tři, které tu Apple Speech nemá, použij Whisper Large V3 Turbo.
Které jazyky Apple Speech podporuje?
Seznam určuje macOS, ne aplikace. V tomto běhu vytvořil Apple Speech výsledky ve 21 z 83 testovaných jazykových konfigurací, oba buildy Whisper v 83, Qwen3-ASR 1.7B ve 30 a Parakeet V3 ve 25. Z deseti nejpoužívanějších jazyků v hlavní tabulce má angličtinu, němčinu, japonštinu, korejštinu, francouzštinu, čínštinu a španělštinu, ale ne nizozemštinu, polštinu ani ruštinu. Druhá tabulka obsahuje dalších čtrnáct konfigurací: italštinu, kantonštinu, brazilskou portugalštinu a jedenáct jazyků, kde odpověděl latinskou transliterací místo původního písma. Aplikace se musí za běhu zeptat macOS, které jazyky daný stroj má. Pokud tvůj jazyk chybí, Whisper pokrývá každý jazyk v seznamu aplikace ve všech kanálech.
Apple Speech, nebo Parakeet V3 — co vybrat?
Parakeet V3 v každém evropském jazyce, který pokrývají oba. Měl 6,89 proti 8,80 v angličtině, 5,83 proti 7,61 ve francouzštině, 4,86 proti 5,41 ve španělštině, 3,43 proti 4,39 v italštině a 6,49 proti 9,35 v brazilské portugalštině; v němčině mají oba 6,26. Parakeet V3 nemá japonštinu, korejštinu, čínštinu ani kantonštinu, takže tam je Apple Speech jediný z dvojice, který existuje, a v japonštině, korejštině a čínštině je do 1,5 bodu od vítěze řádku. Parakeet V3 má ke stažení 465 MB a běžel 75,6× rychleji než v reálném čase se špičkou 0,09 GiB; jazykový balíček Apple Speech stahuje macOS a engine běžel 30,8× rychleji než v reálném čase s pamětí, kterou neuvádíme.
Co je SpeechAnalyzer a je to totéž jako diktování Apple?
SpeechAnalyzer je zastřešující API, které Apple představilo na WWDC 2025 a dodalo v macOS 26 a iOS 26. SpeechTranscriber je pracovní režim přepisu uvnitř něj a právě ten jsme změřili a nazýváme v článku Apple Speech. Diktování je režim kompatibility a spustili jsme i ten: Apple Speech byl přesnější ve všech deseti jazycích, které oba režimy zpracovaly bez zkreslení, odstranil asi třetinu chyb u mediánového jazyka a více než polovinu ve francouzštině a němčině. Diktování pokrývá více jazyků, 33 konfigurací proti 21, takže je systémovým enginem pro nizozemštinu, polštinu nebo ruštinu, pokud přijmeš 17,34 %, 13,50 % a 13,13 % WER. Whisper Large V3 Turbo měl na stejných nahrávkách 5,69 %, 5,45 % a 5,13 %.
Opustí zvuk můj Mac, když použiju Apple Speech?
Apple popisuje SpeechTranscriber jako rozpoznávání řeči v zařízení: macOS jazykové prostředky jednou stáhne a rozpoznávání běží místně. Měřili jsme přesnost a rychlost, ne síťové chování, proto tuto část popisujeme tak jako Apple. Enginy, které Whisper Notes stahuje samo — Whisper, Parakeet V3, SenseVoice a Qwen3-ASR — běží na GPU nebo Neural Engine tvého Macu bez účtu a API key a přepis funguje s vypnutou sítí ve všech kanálech.
Proč tato čísla nesedí s přesností, kterou dostávám na svých nahrávkách?
Protože FLEURS je krátká, čistá, čtená řeč a tvoje nahrávky takové nejsou. Náš běh je kalibrace na veřejném datasetu: zhruba 150 vět a 30 minut zvuku na jazyk, jeden M5 MacBook Air, stejné nahrávky pro každý engine. Říká, zda je engine pro jazyk vůbec použitelný, ne jaký výsledek dostaneš na poradě, v hluku, u řeči s přízvukem nebo u dvouhodinového souboru.
Proč jiné testy říkají, že Apple Speech poráží Whisper?
Srovnávají ho s Whisper Small a jen v angličtině. Náš běh to u Whisper Small potvrzuje: Apple Speech ho porazil v osmi z deseti jazyků, které oba změřily bez zkreslení. Angličtina je jeden ze dvou prohraných, 8,80 proti 7,04. Na Whisper Large V3 Turbo se to nepřenáší: tomu Apple Speech podlehl v osmi z týchž deseti jazyků, v čínštině se s ním shodl na 7,97 a vedl jen v kantonštině. O titulku rozhoduje to, který Whisper je ve srovnání.
Vyzkoušej to
Všech pět stahovaných modelů — Whisper Small, Whisper Large V3 Turbo, Parakeet V3, SenseVoice Small a Qwen3-ASR 1.7B — je v přímém stažení Whisper Notes pro Mac (DMG) v Nastavení → Model přepisu.
Pokud naše čísla nesedí s tvou zkušeností v nějakém jazyce, napiš na mac@whispernotes.app. Kompletní poznámky k vydání: whispernotes.app/changelog.
Zdroje: náš běh na testovacím splitu Google FLEURS v revizi 70bb2e84, dokumentace Apple k SpeechAnalyzer a předchozí běh Qwen3-ASR ve třiceti jazycích.