Apple Speech vs Whisper: jak dobrý je nový SpeechAnalyzer?

1. září 2026
·
8 min read
·Whisper Notes Team

Od macOS 26 a iOS 26 dodává Apple novou generaci rozpoznávání řeči v zařízení — SpeechAnalyzer a SpeechTranscriber, dál zkráceně Apple Speech. Je výrazně přesnější než starý engine diktování. Chtěli jsme tedy zjistit: je už vestavěné rozpoznávání řeči Apple natolik dobré, že se obejdeš úplně bez aplikace pro přepis? A jak daleko má k otevřeným modelům běžícím v zařízení ve Whisper Notes — Whisper, Parakeet, SenseVoice a Qwen3-ASR? Provedli jsme přísný test. Tady jsou výsledky. V deseti testovaných jazycích neměl Apple Speech ani jednou nejnižší chybovost, v korejštině, japonštině a čínštině byl do 1,5 bodu od vítěze a pro nizozemštinu, ruštinu a polštinu nemá model vůbec.

Jak daleko má Apple Speech k modelům, které stahuješ?

Jazyk Apple Speech Qwen3-ASR Whisper Large Whisper Small Parakeet SenseVoice
Angličtina 8,80 4,49 5,49 7,04 6,89 8,46
Němčina 6,26 2,85 4,05 8,67 6,26
Nizozemština 7,36 5,69 16,75 8,58
Ruština 5,65 5,13 11,37 7,12
Polština 12,59 5,45 15,81 8,30
Japonština 6,36 5,74 5,30 11,37 6,78
Korejština 4,31 3,54 4,25 7,30 7,85
Francouzština 7,61 4,57 5,97 13,24 5,83
Čínština 7,97 6,49 7,97 20,50 7,69
Španělština (Latinská Amerika) 5,41 3,38 3,62 6,22 4,86

Deset z nejpoužívanějších jazyků, jeden engine v každém sloupci. Každá buňka ukazuje chybovost daného enginu, nižší je lepší; zeleně je nejnižší hodnota v řádku, bíle druhá nejnižší. CER pro japonštinu, korejštinu a čínštinu, WER pro zbytek; nikdy je neslučujeme do jednoho čísla. Náš vlastní běh FLEURS, provedený týmem Whisper Notes, na jednom M5 MacBook Air, čtená řeč.

Zkrácené názvy: Qwen3-ASR = Qwen3-ASR 1.7B, Whisper Large = Whisper Large V3 Turbo, Parakeet = Parakeet V3, SenseVoice = SenseVoice Small. Pomlčka znamená, že engine nemá model pro daný jazyk.

Qwen3-ASR 1.7B má nejnižší chybovost v šesti z deseti jazyků, Whisper Large V3 Turbo ve zbývajících čtyřech. Apple Speech ztrácí na vítěze řádku 0,77 bodu v korejštině, 1,06 v japonštině a 1,48 v čínštině, kde se shoduje s Whisper Large V3 Turbo na 7,97. V sedmi podporovaných jazycích ztrácí na vítěze 0,8 až 4,3 bodu, nejvíc v angličtině: 8,80 proti 4,49. Pro nizozemštinu, polštinu a ruštinu výsledek Apple Speech není.

Které jazyky Apple Speech podporuje?

V tomto běhu vrátil Apple Speech výsledky pro 21 z 83 jazykových konfigurací. Oba modely Whisper pokrývají všech 83, Qwen3-ASR 1.7B jich pokrývá 30 a Parakeet V3 25. Z deseti jazyků výše nemá model pro nizozemštinu, polštinu ani ruštinu. Neexistuje pevný seznam, který by šlo citovat: jazykové prostředky patří macOS, takže se aplikace za běhu ptá, co je na daném stroji k dispozici.

Jazyk Apple Speech Qwen3-ASR Whisper Large Whisper Small Parakeet SenseVoice
Italština 4,39 2,58 2,58 7,64 3,43
Kantonština 8,69 6,44 36,75 119,01 37,23
Portugalština (Brazílie) 9,35 5,17 5,44 8,61 6,49
Hindština 101,50 13,19 29,64 61,26
Telugština 101,63 81,74 103,19
Urdština 101,69 23,39 38,83
Paňdžábština 101,75 92,05 103,40
Bengálština 102,00 83,52 117,37
Nepálština 102,13 88,59 118,84
Malajálamština 102,18 107,34 167,16
Maráthština 102,23 82,69 109,95
Kannadština 103,83 72,07 116,10
Gudžarátština 104,52 75,31 108,91
Tamilština 113,01 71,28 79,77

Dalších čtrnáct jazyků, pro které Apple Speech vrátil výsledek, seřazených podle jeho vlastní chybovosti. Sloupce, barvy a zkrácené názvy jsou stejné jako výše; CER pro kantonštinu, WER pro zbytek. Chybovost může překročit 100 %, protože se do čitatele započítávají i vložené prvky.

V posledních jedenácti řádcích, od hindštiny po tamilštinu, odpověděl Apple Speech latinskou transliterací místo původního písma. Jeho chybovost tam proto měří nesoulad písem, ne přesnost rozpoznávání, a tyto buňky se do pořadí v řádku nepočítají; hodnoty ostatních enginů v těchto řádcích jsou běžná měření.

Jak funguje SpeechAnalyzer

Apple má API pro rozpoznávání řeči už od iOS 10. To původní, SFSpeechRecognizer, je engine za starou cestou diktování. SpeechAnalyzer ho nahrazuje: byl uveden v macOS 26 a iOS 26 a je dostupný na každé platformě Apple kromě watchOS.

API je postavené kolem relace. Vytvoříš SpeechAnalyzer, předáš mu jeden nebo více modulů a přivádíš zvuk; SpeechTranscriber je modul, který převádí řeč na text. Zvuk přichází jako asynchronní sekvence, kterou sám plníš, výsledky se vracejí jako druhá sekvence a obě obvykle běží v různých úlohách. Analyzátor přijímá vždy jednu vstupní sekvenci. Každý buffer i výsledek má časový kód vůči vlastní časové ose zvuku, takže lze výsledek vrátit tam, odkud pochází.

Schéma Apple z WWDC25 znázorňující souběh SpeechAnalyzer: vstupní úloha předává vstupní AsyncSequence do SpeechAnalyzer a SpeechTranscriber v analytické úloze, které posílají výslednou AsyncSequence výsledkové úloze a uživatelskému rozhraní

Jedna relace, tři úlohy: zvuk přichází jako AsyncSequence, SpeechAnalyzer a SpeechTranscriber ho analyzují a výsledky se vracejí jako druhá AsyncSequence, kterou čte rozhraní. Zdroj: Apple, přednáška 277 z WWDC25.

Výsledky přicházejí dvakrát. Cokoli uvnitř oblasti, kterou Apple označuje jako proměnlivou, lze ještě nahradit lepším výsledkem; vše mimo ni je konečné. Aplikace tak ukazuje hrubý přepis, zatímco ještě mluvíš, a potom ho opraví.

Apple uvádí pět cílů návrhu modelu SpeechTranscriber: dlouhý zvuk, konverzační řeč, vzdálené mluvčí, nízkou latenci a soukromí, tedy běh v zařízení. Využívají ho Poznámky, Diktafon, Deník a shrnutí hovorů.

Snímek Apple z WWDC25 s možnostmi modelu SpeechTranscriber: dlouhý zvuk, konverzační řeč, vzdálení mluvčí, nízká latence, soukromí

Pět cílů návrhu modelu SpeechTranscriber podle Apple. Zdroj: Apple, přednáška 277 z WWDC25.

Modely nejsou součástí žádné aplikace. Stahují se ze serverů Apple přes AssetInventory, systém je ukládá a aktualizuje a aplikace je sdílejí. Nezvětšují velikost stahované aplikace ani paměť jejího procesu a dekódování probíhá mimo volající proces. Kde SpeechTranscriber nemá model pro daný jazyk nebo zařízení, převezme práci DictationTranscriber se stejnými modely jako systémové diktování.

Jak jsme měřili

Každý engine v tomto článku přepsal stejné nahrávky, ve stejném pořadí, vždy po jedné, na M5 MacBook Air (32 GB, macOS 27.0). Zvuk pochází z testovacího splitu Google FLEURS v revizi 70bb2e84, přibližně 150 vět a 30 minut na jazyk. Pevný hash vlastních ID položek datasetu určuje jejich pořadí a my bereme nejkratší posloupnost celých položek, která překročí třicet minut; výstup žádného modelu tento výběr neovlivnil. Každou buňku jsme znovu sestavili z jejího vlastního dokladu a znovu zkontrolovali; všech 285 prošlo.

Skóre je WER tam, kde slova oddělují mezery, a CER pro japonštinu, korejštinu, čínštinu a kantonštinu. FLEURS je čtená řeč, ne porada ani diktování. Tyto tabulky říkají, zda je engine pro tvůj jazyk vůbec použitelný, ne jaký výsledek dostaneš na vlastních nahrávkách.

O kolik je lepší než staré diktování Apple?

Apple dodává dva pracovní režimy přepisu a změřili jsme oba. SpeechTranscriber je nový režim, který v tomto článku nazýváme Apple Speech. DictationTranscriber je režim kompatibility, cesta diktování, kterou Mac používal dřív.

Jazyk Diktování Apple Apple Speech
Korejština 7,11 4,31
Italština 6,93 4,39
Španělština (Latinská Amerika) 8,43 5,41
Němčina 12,69 6,26
Japonština 9,37 6,36
Francouzština 17,10 7,61
Čínština 10,28 7,97
Kantonština 10,18 8,69
Angličtina 13,83 8,80
Portugalština (Brazílie) 10,85 9,35

Všechny jazyky, které oba pracovní režimy Apple změřily bez zkreslení, seřazené podle chybovosti Apple Speech; zeleně je lepší hodnota v řádku. Stejný běh, stejné nahrávky, stejný Mac. CER pro japonštinu, korejštinu, čínštinu a kantonštinu, WER pro zbytek.

Apple Speech je přesnější ve všech deseti jazycích. U mediánového jazyka odstraní přibližně třetinu chyb, u francouzštiny a němčiny více než polovinu a u brazilské portugalštiny a kantonštiny asi jednu chybu ze sedmi.

To je srovnání s vlastní minulostí Apple. Proti modelům, které stahuješ, je jeho nejlepší umístění v jazyce změřeném bez zkreslení druhé místo v kantonštině. Diktování pokrývá víc jazyků: 33 konfigurací proti 21 v tomto běhu, včetně všech tří, které tu novému enginu chybějí.

Co získáš s vestavěným enginem?

Engine Rychlost Špičková paměť Stažení
SenseVoice Small 162,3× rychleji než v reálném čase 0,95 GiB 827 MB
Parakeet V3 75,6× rychleji než v reálném čase 0,09 GiB 465 MB
Apple Speech 30,8× rychleji než v reálném čase neuvedeno jazykový balíček stahuje macOS, ne aplikace
Qwen3-ASR 1.7B 11,1× rychleji než v reálném čase 2,43 GiB asi 2,5 GB
Whisper Small 7,9× rychleji než v reálném čase 0,87 GiB 600 MB
Whisper Large V3 Turbo 3,0× rychleji než v reálném čase 1,87 GiB asi 1,6 GB

Rychlost je medián každého enginu ve třinácti jazycích, které tento článek měří bez zkreslení, a počítají se jen ty, které spustil — propustnost zpracování jednotlivých položek, diagnostika, ne latence produktu. Špičková paměť je maximum skupiny procesů v tomto běhu. Apple Speech dekóduje uvnitř služby macOS, kterou volající aplikace nevlastní, takže by tam žádné číslo neznamenalo totéž jako u ostatních pěti.

Jazykové prostředky Apple Speech stáhne systém jednou a sdílí je každá aplikace. Nic není součástí aplikace a v jejím vlastním procesu se nic nealokuje. Systémová služba při práci paměť pořád používá, ale nedokážeme ji přesně přiřadit, proto tam místo nuly neuvádíme žádné číslo. Běžel 30,8× rychleji než v reálném čase, za Parakeet V3 a SenseVoice Small.

Whisper Large V3 Turbo vyhrává čtyři z deseti řádků a je tady nejpomalejším enginem, zhruba desetkrát pomalejším než Apple Speech, s asi 1,6 GB na disku. Qwen3-ASR 1.7B vyhrává zbývajících šest, za asi 2,5 GB a 2,43 GiB paměti. Parakeet V3 zabírá 465 MB a 0,09 GiB, poráží Turbo ve francouzštině, prohrává s ním v polštině a nemá japonštinu, korejštinu, čínštinu ani kantonštinu. Whisper Small je nejbližší srovnání při 600 MB a Apple Speech byl přesnější v osmi z deseti jazyků změřených bez zkreslení u obou.

Máš použít Apple Speech místo staženého modelu?

Jazyk po jazyku:

  • Angličtina: není to dobrá volba. Apple Speech měl 8,80; Qwen3-ASR 1.7B (4,49) nebo Whisper Large V3 Turbo (5,49) je jednoznačně přesnější.
  • Němčina: není to dobrá volba. Apple Speech měl 6,26; Qwen3-ASR 1.7B (2,85) nebo Whisper Large V3 Turbo (4,05) je jednoznačně přesnější.
  • Nizozemština, ruština a polština: Apple Speech pro tyto tři jazyky nemá model. Whisper Large V3 Turbo byl v každém nejpřesnější, s 5,69, 5,13 a 5,45.
  • Japonština: použitelná. Apple Speech měl 6,36, za Whisper Large V3 Turbo s 5,30.
  • Korejština: použitelná. Apple Speech měl 4,31, za Qwen3-ASR 1.7B s 3,54.
  • Francouzština: není to dobrá volba. Apple Speech měl 7,61; Qwen3-ASR 1.7B (4,57) nebo Parakeet V3 (5,83) je jednoznačně přesnější.
  • Čínština: použitelná. Apple Speech měl 7,97, stejně jako Whisper Large V3 Turbo; nejpřesnější byl Qwen3-ASR 1.7B s 6,49.
  • Španělština: není to dobrá volba. Apple Speech měl 5,41; Qwen3-ASR 1.7B (3,38) nebo Whisper Large V3 Turbo (3,62) je jednoznačně přesnější.

Apple Speech je zkrácený název pro SpeechTranscriber od Apple používaný v tomto článku, API v zařízení, které může každá aplikace pro Mac volat v macOS 26 nebo novějším. Není to jeden z modelů, které stahuje Whisper Notes pro Mac: ve verzi pro přímé stažení pro Mac (DMG) jsou to Whisper, Parakeet V3, SenseVoice a Qwen3-ASR, na iPhonu a ve verzi z Mac App Store pak Whisper, Parakeet V3 a SenseVoice. Tabulku podle enginů najdeš na naší stránce podpory jazyků.

Nic z toho nemění dnešní fungování Whisper Notes pro Mac: Parakeet V3 je stále výchozí.

Často kladené otázky

Je Apple Speech stejně přesný jako Whisper?

Ve většině jazyků, které pokrývají oba, ne. V našem vlastním běhu FLEURS byl mezi sedmi z těchto deseti jazyků podporovaných Apple Speech Whisper Large V3 Turbo přesnější v šesti a v čínštině se oba přesně shodly na 7,97 % CER. Proti Whisper Small se pořadí obrací: Apple Speech vedl v šesti ze sedmi a prohrál jen angličtinu, 8,80 % proti 7,04 % WER. V tomto běhu nevede v žádném jazyce změřeném bez zkreslení a nejblíž je v korejštině, 4,31 % CER proti 3,54 % vítěze řádku. Kantonština je jediný bez zkreslení změřený jazyk, kde porazil Whisper Large V3 Turbo, 8,69 % proti 36,75 % CER. Použij vestavěný engine, když pokrývá tvůj jazyk a raději necháš macOS spravovat jazykový balíček; pro nejpřesnější výsledek nebo když tvůj jazyk patří mezi tři, které tu Apple Speech nemá, použij Whisper Large V3 Turbo.

Které jazyky Apple Speech podporuje?

Seznam určuje macOS, ne aplikace. V tomto běhu vytvořil Apple Speech výsledky ve 21 z 83 testovaných jazykových konfigurací, oba buildy Whisper v 83, Qwen3-ASR 1.7B ve 30 a Parakeet V3 ve 25. Z deseti nejpoužívanějších jazyků v hlavní tabulce má angličtinu, němčinu, japonštinu, korejštinu, francouzštinu, čínštinu a španělštinu, ale ne nizozemštinu, polštinu ani ruštinu. Druhá tabulka obsahuje dalších čtrnáct konfigurací: italštinu, kantonštinu, brazilskou portugalštinu a jedenáct jazyků, kde odpověděl latinskou transliterací místo původního písma. Aplikace se musí za běhu zeptat macOS, které jazyky daný stroj má. Pokud tvůj jazyk chybí, Whisper pokrývá každý jazyk v seznamu aplikace ve všech kanálech.

Apple Speech, nebo Parakeet V3 — co vybrat?

Parakeet V3 v každém evropském jazyce, který pokrývají oba. Měl 6,89 proti 8,80 v angličtině, 5,83 proti 7,61 ve francouzštině, 4,86 proti 5,41 ve španělštině, 3,43 proti 4,39 v italštině a 6,49 proti 9,35 v brazilské portugalštině; v němčině mají oba 6,26. Parakeet V3 nemá japonštinu, korejštinu, čínštinu ani kantonštinu, takže tam je Apple Speech jediný z dvojice, který existuje, a v japonštině, korejštině a čínštině je do 1,5 bodu od vítěze řádku. Parakeet V3 má ke stažení 465 MB a běžel 75,6× rychleji než v reálném čase se špičkou 0,09 GiB; jazykový balíček Apple Speech stahuje macOS a engine běžel 30,8× rychleji než v reálném čase s pamětí, kterou neuvádíme.

Co je SpeechAnalyzer a je to totéž jako diktování Apple?

SpeechAnalyzer je zastřešující API, které Apple představilo na WWDC 2025 a dodalo v macOS 26 a iOS 26. SpeechTranscriber je pracovní režim přepisu uvnitř něj a právě ten jsme změřili a nazýváme v článku Apple Speech. Diktování je režim kompatibility a spustili jsme i ten: Apple Speech byl přesnější ve všech deseti jazycích, které oba režimy zpracovaly bez zkreslení, odstranil asi třetinu chyb u mediánového jazyka a více než polovinu ve francouzštině a němčině. Diktování pokrývá více jazyků, 33 konfigurací proti 21, takže je systémovým enginem pro nizozemštinu, polštinu nebo ruštinu, pokud přijmeš 17,34 %, 13,50 % a 13,13 % WER. Whisper Large V3 Turbo měl na stejných nahrávkách 5,69 %, 5,45 % a 5,13 %.

Opustí zvuk můj Mac, když použiju Apple Speech?

Apple popisuje SpeechTranscriber jako rozpoznávání řeči v zařízení: macOS jazykové prostředky jednou stáhne a rozpoznávání běží místně. Měřili jsme přesnost a rychlost, ne síťové chování, proto tuto část popisujeme tak jako Apple. Enginy, které Whisper Notes stahuje samo — Whisper, Parakeet V3, SenseVoice a Qwen3-ASR — běží na GPU nebo Neural Engine tvého Macu bez účtu a API key a přepis funguje s vypnutou sítí ve všech kanálech.

Proč tato čísla nesedí s přesností, kterou dostávám na svých nahrávkách?

Protože FLEURS je krátká, čistá, čtená řeč a tvoje nahrávky takové nejsou. Náš běh je kalibrace na veřejném datasetu: zhruba 150 vět a 30 minut zvuku na jazyk, jeden M5 MacBook Air, stejné nahrávky pro každý engine. Říká, zda je engine pro jazyk vůbec použitelný, ne jaký výsledek dostaneš na poradě, v hluku, u řeči s přízvukem nebo u dvouhodinového souboru.

Proč jiné testy říkají, že Apple Speech poráží Whisper?

Srovnávají ho s Whisper Small a jen v angličtině. Náš běh to u Whisper Small potvrzuje: Apple Speech ho porazil v osmi z deseti jazyků, které oba změřily bez zkreslení. Angličtina je jeden ze dvou prohraných, 8,80 proti 7,04. Na Whisper Large V3 Turbo se to nepřenáší: tomu Apple Speech podlehl v osmi z týchž deseti jazyků, v čínštině se s ním shodl na 7,97 a vedl jen v kantonštině. O titulku rozhoduje to, který Whisper je ve srovnání.

Vyzkoušej to

Všech pět stahovaných modelů — Whisper Small, Whisper Large V3 Turbo, Parakeet V3, SenseVoice Small a Qwen3-ASR 1.7B — je v přímém stažení Whisper Notes pro Mac (DMG) v Nastavení → Model přepisu.

Pokud naše čísla nesedí s tvou zkušeností v nějakém jazyce, napiš na mac@whispernotes.app. Kompletní poznámky k vydání: whispernotes.app/changelog.

Zdroje: náš běh na testovacím splitu Google FLEURS v revizi 70bb2e84, dokumentace Apple k SpeechAnalyzer a předchozí běh Qwen3-ASR ve třiceti jazycích.