Apple Speech vs Whisper: ako dobrý je nový SpeechAnalyzer?

1. septembra 2026
·
8 min read
·Whisper Notes Team

Od macOS 26 a iOS 26 dodáva Apple novú generáciu rozpoznávania reči v zariadení — SpeechAnalyzer a SpeechTranscriber, ďalej skrátene Apple Speech. Je výrazne presnejšia než starý engine diktovania. Chceli sme teda zistiť: je už vstavané rozpoznávanie reči Apple natoľko dobré, že sa úplne zaobídeš bez aplikácie na prepis? A ako ďaleko má k otvoreným modelom bežiacim v zariadení vo Whisper Notes — Whisper, Parakeet, SenseVoice a Qwen3-ASR? Urobili sme prísny test. Tu sú výsledky. V desiatich testovaných jazykoch nemal Apple Speech ani raz najnižšiu chybovosť, v kórejčine, japončine a čínčine bol do 1,5 bodu od víťaza a pre holandčinu, ruštinu a poľštinu nemá model vôbec.

Ako ďaleko má Apple Speech k modelom, ktoré sťahuješ?

Jazyk Apple Speech Qwen3-ASR Whisper Large Whisper Small Parakeet SenseVoice
Angličtina 8,80 4,49 5,49 7,04 6,89 8,46
Nemčina 6,26 2,85 4,05 8,67 6,26
Holandčina 7,36 5,69 16,75 8,58
Ruština 5,65 5,13 11,37 7,12
Poľština 12,59 5,45 15,81 8,30
Japončina 6,36 5,74 5,30 11,37 6,78
Kórejčina 4,31 3,54 4,25 7,30 7,85
Francúzština 7,61 4,57 5,97 13,24 5,83
Čínčina 7,97 6,49 7,97 20,50 7,69
Španielčina (Latinská Amerika) 5,41 3,38 3,62 6,22 4,86

Desať z najpoužívanejších jazykov, jeden engine v každom stĺpci. Každá bunka ukazuje chybovosť daného enginu, nižšie je lepšie; zelenou je najnižšia hodnota v riadku, bielou druhá najnižšia. CER pre japončinu, kórejčinu a čínčinu, WER pre zvyšok; nikdy ich nezlučujeme do jedného čísla. Náš vlastný beh FLEURS, ktorý urobil tím Whisper Notes, na jednom M5 MacBook Air, čítaná reč.

Skrátené názvy: Qwen3-ASR = Qwen3-ASR 1.7B, Whisper Large = Whisper Large V3 Turbo, Parakeet = Parakeet V3, SenseVoice = SenseVoice Small. Pomlčka znamená, že engine nemá model pre daný jazyk.

Qwen3-ASR 1.7B má najnižšiu chybovosť v šiestich z desiatich jazykov, Whisper Large V3 Turbo vo zvyšných štyroch. Apple Speech stráca na víťaza riadka 0,77 bodu v kórejčine, 1,06 v japončine a 1,48 v čínčine, kde sa zhoduje s Whisper Large V3 Turbo na 7,97. V siedmich podporovaných jazykoch stráca na víťaza 0,8 až 4,3 bodu, najviac v angličtine: 8,80 proti 4,49. Pre holandčinu, poľštinu a ruštinu výsledok Apple Speech nie je.

Ktoré jazyky Apple Speech podporuje?

V tomto behu vrátil Apple Speech výsledky pre 21 z 83 jazykových konfigurácií. Oba modely Whisper pokrývajú všetkých 83, Qwen3-ASR 1.7B ich pokrýva 30 a Parakeet V3 25. Z desiatich jazykov vyššie nemá model pre holandčinu, poľštinu ani ruštinu. Neexistuje pevný zoznam, ktorý by sa dal citovať: jazykové prostriedky patria macOS, takže sa aplikácia počas behu pýta, čo je na danom stroji k dispozícii.

Jazyk Apple Speech Qwen3-ASR Whisper Large Whisper Small Parakeet SenseVoice
Taliančina 4,39 2,58 2,58 7,64 3,43
Kantončina 8,69 6,44 36,75 119,01 37,23
Portugalčina (Brazília) 9,35 5,17 5,44 8,61 6,49
Hindčina 101,50 13,19 29,64 61,26
Telugčina 101,63 81,74 103,19
Urdčina 101,69 23,39 38,83
Pandžábčina 101,75 92,05 103,40
Bengálčina 102,00 83,52 117,37
Nepálčina 102,13 88,59 118,84
Malajálamčina 102,18 107,34 167,16
Maráthčina 102,23 82,69 109,95
Kannadčina 103,83 72,07 116,10
Gudžarátčina 104,52 75,31 108,91
Tamilčina 113,01 71,28 79,77

Ďalších štrnásť jazykov, pre ktoré Apple Speech vrátil výsledok, zoradených podľa jeho vlastnej chybovosti. Stĺpce, farby a skrátené názvy sú rovnaké ako vyššie; CER pre kantončinu, WER pre zvyšok. Chybovosť môže prekročiť 100 %, pretože sa do čitateľa započítavajú aj vložené prvky.

V posledných jedenástich riadkoch, od hindčiny po tamilčinu, odpovedal Apple Speech latinskou transliteráciou namiesto pôvodného písma. Jeho chybovosť tam preto meria nesúlad písem, nie presnosť rozpoznávania, a tieto bunky sa do poradia riadka nepočítajú; hodnoty ostatných enginov v týchto riadkoch sú bežné merania.

Ako funguje SpeechAnalyzer

Apple má API na rozpoznávanie reči už od iOS 10. Pôvodný SFSpeechRecognizer je engine za starou cestou diktovania. SpeechAnalyzer ho nahrádza: bol uvedený v macOS 26 a iOS 26 a je dostupný na každej platforme Apple okrem watchOS.

API je postavené okolo relácie. Vytvoríš SpeechAnalyzer, odovzdáš mu jeden alebo viac modulov a privádzaš zvuk; SpeechTranscriber je modul, ktorý prevádza reč na text. Zvuk prichádza ako asynchrónna sekvencia, ktorú sám napĺňaš, výsledky sa vracajú ako druhá sekvencia a obe zvyčajne bežia v rôznych úlohách. Analyzátor prijíma vždy jednu vstupnú sekvenciu. Každý buffer aj výsledok má časový kód voči vlastnej časovej osi zvuku, takže možno výsledok vrátiť tam, odkiaľ pochádza.

Schéma Apple z WWDC25 znázorňujúca súbeh SpeechAnalyzer: vstupná úloha odovzdáva vstupnú AsyncSequence do SpeechAnalyzer a SpeechTranscriber v analytickej úlohe, ktoré posielajú výslednú AsyncSequence výsledkovej úlohe a používateľskému rozhraniu

Jedna relácia, tri úlohy: zvuk prichádza ako AsyncSequence, SpeechAnalyzer a SpeechTranscriber ho analyzujú a výsledky sa vracajú ako druhá AsyncSequence, ktorú číta rozhranie. Zdroj: Apple, prednáška 277 z WWDC25.

Výsledky prichádzajú dvakrát. Čokoľvek v oblasti, ktorú Apple označuje ako premenlivú, možno ešte nahradiť lepším výsledkom; všetko mimo nej je konečné. Aplikácia tak ukazuje hrubý prepis, kým ešte hovoríš, a potom ho opraví.

Apple uvádza päť cieľov návrhu modelu SpeechTranscriber: dlhý zvuk, konverzačnú reč, vzdialených hovoriacich, nízku latenciu a súkromie, teda beh v zariadení. Využívajú ho Poznámky, Diktafón, Denník a súhrny hovorov.

Snímka Apple z WWDC25 s možnosťami modelu SpeechTranscriber: dlhý zvuk, konverzačná reč, vzdialení hovoriaci, nízka latencia, súkromie

Päť cieľov návrhu modelu SpeechTranscriber podľa Apple. Zdroj: Apple, prednáška 277 z WWDC25.

Modely nie sú súčasťou žiadnej aplikácie. Sťahujú sa zo serverov Apple cez AssetInventory, systém ich ukladá a aktualizuje a aplikácie ich zdieľajú. Nezväčšujú veľkosť sťahovanej aplikácie ani pamäť jej procesu a dekódovanie prebieha mimo volajúceho procesu. Kde SpeechTranscriber nemá model pre daný jazyk alebo zariadenie, prevezme prácu DictationTranscriber s rovnakými modelmi ako systémové diktovanie.

Ako sme merali

Každý engine v tomto článku prepísal tie isté nahrávky, v tom istom poradí, vždy po jednej, na M5 MacBook Air (32 GB, macOS 27.0). Zvuk pochádza z testovacieho splitu Google FLEURS v revízii 70bb2e84, približne 150 viet a 30 minút na jazyk. Pevný hash vlastných ID položiek datasetu určuje ich poradie a my berieme najkratšiu postupnosť celých položiek, ktorá prekročí tridsať minút; výstup žiadneho modelu tento výber neovplyvnil. Každú bunku sme znovu zostavili z jej vlastného dokladu a znova skontrolovali; všetkých 285 prešlo.

Skóre je WER tam, kde slová oddeľujú medzery, a CER pre japončinu, kórejčinu, čínčinu a kantončinu. FLEURS je čítaná reč, nie porada ani diktovanie. Tieto tabuľky hovoria, či je engine pre tvoj jazyk vôbec použiteľný, nie aký výsledok dostaneš na vlastných nahrávkach.

O koľko je lepší než staré diktovanie Apple?

Apple dodáva dva pracovné režimy prepisu a zmerali sme oba. SpeechTranscriber je nový režim, ktorý v tomto článku nazývame Apple Speech. DictationTranscriber je režim kompatibility, cesta diktovania, ktorú Mac používal predtým.

Jazyk Diktovanie Apple Apple Speech
Kórejčina 7,11 4,31
Taliančina 6,93 4,39
Španielčina (Latinská Amerika) 8,43 5,41
Nemčina 12,69 6,26
Japončina 9,37 6,36
Francúzština 17,10 7,61
Čínčina 10,28 7,97
Kantončina 10,18 8,69
Angličtina 13,83 8,80
Portugalčina (Brazília) 10,85 9,35

Všetky jazyky, ktoré oba pracovné režimy Apple zmerali bez skreslenia, zoradené podľa chybovosti Apple Speech; zelenou je lepšia hodnota v riadku. Rovnaký beh, rovnaké nahrávky, rovnaký Mac. CER pre japončinu, kórejčinu, čínčinu a kantončinu, WER pre zvyšok.

Apple Speech je presnejší vo všetkých desiatich jazykoch. Pri mediánovom jazyku odstráni približne tretinu chýb, pri francúzštine a nemčine viac než polovicu a pri brazílskej portugalčine a kantončine asi jednu chybu zo siedmich.

To je porovnanie s vlastnou minulosťou Apple. Proti modelom, ktoré sťahuješ, je jeho najlepšie umiestnenie v jazyku zmeranom bez skreslenia druhé miesto v kantončine. Diktovanie pokrýva viac jazykov: 33 konfigurácií proti 21 v tomto behu vrátane všetkých troch, ktoré tu novému enginu chýbajú.

Čo získaš so vstavaným enginom?

Engine Rýchlosť Špičková pamäť Stiahnutie
SenseVoice Small 162,3× rýchlejšie než v reálnom čase 0,95 GiB 827 MB
Parakeet V3 75,6× rýchlejšie než v reálnom čase 0,09 GiB 465 MB
Apple Speech 30,8× rýchlejšie než v reálnom čase neuvedené jazykový balík sťahuje macOS, nie aplikácia
Qwen3-ASR 1.7B 11,1× rýchlejšie než v reálnom čase 2,43 GiB asi 2,5 GB
Whisper Small 7,9× rýchlejšie než v reálnom čase 0,87 GiB 600 MB
Whisper Large V3 Turbo 3,0× rýchlejšie než v reálnom čase 1,87 GiB asi 1,6 GB

Rýchlosť je medián každého enginu v trinástich jazykoch, ktoré tento článok meria bez skreslenia, a počítajú sa len tie, ktoré spustil — priepustnosť spracovania jednotlivých položiek, diagnostika, nie latencia produktu. Špičková pamäť je maximum skupiny procesov v tomto behu. Apple Speech dekóduje v službe macOS, ktorú volajúca aplikácia nevlastní, takže by tam žiadne číslo neznamenalo to isté ako pri ostatných piatich.

Jazykové prostriedky Apple Speech stiahne systém raz a zdieľa ich každá aplikácia. Nič nie je súčasťou aplikácie a v jej vlastnom procese sa nič nealokuje. Systémová služba pri práci stále používa pamäť, ale nedokážeme ju presne priradiť, preto tam namiesto nuly neuvádzame žiadne číslo. Bežal 30,8× rýchlejšie než v reálnom čase, za Parakeet V3 a SenseVoice Small.

Whisper Large V3 Turbo vyhráva štyri z desiatich riadkov a je tu najpomalším enginom, zhruba desaťkrát pomalším než Apple Speech, s asi 1,6 GB na disku. Qwen3-ASR 1.7B vyhráva zvyšných šesť, za asi 2,5 GB a 2,43 GiB pamäte. Parakeet V3 zaberá 465 MB a 0,09 GiB, poráža Turbo vo francúzštine, prehráva s ním v poľštine a nemá japončinu, kórejčinu, čínčinu ani kantončinu. Whisper Small je najbližšie porovnanie pri 600 MB a Apple Speech bol presnejší v ôsmich z desiatich jazykov zmeraných bez skreslenia pri oboch.

Máš použiť Apple Speech namiesto stiahnutého modelu?

Jazyk po jazyku:

  • Angličtina: nie je to dobrá voľba. Apple Speech mal 8,80; Qwen3-ASR 1.7B (4,49) alebo Whisper Large V3 Turbo (5,49) je jednoznačne presnejší.
  • Nemčina: nie je to dobrá voľba. Apple Speech mal 6,26; Qwen3-ASR 1.7B (2,85) alebo Whisper Large V3 Turbo (4,05) je jednoznačne presnejší.
  • Holandčina, ruština a poľština: Apple Speech pre tieto tri jazyky nemá model. Whisper Large V3 Turbo bol v každom najpresnejší, s 5,69, 5,13 a 5,45.
  • Japončina: použiteľná. Apple Speech mal 6,36, za Whisper Large V3 Turbo s 5,30.
  • Kórejčina: použiteľná. Apple Speech mal 4,31, za Qwen3-ASR 1.7B s 3,54.
  • Francúzština: nie je to dobrá voľba. Apple Speech mal 7,61; Qwen3-ASR 1.7B (4,57) alebo Parakeet V3 (5,83) je jednoznačne presnejší.
  • Čínčina: použiteľná. Apple Speech mal 7,97, rovnako ako Whisper Large V3 Turbo; najpresnejší bol Qwen3-ASR 1.7B s 6,49.
  • Španielčina: nie je to dobrá voľba. Apple Speech mal 5,41; Qwen3-ASR 1.7B (3,38) alebo Whisper Large V3 Turbo (3,62) je jednoznačne presnejší.

Apple Speech je skrátený názov pre SpeechTranscriber od Apple používaný v tomto článku, API v zariadení, ktoré môže každá aplikácia pre Mac volať v macOS 26 alebo novšom. Nie je to jeden z modelov, ktoré sťahuje Whisper Notes pre Mac: vo verzii na priame stiahnutie pre Mac (DMG) sú to Whisper, Parakeet V3, SenseVoice a Qwen3-ASR, na iPhone a vo verzii z Mac App Store potom Whisper, Parakeet V3 a SenseVoice. Tabuľku podľa enginov nájdeš na našej stránke podpory jazykov.

Nič z toho nemení dnešné fungovanie Whisper Notes pre Mac: Parakeet V3 je stále predvolený.

Často kladené otázky

Je Apple Speech rovnako presný ako Whisper?

Vo väčšine jazykov, ktoré pokrývajú oba, nie. V našom vlastnom behu FLEURS bol medzi siedmimi z týchto desiatich jazykov podporovaných Apple Speech Whisper Large V3 Turbo presnejší v šiestich a v čínčine sa oba presne zhodli na 7,97 % CER. Proti Whisper Small sa poradie obracia: Apple Speech viedol v šiestich zo siedmich a prehral len angličtinu, 8,80 % proti 7,04 % WER. V tomto behu nevedie v žiadnom jazyku zmeranom bez skreslenia a najbližšie je v kórejčine, 4,31 % CER proti 3,54 % víťaza riadka. Kantončina je jediný bez skreslenia zmeraný jazyk, kde porazil Whisper Large V3 Turbo, 8,69 % proti 36,75 % CER. Použi vstavaný engine, keď pokrýva tvoj jazyk a radšej necháš macOS spravovať jazykový balík; pre najpresnejší výsledok alebo keď tvoj jazyk patrí medzi tri, ktoré tu Apple Speech nemá, použi Whisper Large V3 Turbo.

Ktoré jazyky Apple Speech podporuje?

Zoznam určuje macOS, nie aplikácia. V tomto behu vytvoril Apple Speech výsledky v 21 z 83 testovaných jazykových konfigurácií, oba buildy Whisper v 83, Qwen3-ASR 1.7B v 30 a Parakeet V3 v 25. Z desiatich najpoužívanejších jazykov v hlavnej tabuľke má angličtinu, nemčinu, japončinu, kórejčinu, francúzštinu, čínčinu a španielčinu, ale nie holandčinu, poľštinu ani ruštinu. Druhá tabuľka obsahuje ďalších štrnásť konfigurácií: taliančinu, kantončinu, brazílsku portugalčinu a jedenásť jazykov, kde odpovedal latinskou transliteráciou namiesto pôvodného písma. Aplikácia sa musí počas behu opýtať macOS, ktoré jazyky daný stroj má. Ak tvoj jazyk chýba, Whisper pokrýva každý jazyk v zozname aplikácie vo všetkých kanáloch.

Apple Speech alebo Parakeet V3 — čo vybrať?

Parakeet V3 v každom európskom jazyku, ktorý pokrývajú oba. Mal 6,89 proti 8,80 v angličtine, 5,83 proti 7,61 vo francúzštine, 4,86 proti 5,41 v španielčine, 3,43 proti 4,39 v taliančine a 6,49 proti 9,35 v brazílskej portugalčine; v nemčine majú oba 6,26. Parakeet V3 nemá japončinu, kórejčinu, čínčinu ani kantončinu, takže tam je Apple Speech jediný z dvojice, ktorý existuje, a v japončine, kórejčine a čínčine je do 1,5 bodu od víťaza riadka. Parakeet V3 má na stiahnutie 465 MB a bežal 75,6× rýchlejšie než v reálnom čase so špičkou 0,09 GiB; jazykový balík Apple Speech sťahuje macOS a engine bežal 30,8× rýchlejšie než v reálnom čase s pamäťou, ktorú neuvádzame.

Čo je SpeechAnalyzer a je to to isté ako diktovanie Apple?

SpeechAnalyzer je zastrešujúce API, ktoré Apple predstavilo na WWDC 2025 a dodalo v macOS 26 a iOS 26. SpeechTranscriber je pracovný režim prepisu v ňom a práve ten sme zmerali a v článku nazývame Apple Speech. Diktovanie je režim kompatibility a spustili sme aj ten: Apple Speech bol presnejší vo všetkých desiatich jazykoch, ktoré oba režimy spracovali bez skreslenia, odstránil asi tretinu chýb pri mediánovom jazyku a viac než polovicu vo francúzštine a nemčine. Diktovanie pokrýva viac jazykov, 33 konfigurácií proti 21, takže je systémovým enginom pre holandčinu, poľštinu alebo ruštinu, ak prijmeš 17,34 %, 13,50 % a 13,13 % WER. Whisper Large V3 Turbo mal na rovnakých nahrávkach 5,69 %, 5,45 % a 5,13 %.

Opustí zvuk môj Mac, keď použijem Apple Speech?

Apple opisuje SpeechTranscriber ako rozpoznávanie reči v zariadení: macOS jazykové prostriedky raz stiahne a rozpoznávanie beží lokálne. Merali sme presnosť a rýchlosť, nie sieťové správanie, preto túto časť opisujeme tak ako Apple. Enginy, ktoré Whisper Notes sťahuje samo — Whisper, Parakeet V3, SenseVoice a Qwen3-ASR — bežia na GPU alebo Neural Engine tvojho Macu bez účtu a API key a prepis funguje s vypnutou sieťou vo všetkých kanáloch.

Prečo tieto čísla nesedia s presnosťou, ktorú dostávam na svojich nahrávkach?

Pretože FLEURS je krátka, čistá, čítaná reč a tvoje nahrávky také nie sú. Náš beh je kalibrácia na verejnom datasete: zhruba 150 viet a 30 minút zvuku na jazyk, jeden M5 MacBook Air, rovnaké nahrávky pre každý engine. Hovorí, či je engine pre jazyk vôbec použiteľný, nie aký výsledok dostaneš na porade, v hluku, pri reči s prízvukom alebo pri dvojhodinovom súbore.

Prečo iné testy hovoria, že Apple Speech poráža Whisper?

Porovnávajú ho s Whisper Small a len v angličtine. Náš beh to pri Whisper Small potvrdzuje: Apple Speech ho porazil v ôsmich z desiatich jazykov, ktoré oba zmerali bez skreslenia. Angličtina je jeden z dvoch prehraných, 8,80 proti 7,04. Na Whisper Large V3 Turbo sa to neprenáša: tomu Apple Speech podľahol v ôsmich z tých istých desiatich jazykov, v čínčine sa s ním zhodol na 7,97 a viedol len v kantončine. O titulku rozhoduje to, ktorý Whisper je v porovnaní.

Vyskúšaj to

Všetkých päť sťahovaných modelov — Whisper Small, Whisper Large V3 Turbo, Parakeet V3, SenseVoice Small a Qwen3-ASR 1.7B — je v priamom stiahnutí Whisper Notes pre Mac (DMG) v Nastaveniach → Model prepisu.

Ak naše čísla nesedia s tvojou skúsenosťou v nejakom jazyku, napíš na mac@whispernotes.app. Kompletné poznámky k vydaniu: whispernotes.app/changelog.

Zdroje: náš beh na testovacom splite Google FLEURS v revízii 70bb2e84, dokumentácia Apple k SpeechAnalyzer a predchádzajúci beh Qwen3-ASR v tridsiatich jazykoch.