Apple Speech vs Whisper: koliko je dobar novi SpeechAnalyzer?

1. rujna 2026.
·
8 min read
·Whisper Notes Team

Od sustava macOS 26 i iOS 26 Apple isporučuje novu generaciju prepoznavanja govora na uređaju — SpeechAnalyzer i SpeechTranscriber, u nastavku skraćeno Apple Speech. Primjetno je točniji od starog enginea za diktiranje. Zato smo htjeli doznati: je li ugrađeno prepoznavanje govora tvrtke Apple sada dovoljno dobro da u potpunosti preskočiš aplikaciju za transkripciju? I koliko zaostaje za otvorenim modelima na uređaju u Whisper Notesu — Whisper, Parakeet, SenseVoice i Qwen3-ASR? Proveli smo strog test. Ovo su rezultati. Na deset jezika koje smo testirali Apple Speech nijednom nije imao najnižu stopu pogreške, na korejskom, japanskom i kineskom bio je unutar 1,5 boda od vodećeg, a za nizozemski, ruski i poljski uopće nema modela.

Koliko Apple Speech zaostaje za modelima koje preuzimaš?

Jezik Apple Speech Qwen3-ASR Whisper Large Whisper Small Parakeet SenseVoice
Engleski 8,80 4,49 5,49 7,04 6,89 8,46
Njemački 6,26 2,85 4,05 8,67 6,26
Nizozemski 7,36 5,69 16,75 8,58
Ruski 5,65 5,13 11,37 7,12
Poljski 12,59 5,45 15,81 8,30
Japanski 6,36 5,74 5,30 11,37 6,78
Korejski 4,31 3,54 4,25 7,30 7,85
Francuski 7,61 4,57 5,97 13,24 5,83
Kineski 7,97 6,49 7,97 20,50 7,69
Španjolski (Latinska Amerika) 5,41 3,38 3,62 6,22 4,86

Deset među najčešće korištenim jezicima, jedan engine po stupcu. Svaka ćelija prikazuje stopu pogreške tog enginea — niže je bolje; zeleno označava najnižu vrijednost u retku, bijelo drugu najnižu. CER za japanski, korejski i kineski, WER za ostale; nikad ih ne spajamo u jedan broj. Naše vlastito mjerenje na FLEURS-u, koje je proveo tim Whisper Notes, na jednom M5 MacBook Airu, čitani govor.

Skraćeni nazivi: Qwen3-ASR = Qwen3-ASR 1.7B, Whisper Large = Whisper Large V3 Turbo, Parakeet = Parakeet V3, SenseVoice = SenseVoice Small. Crtica znači da engine nema model za taj jezik.

Qwen3-ASR 1.7B ima najnižu stopu pogreške u šest od deset jezika, a Whisper Large V3 Turbo u preostala četiri. Apple Speech zaostaje za vodećim u retku 0,77 boda na korejskom, 1,06 na japanskom i 1,48 na kineskom, gdje je izjednačen s Whisper Large V3 Turbo na 7,97. Na sedam podržanih jezika zaostaje za vodećim od 0,8 do 4,3 boda, najviše na engleskom: 8,80 naspram 4,49. Za nizozemski, poljski i ruski nema rezultata Apple Speech.

Koje jezike podržava Apple Speech?

U ovom je mjerenju Apple Speech vratio rezultate za 21 od 83 jezične konfiguracije. Oba modela Whisper pokrivaju svih 83, Qwen3-ASR 1.7B pokriva 30, a Parakeet V3 25. Od deset jezika gore nema model za nizozemski, poljski ni ruski. Ne postoji fiksni popis koji bi se mogao navesti: jezični resursi pripadaju sustavu macOS, pa aplikacija tijekom rada pita što je dostupno na određenom računalu.

Jezik Apple Speech Qwen3-ASR Whisper Large Whisper Small Parakeet SenseVoice
Talijanski 4,39 2,58 2,58 7,64 3,43
Kantonski 8,69 6,44 36,75 119,01 37,23
Portugalski (Brazil) 9,35 5,17 5,44 8,61 6,49
Hindi 101,50 13,19 29,64 61,26
Telugu 101,63 81,74 103,19
Urdu 101,69 23,39 38,83
Pandžapski 101,75 92,05 103,40
Bengalski 102,00 83,52 117,37
Nepalski 102,13 88,59 118,84
Malajalamski 102,18 107,34 167,16
Marathi 102,23 82,69 109,95
Kannada 103,83 72,07 116,10
Gudžaratski 104,52 75,31 108,91
Tamilski 113,01 71,28 79,77

Ostalih četrnaest jezika za koje je Apple Speech vratio rezultat, poredanih prema njegovoj stopi pogreške. Stupci, boje i skraćeni nazivi isti su kao gore; CER za kantonski, WER za ostale. Stopa pogreške može prijeći 100 % jer se i umetanja računaju u brojnik.

U posljednjih jedanaest redaka, od hindija do tamilskog, Apple Speech odgovorio je latiničnom transliteracijom umjesto izvornim pismom. Njegova stopa pogreške ondje zato mjeri nepodudaranje pisama, a ne točnost prepoznavanja, pa su te ćelije izostavljene iz poretka retka; vrijednosti drugih enginea u tim recima obična su mjerenja.

Kako radi SpeechAnalyzer

Apple ima API za prepoznavanje govora još od iOS-a 10. Taj prijašnji, SFSpeechRecognizer, engine je iza starog puta diktiranja. SpeechAnalyzer ga zamjenjuje: uveden je u sustavima macOS 26 i iOS 26 te je dostupan na svim platformama Apple osim watchOS-a.

API je izgrađen oko sesije. Stvoriš SpeechAnalyzer, predaš mu jedan ili više modula i dovodiš zvuk; SpeechTranscriber je modul koji govor pretvara u tekst. Zvuk ulazi kao asinkroni slijed koji sam puniš, rezultati se vraćaju kao drugi, a ta dva slijeda obično rade u različitim zadacima. Analizator prima jedan ulazni slijed odjednom. Svaki međuspremnik i rezultat imaju vremensku oznaku prema vlastitoj vremenskoj crti zvuka, pa se rezultat može vratiti na mjesto s kojeg je došao.

Dijagram Apple s WWDC25 o istodobnom radu SpeechAnalyzer: ulazni zadatak predaje ulaznu AsyncSequence u SpeechAnalyzer i SpeechTranscriber u zadatku analize, koji šalju AsyncSequence rezultata zadatku rezultata i korisničkom sučelju

Jedna sesija, tri zadatka: zvuk ulazi kao AsyncSequence, SpeechAnalyzer i SpeechTranscriber ga analiziraju, a rezultati se vraćaju kao druga AsyncSequence koju čita sučelje. Izvor: Apple, sesija WWDC25 277.

Rezultati stižu dvaput. Sve unutar raspona koji Apple naziva promjenjivim još se može zamijeniti boljim rezultatom; sve izvan njega konačno je. Tako aplikacija prikazuje grubu transkripciju dok još govoriš i poslije je ispravlja.

Apple navodi pet projektnih ciljeva za model SpeechTranscriber: dug zvuk, razgovorni govor, udaljene govornike, malu latenciju i privatnost, što znači da radi na uređaju. Na njemu se temelje Bilješke, Diktafon, Dnevnik i sažeci poziva.

Slajd Apple s WWDC25 s mogućnostima modela SpeechTranscriber: dug zvuk, razgovorni govor, udaljeni govornici, mala latencija, privatnost

Pet projektnih ciljeva modela SpeechTranscriber koje navodi Apple. Izvor: Apple, sesija WWDC25 277.

Modeli nisu dio nijedne aplikacije. Preuzimaju se s poslužitelja Apple preko AssetInventory, sustav ih pohranjuje i ažurira, a aplikacije ih dijele. Ne povećavaju veličinu preuzimanja aplikacije ni memoriju njezina procesa, a dekodiranje se odvija izvan procesa koji ih poziva. Gdje SpeechTranscriber nema model za jezik ili uređaj, rad preuzima DictationTranscriber s istim modelima kao sistemsko diktiranje.

Kako smo mjerili

Svaki engine u ovom tekstu transkribirao je iste isječke, istim redoslijedom, jedan po jedan, na M5 MacBook Airu (32 GB, macOS 27.0). Zvuk je iz testnog dijela skupa Google FLEURS u reviziji 70bb2e84, oko 150 rečenica i 30 minuta po jeziku. Fiksni sažetak vlastitih ID-jeva stavki skupa podataka određuje njihov redoslijed, a uzimamo najkraći niz cijelih stavki koji prelazi trideset minuta; nijedan izlaz modela nije utjecao na taj odabir. Svaku smo ćeliju ponovno izgradili iz njezine potvrde i ponovno provjerili; svih 285 prošlo je provjeru.

Rezultati su WER gdje su riječi odvojene razmacima i CER za japanski, korejski, kineski i kantonski. FLEURS je čitani govor, ne sastanak ni diktiranje. Ove tablice govore je li engine uvjerljiv kandidat za tvoj jezik, a ne kakav ćeš rezultat dobiti na vlastitim snimkama.

Koliko je bolji od starog diktiranja Apple?

Apple isporučuje dvije radne točke transkripcije i izmjerili smo obje. SpeechTranscriber je nova, ona koju ovaj tekst naziva Apple Speech. DictationTranscriber kompatibilna je radna točka, put diktiranja koji je Mac imao prije nje.

Jezik Diktiranje Apple Apple Speech
Korejski 7,11 4,31
Talijanski 6,93 4,39
Španjolski (Latinska Amerika) 8,43 5,41
Njemački 12,69 6,26
Japanski 9,37 6,36
Francuski 17,10 7,61
Kineski 10,28 7,97
Kantonski 10,18 8,69
Engleski 13,83 8,80
Portugalski (Brazil) 10,85 9,35

Svi jezici koje su obje radne točke Apple izmjerile bez smetnji, poredani prema stopi pogreške Apple Speech; zeleno označava bolju vrijednost u retku. Isto mjerenje, isti isječci, isti Mac. CER za japanski, korejski, kineski i kantonski, WER za ostale.

Apple Speech točniji je na svih deset. U medijanskom jeziku uklanja oko trećine pogrešaka, u francuskom i njemačkom više od polovice, a u brazilskom portugalskom i kantonskom oko jedne pogreške od sedam.

To je usporedba s vlastitom prošlošću tvrtke Apple. U odnosu na modele koje preuzimaš, njegov najbolji plasman na jeziku izmjerenom bez smetnji drugo je mjesto na kantonskom. Diktiranje pokriva više jezika: 33 konfiguracije naspram 21 u ovom mjerenju, uključujući sva tri jezika koja ovdje nedostaju novom engineu.

Što dobivaš s ugrađenim engineom?

Engine Brzina Vršno zauzeće memorije Preuzimanje
SenseVoice Small 162,3× brže od stvarnog vremena 0,95 GiB 827 MB
Parakeet V3 75,6× brže od stvarnog vremena 0,09 GiB 465 MB
Apple Speech 30,8× brže od stvarnog vremena nije navedeno jezični paket preuzima macOS, ne aplikacija
Qwen3-ASR 1.7B 11,1× brže od stvarnog vremena 2,43 GiB oko 2,5 GB
Whisper Small 7,9× brže od stvarnog vremena 0,87 GiB 600 MB
Whisper Large V3 Turbo 3,0× brže od stvarnog vremena 1,87 GiB oko 1,6 GB

Brzina je medijan svakog enginea kroz trinaest jezika koje ovaj tekst mjeri bez smetnji, računajući samo one koje je pokrenuo — propusnost obrade pojedinačnih stavki, dijagnostička mjera, a ne latencija proizvoda. Vršno zauzeće memorije vrh je grupe procesa u ovom mjerenju. Apple Speech dekodira unutar usluge macOS koja nije u vlasništvu aplikacije koja je poziva, pa ondje nijedna brojka ne bi značila isto što i za ostalih pet.

Jezične resurse Apple Speech sustav preuzima jednom i dijeli ih svaka aplikacija. Ništa nije dio aplikacije niti se išta dodjeljuje u njezinu vlastitom procesu. Sistemska usluga i dalje koristi memoriju dok radi, ali to ne možemo točno pripisati, pa ondje umjesto nule ne navodimo nikakav broj. Radio je 30,8× brže od stvarnog vremena, iza Parakeet V3 i SenseVoice Small.

Whisper Large V3 Turbo osvaja četiri od deset redaka i ovdje je najsporiji engine, oko deset puta sporiji od Apple Speech, za oko 1,6 GB na disku. Qwen3-ASR 1.7B osvaja ostalih šest, za oko 2,5 GB i 2,43 GiB memorije. Parakeet V3 zauzima 465 MB i 0,09 GiB, vodi ispred Turba na francuskom, zaostaje za njim na poljskom i nema japanski, korejski, kineski ni kantonski. Whisper Small najbliža je usporedba na 600 MB, a Apple Speech bio je točniji na osam od deset jezika izmjerenih bez smetnji za oba.

Trebaš li koristiti Apple Speech umjesto preuzetog modela?

Jezik po jezik:

  • Engleski: nije dobar izbor. Apple Speech postigao je 8,80; Qwen3-ASR 1.7B (4,49) ili Whisper Large V3 Turbo (5,49) očito je točniji.
  • Njemački: nije dobar izbor. Apple Speech postigao je 6,26; Qwen3-ASR 1.7B (2,85) ili Whisper Large V3 Turbo (4,05) očito je točniji.
  • Nizozemski, ruski i poljski: Apple Speech nema model za ta tri jezika. Whisper Large V3 Turbo bio je najtočniji na svakom, s 5,69, 5,13 i 5,45.
  • Japanski: upotrebljiv. Apple Speech postigao je 6,36, iza Whisper Large V3 Turbo s 5,30.
  • Korejski: upotrebljiv. Apple Speech postigao je 4,31, iza Qwen3-ASR 1.7B s 3,54.
  • Francuski: nije dobar izbor. Apple Speech postigao je 7,61; Qwen3-ASR 1.7B (4,57) ili Parakeet V3 (5,83) očito je točniji.
  • Kineski: upotrebljiv. Apple Speech postigao je 7,97, izjednačen s Whisper Large V3 Turbo; najtočniji je bio Qwen3-ASR 1.7B s 6,49.
  • Španjolski: nije dobar izbor. Apple Speech postigao je 5,41; Qwen3-ASR 1.7B (3,38) ili Whisper Large V3 Turbo (3,62) očito je točniji.

Apple Speech skraćeni je naziv za SpeechTranscriber tvrtke Apple koji se koristi u ovom tekstu, API na uređaju koji svaka aplikacija za Mac može pozvati na sustavu macOS 26 ili novijem. Nije jedan od modela koje preuzima Whisper Notes za Mac: u verziji za izravno preuzimanje za Mac (DMG) to su Whisper, Parakeet V3, SenseVoice i Qwen3-ASR, a na iPhoneu i u verziji iz Mac App Storea Whisper, Parakeet V3 i SenseVoice. Tablica po engineima nalazi se na našoj stranici podrške za jezike.

Ništa od toga ne mijenja kako Whisper Notes za Mac radi danas: Parakeet V3 i dalje je zadani.

Često postavljana pitanja

Je li Apple Speech jednako točan kao Whisper?

Ne na većini jezika koje oba pokrivaju. U našem vlastitom mjerenju na FLEURS-u, među sedam od ovih deset jezika koje Apple Speech podržava, Whisper Large V3 Turbo bio je točniji na šest, a na kineskom su se točno podudarali na 7,97 % CER. U odnosu na Whisper Small redoslijed se obrće: Apple Speech bio je ispred na šest od sedam i izgubio je samo engleski, 8,80 % naspram 7,04 % WER. U ovom mjerenju ne vodi ni na jednom jeziku izmjerenom bez smetnji, a najbliži je na korejskom, 4,31 % CER naspram 3,54 % vodećeg u retku. Kantonski je jedini jezik izmjeren bez smetnji na kojem je bio bolji od Whisper Large V3 Turbo, 8,69 % naspram 36,75 % CER. Koristi ugrađeni engine kad podržava tvoj jezik i radije bi prepustio sustavu macOS upravljanje jezičnim paketom; za najtočniji rezultat ili kad je tvoj jezik jedan od tri koja ovdje nedostaju Apple Speech koristi Whisper Large V3 Turbo.

Koje jezike podržava Apple Speech?

Popis određuje macOS, ne aplikacija. U ovom je mjerenju Apple Speech dao rezultate u 21 od 83 testirane jezične konfiguracije, oba izdanja Whisper u 83, Qwen3-ASR 1.7B u 30, a Parakeet V3 u 25. Od deset najčešće korištenih jezika u glavnoj tablici ima engleski, njemački, japanski, korejski, francuski, kineski i španjolski, ali nema nizozemski, poljski ni ruski. Druga tablica sadrži ostalih četrnaest konfiguracija: talijanski, kantonski, brazilski portugalski i jedanaest jezika na kojima je odgovorio latiničnom transliteracijom umjesto izvornim pismom. Aplikacija tijekom rada mora pitati macOS koje jezike određeno računalo ima. Ako tvoj jezik nedostaje, Whisper pokriva svaki jezik na popisu aplikacije na svakom kanalu.

Apple Speech ili Parakeet V3 — koji odabrati?

Parakeet V3 na svakom europskom jeziku koji oba pokrivaju. Postigao je 6,89 naspram 8,80 na engleskom, 5,83 naspram 7,61 na francuskom, 4,86 naspram 5,41 na španjolskom, 3,43 naspram 4,39 na talijanskom i 6,49 naspram 9,35 na brazilskom portugalskom; na njemačkom su oba na 6,26. Parakeet V3 nema japanski, korejski, kineski ni kantonski, pa je ondje Apple Speech jedini od njih koji postoji, unutar 1,5 boda od vodećeg u retku na japanskom, korejskom i kineskom. Parakeet V3 je preuzimanje od 465 MB i radio je 75,6× brže od stvarnog vremena s vrhom od 0,09 GiB; jezični paket Apple Speech preuzima macOS, a radio je 30,8× brže od stvarnog vremena uz memoriju koju ne navodimo.

Što je SpeechAnalyzer i je li to isto što i diktiranje Apple?

SpeechAnalyzer krovni je API koji je Apple predstavio na WWDC-u 2025 i isporučio u sustavima macOS 26 i iOS 26. SpeechTranscriber je radna točka transkripcije unutar njega i to je ono što smo mjerili i što ovaj tekst naziva Apple Speech. Diktiranje je kompatibilna radna točka, a pokrenuli smo i nju: Apple Speech bio je točniji na svih deset jezika koje su oba obradila bez smetnji, uklonivši oko trećine pogrešaka u medijanskom jeziku i više od polovice u francuskom i njemačkom. Diktiranje pokriva više jezika, 33 konfiguracije naspram 21, pa je sistemski engine za nizozemski, poljski ili ruski ako prihvaćaš 17,34 %, 13,50 % i 13,13 % WER. Whisper Large V3 Turbo na istim je isječcima postigao 5,69 %, 5,45 % i 5,13 %.

Napušta li zvuk moj Mac kad koristim Apple Speech?

Apple opisuje SpeechTranscriber kao prepoznavanje govora na uređaju: macOS jednom preuzima jezične resurse, a prepoznavanje radi lokalno. Mjerili smo točnost i brzinu, ne ponašanje mreže, pa taj dio opisujemo kako ga opisuje Apple. Enginei koje Whisper Notes sam preuzima — Whisper, Parakeet V3, SenseVoice i Qwen3-ASR — rade na GPU-u ili Neural Engineu tvog Maca bez računa i bez API key, a transkripcija radi s isključenom mrežom na svakom kanalu.

Zašto se ove brojke ne podudaraju s točnošću koju dobivam na svojim snimkama?

Zato što je FLEURS kratak, čist, čitani govor, a tvoje snimke nisu. Naše je mjerenje kalibracija na javnom skupu podataka: oko 150 rečenica i 30 minuta zvuka po jeziku, jedan M5 MacBook Air, isti isječci za svaki engine. Govori je li engine uvjerljiv kandidat za jezik, a ne kakav ćeš rezultat dobiti na sastanku, bučnom zvuku, govoru s naglaskom ili dvosatnoj datoteci.

Zašto druga mjerenja kažu da je Apple Speech bolji od Whispera?

Uspoređuju ga s Whisper Small, i to samo na engleskom. Naše se mjerenje za Whisper Small s tim slaže: Apple Speech bio je bolji na osam od deset jezika koje su oba izmjerila bez smetnji. Engleski je jedan od dva koja je izgubio, 8,80 naspram 7,04. Na Whisper Large V3 Turbo se to ne prenosi: za njim je Apple Speech zaostao na osam od tih deset jezika, izjednačio se na kineskom na 7,97 i bio bolji samo na kantonskom. Naslov ovisi o tome koji je Whisper u usporedbi.

Isprobaj

Svih pet modela za preuzimanje — Whisper Small, Whisper Large V3 Turbo, Parakeet V3, SenseVoice Small i Qwen3-ASR 1.7B — nalazi se u izravnom preuzimanju Whisper Notes za Mac (DMG) u Postavkama → Model transkripcije.

Ako se naše brojke ne podudaraju s tvojim iskustvom na nekom jeziku, piši na mac@whispernotes.app. Potpune bilješke o izdanju: whispernotes.app/changelog.

Izvori: naše mjerenje na testnom dijelu skupa Google FLEURS u reviziji 70bb2e84, dokumentacija Apple za SpeechAnalyzer i prethodno mjerenje Qwen3-ASR na trideset jezika.