Apple Speech vagy Whisper: mire képes a SpeechAnalyzer?

2026. szeptember 1.
·
8 min read
·Whisper Notes Team

A macOS 26 és az iOS 26 óta az Apple a készüléken futó beszédfelismerés új generációját kínálja: a SpeechAnalyzer és a SpeechTranscriber technológiát, amelyre alább röviden az Apple Speech nevet használjuk. Ez lényegesen pontosabb a régi diktálási motornál. Ezért arra kerestük a választ: elég jó-e már az Apple beépített beszédfelismerése ahhoz, hogy Ön teljesen elhagyhassa az átíróalkalmazást? És mekkora a lemaradása a Whisper Notes készüléken futó nyílt megoldásaihoz — a Whisper, a Parakeet, a SenseVoice és a Qwen3-ASR modelljeihez — képest? Szigorú tesztet végeztünk. Íme az eredmények. Az általunk tesztelt tíz nyelv közül az Apple Speech egyiknél sem érte el a legalacsonyabb hibaarányt, koreainál, japánnál és kínainál 1,5 ponton belül maradt a legjobbhoz képest, hollandhoz, oroszhoz és lengyelhez pedig egyáltalán nincs modellje.

Mekkora az Apple Speech lemaradása a letölthető modellekhez képest?

Nyelv Apple Speech Qwen3-ASR Whisper Large Whisper Small Parakeet SenseVoice
Angol 8,80 4,49 5,49 7,04 6,89 8,46
Német 6,26 2,85 4,05 8,67 6,26
Holland 7,36 5,69 16,75 8,58
Orosz 5,65 5,13 11,37 7,12
Lengyel 12,59 5,45 15,81 8,30
Japán 6,36 5,74 5,30 11,37 6,78
Koreai 4,31 3,54 4,25 7,30 7,85
Francia 7,61 4,57 5,97 13,24 5,83
Kínai 7,97 6,49 7,97 20,50 7,69
Spanyol (Latin-Amerika) 5,41 3,38 3,62 6,22 4,86

Tíz a leggyakrabban használt nyelvek közül, oszloponként egy motorral. Minden cella az adott motor hibaarányát mutatja; az alacsonyabb a jobb. A zöld a sor legalacsonyabb, a fehér a második legalacsonyabb értékét jelöli. Japánnál, koreainál és kínainál CER, a többinél WER; a kettőt soha nem vontuk össze egyetlen számmá. Saját FLEURS futásunk, a Whisper Notes csapatától, egyetlen M5 MacBook Air gépen, felolvasott beszéd.

Rövid nevek: Qwen3-ASR = Qwen3-ASR 1.7B, Whisper Large = Whisper Large V3 Turbo, Parakeet = Parakeet V3, SenseVoice = SenseVoice Small. A gondolatjel azt jelenti, hogy a motornak nincs modellje az adott nyelvhez.

A Qwen3-ASR 1.7B hibaaránya a legalacsonyabb a tíz nyelvből hatnál, a másik négynél pedig a Whisper Large V3 Turbo vezet. Az Apple Speech koreainál 0,77 ponttal, japánnál 1,06 ponttal, kínainál pedig 1,48 ponttal marad el a sor legjobbjától; kínainál 7,97-os értékkel holtversenyben áll a Whisper Large V3 Turbo eredményével. A támogatott hét nyelven 0,8–4,3 ponttal marad le a sor legjobbjától; a legnagyobb különbség angolnál van, 8,80 a 4,49-cel szemben. Hollandnál, lengyelnél és orosznál nincs Apple Speech-eredmény.

Mely nyelveket támogatja az Apple Speech?

Az Apple Speech ebben a futásban a 83 nyelvi konfigurációból 21-nél adott eredményt. Mindkét Whisper modell lefedi mind a 83-at, a Qwen3-ASR 1.7B 30-at, a Parakeet V3 pedig 25-öt. A fenti tíz nyelv közül hollandhoz, lengyelhez és oroszhoz nincs modellje. Nincs idézhető, rögzített lista: a nyelvi erőforrások a macOS-hez tartoznak, ezért az app futásidőben kérdezi le, hogy mi érhető el az adott gépen.

Nyelv Apple Speech Qwen3-ASR Whisper Large Whisper Small Parakeet SenseVoice
Olasz 4,39 2,58 2,58 7,64 3,43
Kantoni 8,69 6,44 36,75 119,01 37,23
Portugál (Brazília) 9,35 5,17 5,44 8,61 6,49
Hindi nyelv 101,50 13,19 29,64 61,26
Telugu nyelv 101,63 81,74 103,19
Urdu nyelv 101,69 23,39 38,83
Pandzsábi 101,75 92,05 103,40
Bengáli 102,00 83,52 117,37
Nepáli 102,13 88,59 118,84
Malajálam 102,18 107,34 167,16
Maráthi 102,23 82,69 109,95
Kannada nyelv 103,83 72,07 116,10
Gudzsaráti 104,52 75,31 108,91
Tamil nyelv 113,01 71,28 79,77

A másik tizennégy nyelv, amelynél az Apple Speech eredményt adott, a saját hibaaránya szerint rendezve. Ugyanazok az oszlopok, színek és rövid nevek, mint fent; kantoninál CER, a többinél WER. A hibaarány 100% fölé is kerülhet, mert a beszúrások is szerepelnek a számlálóban.

Az utolsó tizenegy sorban, a hinditől a tamilig, az Apple Speech a natív írás helyett latin betűs átírással válaszolt. Hibaaránya ezért az írásrendszerek eltérését méri, nem a felismerési pontosságot; ezek a cellák kimaradnak a soron belüli rangsorból. A többi motor értékei ezekben a sorokban szokásos mérések.

A SpeechAnalyzer működése

Az Apple az iOS 10 óta rendelkezik beszédfelismerési API-val. Az SFSpeechRecognizer a régi diktálási útvonal mögötti motor. Ezt váltja fel a macOS 26-ban és az iOS 26-ban bevezetett SpeechAnalyzer, amely a watchOS kivételével minden Apple-platformon elérhető.

Az API egy munkamenet köré épül. Létrehoz egy SpeechAnalyzer példányt, egy vagy több modult ad hozzá, majd hangot táplál be; a beszédet a SpeechTranscriber modul alakítja szöveggé. A hang egy Ön által feltöltött aszinkron sorozatként érkezik, az eredmények egy második sorozatként térnek vissza, és a kettő rendszerint külön feladaton fut. Az elemző egyszerre egy bemeneti sorozatot fogad. Minden puffer és eredmény időbélyege a hang saját idővonalához igazodik, így az eredmény visszahelyezhető oda, ahonnan származik.

Az Apple WWDC25 ábrája a SpeechAnalyzer párhuzamos működéséről: egy bemeneti feladat egy bemeneti AsyncSequence sorozatot ad át a SpeechAnalyzer és SpeechTranscriber számára egy elemzési feladaton, amelyek egy eredményeket tartalmazó AsyncSequence sorozatot küldenek az eredményfeladatnak és a felhasználói felületnek

Egy munkamenet, három feladat: a hang AsyncSequence formájában érkezik, a SpeechAnalyzer és a SpeechTranscriber elemzi, az eredmények pedig egy második AsyncSequence sorozatként térnek vissza, amelyet a felület olvashat. Forrás: Apple, WWDC25, 277. előadás.

Az eredmények kétszer érkeznek meg. Az Apple által változékony tartománynak nevezett részen belül bármi lecserélhető még egy jobb eredményre; az azon kívüli rész végleges. Így tud egy app hozzávetőleges átiratot mutatni, miközben Ön még beszél, majd később kijavítani.

Az Apple öt tervezési célt ad meg a SpeechTranscriber modellhez: hosszú hanganyag, társalgási beszéd, távoli beszélők, alacsony késleltetés és adatvédelem, vagyis a készüléken történő futás. A Jegyzetek, a Hangjegyzetek, a Napló és a hívásösszefoglalás erre épül.

Az Apple WWDC25 diája a SpeechTranscriber modell képességeiről: hosszú hanganyag, társalgási beszéd, távoli beszélők, alacsony késleltetés és adatvédelem

Az Apple által megadott öt tervezési cél a SpeechTranscriber modellhez. Forrás: Apple, WWDC25, 277. előadás.

A modellek nem részei egyetlen appnak sem. Az Apple szervereiről az AssetInventory tölti le őket, a rendszer tárolja és frissíti őket, az appok pedig megosztva használják. Nem növelik az app letöltési méretét vagy saját memóriaterét, a dekódolás pedig a hívó folyamaton kívül történik. Ha a SpeechTranscriber nem rendelkezik modellel egy nyelvhez vagy készülékhez, a DictationTranscriber veszi át a feladatot a rendszerdiktálás modelljeivel.

Így mértük

A cikk minden motorja ugyanazokat a klipeket írta át, ugyanabban a sorrendben, egyenként, egy M5 MacBook Air gépen (32 GB, macOS 27.0). A hanganyag a Google FLEURS teszthalmaza a 70bb2e84 revíziónál, nyelvenként körülbelül 150 mondattal és 30 perccel. Az adatkészlet saját elemazonosítóinak rögzített hash-e rendezi sorba az elemeket, és a harminc percet meghaladó legrövidebb, teljes elemekből álló sorozatot vesszük; a választásban egyetlen modellkimenet sem játszott szerepet. Minden cellát a saját bizonylatából építettünk újra és ismét ellenőriztünk; mind a 285 megfelelt.

A pontszám szóhibaarány, ha a szavakat szóköz választja el, japánnál, koreainál, kínainál és kantoninál pedig karakterhibaarány. A FLEURS felolvasott beszéd, nem megbeszélés és nem diktálás. Ezek a táblázatok azt mutatják meg, hogy egy motor szóba jöhet-e az Ön nyelvéhez, nem azt, hogy mit kap majd a saját felvételein.

Mennyivel jobb a régi Apple Diktálásnál?

Az Apple két átírási működési módot kínál, és mindkettőt megmértük. A SpeechTranscriber az új, amelyre a cikkben az Apple Speech nevet használjuk. DictationTranscriber a kompatibilitási mód, vagyis a Mac korábbi diktálási útvonala.

Nyelv Apple Diktálás Apple Speech
Koreai 7,11 4,31
Olasz 6,93 4,39
Spanyol (Latin-Amerika) 8,43 5,41
Német 12,69 6,26
Japán 9,37 6,36
Francia 17,10 7,61
Kínai 10,28 7,97
Kantoni 10,18 8,69
Angol 13,83 8,80
Portugál (Brazília) 10,85 9,35

Minden nyelv, amelyet mindkét Apple-mód tisztán mért, az Apple Speech hibaaránya szerint rendezve; a zöld a sor jobb értékét jelöli. Ugyanaz a futás, ugyanazok a klipek, ugyanaz a Mac. Japánnál, koreainál, kínainál és kantoninál CER, a többinél WER.

Az Apple Speech mind a tíz nyelvnél pontosabb. A medián nyelvnél a hibák körülbelül harmada eltűnik, franciánál és németnél több mint a fele, brazil portugálnál és kantoninál pedig nagyjából minden hetedik hiba.

Ez az Apple saját korábbi technológiájával való összevetés. A letölthető modellekkel szemben a legjobb helyezése egy tisztán mért nyelven a második, kantoninál. A Diktálás több nyelvet fed le: ebben a futásban 33 konfigurációt a 21-gyel szemben, köztük mindhárom nyelvet, amely itt hiányzik az új motorból.

Mit nyújt a beépített motor?

Motor Sebesség Csúcsmemória Letöltés
SenseVoice Small 162,3× valós idő 0,95 GiB 827 MB
Parakeet V3 75,6× valós idő 0,09 GiB 465 MB
Apple Speech 30,8× valós idő nincs közölve a nyelvi csomagot a macOS tölti le, nem az app
Qwen3-ASR 1.7B 11,1× valós idő 2,43 GiB körülbelül 2,5 GB
Whisper Small 7,9× valós idő 0,87 GiB 600 MB
Whisper Large V3 Turbo 3,0× valós idő 1,87 GiB körülbelül 1,6 GB

A sebesség az egyes motorok mediánja a cikkben tisztán mért tizenhárom nyelven, csak azokat számítva, amelyeken futottak — elkülönített elemek feldolgozási sebessége, diagnosztikai adat, nem termékkésleltetés. A csúcsmemória a folyamatcsoport csúcsa ebben a futásban. Az Apple Speech egy olyan macOS-szolgáltatáson belül dekódol, amely nem a hívó app tulajdona, ezért ott egyetlen szám sem jelentené ugyanazt, mint a másik öt esetében.

Az Apple Speech nyelvi erőforrásait a rendszer egyszer tölti le, és minden app megosztva használja őket. Az app nem tartalmaz modellt, és a saját folyamatában sem foglal hozzá memóriát. A rendszerszolgáltatás működés közben ettől még használ memóriát, amelyet nem tudunk pontosan hozzárendelni; ezért nulla helyett nem közlünk számot. 30,8× valós idő sebességgel futott, a Parakeet V3 és a SenseVoice Small mögött.

A Whisper Large V3 Turbo a tíz sorból négyet nyer, és itt ez a leglassabb motor: nagyjából az Apple Speech sebességének tizedével fut, és körülbelül 1,6 GB lemezterületet igényel. A Qwen3-ASR 1.7B nyeri a másik hatot, körülbelül 2,5 GB lemezterülettel és 2,43 GiB memóriával. A Parakeet V3 mérete 465 MB, memóriaigénye 0,09 GiB; franciánál megelőzi, lengyelnél követi a Turbo modellt, japánhoz, koreaihoz, kínaihoz és kantonihoz pedig nincs modellje. A legközelebbi összehasonlítási alap a 600 MB-os Whisper Small, és az Apple Speech a mindkettővel tisztán mért tíz nyelvből nyolcnál pontosabb volt.

Apple Speech vagy letöltött modell legyen?

Nyelvenként:

  • Angol: nem jó választás. Az Apple Speech 8,80-at ért el; Qwen3-ASR 1.7B (4,49) vagy Whisper Large V3 Turbo (5,49) egyértelműen pontosabb.
  • Német: nem jó választás. Az Apple Speech 6,26-ot ért el; Qwen3-ASR 1.7B (2,85) vagy Whisper Large V3 Turbo (4,05) egyértelműen pontosabb.
  • Holland, orosz és lengyel: az Apple Speech e három nyelv egyikéhez sem kínál modellt. Whisper Large V3 Turbo mindegyiknél a legpontosabb volt, 5,69, 5,13 és 5,45 értékkel.
  • Japán: használható. Az Apple Speech 6,36-ot ért el, lemaradva a Whisper Large V3 Turbo 5,30-os értékétől.
  • Koreai: használható. Az Apple Speech 4,31-et ért el, lemaradva a Qwen3-ASR 1.7B 3,54-os értékétől.
  • Francia: nem jó választás. Az Apple Speech 7,61-et ért el; Qwen3-ASR 1.7B (4,57) vagy Parakeet V3 (5,83) egyértelműen pontosabb.
  • Kínai: használható. Az Apple Speech 7,97-ot ért el, ugyanannyit, mint a Whisper Large V3 Turbo; a legpontosabb a Qwen3-ASR 1.7B volt 6,49-cel.
  • Spanyol: nem jó választás. Az Apple Speech 5,41-et ért el; Qwen3-ASR 1.7B (3,38) vagy Whisper Large V3 Turbo (3,62) egyértelműen pontosabb.

Az Apple Speech a cikk rövid neve az Apple által készített SpeechTranscriber technológiára, arra a készüléken futó API-ra, amelyet macOS 26 vagy újabb rendszeren bármely Mac-app meghívhat. Nem tartozik azok közé a modellek közé, amelyeket a Whisper Notes for Mac letölt: a közvetlenül letölthető Mac-verzióban (DMG) ezek a Whisper, a Parakeet V3, a SenseVoice és a Qwen3-ASR, iPhone-on és a Mac App Store-verzióban pedig a Whisper, a Parakeet V3 és a SenseVoice. A motoronkénti táblázat a nyelvi támogatás oldalunkon található.

Mindez nem változtat a Whisper Notes for Mac jelenlegi működésén: továbbra is a Parakeet V3 az alapértelmezett modell.

Gyakori kérdések

Olyan pontos az Apple Speech, mint a Whisper?

A legtöbb közösen támogatott nyelvnél nem. Saját FLEURS futásunkban az Apple Speech által támogatott hét nyelv közül hatnál a Whisper Large V3 Turbo volt pontosabb, kínainál pedig pontosan megegyeztek, egyaránt 7,97% CER-rel. A Whisper Small eredményeivel szemben megfordul a sorrend: az Apple Speech hétből hatnál vezetett, és csak angolnál veszített, 8,80% a 7,04% WER-rel szemben. Ebben a futásban egyetlen tisztán mért nyelvnél sem vezet, és koreainál van a legközelebb: 4,31% CER a sorvezető 3,54%-ával szemben. A kantoni az egyetlen tisztán mért nyelv, amelynél megelőzte a Whisper Large V3 Turbo modellt: 8,69% a 36,75% CER-rel szemben. Használja a beépített motort, ha az támogatja az Ön nyelvét, és inkább a macOS-re bízná a nyelvi csomag kezelését; a legpontosabb eredményhez, illetve az Apple Speech kínálatából itt hiányzó három nyelv egyikén használja a Whisper Large V3 Turbo modellt.

Mely nyelveket támogatja az Apple Speech?

A listát a macOS határozza meg, nem valamelyik app. Ebben a futásban az Apple Speech a tesztelt 83 nyelvi konfigurációból 21-nél adott eredményt, míg a Whisper mindkét verziója 83-at, a Qwen3-ASR 1.7B 30-at, a Parakeet V3 pedig 25-öt fed le. A főtábla tíz leggyakrabban használt nyelve közül támogatja az angolt, a németet, a japánt, a koreait, a franciát, a kínait és a spanyolt, a hollandot, a lengyelt és az oroszt viszont nem. A második táblázat tartalmazza a másik tizennégy konfigurációt: az olaszt, a kantonit, a brazil portugált és tizenegy olyan nyelvet, amelynél a natív írás helyett latin betűs átírással válaszolt. Egy appnak futásidőben kell megkérdeznie a macOS-t, hogy milyen nyelvek vannak az adott gépen. Ha az Ön nyelve hiányzik, a Whisper minden csatornán eléri az app listájának összes nyelvét.

Apple Speech vagy Parakeet V3 — melyiket válassza?

A Parakeet V3 a választás minden olyan európai nyelvnél, amelyet mindkettő támogat. Angolnál 6,89-et ért el 8,80-nal szemben, franciánál 5,83-at 7,61-gyel szemben, spanyolnál 4,86-ot 5,41-gyel szemben, olasznál 3,43-at 4,39-cel szemben, brazil portugálnál pedig 6,49-et 9,35-tel szemben; németnél mindkettő 6,26-on áll. A Parakeet V3 nem kínál japán, koreai, kínai vagy kantoni modellt, ezért ezeken csak az Apple Speech érhető el a kettő közül; japánnál, koreainál és kínainál 1,5 ponton belül marad a sor legjobbjához képest. A Parakeet V3 letöltése 465 MB, 75,6× valós idővel futott, 0,09 GiB-os csúccsal; az Apple Speech nyelvi csomagját a macOS tölti le, és 30,8× sebességgel futott, általunk nem közölt memóriahasználattal.

Mi a SpeechAnalyzer, és ugyanaz-e, mint az Apple Diktálás?

A SpeechAnalyzer az az átfogó API, amelyet az Apple a WWDC 2025 rendezvényen mutatott be, majd a macOS 26 és az iOS 26 részeként adott ki. A benne lévő átírási működési mód a SpeechTranscriber; ezt mértük, és erre használja a cikk az Apple Speech nevet. A Diktálás a kompatibilitási mód, amelyet szintén futtattunk: az Apple Speech mind a tíz, mindkettő által tisztán kezelt nyelvnél pontosabb volt, a medián nyelvnél körülbelül a hibák harmadát, franciánál és németnél pedig több mint a felét eltávolítva. A Diktálás több nyelvet fed le, 33 konfigurációt a 21-gyel szemben, ezért hollandnál, lengyelnél vagy orosznál ez a rendszermotor, ha Ön elfogadja a 17,34%, 13,50% és 13,13% WER értéket. A Whisper Large V3 Turbo ugyanazokon a klipeken 5,69%, 5,45% és 5,13% eredményt ért el.

Elhagyja a hanganyag a Macemet az Apple Speech használatakor?

Az Apple a SpeechTranscriber technológiát készüléken futó beszédfelismerésként dokumentálja: a macOS egyszer tölti le a nyelvi erőforrásokat, a felismerés pedig helyben fut. Mi a pontosságot és a sebességet mértük, nem a hálózati működést, ezért ezt a részt az Apple leírása szerint közöljük. A Whisper Notes által letöltött motorok — a Whisper, a Parakeet V3, a SenseVoice és a Qwen3-ASR — az Ön Mac gépének GPU vagy Neural Engine egységén futnak fiók és API key nélkül, és az átírás kikapcsolt hálózattal is működik, minden csatornán.

Miért nem egyeznek ezek a számok a saját felvételeimen tapasztalt pontossággal?

Mert a FLEURS rövid, tiszta, felolvasott beszéd, az Ön felvételei pedig nem azok. Futásunk egy nyilvános adatkészleten végzett kalibráció: nyelvenként körülbelül 150 mondat és 30 perc hang, egyetlen M5 MacBook Air, minden motornak ugyanazok a klipek. Azt mutatja meg, hogy egy motor szóba jöhet-e egy nyelvhez, nem azt, hogy milyen eredményt kap egy megbeszélésen, zajos hanganyaggal, akcentussal beszélt szövegnél vagy egy kétórás fájlon.

Miért mondják más mérések, hogy az Apple Speech legyőzi a Whispert?

A Whisper Small modellel hasonlítják össze, és csak angolon. Futásunk a Whisper Small esetében ugyanezt mutatja: az Apple Speech a mindkettő által tisztán mért tíz nyelv közül nyolcnál bizonyult jobbnak. Az angol az a kettő egyike, amelyet elveszített, 8,80 a 7,04-gyel szemben. Az eredmény nem vihető át a Whisper Large V3 Turbo modellre: attól az Apple Speech ugyanezen tíz nyelv közül nyolcnál maradt el, kínainál 7,97-nál holtversenyben végzett, és csak kantoninál vezetett. Azt, hogy mi kerül a címbe, az dönti el, melyik Whisper szerepel az összehasonlításban.

Próbálja ki

Az itt szereplő öt letölthető modell — Whisper Small, Whisper Large V3 Turbo, Parakeet V3, SenseVoice Small és Qwen3-ASR 1.7B — mind megtalálható a Macre készült Whisper Notes közvetlenül letölthető változatában (DMG), a Beállítások, majd Átírási modell alatt.

Ha számaink nem egyeznek az Ön tapasztalataival egy nyelven, írjon a mac@whispernotes.app. A teljes kiadási megjegyzések: whispernotes.app/changelog.

Források: saját futásunk a Google FLEURS teszthalmazán a 70bb2e84 revíziónál, az Apple SpeechAnalyzer-dokumentációja, valamint az ezt megelőző harmincnyelvű Qwen3-ASR futás .