A macOS 26 és az iOS 26 óta az Apple a készüléken futó beszédfelismerés új generációját kínálja: a SpeechAnalyzer és a SpeechTranscriber technológiát, amelyre alább röviden az Apple Speech nevet használjuk. Ez lényegesen pontosabb a régi diktálási motornál. Ezért arra kerestük a választ: elég jó-e már az Apple beépített beszédfelismerése ahhoz, hogy Ön teljesen elhagyhassa az átíróalkalmazást? És mekkora a lemaradása a Whisper Notes készüléken futó nyílt megoldásaihoz — a Whisper, a Parakeet, a SenseVoice és a Qwen3-ASR modelljeihez — képest? Szigorú tesztet végeztünk. Íme az eredmények. Az általunk tesztelt tíz nyelv közül az Apple Speech egyiknél sem érte el a legalacsonyabb hibaarányt, koreainál, japánnál és kínainál 1,5 ponton belül maradt a legjobbhoz képest, hollandhoz, oroszhoz és lengyelhez pedig egyáltalán nincs modellje.
Mekkora az Apple Speech lemaradása a letölthető modellekhez képest?
| Nyelv | Apple Speech | Qwen3-ASR | Whisper Large | Whisper Small | Parakeet | SenseVoice |
|---|---|---|---|---|---|---|
| Angol | 8,80 | 4,49 | 5,49 | 7,04 | 6,89 | 8,46 |
| Német | 6,26 | 2,85 | 4,05 | 8,67 | 6,26 | — |
| Holland | — | 7,36 | 5,69 | 16,75 | 8,58 | — |
| Orosz | — | 5,65 | 5,13 | 11,37 | 7,12 | — |
| Lengyel | — | 12,59 | 5,45 | 15,81 | 8,30 | — |
| Japán | 6,36 | 5,74 | 5,30 | 11,37 | — | 6,78 |
| Koreai | 4,31 | 3,54 | 4,25 | 7,30 | — | 7,85 |
| Francia | 7,61 | 4,57 | 5,97 | 13,24 | 5,83 | — |
| Kínai | 7,97 | 6,49 | 7,97 | 20,50 | — | 7,69 |
| Spanyol (Latin-Amerika) | 5,41 | 3,38 | 3,62 | 6,22 | 4,86 | — |
Tíz a leggyakrabban használt nyelvek közül, oszloponként egy motorral. Minden cella az adott motor hibaarányát mutatja; az alacsonyabb a jobb. A zöld a sor legalacsonyabb, a fehér a második legalacsonyabb értékét jelöli. Japánnál, koreainál és kínainál CER, a többinél WER; a kettőt soha nem vontuk össze egyetlen számmá. Saját FLEURS futásunk, a Whisper Notes csapatától, egyetlen M5 MacBook Air gépen, felolvasott beszéd.
Rövid nevek: Qwen3-ASR = Qwen3-ASR 1.7B, Whisper Large = Whisper Large V3 Turbo, Parakeet = Parakeet V3, SenseVoice = SenseVoice Small. A gondolatjel azt jelenti, hogy a motornak nincs modellje az adott nyelvhez.
A Qwen3-ASR 1.7B hibaaránya a legalacsonyabb a tíz nyelvből hatnál, a másik négynél pedig a Whisper Large V3 Turbo vezet. Az Apple Speech koreainál 0,77 ponttal, japánnál 1,06 ponttal, kínainál pedig 1,48 ponttal marad el a sor legjobbjától; kínainál 7,97-os értékkel holtversenyben áll a Whisper Large V3 Turbo eredményével. A támogatott hét nyelven 0,8–4,3 ponttal marad le a sor legjobbjától; a legnagyobb különbség angolnál van, 8,80 a 4,49-cel szemben. Hollandnál, lengyelnél és orosznál nincs Apple Speech-eredmény.
Mely nyelveket támogatja az Apple Speech?
Az Apple Speech ebben a futásban a 83 nyelvi konfigurációból 21-nél adott eredményt. Mindkét Whisper modell lefedi mind a 83-at, a Qwen3-ASR 1.7B 30-at, a Parakeet V3 pedig 25-öt. A fenti tíz nyelv közül hollandhoz, lengyelhez és oroszhoz nincs modellje. Nincs idézhető, rögzített lista: a nyelvi erőforrások a macOS-hez tartoznak, ezért az app futásidőben kérdezi le, hogy mi érhető el az adott gépen.
| Nyelv | Apple Speech | Qwen3-ASR | Whisper Large | Whisper Small | Parakeet | SenseVoice |
|---|---|---|---|---|---|---|
| Olasz | 4,39 | 2,58 | 2,58 | 7,64 | 3,43 | — |
| Kantoni | 8,69 | 6,44 | 36,75 | 119,01 | — | 37,23 |
| Portugál (Brazília) | 9,35 | 5,17 | 5,44 | 8,61 | 6,49 | — |
| Hindi nyelv | 101,50 | 13,19 | 29,64 | 61,26 | — | — |
| Telugu nyelv | 101,63 | — | 81,74 | 103,19 | — | — |
| Urdu nyelv | 101,69 | — | 23,39 | 38,83 | — | — |
| Pandzsábi | 101,75 | — | 92,05 | 103,40 | — | — |
| Bengáli | 102,00 | — | 83,52 | 117,37 | — | — |
| Nepáli | 102,13 | — | 88,59 | 118,84 | — | — |
| Malajálam | 102,18 | — | 107,34 | 167,16 | — | — |
| Maráthi | 102,23 | — | 82,69 | 109,95 | — | — |
| Kannada nyelv | 103,83 | — | 72,07 | 116,10 | — | — |
| Gudzsaráti | 104,52 | — | 75,31 | 108,91 | — | — |
| Tamil nyelv | 113,01 | — | 71,28 | 79,77 | — | — |
A másik tizennégy nyelv, amelynél az Apple Speech eredményt adott, a saját hibaaránya szerint rendezve. Ugyanazok az oszlopok, színek és rövid nevek, mint fent; kantoninál CER, a többinél WER. A hibaarány 100% fölé is kerülhet, mert a beszúrások is szerepelnek a számlálóban.
Az utolsó tizenegy sorban, a hinditől a tamilig, az Apple Speech a natív írás helyett latin betűs átírással válaszolt. Hibaaránya ezért az írásrendszerek eltérését méri, nem a felismerési pontosságot; ezek a cellák kimaradnak a soron belüli rangsorból. A többi motor értékei ezekben a sorokban szokásos mérések.
A SpeechAnalyzer működése
Az Apple az iOS 10 óta rendelkezik beszédfelismerési API-val. Az SFSpeechRecognizer a régi diktálási útvonal mögötti motor. Ezt váltja fel a macOS 26-ban és az iOS 26-ban bevezetett SpeechAnalyzer, amely a watchOS kivételével minden Apple-platformon elérhető.
Az API egy munkamenet köré épül. Létrehoz egy SpeechAnalyzer példányt, egy vagy több modult ad hozzá, majd hangot táplál be; a beszédet a SpeechTranscriber modul alakítja szöveggé. A hang egy Ön által feltöltött aszinkron sorozatként érkezik, az eredmények egy második sorozatként térnek vissza, és a kettő rendszerint külön feladaton fut. Az elemző egyszerre egy bemeneti sorozatot fogad. Minden puffer és eredmény időbélyege a hang saját idővonalához igazodik, így az eredmény visszahelyezhető oda, ahonnan származik.
Egy munkamenet, három feladat: a hang AsyncSequence formájában érkezik, a SpeechAnalyzer és a SpeechTranscriber elemzi, az eredmények pedig egy második AsyncSequence sorozatként térnek vissza, amelyet a felület olvashat. Forrás: Apple, WWDC25, 277. előadás.
Az eredmények kétszer érkeznek meg. Az Apple által változékony tartománynak nevezett részen belül bármi lecserélhető még egy jobb eredményre; az azon kívüli rész végleges. Így tud egy app hozzávetőleges átiratot mutatni, miközben Ön még beszél, majd később kijavítani.
Az Apple öt tervezési célt ad meg a SpeechTranscriber modellhez: hosszú hanganyag, társalgási beszéd, távoli beszélők, alacsony késleltetés és adatvédelem, vagyis a készüléken történő futás. A Jegyzetek, a Hangjegyzetek, a Napló és a hívásösszefoglalás erre épül.
Az Apple által megadott öt tervezési cél a SpeechTranscriber modellhez. Forrás: Apple, WWDC25, 277. előadás.
A modellek nem részei egyetlen appnak sem. Az Apple szervereiről az AssetInventory tölti le őket, a rendszer tárolja és frissíti őket, az appok pedig megosztva használják. Nem növelik az app letöltési méretét vagy saját memóriaterét, a dekódolás pedig a hívó folyamaton kívül történik. Ha a SpeechTranscriber nem rendelkezik modellel egy nyelvhez vagy készülékhez, a DictationTranscriber veszi át a feladatot a rendszerdiktálás modelljeivel.
Így mértük
A cikk minden motorja ugyanazokat a klipeket írta át, ugyanabban a sorrendben, egyenként, egy M5 MacBook Air gépen (32 GB, macOS 27.0). A hanganyag a Google FLEURS teszthalmaza a 70bb2e84 revíziónál, nyelvenként körülbelül 150 mondattal és 30 perccel. Az adatkészlet saját elemazonosítóinak rögzített hash-e rendezi sorba az elemeket, és a harminc percet meghaladó legrövidebb, teljes elemekből álló sorozatot vesszük; a választásban egyetlen modellkimenet sem játszott szerepet. Minden cellát a saját bizonylatából építettünk újra és ismét ellenőriztünk; mind a 285 megfelelt.
A pontszám szóhibaarány, ha a szavakat szóköz választja el, japánnál, koreainál, kínainál és kantoninál pedig karakterhibaarány. A FLEURS felolvasott beszéd, nem megbeszélés és nem diktálás. Ezek a táblázatok azt mutatják meg, hogy egy motor szóba jöhet-e az Ön nyelvéhez, nem azt, hogy mit kap majd a saját felvételein.
Mennyivel jobb a régi Apple Diktálásnál?
Az Apple két átírási működési módot kínál, és mindkettőt megmértük. A SpeechTranscriber az új, amelyre a cikkben az Apple Speech nevet használjuk. DictationTranscriber a kompatibilitási mód, vagyis a Mac korábbi diktálási útvonala.
| Nyelv | Apple Diktálás | Apple Speech |
|---|---|---|
| Koreai | 7,11 | 4,31 |
| Olasz | 6,93 | 4,39 |
| Spanyol (Latin-Amerika) | 8,43 | 5,41 |
| Német | 12,69 | 6,26 |
| Japán | 9,37 | 6,36 |
| Francia | 17,10 | 7,61 |
| Kínai | 10,28 | 7,97 |
| Kantoni | 10,18 | 8,69 |
| Angol | 13,83 | 8,80 |
| Portugál (Brazília) | 10,85 | 9,35 |
Minden nyelv, amelyet mindkét Apple-mód tisztán mért, az Apple Speech hibaaránya szerint rendezve; a zöld a sor jobb értékét jelöli. Ugyanaz a futás, ugyanazok a klipek, ugyanaz a Mac. Japánnál, koreainál, kínainál és kantoninál CER, a többinél WER.
Az Apple Speech mind a tíz nyelvnél pontosabb. A medián nyelvnél a hibák körülbelül harmada eltűnik, franciánál és németnél több mint a fele, brazil portugálnál és kantoninál pedig nagyjából minden hetedik hiba.
Ez az Apple saját korábbi technológiájával való összevetés. A letölthető modellekkel szemben a legjobb helyezése egy tisztán mért nyelven a második, kantoninál. A Diktálás több nyelvet fed le: ebben a futásban 33 konfigurációt a 21-gyel szemben, köztük mindhárom nyelvet, amely itt hiányzik az új motorból.
Mit nyújt a beépített motor?
| Motor | Sebesség | Csúcsmemória | Letöltés |
|---|---|---|---|
| SenseVoice Small | 162,3× valós idő | 0,95 GiB | 827 MB |
| Parakeet V3 | 75,6× valós idő | 0,09 GiB | 465 MB |
| Apple Speech | 30,8× valós idő | nincs közölve | a nyelvi csomagot a macOS tölti le, nem az app |
| Qwen3-ASR 1.7B | 11,1× valós idő | 2,43 GiB | körülbelül 2,5 GB |
| Whisper Small | 7,9× valós idő | 0,87 GiB | 600 MB |
| Whisper Large V3 Turbo | 3,0× valós idő | 1,87 GiB | körülbelül 1,6 GB |
A sebesség az egyes motorok mediánja a cikkben tisztán mért tizenhárom nyelven, csak azokat számítva, amelyeken futottak — elkülönített elemek feldolgozási sebessége, diagnosztikai adat, nem termékkésleltetés. A csúcsmemória a folyamatcsoport csúcsa ebben a futásban. Az Apple Speech egy olyan macOS-szolgáltatáson belül dekódol, amely nem a hívó app tulajdona, ezért ott egyetlen szám sem jelentené ugyanazt, mint a másik öt esetében.
Az Apple Speech nyelvi erőforrásait a rendszer egyszer tölti le, és minden app megosztva használja őket. Az app nem tartalmaz modellt, és a saját folyamatában sem foglal hozzá memóriát. A rendszerszolgáltatás működés közben ettől még használ memóriát, amelyet nem tudunk pontosan hozzárendelni; ezért nulla helyett nem közlünk számot. 30,8× valós idő sebességgel futott, a Parakeet V3 és a SenseVoice Small mögött.
A Whisper Large V3 Turbo a tíz sorból négyet nyer, és itt ez a leglassabb motor: nagyjából az Apple Speech sebességének tizedével fut, és körülbelül 1,6 GB lemezterületet igényel. A Qwen3-ASR 1.7B nyeri a másik hatot, körülbelül 2,5 GB lemezterülettel és 2,43 GiB memóriával. A Parakeet V3 mérete 465 MB, memóriaigénye 0,09 GiB; franciánál megelőzi, lengyelnél követi a Turbo modellt, japánhoz, koreaihoz, kínaihoz és kantonihoz pedig nincs modellje. A legközelebbi összehasonlítási alap a 600 MB-os Whisper Small, és az Apple Speech a mindkettővel tisztán mért tíz nyelvből nyolcnál pontosabb volt.
Apple Speech vagy letöltött modell legyen?
Nyelvenként:
- Angol: nem jó választás. Az Apple Speech 8,80-at ért el; Qwen3-ASR 1.7B (4,49) vagy Whisper Large V3 Turbo (5,49) egyértelműen pontosabb.
- Német: nem jó választás. Az Apple Speech 6,26-ot ért el; Qwen3-ASR 1.7B (2,85) vagy Whisper Large V3 Turbo (4,05) egyértelműen pontosabb.
- Holland, orosz és lengyel: az Apple Speech e három nyelv egyikéhez sem kínál modellt. Whisper Large V3 Turbo mindegyiknél a legpontosabb volt, 5,69, 5,13 és 5,45 értékkel.
- Japán: használható. Az Apple Speech 6,36-ot ért el, lemaradva a Whisper Large V3 Turbo 5,30-os értékétől.
- Koreai: használható. Az Apple Speech 4,31-et ért el, lemaradva a Qwen3-ASR 1.7B 3,54-os értékétől.
- Francia: nem jó választás. Az Apple Speech 7,61-et ért el; Qwen3-ASR 1.7B (4,57) vagy Parakeet V3 (5,83) egyértelműen pontosabb.
- Kínai: használható. Az Apple Speech 7,97-ot ért el, ugyanannyit, mint a Whisper Large V3 Turbo; a legpontosabb a Qwen3-ASR 1.7B volt 6,49-cel.
- Spanyol: nem jó választás. Az Apple Speech 5,41-et ért el; Qwen3-ASR 1.7B (3,38) vagy Whisper Large V3 Turbo (3,62) egyértelműen pontosabb.
Az Apple Speech a cikk rövid neve az Apple által készített SpeechTranscriber technológiára, arra a készüléken futó API-ra, amelyet macOS 26 vagy újabb rendszeren bármely Mac-app meghívhat. Nem tartozik azok közé a modellek közé, amelyeket a Whisper Notes for Mac letölt: a közvetlenül letölthető Mac-verzióban (DMG) ezek a Whisper, a Parakeet V3, a SenseVoice és a Qwen3-ASR, iPhone-on és a Mac App Store-verzióban pedig a Whisper, a Parakeet V3 és a SenseVoice. A motoronkénti táblázat a nyelvi támogatás oldalunkon található.
Mindez nem változtat a Whisper Notes for Mac jelenlegi működésén: továbbra is a Parakeet V3 az alapértelmezett modell.
Gyakori kérdések
Olyan pontos az Apple Speech, mint a Whisper?
A legtöbb közösen támogatott nyelvnél nem. Saját FLEURS futásunkban az Apple Speech által támogatott hét nyelv közül hatnál a Whisper Large V3 Turbo volt pontosabb, kínainál pedig pontosan megegyeztek, egyaránt 7,97% CER-rel. A Whisper Small eredményeivel szemben megfordul a sorrend: az Apple Speech hétből hatnál vezetett, és csak angolnál veszített, 8,80% a 7,04% WER-rel szemben. Ebben a futásban egyetlen tisztán mért nyelvnél sem vezet, és koreainál van a legközelebb: 4,31% CER a sorvezető 3,54%-ával szemben. A kantoni az egyetlen tisztán mért nyelv, amelynél megelőzte a Whisper Large V3 Turbo modellt: 8,69% a 36,75% CER-rel szemben. Használja a beépített motort, ha az támogatja az Ön nyelvét, és inkább a macOS-re bízná a nyelvi csomag kezelését; a legpontosabb eredményhez, illetve az Apple Speech kínálatából itt hiányzó három nyelv egyikén használja a Whisper Large V3 Turbo modellt.
Mely nyelveket támogatja az Apple Speech?
A listát a macOS határozza meg, nem valamelyik app. Ebben a futásban az Apple Speech a tesztelt 83 nyelvi konfigurációból 21-nél adott eredményt, míg a Whisper mindkét verziója 83-at, a Qwen3-ASR 1.7B 30-at, a Parakeet V3 pedig 25-öt fed le. A főtábla tíz leggyakrabban használt nyelve közül támogatja az angolt, a németet, a japánt, a koreait, a franciát, a kínait és a spanyolt, a hollandot, a lengyelt és az oroszt viszont nem. A második táblázat tartalmazza a másik tizennégy konfigurációt: az olaszt, a kantonit, a brazil portugált és tizenegy olyan nyelvet, amelynél a natív írás helyett latin betűs átírással válaszolt. Egy appnak futásidőben kell megkérdeznie a macOS-t, hogy milyen nyelvek vannak az adott gépen. Ha az Ön nyelve hiányzik, a Whisper minden csatornán eléri az app listájának összes nyelvét.
Apple Speech vagy Parakeet V3 — melyiket válassza?
A Parakeet V3 a választás minden olyan európai nyelvnél, amelyet mindkettő támogat. Angolnál 6,89-et ért el 8,80-nal szemben, franciánál 5,83-at 7,61-gyel szemben, spanyolnál 4,86-ot 5,41-gyel szemben, olasznál 3,43-at 4,39-cel szemben, brazil portugálnál pedig 6,49-et 9,35-tel szemben; németnél mindkettő 6,26-on áll. A Parakeet V3 nem kínál japán, koreai, kínai vagy kantoni modellt, ezért ezeken csak az Apple Speech érhető el a kettő közül; japánnál, koreainál és kínainál 1,5 ponton belül marad a sor legjobbjához képest. A Parakeet V3 letöltése 465 MB, 75,6× valós idővel futott, 0,09 GiB-os csúccsal; az Apple Speech nyelvi csomagját a macOS tölti le, és 30,8× sebességgel futott, általunk nem közölt memóriahasználattal.
Mi a SpeechAnalyzer, és ugyanaz-e, mint az Apple Diktálás?
A SpeechAnalyzer az az átfogó API, amelyet az Apple a WWDC 2025 rendezvényen mutatott be, majd a macOS 26 és az iOS 26 részeként adott ki. A benne lévő átírási működési mód a SpeechTranscriber; ezt mértük, és erre használja a cikk az Apple Speech nevet. A Diktálás a kompatibilitási mód, amelyet szintén futtattunk: az Apple Speech mind a tíz, mindkettő által tisztán kezelt nyelvnél pontosabb volt, a medián nyelvnél körülbelül a hibák harmadát, franciánál és németnél pedig több mint a felét eltávolítva. A Diktálás több nyelvet fed le, 33 konfigurációt a 21-gyel szemben, ezért hollandnál, lengyelnél vagy orosznál ez a rendszermotor, ha Ön elfogadja a 17,34%, 13,50% és 13,13% WER értéket. A Whisper Large V3 Turbo ugyanazokon a klipeken 5,69%, 5,45% és 5,13% eredményt ért el.
Elhagyja a hanganyag a Macemet az Apple Speech használatakor?
Az Apple a SpeechTranscriber technológiát készüléken futó beszédfelismerésként dokumentálja: a macOS egyszer tölti le a nyelvi erőforrásokat, a felismerés pedig helyben fut. Mi a pontosságot és a sebességet mértük, nem a hálózati működést, ezért ezt a részt az Apple leírása szerint közöljük. A Whisper Notes által letöltött motorok — a Whisper, a Parakeet V3, a SenseVoice és a Qwen3-ASR — az Ön Mac gépének GPU vagy Neural Engine egységén futnak fiók és API key nélkül, és az átírás kikapcsolt hálózattal is működik, minden csatornán.
Miért nem egyeznek ezek a számok a saját felvételeimen tapasztalt pontossággal?
Mert a FLEURS rövid, tiszta, felolvasott beszéd, az Ön felvételei pedig nem azok. Futásunk egy nyilvános adatkészleten végzett kalibráció: nyelvenként körülbelül 150 mondat és 30 perc hang, egyetlen M5 MacBook Air, minden motornak ugyanazok a klipek. Azt mutatja meg, hogy egy motor szóba jöhet-e egy nyelvhez, nem azt, hogy milyen eredményt kap egy megbeszélésen, zajos hanganyaggal, akcentussal beszélt szövegnél vagy egy kétórás fájlon.
Miért mondják más mérések, hogy az Apple Speech legyőzi a Whispert?
A Whisper Small modellel hasonlítják össze, és csak angolon. Futásunk a Whisper Small esetében ugyanezt mutatja: az Apple Speech a mindkettő által tisztán mért tíz nyelv közül nyolcnál bizonyult jobbnak. Az angol az a kettő egyike, amelyet elveszített, 8,80 a 7,04-gyel szemben. Az eredmény nem vihető át a Whisper Large V3 Turbo modellre: attól az Apple Speech ugyanezen tíz nyelv közül nyolcnál maradt el, kínainál 7,97-nál holtversenyben végzett, és csak kantoninál vezetett. Azt, hogy mi kerül a címbe, az dönti el, melyik Whisper szerepel az összehasonlításban.
Próbálja ki
Az itt szereplő öt letölthető modell — Whisper Small, Whisper Large V3 Turbo, Parakeet V3, SenseVoice Small és Qwen3-ASR 1.7B — mind megtalálható a Macre készült Whisper Notes közvetlenül letölthető változatában (DMG), a Beállítások, majd Átírási modell alatt.
Ha számaink nem egyeznek az Ön tapasztalataival egy nyelven, írjon a mac@whispernotes.app. A teljes kiadási megjegyzések: whispernotes.app/changelog.
Források: saját futásunk a Google FLEURS teszthalmazán a 70bb2e84 revíziónál, az Apple SpeechAnalyzer-dokumentációja, valamint az ezt megelőző harmincnyelvű Qwen3-ASR futás .