Починаючи з macOS 26 та iOS 26, Apple постачає нове покоління розпізнавання мовлення на пристрої — SpeechAnalyzer і SpeechTranscriber, далі скорочено Apple Speech. Воно помітно точніше за старий рушій диктування. Тож ми хотіли з'ясувати: чи достатньо добре тепер працює вбудоване розпізнавання мовлення Apple, щоб можна було цілком обійтися без застосунку для транскрипції? І наскільки воно відстає від відкритих моделей на пристрої у Whisper Notes — Whisper, Parakeet, SenseVoice та Qwen3-ASR? Ми провели суворий тест. Ось результати. На десяти протестованих мовах Apple Speech жодного разу не показав найнижчої частки помилок, відстав від лідера не більш ніж на 1,5 пункту на корейській, японській і китайській, а для нідерландської, російської та польської взагалі не має моделі.
Наскільки Apple Speech відстає від моделей, які ти завантажуєш?
| Мова | Apple Speech | Qwen3-ASR | Whisper Large | Whisper Small | Parakeet | SenseVoice |
|---|---|---|---|---|---|---|
| Англійська | 8,80 | 4,49 | 5,49 | 7,04 | 6,89 | 8,46 |
| Німецька | 6,26 | 2,85 | 4,05 | 8,67 | 6,26 | — |
| Нідерландська | — | 7,36 | 5,69 | 16,75 | 8,58 | — |
| Російська | — | 5,65 | 5,13 | 11,37 | 7,12 | — |
| Польська | — | 12,59 | 5,45 | 15,81 | 8,30 | — |
| Японська | 6,36 | 5,74 | 5,30 | 11,37 | — | 6,78 |
| Корейська | 4,31 | 3,54 | 4,25 | 7,30 | — | 7,85 |
| Французька | 7,61 | 4,57 | 5,97 | 13,24 | 5,83 | — |
| Китайська | 7,97 | 6,49 | 7,97 | 20,50 | — | 7,69 |
| Іспанська (Латинська Америка) | 5,41 | 3,38 | 3,62 | 6,22 | 4,86 | — |
Десять із найуживаніших мов, по одному рушію в кожному стовпці. У кожній клітинці — частка помилок рушія: що нижче, то краще; зеленим позначено найнижче значення в рядку, білим — друге. CER для японської, корейської та китайської, WER для решти; ми ніколи не зводимо їх до одного числа. Наш власний прогін FLEURS, виконаний командою Whisper Notes, на одному M5 MacBook Air, начитане мовлення.
Короткі назви: Qwen3-ASR = Qwen3-ASR 1.7B, Whisper Large = Whisper Large V3 Turbo, Parakeet = Parakeet V3, SenseVoice = SenseVoice Small. Риска означає, що рушій не має моделі для цієї мови.
Qwen3-ASR 1.7B має найнижчу частку помилок у шести з десяти мов, Whisper Large V3 Turbo — у решті чотирьох. Apple Speech відстає від лідера рядка на 0,77 пункту на корейській, на 1,06 на японській і на 1,48 на китайській, де має однакові з Whisper Large V3 Turbo 7,97. На семи підтримуваних мовах відставання від лідера становить від 0,8 до 4,3 пункту; найбільше — на англійській, 8,80 проти 4,49. Для нідерландської, польської та російської результату Apple Speech немає.
Які мови підтримує Apple Speech?
У цьому прогоні Apple Speech повернув результати для 21 з 83 мовних конфігурацій. Обидві моделі Whisper охоплюють усі 83, Qwen3-ASR 1.7B — 30, Parakeet V3 — 25. Серед десяти мов вище він не має моделі для нідерландської, польської та російської. Сталого списку, який можна навести, немає: мовні ресурси належать macOS, тому застосунок під час роботи запитує, що доступно на конкретному комп'ютері.
| Мова | Apple Speech | Qwen3-ASR | Whisper Large | Whisper Small | Parakeet | SenseVoice |
|---|---|---|---|---|---|---|
| Італійська | 4,39 | 2,58 | 2,58 | 7,64 | 3,43 | — |
| Кантонська | 8,69 | 6,44 | 36,75 | 119,01 | — | 37,23 |
| Португальська (Бразилія) | 9,35 | 5,17 | 5,44 | 8,61 | 6,49 | — |
| Гінді | 101,50 | 13,19 | 29,64 | 61,26 | — | — |
| Телугу | 101,63 | — | 81,74 | 103,19 | — | — |
| Урду | 101,69 | — | 23,39 | 38,83 | — | — |
| Панджабі | 101,75 | — | 92,05 | 103,40 | — | — |
| Бенгальська | 102,00 | — | 83,52 | 117,37 | — | — |
| Непальська | 102,13 | — | 88,59 | 118,84 | — | — |
| Малаялам | 102,18 | — | 107,34 | 167,16 | — | — |
| Маратхі | 102,23 | — | 82,69 | 109,95 | — | — |
| Каннада | 103,83 | — | 72,07 | 116,10 | — | — |
| Гуджараті | 104,52 | — | 75,31 | 108,91 | — | — |
| Тамільська | 113,01 | — | 71,28 | 79,77 | — | — |
Інші чотирнадцять мов, для яких Apple Speech повернув результат, у порядку зростання його власної частки помилок. Стовпці, кольори й короткі назви ті самі, що вище; CER для кантонської, WER для решти. Частка помилок може перевищувати 100 %, бо вставки теж входять до чисельника.
В останніх одинадцяти рядках, від гінді до тамільської, Apple Speech відповів латинською транслітерацією замість рідної писемності. Тому частка помилок там вимірює невідповідність писемностей, а не точність розпізнавання, і ці клітинки не беруть участі в ранжуванні рядків; значення інших рушіїв у цих рядках — звичайні вимірювання.
Як працює SpeechAnalyzer
API розпізнавання мовлення є в Apple ще з iOS 10. Його попередня версія, SFSpeechRecognizer, лежить в основі старого шляху диктування. SpeechAnalyzer замінює її: цей API з'явився в macOS 26 та iOS 26 і доступний на всіх платформах Apple, крім watchOS.
API побудовано навколо сеансу. Ти створюєш SpeechAnalyzer, передаєш йому один або кілька модулів і подаєш аудіо; SpeechTranscriber — модуль, який перетворює мовлення на текст. Аудіо надходить як асинхронна послідовність, яку ти наповнюєш сам, результати повертаються другою, і зазвичай вони виконуються в різних завданнях. Аналізатор приймає по одній вхідній послідовності. Кожен буфер і кожен результат має часову мітку відносно власної часової шкали аудіо, тож результат можна повернути на його початкове місце.
Один сеанс, три завдання: аудіо надходить як AsyncSequence, SpeechAnalyzer і SpeechTranscriber аналізують його, а результати повертаються другою AsyncSequence, яку читає інтерфейс. Джерело: Apple, сесія 277 на WWDC25.
Результати надходять двічі. Усе всередині діапазону, який Apple називає мінливим, ще може бути замінено кращим результатом; усе поза ним остаточне. Так застосунок показує чорнову транскрипцію, поки ти ще говориш, а потім виправляє її.
Apple називає п'ять цілей проєктування моделі SpeechTranscriber: довге аудіо, розмовне мовлення, віддалені мовці, низька затримка та конфіденційність, тобто робота на пристрої. На ній побудовані Нотатки, Диктофон, Щоденник і підсумки дзвінків.
П'ять заявлених Apple цілей проєктування моделі SpeechTranscriber. Джерело: Apple, сесія 277 на WWDC25.
Моделі не входять до жодного застосунку. Вони завантажуються із серверів Apple через AssetInventory, зберігаються й оновлюються системою та спільно використовуються застосунками. Вони не збільшують ні розмір завантаження застосунку, ні обсяг пам'яті його процесу, а декодування відбувається поза процесом, який їх викликає. Якщо SpeechTranscriber не має моделі для мови або пристрою, роботу перебирає DictationTranscriber із тими самими моделями, що й системне диктування.
Як ми це вимірювали
Кожен рушій у цій статті транскрибував ті самі фрагменти, у тому самому порядку, по одному за раз, на M5 MacBook Air (32 GB, macOS 27.0). Аудіо взято з тестового спліту Google FLEURS ревізії 70bb2e84: близько 150 речень і 30 хвилин на мову. Фіксований хеш власних ідентифікаторів елементів датасету визначає їхній порядок, а ми беремо найкоротшу послідовність цілих елементів, що перетинає позначку в тридцять хвилин; результати моделей ніяк не впливали на цей вибір. Кожну клітинку заново зібрано за її власною квитанцією та повторно перевірено; перевірку пройшли всі 285.
Оцінки — це WER там, де слова розділено пробілами, і CER для японської, корейської, китайської та кантонської. FLEURS — начитане мовлення, не нарада й не диктування. Ці таблиці показують, чи підходить рушій у принципі для твоєї мови, а не який результат ти отримаєш на власних записах.
Наскільки це краще за старе диктування Apple?
Apple постачає два робочі режими транскрипції, і ми виміряли обидва. SpeechTranscriber — новий режим, який у цій статті названо Apple Speech. DictationTranscriber — режим сумісності, шлях диктування, який Mac використовував раніше.
| Мова | Диктування Apple | Apple Speech |
|---|---|---|
| Корейська | 7,11 | 4,31 |
| Італійська | 6,93 | 4,39 |
| Іспанська (Латинська Америка) | 8,43 | 5,41 |
| Німецька | 12,69 | 6,26 |
| Японська | 9,37 | 6,36 |
| Французька | 17,10 | 7,61 |
| Китайська | 10,28 | 7,97 |
| Кантонська | 10,18 | 8,69 |
| Англійська | 13,83 | 8,80 |
| Португальська (Бразилія) | 10,85 | 9,35 |
Усі мови, які обидва робочі режими Apple виміряли без спотворень, у порядку зростання частки помилок Apple Speech; зеленим позначено краще значення в рядку. Той самий прогін, ті самі фрагменти, той самий Mac. CER для японської, корейської, китайської та кантонської, WER для решти.
Apple Speech точніший на всіх десяти мовах. Для медіанної мови кількість помилок зменшується приблизно на третину, для французької та німецької — більш ніж наполовину, для бразильської португальської та кантонської — приблизно на одну помилку із семи.
Це порівняння з минулим самої Apple. Серед моделей, які ти завантажуєш, його найкращий результат на мові, виміряній без спотворень, — друге місце на кантонській. Диктування охоплює більше мов: 33 конфігурації проти 21 у цьому прогоні, включно з усіма трьома мовами, яких тут бракує новому рушію.
Що дає вбудований рушій?
| Рушій | Швидкість | Пікова пам'ять | Завантаження |
|---|---|---|---|
| SenseVoice Small | 162,3× реального часу | 0,95 GiB | 827 MB |
| Parakeet V3 | 75,6× реального часу | 0,09 GiB | 465 MB |
| Apple Speech | 30,8× реального часу | не вказано | мовний пакет завантажує macOS, а не застосунок |
| Qwen3-ASR 1.7B | 11,1× реального часу | 2,43 GiB | близько 2,5 GB |
| Whisper Small | 7,9× реального часу | 0,87 GiB | 600 MB |
| Whisper Large V3 Turbo | 3,0× реального часу | 1,87 GiB | близько 1,6 GB |
Швидкість — медіана кожного рушія за тринадцятьма мовами, які ця стаття вимірює без спотворень, з урахуванням лише виконаних ним прогонів: пропускна здатність обробки окремих елементів, діагностичний показник, а не затримка продукту. Пікова пам'ять — максимум для групи процесів у цьому прогоні. Apple Speech декодує у службі macOS, якою застосунок-викликач не володіє, тому жодне число там не було б зіставним з іншими п'ятьма.
Мовні ресурси Apple Speech один раз завантажуються системою та спільно використовуються всіма застосунками. У застосунок нічого не входить, і в його власному процесі пам'ять не виділяється. Системна служба все одно використовує пам'ять під час роботи, але ми не можемо точно віднести її до рушія, тому замість нуля ми не наводимо там жодного числа. Швидкість становила 30,8× реального часу — нижче за Parakeet V3 і SenseVoice Small.
Whisper Large V3 Turbo виграє чотири з десяти рядків і є тут найповільнішим рушієм: приблизно вдесятеро повільніший за Apple Speech, займаючи близько 1,6 GB на диску. Qwen3-ASR 1.7B виграє інші шість, займаючи близько 2,5 GB і 2,43 GiB пам'яті. Parakeet V3 потребує 465 MB і 0,09 GiB, випереджає Turbo на французькій, поступається йому на польській і не підтримує японську, корейську, китайську та кантонську. Whisper Small — найближче порівняння за 600 MB, а Apple Speech був точніший на восьми з десяти мов, які обидва виміряли без спотворень.
Чи варто використовувати Apple Speech замість завантаженої моделі?
Мова за мовою:
- Англійська: не найкращий вибір. Apple Speech показав 8,80; Qwen3-ASR 1.7B (4,49) або Whisper Large V3 Turbo (5,49) явно точніший.
- Німецька: не найкращий вибір. Apple Speech показав 6,26; Qwen3-ASR 1.7B (2,85) або Whisper Large V3 Turbo (4,05) явно точніший.
- Нідерландська, російська та польська: Apple Speech не має моделі для цих трьох мов. Whisper Large V3 Turbo був найточнішим для кожної: 5,69, 5,13 та 5,45.
- Японська: можна використовувати. Apple Speech показав 6,36, поступившись Whisper Large V3 Turbo із результатом 5,30.
- Корейська: можна використовувати. Apple Speech показав 4,31, поступившись Qwen3-ASR 1.7B із результатом 3,54.
- Французька: не найкращий вибір. Apple Speech показав 7,61; Qwen3-ASR 1.7B (4,57) або Parakeet V3 (5,83) явно точніший.
- Китайська: можна використовувати. Apple Speech показав 7,97, стільки ж, скільки Whisper Large V3 Turbo; найточнішим був Qwen3-ASR 1.7B із результатом 6,49.
- Іспанська: не найкращий вибір. Apple Speech показав 5,41; Qwen3-ASR 1.7B (3,38) або Whisper Large V3 Turbo (3,62) явно точніший.
Apple Speech — уживана в цій статті коротка назва SpeechTranscriber від Apple, API на пристрої, який може викликати будь-який застосунок для Mac на macOS 26 або новішій. Це не одна з моделей, які завантажує Whisper Notes для Mac: у збірці прямого завантаження для Mac (DMG) це Whisper, Parakeet V3, SenseVoice та Qwen3-ASR, а на iPhone і в збірці з Mac App Store — Whisper, Parakeet V3 та SenseVoice. Таблиця за рушіями є на нашій сторінці підтримки мов.
Усе це не змінює того, як Whisper Notes для Mac працює сьогодні: Parakeet V3 і далі використовується за замовчуванням.
Поширені запитання
Apple Speech такий самий точний, як Whisper?
На більшості мов, які підтримують обидва, — ні. У нашому власному прогоні FLEURS серед семи з цих десяти мов, підтримуваних Apple Speech, Whisper Large V3 Turbo був точніший на шести, а на китайській обидва показали рівно по 7,97 % CER. У порівнянні з Whisper Small порядок змінюється: Apple Speech був попереду на шести із семи й поступився лише на англійській — 8,80 % проти 7,04 % WER. У цьому прогоні він не лідирує на жодній мові, виміряній без спотворень, і найближчий до лідера на корейській: 4,31 % CER проти 3,54 %. Кантонська — єдина мова, виміряна без спотворень, де він обійшов Whisper Large V3 Turbo: 8,69 % проти 36,75 % CER. Використовуй вбудований рушій, якщо він підтримує твою мову й ти волієш, щоб мовним пакетом керувала macOS; для найточнішого результату або якщо твоя мова — одна з трьох, яких тут немає в Apple Speech, використовуй Whisper Large V3 Turbo.
Які мови підтримує Apple Speech?
Список визначає macOS, а не застосунок. У цьому прогоні Apple Speech видав результати для 21 з 83 протестованих мовних конфігурацій, обидві збірки Whisper — для 83, Qwen3-ASR 1.7B — для 30, Parakeet V3 — для 25. Із десяти найуживаніших мов основної таблиці він підтримує англійську, німецьку, японську, корейську, французьку, китайську та іспанську, але не нідерландську, польську й російську. У другій таблиці ще чотирнадцять конфігурацій: італійська, кантонська, бразильська португальська та одинадцять мов, де він відповів латинською транслітерацією замість рідної писемності. Застосунок має під час роботи запитати в macOS, які мови доступні на конкретному комп'ютері. Якщо твоєї мови немає, Whisper охоплює всі мови зі списку застосунку на кожному каналі.
Apple Speech чи Parakeet V3 — що вибрати?
Parakeet V3 — для кожної європейської мови, яку підтримують обидва. Він показав 6,89 проти 8,80 на англійській, 5,83 проти 7,61 на французькій, 4,86 проти 5,41 на іспанській, 3,43 проти 4,39 на італійській і 6,49 проти 9,35 на бразильській португальській; на німецькій обидва отримали 6,26. Parakeet V3 не має японської, корейської, китайської та кантонської, тож із цієї пари там доступний лише Apple Speech, який відстає від лідера рядка не більш ніж на 1,5 пункту на японській, корейській і китайській. Розмір завантаження Parakeet V3 — 465 MB, швидкість — 75,6× реального часу, пік — 0,09 GiB; мовний пакет Apple Speech завантажує macOS, а його швидкість становила 30,8× реального часу із пам'яттю, яку ми не вказуємо.
Що таке SpeechAnalyzer і чи це те саме, що диктування Apple?
SpeechAnalyzer — парасольковий API, який Apple представила на WWDC 2025 і випустила в macOS 26 та iOS 26. SpeechTranscriber — робочий режим транскрипції всередині нього; саме його ми вимірювали й називаємо в цій статті Apple Speech. Диктування — режим сумісності, який ми також протестували: Apple Speech був точніший на всіх десяти мовах, які обидва режими обробили без спотворень, скоротивши приблизно третину помилок для медіанної мови й більш ніж половину для французької та німецької. Диктування охоплює більше мов, 33 конфігурації проти 21, тому для нідерландської, польської чи російської це системний рушій, якщо тебе влаштовують 17,34 %, 13,50 % і 13,13 % WER. Whisper Large V3 Turbo показав на тих самих фрагментах 5,69 %, 5,45 % і 5,13 %.
Чи залишає аудіо мій Mac, коли я використовую Apple Speech?
Apple документує SpeechTranscriber як розпізнавання мовлення на пристрої: macOS один раз завантажує мовні ресурси, а розпізнавання працює локально. Ми вимірювали точність і швидкість, а не поведінку мережі, тому описуємо цю частину так само, як Apple. Рушії, які Whisper Notes завантажує сам, — Whisper, Parakeet V3, SenseVoice і Qwen3-ASR — працюють на GPU або Neural Engine твого Mac без облікового запису й API key, а транскрипція працює з вимкненою мережею на кожному каналі.
Чому ці цифри не збігаються з точністю на моїх записах?
Тому що FLEURS — це коротке, чисте, начитане мовлення, а твої записи — ні. Наш прогін — калібрування на відкритому датасеті: близько 150 речень і 30 хвилин аудіо на мову, один M5 MacBook Air, ті самі фрагменти для кожного рушія. Він показує, чи підходить рушій у принципі для мови, а не який результат ти отримаєш на нараді, шумному аудіо, мовленні з акцентом чи двогодинному файлі.
Чому інші тести кажуть, що Apple Speech випереджає Whisper?
Вони порівнюють його з Whisper Small і лише на англійській. У нашому прогоні з Whisper Small усе збігається: Apple Speech випередив його на восьми з десяти мов, які обидва виміряли без спотворень. Англійська — одна з двох програних, 8,80 проти 7,04. На Whisper Large V3 Turbo це не переноситься: йому Apple Speech поступився на восьми з тих самих десяти мов, зрівнявся на китайській при 7,97 і вийшов уперед лише на кантонській. Заголовок вирішує те, який саме Whisper бере участь у порівнянні.
Спробуй
Усі п'ять завантажуваних моделей тут — Whisper Small, Whisper Large V3 Turbo, Parakeet V3, SenseVoice Small і Qwen3-ASR 1.7B — є у прямому завантаженні Whisper Notes для Mac (DMG) за шляхом Налаштування → Модель транскрипції.
Якщо наші цифри не збігаються з твоїм досвідом для якоїсь мови, напиши на mac@whispernotes.app. Повні примітки до випусків: whispernotes.app/changelog.
Джерела: наш прогін на тестовому спліті Google FLEURS ревізії 70bb2e84, документація Apple щодо SpeechAnalyzer і попередній прогін Qwen3-ASR на тридцяти мовах.