Начиная с macOS 26 и iOS 26 Apple выпускает новое поколение распознавания речи на устройстве — SpeechAnalyzer и SpeechTranscriber, далее для краткости Apple Speech. Оно заметно точнее старого движка диктовки. Поэтому мы хотели выяснить: достаточно ли теперь хорошо работает встроенное распознавание речи Apple, чтобы можно было полностью обойтись без приложения для транскрипции? И насколько оно отстаёт от открытых моделей, работающих на устройстве в Whisper Notes, — Whisper, Parakeet, SenseVoice и Qwen3-ASR? Мы провели строгий тест. Вот результаты. На десяти протестированных языках Apple Speech ни разу не показал самую низкую частоту ошибок, отстал от лидера не более чем на 1,5 пункта на корейском, японском и китайском и вовсе не имеет модели для нидерландского, русского и польского.
Насколько Apple Speech отстаёт от загружаемых моделей?
| Язык | Apple Speech | Qwen3-ASR | Whisper Large | Whisper Small | Parakeet | SenseVoice |
|---|---|---|---|---|---|---|
| Английский | 8,80 | 4,49 | 5,49 | 7,04 | 6,89 | 8,46 |
| Немецкий | 6,26 | 2,85 | 4,05 | 8,67 | 6,26 | — |
| Нидерландский | — | 7,36 | 5,69 | 16,75 | 8,58 | — |
| Русский | — | 5,65 | 5,13 | 11,37 | 7,12 | — |
| Польский | — | 12,59 | 5,45 | 15,81 | 8,30 | — |
| Японский | 6,36 | 5,74 | 5,30 | 11,37 | — | 6,78 |
| Корейский | 4,31 | 3,54 | 4,25 | 7,30 | — | 7,85 |
| Французский | 7,61 | 4,57 | 5,97 | 13,24 | 5,83 | — |
| Китайский | 7,97 | 6,49 | 7,97 | 20,50 | — | 7,69 |
| Испанский (Латинская Америка) | 5,41 | 3,38 | 3,62 | 6,22 | 4,86 | — |
Десять из наиболее используемых языков, по одному движку в каждом столбце. В каждой ячейке указана частота ошибок движка: чем меньше, тем лучше; зелёным отмечено наименьшее значение в строке, белым — второе. CER для японского, корейского и китайского, WER для остальных; мы никогда не объединяем их в одно число. Наш собственный прогон FLEURS, выполненный командой Whisper Notes, на одном M5 MacBook Air, начитанная речь.
Короткие названия: Qwen3-ASR = Qwen3-ASR 1.7B, Whisper Large = Whisper Large V3 Turbo, Parakeet = Parakeet V3, SenseVoice = SenseVoice Small. Прочерк означает, что у движка нет модели для этого языка.
Qwen3-ASR 1.7B показал самую низкую частоту ошибок на шести из десяти языков, Whisper Large V3 Turbo — на остальных четырёх. Apple Speech отстаёт от лидера строки на 0,77 пункта на корейском, на 1,06 на японском и на 1,48 на китайском, где совпадает с Whisper Large V3 Turbo: 7,97. На семи поддерживаемых языках отставание от лидера составляет от 0,8 до 4,3 пункта; самое большое — на английском, 8,80 против 4,49. Для нидерландского, польского и русского результата Apple Speech нет.
Какие языки поддерживает Apple Speech?
В этом прогоне Apple Speech вернул результаты для 21 из 83 языковых конфигураций. Обе модели Whisper покрывают все 83, Qwen3-ASR 1.7B — 30, Parakeet V3 — 25. Среди десяти языков выше у него нет модели для нидерландского, польского и русского. Фиксированного списка, который можно было бы привести, нет: языковые ресурсы принадлежат macOS, поэтому приложение во время работы запрашивает, что доступно на конкретном компьютере.
| Язык | Apple Speech | Qwen3-ASR | Whisper Large | Whisper Small | Parakeet | SenseVoice |
|---|---|---|---|---|---|---|
| Итальянский | 4,39 | 2,58 | 2,58 | 7,64 | 3,43 | — |
| Кантонский | 8,69 | 6,44 | 36,75 | 119,01 | — | 37,23 |
| Португальский (Бразилия) | 9,35 | 5,17 | 5,44 | 8,61 | 6,49 | — |
| Хинди | 101,50 | 13,19 | 29,64 | 61,26 | — | — |
| Телугу | 101,63 | — | 81,74 | 103,19 | — | — |
| Урду | 101,69 | — | 23,39 | 38,83 | — | — |
| Панджаби | 101,75 | — | 92,05 | 103,40 | — | — |
| Бенгальский | 102,00 | — | 83,52 | 117,37 | — | — |
| Непальский | 102,13 | — | 88,59 | 118,84 | — | — |
| Малаялам | 102,18 | — | 107,34 | 167,16 | — | — |
| Маратхи | 102,23 | — | 82,69 | 109,95 | — | — |
| Каннада | 103,83 | — | 72,07 | 116,10 | — | — |
| Гуджарати | 104,52 | — | 75,31 | 108,91 | — | — |
| Тамильский | 113,01 | — | 71,28 | 79,77 | — | — |
Остальные четырнадцать языков, для которых Apple Speech вернул результат, в порядке возрастания его собственной частоты ошибок. Столбцы, цвета и короткие названия те же, что выше; CER для кантонского, WER для остальных. Частота ошибок может превышать 100 %, потому что вставки тоже учитываются в числителе.
В последних одиннадцати строках, от хинди до тамильского, Apple Speech ответил латинской транслитерацией вместо родной письменности. Поэтому частота ошибок там отражает несовпадение письменностей, а не точность распознавания, и эти ячейки исключены из ранжирования строк; значения остальных движков в этих строках — обычные измерения.
Как работает SpeechAnalyzer
API распознавания речи существует у Apple со времён iOS 10. Его прежняя версия, SFSpeechRecognizer, лежит в основе старого пути диктовки. SpeechAnalyzer заменяет её: этот API появился в macOS 26 и iOS 26 и доступен на всех платформах Apple, кроме watchOS.
API построен вокруг сеанса. Ты создаёшь SpeechAnalyzer, передаёшь ему один или несколько модулей и подаёшь звук; SpeechTranscriber — модуль, который превращает речь в текст. Звук поступает как асинхронная последовательность, которую ты заполняешь сам, результаты возвращаются второй последовательностью, и обычно они выполняются в разных задачах. Анализатор принимает по одной входной последовательности. Каждый буфер и каждый результат имеют временную метку относительно собственной временной шкалы аудио, поэтому результат можно вернуть на исходное место.
Один сеанс, три задачи: звук поступает как AsyncSequence, SpeechAnalyzer и SpeechTranscriber анализируют его, а результаты возвращаются второй AsyncSequence, которую читает интерфейс. Источник: Apple, сессия 277 на WWDC25.
Результаты приходят дважды. Всё внутри диапазона, который Apple называет изменяемым, ещё может быть заменено более точным результатом; всё за его пределами окончательно. Так приложение показывает черновую расшифровку, пока ты ещё говоришь, а затем исправляет её.
Apple заявляет пять целей проектирования модели SpeechTranscriber: длинные аудиозаписи, разговорная речь, удалённые говорящие, низкая задержка и конфиденциальность, то есть работа на устройстве. На ней построены Заметки, Диктофон, Дневник и сводки звонков.
Пять заявленных Apple целей проектирования модели SpeechTranscriber. Источник: Apple, сессия 277 на WWDC25.
Модели не входят ни в одно приложение. Они загружаются с серверов Apple через AssetInventory, хранятся и обновляются системой и совместно используются приложениями. Они не увеличивают ни размер загрузки приложения, ни объём памяти его процесса, а декодирование происходит вне вызывающего процесса. Если у SpeechTranscriber нет модели для языка или устройства, работу принимает DictationTranscriber с теми же моделями, что и системная диктовка.
Как мы это измеряли
Каждый движок в этой статье расшифровал одни и те же фрагменты, в одном порядке, по одному за раз, на M5 MacBook Air (32 ГБ, macOS 27.0). Аудио взято из тестового сплита Google FLEURS ревизии 70bb2e84: около 150 предложений и 30 минут на язык. Фиксированный хеш собственных идентификаторов элементов датасета задаёт их порядок, а мы берём кратчайшую последовательность целых элементов, которая пересекает отметку в тридцать минут; результаты моделей никак не влияли на этот выбор. Каждая ячейка была заново собрана по собственной квитанции и повторно проверена; проверку прошли все 285.
Оценки — это WER там, где слова разделяются пробелами, и CER для японского, корейского, китайского и кантонского. FLEURS — начитанная речь, не совещание и не диктовка. Эти таблицы показывают, подходит ли движок в принципе для твоего языка, а не какой результат ты получишь на своих записях.
Насколько это лучше старой диктовки Apple?
Apple выпускает два рабочих режима транскрипции, и мы измерили оба. SpeechTranscriber — новый режим, который в этой статье называется Apple Speech. DictationTranscriber — режим совместимости, путь диктовки, который раньше использовал Mac.
| Язык | Диктовка Apple | Apple Speech |
|---|---|---|
| Корейский | 7,11 | 4,31 |
| Итальянский | 6,93 | 4,39 |
| Испанский (Латинская Америка) | 8,43 | 5,41 |
| Немецкий | 12,69 | 6,26 |
| Японский | 9,37 | 6,36 |
| Французский | 17,10 | 7,61 |
| Китайский | 10,28 | 7,97 |
| Кантонский | 10,18 | 8,69 |
| Английский | 13,83 | 8,80 |
| Португальский (Бразилия) | 10,85 | 9,35 |
Все языки, которые оба рабочих режима Apple измерили без искажений, в порядке возрастания частоты ошибок Apple Speech; зелёным отмечено лучшее значение в строке. Тот же прогон, те же фрагменты, тот же Mac. CER для японского, корейского, китайского и кантонского, WER для остальных.
Apple Speech точнее на всех десяти языках. Для медианного языка число ошибок сокращается примерно на треть, для французского и немецкого — более чем наполовину, для бразильского португальского и кантонского — примерно на одну ошибку из семи.
Это сравнение с собственным прошлым Apple. Среди загружаемых моделей его лучший результат на языке, измеренном без искажений, — второе место на кантонском. Диктовка покрывает больше языков: 33 конфигурации против 21 в этом прогоне, включая все три языка, для которых здесь нет нового движка.
Что даёт встроенный движок?
| Движок | Скорость | Пиковая память | Загрузка |
|---|---|---|---|
| SenseVoice Small | 162,3× реального времени | 0,95 ГиБ | 827 МБ |
| Parakeet V3 | 75,6× реального времени | 0,09 ГиБ | 465 МБ |
| Apple Speech | 30,8× реального времени | не указано | языковой пакет загружается macOS, а не приложением |
| Qwen3-ASR 1.7B | 11,1× реального времени | 2,43 ГиБ | около 2,5 ГБ |
| Whisper Small | 7,9× реального времени | 0,87 ГиБ | 600 МБ |
| Whisper Large V3 Turbo | 3,0× реального времени | 1,87 ГиБ | около 1,6 ГБ |
Скорость — медиана каждого движка по тринадцати языкам, которые эта статья измеряет без искажений, с учётом только выполненных им прогонов: пропускная способность обработки отдельных элементов, диагностический показатель, а не задержка продукта. Пиковая память — максимум для группы процессов в этом прогоне. Apple Speech декодирует в службе macOS, которой вызывающее приложение не владеет, поэтому указанное там число не было бы сопоставимо с остальными пятью.
Языковые ресурсы Apple Speech один раз загружаются системой и совместно используются всеми приложениями. В состав приложения ничего не входит, и в собственном процессе приложения память не выделяется. Системная служба всё равно использует память во время работы, но мы не можем точно отнести её к движку, поэтому вместо нуля мы не приводим там никакого числа. Скорость составила 30,8× реального времени — ниже Parakeet V3 и SenseVoice Small.
Whisper Large V3 Turbo выигрывает четыре из десяти строк и является здесь самым медленным движком: примерно в десять раз медленнее Apple Speech при размере около 1,6 ГБ на диске. Qwen3-ASR 1.7B выигрывает остальные шесть, занимая около 2,5 ГБ и 2,43 ГиБ памяти. Parakeet V3 требует 465 МБ и 0,09 ГиБ, опережает Turbo на французском, уступает ему на польском и не поддерживает японский, корейский, китайский и кантонский. Whisper Small — ближайшее сравнение при размере 600 МБ, а Apple Speech оказался точнее на восьми из десяти языков, которые оба измерили без искажений.
Стоит ли использовать Apple Speech вместо загружаемой модели?
По языкам:
- Английский: не лучший выбор. Apple Speech показал 8,80; Qwen3-ASR 1.7B (4,49) или Whisper Large V3 Turbo (5,49) явно точнее.
- Немецкий: не лучший выбор. Apple Speech показал 6,26; Qwen3-ASR 1.7B (2,85) или Whisper Large V3 Turbo (4,05) явно точнее.
- Нидерландский, русский и польский: у Apple Speech нет модели для этих трёх языков. Whisper Large V3 Turbo оказался самым точным для каждого: 5,69, 5,13 и 5,45.
- Японский: можно использовать. Apple Speech показал 6,36, уступив Whisper Large V3 Turbo с результатом 5,30.
- Корейский: можно использовать. Apple Speech показал 4,31, уступив Qwen3-ASR 1.7B с результатом 3,54.
- Французский: не лучший выбор. Apple Speech показал 7,61; Qwen3-ASR 1.7B (4,57) или Parakeet V3 (5,83) явно точнее.
- Китайский: можно использовать. Apple Speech показал 7,97, столько же, сколько Whisper Large V3 Turbo; самым точным оказался Qwen3-ASR 1.7B с результатом 6,49.
- Испанский: не лучший выбор. Apple Speech показал 5,41; Qwen3-ASR 1.7B (3,38) или Whisper Large V3 Turbo (3,62) явно точнее.
Apple Speech — принятое в этой статье короткое название SpeechTranscriber от Apple, API на устройстве, который любое приложение для Mac может вызывать в macOS 26 и новее. Это не одна из моделей, которые загружает Whisper Notes для Mac: в сборке прямой загрузки для Mac (DMG) это Whisper, Parakeet V3, SenseVoice и Qwen3-ASR, а на iPhone и в сборке из Mac App Store — Whisper, Parakeet V3 и SenseVoice. Таблица по движкам находится на нашей странице поддержки языков.
Всё это не меняет сегодняшнюю работу Whisper Notes для Mac: Parakeet V3 по-прежнему используется по умолчанию.
Часто задаваемые вопросы
Apple Speech так же точен, как Whisper?
На большинстве языков, которые поддерживают оба, — нет. В нашем собственном прогоне FLEURS среди семи из этих десяти языков, поддерживаемых Apple Speech, Whisper Large V3 Turbo был точнее на шести, а на китайском оба показали ровно по 7,97 % CER. В сравнении с Whisper Small порядок меняется: Apple Speech был впереди на шести из семи и уступил только на английском — 8,80 % против 7,04 % WER. В этом прогоне он не лидирует ни на одном языке, измеренном без искажений, и ближе всего к лидеру на корейском: 4,31 % CER против 3,54 %. Кантонский — единственный язык, измеренный без искажений, на котором он обошёл Whisper Large V3 Turbo: 8,69 % против 36,75 % CER. Используй встроенный движок, если он поддерживает твой язык и ты предпочитаешь, чтобы языковым пакетом управляла macOS; для самого точного результата или если твой язык входит в отсутствующую здесь тройку Apple Speech используй Whisper Large V3 Turbo.
Какие языки поддерживает Apple Speech?
Список определяет macOS, а не приложение. В этом прогоне Apple Speech выдал результаты для 21 из 83 протестированных языковых конфигураций, обе сборки Whisper — для 83, Qwen3-ASR 1.7B — для 30, Parakeet V3 — для 25. Из десяти наиболее используемых языков основной таблицы он поддерживает английский, немецкий, японский, корейский, французский, китайский и испанский, но не нидерландский, польский и русский. Во второй таблице ещё четырнадцать конфигураций: итальянский, кантонский, бразильский португальский и одиннадцать языков, где он ответил латинской транслитерацией вместо родной письменности. Приложение должно во время работы запросить у macOS языки, доступные на конкретном компьютере. Если твоего языка нет, Whisper охватывает все языки из списка приложения на каждом канале.
Apple Speech или Parakeet V3 — что выбрать?
Parakeet V3 — для каждого европейского языка, который поддерживают оба. Он показал 6,89 против 8,80 на английском, 5,83 против 7,61 на французском, 4,86 против 5,41 на испанском, 3,43 против 4,39 на итальянском и 6,49 против 9,35 на бразильском португальском; на немецком оба получили 6,26. У Parakeet V3 нет японского, корейского, китайского и кантонского, поэтому из этой пары там доступен только Apple Speech, который отстаёт от лидера строки не более чем на 1,5 пункта на японском, корейском и китайском. Размер загрузки Parakeet V3 — 465 МБ, скорость — 75,6× реального времени, пик — 0,09 ГиБ; языковой пакет Apple Speech загружается macOS, а его скорость составила 30,8× реального времени при памяти, которую мы не указываем.
Что такое SpeechAnalyzer и то же ли это, что диктовка Apple?
SpeechAnalyzer — зонтичный API, который Apple представила на WWDC 2025 и выпустила в macOS 26 и iOS 26. SpeechTranscriber — рабочий режим транскрипции внутри него; именно его мы измеряли и называем в этой статье Apple Speech. Диктовка — режим совместимости, который мы тоже протестировали: Apple Speech был точнее на всех десяти языках, которые оба режима обработали без искажений, сократив примерно треть ошибок для медианного языка и более половины для французского и немецкого. Диктовка покрывает больше языков, 33 конфигурации против 21, поэтому для нидерландского, польского и русского это системный движок, если тебя устраивают 17,34 %, 13,50 % и 13,13 % WER. Whisper Large V3 Turbo показал на тех же фрагментах 5,69 %, 5,45 % и 5,13 %.
Покидает ли аудио мой Mac при использовании Apple Speech?
Apple описывает SpeechTranscriber в документации как распознавание речи на устройстве: macOS один раз загружает языковые ресурсы, а распознавание выполняется локально. Мы измеряли точность и скорость, а не сетевое поведение, поэтому описываем эту часть так же, как Apple. Движки, которые Whisper Notes загружает сам, — Whisper, Parakeet V3, SenseVoice и Qwen3-ASR — работают на GPU или Neural Engine твоего Mac без учётной записи и API key, а транскрипция работает при отключённой сети на каждом канале.
Почему эти цифры не совпадают с точностью на моих записях?
Потому что FLEURS — это короткая, чистая, начитанная речь, а твои записи — нет. Наш прогон — калибровка на общедоступном датасете: около 150 предложений и 30 минут аудио на язык, один M5 MacBook Air, одинаковые фрагменты для каждого движка. Он показывает, подходит ли движок в принципе для языка, а не какой результат ты получишь на совещании, шумном аудио, речи с акцентом или двухчасовом файле.
Почему другие тесты утверждают, что Apple Speech обходит Whisper?
Они сравнивают его с Whisper Small и только на английском. В нашем прогоне с Whisper Small всё сходится: Apple Speech обошёл его на восьми из десяти языков, которые оба измерили без искажений. Английский — один из двух проигранных, 8,80 против 7,04. На Whisper Large V3 Turbo это не переносится: ему Apple Speech уступил на восьми из тех же десяти языков, сравнялся на китайском при 7,97 и вышел вперёд только на кантонском. Заголовок решает то, какой именно Whisper участвует в сравнении.
Попробуй
Все пять загружаемых моделей здесь — Whisper Small, Whisper Large V3 Turbo, Parakeet V3, SenseVoice Small и Qwen3-ASR 1.7B — доступны в прямой загрузке Whisper Notes для Mac (DMG) по пути Настройки → Модель транскрипции.
Если наши цифры не совпадают с твоим опытом для какого-либо языка, напиши на mac@whispernotes.app. Полные примечания к выпускам: whispernotes.app/changelog.
Источники: наш прогон на тестовом сплите Google FLEURS ревизии 70bb2e84, документация Apple по SpeechAnalyzer и предыдущий прогон Qwen3-ASR на тридцати языках.