Мы хотели ответить на один вопрос: есть ли локальная модель, которая распознаёт твой язык точнее, чем Whisper Large V3? Поэтому мы прогнали эти модели на датасете FLEURS.
FLEURS — датасет Google с начитанной речью на 102 языках. Мы взяли примерно по 75 фраз на язык и прогнали одни и те же записи, в одном и том же порядке, через пять моделей:
- Parakeet V3
- Whisper Large V3 Turbo
- SenseVoice Small
- Whisper Small
- Qwen3-ASR 1.7B
Вот что получилось.
Qwen3-ASR 1.7B против Whisper Large V3 Turbo — наш собственный прогон FLEURS, один M5 MacBook Air, начитанная речь, короткие фрагменты.
| Qwen3-ASR 1.7B | Whisper Large V3 Turbo | |
|---|---|---|
| Поддерживаемые языки | 30 | 101 |
| Явные преимущества | кантонский, хинди, тайский, вьетнамский, французский (5) | финский, венгерский, греческий и ещё 8 языков (11) |
| Скорость | 8,7× реального времени | 2,4× реального времени |
| Пиковая память | 2,43 ГиБ | 1,87 ГиБ |
| Размер загрузки | около 2,5 ГБ | около 1,6 ГБ |
За пределами сильных языков каждой модели разница в точности небольшая.
Whisper Large V3 против Qwen3-ASR: подробное сравнение
Все 30 языков — от самого крупного выигрыша Qwen до самого крупного проигрыша. В обоих столбцах меньше значит лучше.
Наш собственный прогон FLEURS, один M5 MacBook Air, начитанная речь. Для китайского, кантонского, японского, корейского и тайского — CER, для остальных — WER; зелёным отмечен отрыв шире парных 95-процентных интервалов.
| Язык | Qwen3-ASR 1.7B | Whisper Large V3 Turbo |
|---|---|---|
| Кантонский | 6,00 | 37,97 |
| Хинди | 13,67 | 30,42 |
| Тайский | 5,92 | 12,95 |
| Вьетнамский | 5,07 | 9,79 |
| Персидский | 26,98 | 30,03 |
| Арабский | 14,14 | 15,75 |
| Индонезийский | 4,97 | 6,50 |
| Французский | 3,98 | 5,39 |
| Китайский | 5,69 | 6,88 |
| Английский | 5,07 | 5,92 |
| Немецкий | 3,51 | 4,10 |
| Японский | 5,39 | 5,71 |
| Корейский | 3,51 | 3,70 |
| Испанский | 3,60 | 3,76 |
| Итальянский | 2,98 | 3,05 |
| Русский | 5,98 | 5,51 |
| Португальский | 5,64 | 4,91 |
| Македонский | 17,81 | 16,64 |
| Малайский | 11,60 | 10,18 |
| Нидерландский | 7,65 | 5,63 |
| Турецкий | 8,34 | 5,53 |
| Датский | 20,12 | 14,92 |
| Польский | 12,78 | 5,32 |
| Румынский | 18,97 | 8,22 |
| Филиппинский | 20,44 | 9,37 |
| Шведский | 20,04 | 8,72 |
| Чешский | 23,92 | 11,15 |
| Греческий | 30,20 | 12,97 |
| Финский | 26,08 | 6,54 |
| Венгерский | 36,35 | 13,66 |
Наш собственный парный прогон на тестовом сплите FLEURS, ревизия 70bb2e84, примерно 75 фраз на язык, один M5 MacBook Air.
Пять языков, где Qwen3-ASR 1.7B выигрывает уверенно. Частота ошибок в процентах, Qwen против Turbo: кантонский (6,0 против 38,0), хинди (13,7 против 30,4), тайский (5,9 против 13,0), вьетнамский (5,1 против 9,8), французский (4,0 против 5,4). Кантонский и тайский считаются по символам, остальные — по словам. Преимущество Qwen — в языках, которые считаются по символам: на китайском, кантонском, японском, корейском и тайском он дал в среднем 5,3 % против 13,4 % у Turbo. На остальных двадцати пяти, где счёт идёт по словам, у него в среднем 14,0 % против 10,2 % у Turbo.
Одиннадцать языков, где Whisper Large V3 Turbo выигрывает уверенно. Частота ошибок в процентах, Qwen против Turbo, везде счёт по словам: венгерский (36,4 против 13,7), греческий (30,2 против 13,0), финский (26,1 против 6,5), чешский (23,9 против 11,2), филиппинский (20,4 против 9,4), датский (20,1 против 14,9), шведский (20,0 против 8,7), румынский (19,0 против 8,2), польский (12,8 против 5,3), турецкий (8,3 против 5,5), нидерландский (7,7 против 5,6).
Четырнадцать языков, где разрыва почти нет. Английский (5,1 против 5,9), немецкий (3,5 против 4,1), испанский (3,6 против 3,8), итальянский (3,0 против 3,1), русский (6,0 против 5,5), португальский (5,6 против 4,9); китайский (5,7 против 6,9), японский (5,4 против 5,7) и корейский (3,5 против 3,7) считаются по символам. Дальше — арабский, индонезийский, персидский, малайский и македонский. Все разрывы здесь маленькие и укладываются в 95-процентный интервал, так что этот прогон не разделяет две модели.
Кантонский — единственная строка, которая меняет решение: 6,00 % против 37,97 %. SenseVoice Small, который мы раньше называли ответом для кантонского, дал на тех же записях 36,71 % CER. На этом наборе начитанной речи планку не берёт ни один из двух, поэтому у старой рекомендации теперь есть эта оговорка.
Насколько быстр Qwen3-ASR 1.7B?
Все пять движков измерены на одном и том же стенде, на одной машине (M5 MacBook Air), так что между собой они сравнимы.
Медианный коэффициент реального времени по языкам каждого движка в одном и том же прогоне FLEURS, один M5 MacBook Air, начитанная речь.
| Движок | Языки | Медианная скорость в этом прогоне (короткие фрагменты) |
|---|---|---|
| SenseVoice Small | 6 языков | 161,0× |
| Parakeet TDT 0.6B v3 | 25 | 82,9× |
| Qwen3-ASR 1.7B | 30 заявленных | 8,7× |
| Whisper Small | 101 | 6,4× |
| Whisper Large V3 Turbo | 101 | 2,4× |
Это цифры со стенда на коротких фрагментах, и они ниже того, что те же движки выдают на длинной записи. Столбец годится только для сравнения движков между собой внутри этого прогона.
Parakeet V3 и SenseVoice Small на том же стенде примерно на порядок быстрее Qwen3-ASR. На длинных файлах, а не на коротких фрагментах, Parakeet выходил на 103× реального времени на M4 Pro, а SenseVoice — на 52× и выше: другое измерение на другом аудио, но вывод тот же.
Qwen3-ASR посередине. В этом прогоне на коротких фрагментах он не был самым медленным: самым медленным оказался Whisper Large V3 Turbo. Но разброс по языкам у него больше, чем у остальных: от 2,7× на греческом до 12,4× на японском.
Сколько Qwen3-ASR занимает памяти и места на диске?
Пиковая память — максимальный объём процесса, замеченный на элементах того же прогона FLEURS, один M5 MacBook Air, начитанная речь, короткие фрагменты.
| Движок | Размер загрузки | Пиковая память в этом прогоне |
|---|---|---|
| Parakeet TDT 0.6B v3 | 465 МБ | 0,09 ГиБ |
| Whisper Small | 600 МБ | 0,87 ГиБ |
| SenseVoice Small | 827 МБ | 0,95 ГиБ |
| Whisper Large V3 Turbo | около 1,6 ГБ | 1,87 ГиБ |
| Qwen3-ASR 1.7B | около 2,5 ГБ | 2,43 ГиБ |
По обеим осям Qwen3-ASR самый тяжёлый из пяти: около 2,5 ГБ загрузки и 2,43 ГиБ пиковой памяти процесса в этом прогоне против примерно 1,6 ГБ и 1,87 ГиБ у Whisper Large V3 Turbo.
На Mac с 8 ГБ есть путь полегче. Parakeet V3 закрывает 25 языков в 465 МБ и 0,09 ГиБ, а Whisper Small — 101 язык в 600 МБ и 0,87 ГиБ.
Как мы измеряли: FLEURS, 30 языков, один Mac
Qwen3-ASR 1.7B работал как сборка MLX 8-bit, Whisper Large V3 Turbo — как сборка ggml для whisper.cpp на Metal. Данные — тестовый сплит Google FLEURS ревизии 70bb2e84 (CC-BY-4.0): 83 языка из его 102, примерно по 75 фраз и 15 минут на каждый, одни и те же записи в одном и том же порядке для всех моделей; парное сравнение — это 30 языков Qwen. WER для языков с пробелами между словами, CER для китайского, кантонского, японского, корейского и тайского, без сведения в одно число; интервалы — бутстрап по элементам, 10 000 пересэмплирований. Один M5 MacBook Air, 32 ГБ, macOS 26.5, ни одна из двух моделей не дала пустых расшифровок или сбоев.
FLEURS — это начитанная речь, а не совещание и не диктовка. Рейтинги на начитанной речи дважды не пережили у нас встречу с реальным аудио, поэтому мы не переносим их на длинные записи: эти таблицы говорят, стоит ли пробовать модель на твоём языке, а не какую точность ты получишь. Про оценку Qwen3-ASR 1.7B на настоящих совещаниях будет отдельный текст.
Стоит ли переходить с Whisper Large V3 на Qwen3-ASR?
Вот как мы ответили бы на это по языкам, внутри Whisper Notes для Mac.
- Если ты расшифровываешь кантонский, хинди, тайский, вьетнамский или французский — бери Qwen3-ASR 1.7B.
- Если ты расшифровываешь китайский, японский, корейский, английский, немецкий, испанский или итальянский — он впереди на волосок, и на большее мы не претендуем. Подойдёт любая из двух моделей; то же самое с персидским, арабским, индонезийским, русским, португальским, македонским и малайским.
- Если ты расшифровываешь финский, венгерский, греческий, чешский, шведский, датский, польский, румынский, филиппинский, турецкий или нидерландский — оставайся на Whisper Large V3 Turbo. Все одиннадцать он выиграл уверенно.
- Если тебе важны скорость или место на диске — этот движок не подойдёт. Parakeet V3 и SenseVoice Small оказались на порядок быстрее, а весят в разы меньше; Whisper Small закрывает 101 язык в 600 МБ на 6,4×.
- Если у тебя iPhone или сборка из Mac App Store — движка там пока нет. На этих каналах кантонский закрывает SenseVoice.
Это перенос открытой модели Alibaba Qwen3-ASR на устройство, сделанный в Whisper Notes для Mac: открытые веса переведены в Apple MLX в 8-bit и работают на собственном GPU твоего Mac, аудио не уходит на серверы Alibaba. Это не та же модель, что 0.6B, которую SenseVoice заменил в прямой загрузке для Mac (DMG) 1.5.0.
Как включить (прямая загрузка для Mac, DMG 1.6.0 и новее): Настройки → Модель транскрипции → Qwen3-ASR 1.7B. Модель скачивается внутри приложения при первом использовании и весит около 2,5 ГБ. Нужен macOS 15 или новее на Apple silicon, рекомендуется 16 ГБ памяти; остальная часть приложения работает на macOS 14. Список языков по движкам — на странице поддержки языков. Локальный CLI и MCP-сервер принимают «qwen», «qwen3» и «qwen3-asr».
Если менять не хочется, менять ничего и не нужно: Parakeet V3 по-прежнему стоит по умолчанию.
Часто задаваемые вопросы
Qwen3-ASR точнее, чем Whisper Large V3 Turbo?
Зависит от языка, и счёт почти равный. В нашем прогоне FLEURS внутри Whisper Notes для Mac на 30 языках, которые покрывают обе модели, Qwen3-ASR 1.7B был впереди в 15, а Whisper Large V3 Turbo — в 15. Qwen уверенно вёл на кантонском (6,00 % против 37,97 % CER), хинди (13,67 % против 30,42 % WER), тайском, вьетнамском и французском. Turbo уверенно вёл на финском (6,54 % против 26,08 % WER), венгерском, греческом, чешском, шведском, датском, польском, румынском, филиппинском, турецком и нидерландском. Четырнадцать из тридцати разрывов укладываются в интервалы ошибок и читаются как ничья. Выбирай Qwen3-ASR, если твой язык в его выигрышном столбце и у тебя прямая загрузка Whisper Notes для Mac (DMG); во всех остальных случаях и для любого языка за пределами тех 30 — Whisper Large V3 Turbo: у него их 101.
Можно ли использовать Qwen3-ASR на iPhone или в версии из Mac App Store?
Сегодня он есть в прямой загрузке Whisper Notes для Mac (DMG), начиная с версии 1.6.0. Версия из Mac App Store должна получить новые движки в следующих релизах, но даты у нас нет. Пока что в приложении для iPhone и в сборке из Mac App Store три семейства движков — Whisper, Parakeet V3 и SenseVoice — и каждый язык, который распознаёт Qwen, там покрывает Whisper. Если считать моделями, в сборке из Mac App Store их сегодня четыре, а в прямой загрузке пять, потому что Whisper поставляется и как Small, и как Large V3 Turbo. Если кантонский нужен на iPhone, там для этого есть SenseVoice.
Qwen3-ASR или SenseVoice для китайского, японского и корейского?
По точности они близко, по скорости — очень далеко друг от друга. В нашем прогоне FLEURS Qwen3-ASR дал 5,69 % CER на китайском, 5,39 % на японском и 3,51 % на корейском; SenseVoice Small на тех же записях — 7,06 %, 6,85 % и 7,82 %. При этом SenseVoice шёл на медианных 161× реального времени против 8,7× у Qwen, весит 827 МБ против примерно 2,5 ГБ и доступен на iPhone и в обеих сборках для Mac. Выбирай SenseVoice, если только не расшифровываешь кантонский: там у Qwen3-ASR 6,00 % CER против 36,71 % у SenseVoice, и разрыв достаточно велик, чтобы подождать подольше.
Какие системные требования у Qwen3-ASR 1.7B?
Mac на Apple silicon с macOS 15 или новее, рекомендуется 16 ГБ памяти, плюс около 2,5 ГБ на диске под саму модель. Это выше, чем у остального Whisper Notes для Mac, который работает на macOS 14 и новее. В нашем прогоне пиковая память процесса у модели дошла до 2,43 ГиБ — самый высокий результат из пяти движков. На Mac с 8 ГБ тот же список из 101 языка закрывает Whisper Small в 600 МБ, а 25 европейских языков — Parakeet V3 в 465 МБ.
Уходит ли аудио с моего Mac, когда я использую Qwen3-ASR?
Нет. Alibaba предлагает Qwen3-ASR и как облачный сервис — через API DashScope Real-time и FileTrans, куда аудио загружается на их серверы. Whisper Notes ими не пользуется. Он запускает открытые веса локально, как модель MLX 8-bit на GPU твоего Mac, без аккаунта и без API-ключа, и расшифровка работает с выключенной сетью. Так же устроено каждое семейство движков в приложении, на любом канале.
Почему эти цифры не совпадают с точностью на моих записях?
Потому что FLEURS — это короткая, чистая, начитанная речь, а твои записи — нет. Наш прогон — это калибровка на открытом датасете: примерно по 75 фраз на язык, один M5 MacBook Air, одни и те же записи для всех моделей. Он полезен, чтобы понять, стоит ли пробовать модель на конкретном языке, и не предсказывает твою точность на совещании, на шумном аудио, на речи с акцентом или на двухчасовом файле.
Попробуй
Qwen3-ASR 1.7B есть в Whisper Notes для Mac 1.6.0 и новее, только в прямой загрузке (DMG). Настройки → Модель транскрипции. Бесплатный пробный период — 10 000 слов: хватит, чтобы прогнать свой язык и поспорить с таблицами выше.
Если найдёшь язык, где наши цифры расходятся с твоим опытом, напиши на mac@whispernotes.app. Полный список изменений: whispernotes.app/changelog.
Источники всего вышесказанного: наш прогон на тестовом сплите Google FLEURS ревизии 70bb2e84, карточка модели Qwen3-ASR 1.7B и таблица языков по движкам на странице поддержки языков, которая генерируется из исходников приложения.