Mistral выпустила Voxtral — своё первое семейство моделей с открытыми весами для транскрипции и понимания аудио. Официальные бенчмарки показывают сильное многоязычное распознавание речи и ответы на вопросы по аудио, при этом у двух размеров модели совершенно разные требования к железу. Разберёмся, что на самом деле умеет этот релиз и почему Whisper Notes по-прежнему использует компактные, заточенные под транскрипцию модели на потребительском железе Apple.
Две модели
В июле 2025 года Mistral выпустила два чекпойнта под лицензией Apache 2.0:
Voxtral Small 24B
- •24 миллиарда параметров
- •Транскрипция, перевод, ответы на вопросы по аудио и суммаризация
- •Контекстное окно 32k
- •Около 55 ГБ GPU-памяти в bf16/fp16
Voxtral Mini 3B
- •3 миллиарда параметров
- •Тот же набор аудио- и текстовых задач в компактном чекпойнте
- •Официально позиционируется для локального и edge-развёртывания
- •Около 9,5 ГБ GPU-памяти в bf16/fp16
Открытые веса и лицензия
Оба чекпойнта 2025 года — это открытые веса под лицензией Apache 2.0. Их можно скачать и запустить самостоятельно:
- ✓ Полные веса моделей в открытом доступе
- ✓ Можно разворачивать у себя и адаптировать в рамках лицензии Apache 2.0
- ✓ При самостоятельном развёртывании нет платы за API Mistral — вы платите только за собственные вычисления
- ✓ Обработка аудио на ваших собственных серверах
Источники: анонс Voxtral от Mistral, официальная карточка модели Voxtral Small и официальная карточка модели Voxtral Mini.
Бенчмарки
В анонсе Mistral сравнивает усреднённый word error rate по английским коротким и длинным записям, Mozilla Common Voice, FLEURS и Multilingual LibriSpeech. По опубликованным Mistral результатам FLEURS Voxtral Small обходит Whisper на каждой из оценённых задач. Чем ниже WER, тем лучше:
WER на FLEURS из стартовых бенчмарков Mistral, сопоставленный с оценочной ценой API; и результаты бенчмарков, и цены могут меняться
FLEURS — лишь один срез качества транскрипции. Это результаты, заявленные самими вендорами, поэтому перед выбором модели сверьтесь с опубликованными методиками бенчмарков и протестируйте свои языки, микрофоны и условия записи.
Voxtral или Whisper: что выбрать?
Бенчмарки — только часть картины. Вот как два семейства моделей соотносятся по критериям, которые действительно важны, если вы собираетесь запускать модель самостоятельно:
| Voxtral Small | Voxtral Mini | Whisper Large v3 | Whisper Large-v3 Turbo | |
|---|---|---|---|---|
| Языки | 8 основных языков | 8 основных языков | 100+ | 100+ |
| Открытый код | Да | Да | Да | Да |
| Размер модели | 24 млрд параметров; ~55 ГБ GPU-памяти в bf16/fp16 | 3 млрд параметров; ~9,5 ГБ GPU-памяти в bf16/fp16 | 1,55 млрд параметров | 809 млн параметров (~1,6 ГБ) |
| Реально ли запустить на обычном Mac | В полной точности на типичном железе — нет | Возможно при совместимом рантайме; тяжелее, чем Turbo | Да | Да |
Итог: Voxtral Small показывает сильные результаты по WER и добавляет понимание аудио, на которое Whisper даже не претендует. Voxtral Mini — тот самый чекпойнт, который Mistral позиционирует для локального и edge-развёртывания, но его официальная карточка всё равно указывает около 9,5 ГБ GPU-памяти в bf16/fp16. Для потребительского приложения-транскрибатора Whisper Large-v3 Turbo по-прежнему проще в поставке и покрывает куда больше языков. Именно поэтому Whisper Notes сейчас сочетает Whisper Turbo с Parakeet V3 и SenseVoice, а не переходит на Voxtral.
Стоимость API и самостоятельного развёртывания
По данным на 10 июля 2026 года, в карточке модели Mistral аудиовход Voxtral Small стоит $0.004 за минуту. Текстовый ввод и сгенерированный текст в запросах на понимание аудио тарифицируются отдельно. Если развернуть Apache-2.0-веса у себя, платы за API Mistral не будет, но железо и эксплуатация останутся на вас.
API Mistral
Собственное развёртывание
Как это работает
Официальная карточка описывает Voxtral как языковую модель с аудиокодировщиком и выделенным режимом транскрипции. Важные продуктовые ограничения вполне конкретны:
1. Мультимодальная архитектура
Voxtral принимает аудио и текст в одном диалоге, а не работает исключительно как декодер речи в текст:
- •Выделенный режим для прямой транскрипции
- •Ответы на вопросы по аудио и структурированная суммаризация
- •Несколько аудиовходов и многоходовые диалоги с аудио
Ограничение на длинные записи
Контекстное окно 32k вмещает до 30 минут аудио для транскрипции или до 40 минут для более широкого понимания аудио.
2. Языки и оценка качества
Mistral перечисляет восемь основных языков с автоматическим определением:
- •Английский, испанский, французский, португальский, хинди, немецкий, нидерландский и итальянский
- •Среди бенчмарков — FLEURS, Mozilla Common Voice и Multilingual LibriSpeech
- •Английские короткие и длинные записи в релизе оцениваются отдельно
3. Требования к развёртыванию
Открытые веса ещё не значат, что каждый чекпойнт достаточно мал для любого устройства:
- •Voxtral Small, согласно карточке модели, требует около 55 ГБ GPU-памяти в bf16/fp16
- •Voxtral Mini — чекпойнт на 3 млрд параметров, предназначенный для локального и edge-развёртывания
- •Для запуска выпущенных чекпойнтов Mistral рекомендует vLLM
4. Ключевые возможности
Понимание контекста
Может отвечать на вопросы и составлять резюме прямо по аудио — в пределах контекстного окна 32k.
Многоязычность
Автоматически определяет и транскрибирует восемь основных языков: английский, испанский, французский, португальский, хинди, немецкий, нидерландский и итальянский.
Работа с шумом
Официальная оценка включает разнообразные речевые датасеты, но универсальной гарантии для любой шумной записи Mistral не даёт.
Edge-развёртывание
Voxtral Mini — вариант для локального и edge-использования. Его официальная карточка указывает около 9,5 ГБ GPU-памяти в bf16/fp16.
5. Архитектура
Три основных компонента:
- 1. Аудиокодировщик: преобразует звуковую волну в обученные аудиопредставления
- 2. Проектор: отображает аудиопредставления в скрытое пространство языковой модели
- 3. Языковая модель: генерирует транскрипты, ответы, резюме или вызовы инструментов
Такое устройство объясняет, почему Voxtral умеет больше, чем просто транскрибировать, — но оно же означает куда более тяжёлые веса языковой модели по сравнению с чисто транскрипционной моделью вроде Whisper Turbo.
Почему Whisper Notes по-прежнему имеет смысл
Voxtral и Whisper Notes решают разные задачи. Voxtral объединяет транскрипцию с пониманием аудио; Whisper Notes сфокусирован на приватной транскрипции, которую легко запустить на потребительском железе Apple.
Что даёт Whisper Notes
Приватность
- •100% офлайн-обработка
- •Никакой передачи данных
- •Без облачных зависимостей
Производительность
- •Технология Whisper с проверенной точностью
- •Оптимизация под Apple Silicon
- •Стабильные результаты
Стоимость
- •разовая покупка по цене, указанной в соответствующем канале; на Mac есть пробный период на 10 000 слов
- •Без поминутной оплаты
- •Неограниченная транскрипция
Удобство
- •Простой интерфейс
- •Регулярные обновления
- •Постоянные улучшения
Требования к хранилищу
Voxtral Small в полной точности — модель серверного класса: официальная карточка указывает около 55 ГБ GPU-памяти. Voxtral Mini создан специально для локального и edge-использования, но и его карточка указывает около 9,5 ГБ GPU-памяти в bf16/fp16. Загрузка Whisper Turbo в приложении занимает примерно 1,6 ГБ — и это куда лучше подходит текущему продукту Whisper Notes.
Whisper Notes использует Whisper Large-v3 Turbo — оптимальный баланс производительности, скорости и требований к VRAM для повседневной работы. Как только появятся модели лучше с разумными требованиями к ресурсам, мы на них перейдём.
Voxtral привлекателен, когда важны ответы на вопросы по аудио, суммаризация или собственное серверное развёртывание. Whisper Notes рассчитан на частных пользователей, которым нужна приватная транскрипция без регулярной подписки.
Что это значит
Voxtral — важный шаг open-weight-моделей за пределы обычного распознавания речи: модель умеет не только транскрибировать аудио, но и рассуждать о нём.
Но для приватной офлайн-транскрипции на Mac и iPhone компактные специализированные движки по-прежнему проще упаковать и стабильнее запускать.
Сравниваете все локальные варианты? Все on-device-модели распознавания речи — варианты Whisper, Parakeet V3, SenseVoice и Voxtral — сведены в одну таблицу на нашей странице сравнения моделей Whisper.
Часто задаваемые вопросы
Что такое Mistral Voxtral?
Voxtral — семейство моделей Mistral с открытыми весами для транскрипции речи и понимания аудио. В релиз июля 2025 года вошли Voxtral Small 24B для серверных нагрузок и Voxtral Mini 3B для локального и edge-развёртывания. Оба чекпойнта распространяются под лицензией Apache 2.0.
Может ли Voxtral работать локально на Mac?
Скачиваемые веса можно развернуть самостоятельно, но у двух размеров разные требования. Voxtral Small нужно около 55 ГБ GPU-памяти в bf16/fp16 — это вариант серверного класса. Voxtral Mini — чекпойнт для локального и edge-использования; его карточка указывает около 9,5 ГБ в bf16/fp16, а реальная скорость и потребление памяти на Mac зависят от рантайма и квантизации.
Использует ли Whisper Notes Voxtral?
Нет. Whisper Notes работает на Parakeet V3 (модель по умолчанию на Mac), Whisper Large-v3 Turbo и SenseVoice — эти модели выбраны за баланс производительности, скорости и требований к VRAM для повседневной работы на Apple Silicon. Как только более сильные модели станет практично запускать на потребительском железе, мы их добавим.
Сколько языков поддерживает Voxtral?
Официальные карточки моделей перечисляют восемь основных языков с автоопределением: английский, испанский, французский, португальский, хинди, немецкий, нидерландский и итальянский. Mistral также оценивает арабский в FLEURS, но в список основных языков в карточке модели он не входит.
Когда вышел Mistral Voxtral?
Mistral выпустила Voxtral 15 июля 2025 года. Первыми чекпойнтами под лицензией Apache 2.0 стали Voxtral Small 24B и Voxtral Mini 3B.