Mistral Voxtral vs GPT-4o | Бенчмарк ШІ Мовлення

2 серпня 2025 р.
·
8 min read
·Whisper Notes Team

Mistral випустила Voxtral — свою першу родину моделей з відкритими вагами для транскрипції та розуміння аудіо. Офіційні бенчмарки показують сильне багатомовне розпізнавання мовлення та відповіді на запитання за аудіо, однак два розміри моделі мають дуже різні вимоги до обладнання. Ось що насправді підтримує цей реліз і чому Whisper Notes і далі використовує менші моделі, зосереджені на транскрипції, на споживчому обладнанні Apple.

Бенчмарки продуктивності Mistral Voxtral

Дві моделі

У липні 2025 року Mistral випустила два чекпоінти під ліцензією Apache 2.0:

Voxtral Small 24B

  • 24 мільярди параметрів
  • Транскрипція, переклад, запитання-відповіді за аудіо та підсумовування
  • Контекстне вікно 32k
  • Близько 55 ГБ GPU-пам'яті у bf16/fp16

Voxtral Mini 3B

  • 3 мільярди параметрів
  • Той самий набір аудіо- й текстових завдань у меншому чекпоінті
  • Офіційно позиціонується для локального та периферійного розгортання
  • Близько 9.5 ГБ GPU-пам'яті у bf16/fp16

Відкриті ваги та ліцензія

Обидва чекпоінти 2025 року — це відкриті ваги під ліцензією Apache 2.0. Ви можете завантажити та запускати їх самостійно:

  • Повні ваги моделей у відкритому доступі
  • Самостійний хостинг або адаптація в межах ліцензії Apache 2.0
  • Без плати за API Mistral при самостійному хостингу; ви все одно оплачуєте власні обчислення
  • Обробка аудіо на власних серверах

Джерела: анонс Voxtral від Mistral, офіційна картка моделі Voxtral Small та офіційна картка моделі Voxtral Mini.

Бенчмарки

У релізі Mistral порівнює усереднений word error rate на англійських наборах короткої та довгої форми, Mozilla Common Voice, FLEURS і Multilingual LibriSpeech. У заявлених Mistral результатах FLEURS Voxtral Small випереджає Whisper у кожному оціненому завданні. Менший WER — краще:

Порівняння WER Voxtral з іншими моделями

WER на FLEURS зі стартових бенчмарків Mistral у зіставленні з орієнтовною ціною API; і результати бенчмарків, і ціни можуть змінюватися

FLEURS — лише один зріз якості транскрипції. Це результати, заявлені самим вендором, тож перш ніж обирати модель, звіртеся з опублікованими визначеннями бенчмарків і протестуйте власні мови, мікрофони та умови запису.

Voxtral проти Whisper: що обрати?

Бенчмарки розповідають лише частину історії. Ось як дві родини моделей порівнюються за критеріями, що справді важать, якщо ви збираєтеся запускати одну з них самостійно:

Voxtral Small Voxtral Mini Whisper Large v3 Whisper Large-v3 Turbo
Мови 8 основних мов 8 основних мов 100+ 100+
Відкритий код Так Так Так Так
Розмір моделі 24B параметрів; ~55 ГБ GPU-пам'яті у bf16/fp16 3B параметрів; ~9.5 ГБ GPU-пам'яті у bf16/fp16 1.55B параметрів 809M параметрів (~1.6 ГБ)
Практично на споживчому Mac У повній точності — ні, на типовому обладнанні Можливо із сумісним рантаймом; важча за Turbo Так Так

Вердикт: Voxtral Small заявляє сильні результати WER і додає розуміння аудіо, на яке Whisper навіть не претендує. Voxtral Mini — це чекпоінт, який Mistral позиціонує для локального та периферійного розгортання, але його офіційна картка все одно вказує близько 9.5 ГБ GPU-пам'яті у bf16/fp16. Для споживчого застосунку транскрипції Whisper Large-v3 Turbo залишається простішим у постачанні та покриває значно більше мов. Саме тому Whisper Notes наразі поєднує Whisper Turbo з Parakeet V3 і SenseVoice, а не з Voxtral.

Вартість API та самостійного хостингу

Станом на перевірку 10 липня 2026 року картка моделі Mistral вказує ціну аудіовходу Voxtral Small $0.004 за хвилину. Текстовий вхід і згенерований текст для запитів на розуміння аудіо тарифікуються окремо. Якщо ви самостійно хостите ваги Apache 2.0, плати за API Mistral немає, але ви оплачуєте обладнання та експлуатацію.

API Mistral

$0.004
за хвилину аудіо для Voxtral Small

Самостійний хостинг ваг

Apache 2.0
без плати за API; обчислення — ваша відповідальність

Як це працює

Офіційна картка моделі описує Voxtral як мовну модель-основу з аудіокодувальником і окремим режимом транскрипції. Важливі продуктові обмеження цілком конкретні:

1. Мультимодальна архітектура

Voxtral приймає аудіо й текст в одній розмові, а не працює лише як декодер мовлення в текст:

  • Окремий режим для прямої транскрипції
  • Запитання-відповіді за аудіо та структуроване підсумовування
  • Кілька аудіовходів і багатокрокові аудіорозмови

Обмеження для довгих записів

Контекстне вікно 32k підтримує до 30 хвилин аудіо для транскрипції або 40 хвилин для ширшого розуміння аудіо.

2. Мови та оцінювання

Mistral перелічує вісім основних мов з автоматичним визначенням:

  • Англійська, іспанська, французька, португальська, гінді, німецька, нідерландська та італійська
  • Бенчмарки включають FLEURS, Mozilla Common Voice і Multilingual LibriSpeech
  • Реліз також окремо оцінює англійське аудіо короткої та довгої форми

3. Вимоги до розгортання

Відкриті ваги не означають, що кожен чекпоінт достатньо малий для будь-якого пристрою:

  • Voxtral Small потребує близько 55 ГБ GPU-пам'яті у bf16/fp16 згідно з карткою моделі
  • Voxtral Mini — це чекпоінт на 3B, призначений для локального та периферійного розгортання
  • Для запуску випущених чекпоінтів Mistral рекомендує vLLM

4. Ключові можливості

Розуміння контексту

Може відповідати на запитання та створювати підсумки безпосередньо з аудіо в межах контекстного ліміту 32k.

Багатомовність

Автоматично визначає і транскрибує вісім основних мов: англійську, іспанську, французьку, португальську, гінді, німецьку, нідерландську та італійську.

Робота з шумом

Офіційне оцінювання охоплює різноманітні мовленнєві набори даних, але Mistral не публікує універсальної гарантії для будь-якого зашумленого запису.

Периферійне розгортання

Voxtral Mini — варіант для локального та периферійного використання. Його офіційна картка вказує близько 9.5 ГБ GPU-пам'яті у bf16/fp16.

5. Архітектура

Три основні компоненти:

  1. 1. Аудіокодувальник: перетворює звукову хвилю на навчені аудіопредставлення
  2. 2. Проєктор: відображає аудіопредставлення у прихований простір мовної моделі
  3. 3. Мовна модель-основа: генерує транскрипти, відповіді, підсумки або виклики інструментів

Такий дизайн пояснює, чому Voxtral уміє більше, ніж транскрипція, але він також несе значно більші ваги мовної моделі, ніж модель лише для транскрипції на кшталт Whisper Turbo.

Чому Whisper Notes і далі має сенс

Voxtral і Whisper Notes розв'язують різні задачі. Voxtral поєднує транскрипцію з розумінням аудіо; Whisper Notes зосереджений на приватній транскрипції, яку легко запускати на споживчому обладнанні Apple.

Що пропонує Whisper Notes

Приватність

Продуктивність

  • Технологія Whisper з перевіреною точністю
  • Оптимізовано для Apple Silicon
  • Надійні результати

Вартість

  • Разова покупка; App Store охоплює iPhone, iPad і Mac App Store, а DMG із пробною версією продається окремо
  • Без похвилинної оплати
  • Необмежена транскрипція

Зручність

  • Простий інтерфейс
  • Регулярні оновлення
  • Постійні вдосконалення

Вимоги до ресурсів

Voxtral Small у повній точності — модель серверного класу: офіційна картка вказує близько 55 ГБ GPU-пам'яті. Voxtral Mini призначений саме для локального та периферійного використання, але його картка все одно вказує близько 9.5 ГБ GPU-пам'яті у bf16/fp16. Завантаження Whisper Turbo у застосунку — приблизно 1.6 ГБ, і це краще пасує поточному продукту Whisper Notes.

Whisper Notes використовує Whisper Large-v3 Turbo — він збалансовує продуктивність, швидкість і вимоги до VRAM для щоденного використання. Ми перейдемо на кращі моделі, щойно вони стануть доступними з розумними вимогами до ресурсів.

Voxtral привабливий, коли важать запитання-відповіді за аудіо, підсумовування чи самостійне серверне розгортання. Whisper Notes орієнтований на індивідуальних користувачів, яким потрібна приватна транскрипція і жодних регулярних підписок.

Що це означає

Voxtral — важливий крок відкритих ваг за межі простого розпізнавання мовлення, адже він уміє не лише транскрибувати аудіо, а й міркувати над ним.

Для приватної офлайн-транскрипції на Mac та iPhone менші спеціалізовані рушії залишаються простішими в пакуванні та стабільнішими в роботі.

Порівнюєте всі локальні варіанти? Кожну локальну модель мовлення в текст — варіанти Whisper, Parakeet V3, SenseVoice і Voxtral — зіставлено пліч-о-пліч на нашій сторінці порівняння моделей Whisper.

Поширені запитання

Що таке Mistral Voxtral?

Voxtral — родина моделей Mistral з відкритими вагами для транскрипції мовлення та розуміння аудіо. Реліз липня 2025 року включає Voxtral Small 24B для серверних навантажень і Voxtral Mini 3B для локального та периферійного розгортання. Обидва чекпоінти використовують ліцензію Apache 2.0.

Чи може Voxtral працювати локально на Mac?

Завантажувані ваги можна хостити самостійно, але два розміри мають різні вимоги. Voxtral Small потребує близько 55 ГБ GPU-пам'яті у bf16/fp16, тож це варіант серверного класу. Voxtral Mini — чекпоінт для локального та периферійного використання; його картка моделі вказує близько 9.5 ГБ у bf16/fp16, а реальна швидкість і споживання пам'яті на Mac залежать від рантайму та квантизації.

Чи використовує Whisper Notes Voxtral?

Ні. Whisper Notes працює на Parakeet V3 (модель за замовчуванням на Mac), Whisper Large-v3 Turbo і SenseVoice — моделях, обраних за баланс продуктивності, швидкості та вимог до VRAM для щоденного використання на Apple Silicon. Ми впровадимо кращі моделі, щойно їх стане практично запускати на споживчому обладнанні.

Скільки мов підтримує Voxtral?

Офіційні картки моделей перелічують вісім основних мов з автоматичним визначенням: англійську, іспанську, французьку, португальську, гінді, німецьку, нідерландську та італійську. Mistral також оцінює арабську у FLEURS, але її немає в переліку основних мов у картці моделі.

Коли було випущено Mistral Voxtral?

Mistral випустила Voxtral 15 липня 2025 року. Початковими чекпоінтами під Apache 2.0 були Voxtral Small 24B і Voxtral Mini 3B.