Mistral wydał Voxtral — swoją pierwszą rodzinę modeli z otwartymi wagami do transkrypcji i rozumienia audio. Oficjalne benchmarki pokazują mocne wielojęzyczne rozpoznawanie mowy i odpowiadanie na pytania o treść nagrania, ale dwa rozmiary modelu mają bardzo różne wymagania sprzętowe. Oto co ta premiera faktycznie oferuje i dlaczego Whisper Notes nadal korzysta z mniejszych, wyspecjalizowanych w transkrypcji modeli na konsumenckim sprzęcie Apple.
Dwa modele
W lipcu 2025 Mistral opublikował dwa checkpointy na licencji Apache 2.0:
Voxtral Small 24B
- •24 miliardy parametrów
- •Transkrypcja, tłumaczenie, pytania i odpowiedzi o audio, streszczenia
- •Okno kontekstu 32k
- •Około 55 GB pamięci GPU w bf16/fp16
Voxtral Mini 3B
- •3 miliardy parametrów
- •Ta sama rodzina zadań audio-tekst w mniejszym checkpoincie
- •Oficjalnie pozycjonowany do wdrożeń lokalnych i edge
- •Około 9,5 GB pamięci GPU w bf16/fp16
Otwarte wagi i licencja
Oba checkpointy z 2025 roku mają otwarte wagi na licencji Apache 2.0. Możesz je pobrać i uruchomić samodzielnie:
- ✓ Pełne wagi modeli dostępne do pobrania
- ✓ Self-hosting i modyfikacje w ramach licencji Apache 2.0
- ✓ Brak opłat za API Mistrala przy self-hostingu; płacisz jednak za własną moc obliczeniową
- ✓ Przetwarzanie audio na własnych serwerach
Źródła: ogłoszenie premiery Voxtral od Mistrala, oficjalna karta modelu Voxtral Small oraz oficjalna karta modelu Voxtral Mini.
Benchmarki
Materiały z premiery Mistrala porównują uśredniony współczynnik błędów słów (WER) na angielskich zbiorach krótkich i długich nagrań, Mozilla Common Voice, FLEURS i Multilingual LibriSpeech. W raportowanych przez Mistrala wynikach FLEURS Voxtral Small wygrywa z Whisperem w każdym ocenianym zadaniu. Niższy WER jest lepszy:
WER na FLEURS z benchmarków premierowych Mistrala zestawiony z szacowaną ceną API; zarówno wyniki, jak i ceny mogą się zmieniać
FLEURS to tylko jeden wycinek jakości transkrypcji. To wyniki raportowane przez producenta — zanim wybierzesz model, porównaj opublikowane definicje benchmarków i przetestuj własne języki, mikrofony i warunki nagrywania.
Voxtral kontra Whisper: którego użyć?
Benchmarki to tylko część historii. Oto jak obie rodziny modeli wypadają pod względem czynników, które naprawdę się liczą, jeśli chcesz uruchomić model samodzielnie:
| Voxtral Small | Voxtral Mini | Whisper Large v3 | Whisper Large-v3 Turbo | |
|---|---|---|---|---|
| Języki | 8 głównych języków | 8 głównych języków | ponad 100 | ponad 100 |
| Open source | Tak | Tak | Tak | Tak |
| Rozmiar modelu | 24 mld parametrów; ~55 GB pamięci GPU w bf16/fp16 | 3 mld parametrów; ~9,5 GB pamięci GPU w bf16/fp16 | 1,55 mld parametrów | 809 mln parametrów (~1,6 GB) |
| Praktyczny na konsumenckim Macu | Nie w pełnej precyzji na typowym sprzęcie | Możliwy z kompatybilnym środowiskiem uruchomieniowym; cięższy niż Turbo | Tak | Tak |
Werdykt: Voxtral Small raportuje mocne wyniki WER i dodaje rozumienie audio, którego Whisper w ogóle nie próbuje. Voxtral Mini to checkpoint, który Mistral pozycjonuje do wdrożeń lokalnych i edge, ale jego oficjalna karta modelu wciąż podaje około 9,5 GB pamięci GPU w bf16/fp16. Dla konsumenckiej aplikacji do transkrypcji Whisper Large-v3 Turbo pozostaje łatwiejszy do dostarczenia i obsługuje znacznie więcej języków. Dlatego Whisper Notes łączy obecnie Whisper Turbo z Parakeet V3 i SenseVoice zamiast Voxtrala.
Koszt API i self-hostingu
Według stanu na 10 lipca 2026 karta modelu Mistrala podaje cenę wejścia audio dla Voxtral Small na poziomie 0,004 USD za minutę. Wejście tekstowe i wygenerowany tekst są rozliczane osobno przy zapytaniach o rozumienie audio. Jeśli hostujesz wagi Apache 2.0 samodzielnie, nie ma opłat za API Mistrala, ale płacisz za sprzęt i utrzymanie.
API Mistrala
Wagi hostowane samodzielnie
Jak to działa
Oficjalna karta modelu opisuje Voxtral jako model językowy z enkoderem audio i dedykowanym trybem transkrypcji. Istotne ograniczenia produktowe są konkretne:
1. Architektura multimodalna
Voxtral przyjmuje audio i tekst w tej samej konwersacji, zamiast działać wyłącznie jako dekoder mowy na tekst:
- •Dedykowany tryb bezpośredniej transkrypcji
- •Pytania i odpowiedzi o audio oraz ustrukturyzowane streszczenia
- •Wiele wejść audio i wieloetapowe rozmowy o nagraniach
Limit długich nagrań
Okno kontekstu 32k obsługuje do 30 minut audio przy transkrypcji lub 40 minut przy szerszym rozumieniu audio.
2. Języki i ewaluacja
Mistral wymienia osiem głównych języków z automatycznym wykrywaniem:
- •Angielski, hiszpański, francuski, portugalski, hindi, niemiecki, niderlandzki i włoski
- •Benchmarki obejmują FLEURS, Mozilla Common Voice i Multilingual LibriSpeech
- •Premiera osobno ocenia też angielskie nagrania krótkie i długie
3. Wymagania wdrożeniowe
Otwarte wagi nie oznaczają, że każdy checkpoint jest dość mały dla każdego urządzenia:
- •Voxtral Small wymaga według karty modelu około 55 GB pamięci GPU w bf16/fp16
- •Voxtral Mini to checkpoint 3B przeznaczony do wdrożeń lokalnych i edge
- •Do serwowania opublikowanych checkpointów Mistral zaleca vLLM
4. Kluczowe funkcje
Rozumienie kontekstu
Potrafi odpowiadać na pytania i tworzyć streszczenia bezpośrednio z audio, w granicach kontekstu 32k.
Wielojęzyczność
Automatycznie wykrywa i transkrybuje osiem głównych języków: angielski, hiszpański, francuski, portugalski, hindi, niemiecki, niderlandzki i włoski.
Odporność na hałas
Oficjalna ewaluacja obejmuje zróżnicowane zbiory mowy, ale Mistral nie publikuje ogólnej gwarancji dla każdego zaszumionego nagrania.
Wdrożenia edge
Voxtral Mini to opcja lokalna i edge. Jego oficjalna karta modelu podaje około 9,5 GB pamięci GPU w bf16/fp16.
5. Architektura
Trzy główne komponenty:
- 1. Enkoder audio: zamienia falę dźwiękową na wyuczone reprezentacje audio
- 2. Projektor: mapuje reprezentacje audio do przestrzeni ukrytej modelu językowego
- 3. Model językowy: generuje transkrypcje, odpowiedzi, streszczenia lub wywołania narzędzi
Ta konstrukcja wyjaśnia, dlaczego Voxtral potrafi więcej niż sama transkrypcja — ale też dlaczego niesie ze sobą znacznie większe wagi modelu językowego niż model czysto transkrypcyjny, taki jak Whisper Turbo.
Dlaczego Whisper Notes wciąż ma sens
Voxtral i Whisper Notes rozwiązują różne problemy. Voxtral łączy transkrypcję z rozumieniem audio; Whisper Notes koncentruje się na prywatnej transkrypcji, którą łatwo uruchomić na konsumenckim sprzęcie Apple.
Co oferuje Whisper Notes
Prywatność
- •100% przetwarzania offline
- •Zero przesyłania danych
- •Brak zależności od chmury
Wydajność
- •Technologia Whisper, sprawdzona dokładność
- •Optymalizacja pod Apple Silicon
- •Niezawodne wyniki
Koszt
- •jednorazowy zakup w cenie podanej w odpowiednim kanale; wersja na Maca ma darmowy okres próbny 10 000 słów
- •Brak opłat za minutę
- •Nielimitowana transkrypcja
Doświadczenie użytkownika
- •Prosty interfejs
- •Regularne aktualizacje
- •Ciągłe ulepszenia
Wymagania pamięciowe
Voxtral Small to w pełnej precyzji model klasy serwerowej: jego oficjalna karta podaje około 55 GB pamięci GPU. Voxtral Mini jest wprost przeznaczony do użytku lokalnego i edge, ale jego karta wciąż podaje około 9,5 GB pamięci GPU w bf16/fp16. Pobierany w aplikacji Whisper Turbo zajmuje około 1,6 GB — i to znacznie lepiej pasuje do obecnego produktu Whisper Notes.
Whisper Notes używa modelu Whisper Large-v3 Turbo — równoważy on wydajność, szybkość i wymagania VRAM w codziennym użyciu. Przejdziemy na lepsze modele, gdy tylko staną się dostępne przy rozsądnych wymaganiach sprzętowych.
Voxtral jest atrakcyjny, gdy liczą się pytania o treść audio, streszczenia lub wdrożenie na własnym serwerze. Whisper Notes jest skierowany do użytkowników indywidualnych, którzy chcą prywatnej transkrypcji i żadnych cyklicznych subskrypcji.
Co to oznacza
Voxtral to ważny krok świata otwartych wag poza zwykłe rozpoznawanie mowy, bo potrafi nie tylko transkrybować audio, ale też wyciągać z niego wnioski.
Do prywatnej transkrypcji offline na Macu i iPhonie mniejsze, wyspecjalizowane silniki pozostają łatwiejsze do spakowania i niezawodnego uruchamiania.
Porównujesz wszystkie lokalne opcje? Każdy działający na urządzeniu model mowy na tekst — warianty Whisper, Parakeet V3, SenseVoice i Voxtral — zestawiamy obok siebie na naszej stronie porównania modeli Whisper.
Najczęściej zadawane pytania
Czym jest Mistral Voxtral?
Voxtral to rodzina modeli Mistrala z otwartymi wagami do transkrypcji mowy i rozumienia audio. Premiera z lipca 2025 obejmuje Voxtral Small 24B do zastosowań serwerowych oraz Voxtral Mini 3B do wdrożeń lokalnych i edge. Oba checkpointy korzystają z licencji Apache 2.0.
Czy Voxtral może działać lokalnie na Macu?
Pobrane wagi można hostować samodzielnie, ale oba rozmiary mają różne wymagania. Voxtral Small potrzebuje około 55 GB pamięci GPU w bf16/fp16, więc to wybór klasy serwerowej. Voxtral Mini to checkpoint lokalny i edge; jego karta modelu podaje około 9,5 GB w bf16/fp16, a rzeczywista szybkość i zużycie pamięci na Macu zależą od środowiska uruchomieniowego i kwantyzacji.
Czy Whisper Notes używa Voxtrala?
Nie. Whisper Notes uruchamia Parakeet V3 (domyślny na Macu), Whisper Large-v3 Turbo i SenseVoice — modele wybrane dlatego, że równoważą wydajność, szybkość i wymagania VRAM w codziennym użyciu na Apple Silicon. Przyjmiemy lepsze modele, gdy tylko będą praktyczne do uruchomienia na konsumenckim sprzęcie.
Ile języków obsługuje Voxtral?
Oficjalne karty modeli wymieniają osiem głównych języków z automatycznym wykrywaniem: angielski, hiszpański, francuski, portugalski, hindi, niemiecki, niderlandzki i włoski. Mistral ocenia też arabski w FLEURS, ale nie znajduje się on na liście głównych języków w karcie modelu.
Kiedy wydano Mistral Voxtral?
Mistral wydał Voxtral 15 lipca 2025 roku. Pierwsze checkpointy na licencji Apache 2.0 to Voxtral Small 24B i Voxtral Mini 3B.