Qwen3-ASR vs Whisper Large V3 Turbo: które języki wygrywa (Mac)

25 sierpnia 2026
·
11 min read
·Whisper Notes Team

Chcieliśmy odpowiedzieć na jedno pytanie: czy istnieje lokalny model, który dokładniej transkrybuje Twój język niż Whisper Large V3? Przepuściliśmy więc te modele przez zbiór FLEURS.

FLEURS to zbiór Google z mową czytaną w 102 językach. Wzięliśmy około 75 zdań z każdego języka i puściliśmy te same nagrania, w tej samej kolejności, przez pięć modeli:

  • Parakeet V3
  • Whisper Large V3 Turbo
  • SenseVoice Small
  • Whisper Small
  • Qwen3-ASR 1.7B

Wyniki wyglądają tak.

Qwen3-ASR 1.7B wobec Whisper Large V3 Turbo — nasz własny przebieg FLEURS, jeden M5 MacBook Air, mowa czytana, krótkie nagrania.

Qwen3-ASR 1.7B Whisper Large V3 Turbo
Obsługiwane języki 30 101
Wyraźne przewagi kantoński, hindi, tajski, wietnamski, francuski (5) fiński, węgierski, grecki i 8 innych języków (11)
Szybkość 8,7× szybciej niż w czasie rzeczywistym 2,4× szybciej niż w czasie rzeczywistym
Szczytowe zużycie pamięci 2,43 GiB 1,87 GiB
Rozmiar pobierania około 2,5 GB około 1,6 GB

Poza mocnymi językami każdego z modeli różnica w dokładności jest niewielka.

Whisper Large V3 kontra Qwen3-ASR: szczegółowe porównanie

Wszystkie 30 języków, od największej wygranej Qwena do jego największej porażki. W obu kolumnach niżej znaczy lepiej.

Nasz własny przebieg FLEURS, jeden M5 MacBook Air, mowa czytana. Dla chińskiego, kantońskiego, japońskiego, koreańskiego i tajskiego CER, dla reszty WER; zielony oznacza przewagę szerszą niż sparowane przedziały 95 %.

Język Qwen3-ASR 1.7B Whisper Large V3 Turbo
Kantoński 6,00 37,97
Hindi 13,67 30,42
Tajski 5,92 12,95
Wietnamski 5,07 9,79
Perski 26,98 30,03
Arabski 14,14 15,75
Indonezyjski 4,97 6,50
Francuski 3,98 5,39
Chiński 5,69 6,88
Angielski 5,07 5,92
Niemiecki 3,51 4,10
Japoński 5,39 5,71
Koreański 3,51 3,70
Hiszpański 3,60 3,76
Włoski 2,98 3,05
Rosyjski 5,98 5,51
Portugalski 5,64 4,91
Macedoński 17,81 16,64
Malajski 11,60 10,18
Niderlandzki 7,65 5,63
Turecki 8,34 5,53
Duński 20,12 14,92
Polski 12,78 5,32
Rumuński 18,97 8,22
Filipiński 20,44 9,37
Szwedzki 20,04 8,72
Czeski 23,92 11,15
Grecki 30,20 12,97
Fiński 26,08 6,54
Węgierski 36,35 13,66

Nasz własny sparowany przebieg na zbiorze testowym FLEURS, rewizja 70bb2e84, około 75 zdań na język, jeden M5 MacBook Air.

Pięć języków, w których Qwen3-ASR 1.7B wygrywa wyraźnie. Współczynnik błędów w procentach, Qwen wobec Turbo: kantoński (6,0 wobec 38,0), hindi (13,7 wobec 30,4), tajski (5,9 wobec 13,0), wietnamski (5,1 wobec 9,8), francuski (4,0 wobec 5,4). Kantoński i tajski liczone są po znakach, reszta po słowach. Przewaga Qwena leży w językach liczonych po znakach: w chińskim, kantońskim, japońskim, koreańskim i tajskim uzyskał średnio 5,3 % wobec 13,4 % u Turbo. W pozostałych dwudziestu pięciu, liczonych po słowach, ma średnio 14,0 % wobec 10,2 % u Turbo.

Jedenaście języków, w których Whisper Large V3 Turbo wygrywa wyraźnie. Współczynnik błędów w procentach, Qwen wobec Turbo, wszędzie liczone po słowach: węgierski (36,4 wobec 13,7), grecki (30,2 wobec 13,0), fiński (26,1 wobec 6,5), czeski (23,9 wobec 11,2), filipiński (20,4 wobec 9,4), duński (20,1 wobec 14,9), szwedzki (20,0 wobec 8,7), rumuński (19,0 wobec 8,2), polski (12,8 wobec 5,3), turecki (8,3 wobec 5,5), niderlandzki (7,7 wobec 5,6).

Czternaście języków, w których jest blisko albo równo. Angielski (5,1 wobec 5,9), niemiecki (3,5 wobec 4,1), hiszpański (3,6 wobec 3,8), włoski (3,0 wobec 3,1), rosyjski (6,0 wobec 5,5), portugalski (5,6 wobec 4,9); chiński (5,7 wobec 6,9), japoński (5,4 wobec 5,7) i koreański (3,5 wobec 3,7) liczone są po znakach. Dalej arabski, indonezyjski, perski, malajski i macedoński. Każda różnica w tej grupie jest mała i mieści się w przedziale 95 %, więc ten przebieg nie rozdziela obu modeli.

Kantoński to jedyny wiersz, który zmienia decyzję: 6,00 % wobec 37,97 %. SenseVoice Small, który podawaliśmy wcześniej jako odpowiedź dla kantońskiego, uzyskał na tych samych nagraniach 36,71 % CER. Na tym zbiorze mowy czytanej żaden z nich nie przekracza progu, więc dawna rekomendacja ma od teraz to zastrzeżenie.

Jak szybki jest Qwen3-ASR 1.7B?

Wszystkie pięć silników zmierzyliśmy na tym samym stanowisku, na jednej maszynie (M5 MacBook Air), więc przynajmniej między sobą są porównywalne.

Mediana współczynnika czasu rzeczywistego dla języków każdego silnika w tym samym przebiegu FLEURS, jeden M5 MacBook Air, mowa czytana.

Silnik Języki Mediana szybkości w tym przebiegu (krótkie nagrania)
SenseVoice Small 6 języków 161,0×
Parakeet TDT 0.6B v3 25 82,9×
Qwen3-ASR 1.7B 30 deklarowanych 8,7×
Whisper Small 101 6,4×
Whisper Large V3 Turbo 101 2,4×

To dane ze stanowiska na krótkich nagraniach i są niższe niż to, co te same silniki osiągają na długim nagraniu. Tej kolumny używaj tylko do porównania silników między sobą w obrębie tego jednego przebiegu.

Parakeet V3 i SenseVoice Small są na tym samym stanowisku mniej więcej o rząd wielkości szybsze od Qwen3-ASR. Na długich plikach zamiast krótkich nagrań Parakeet osiągał 103× szybciej niż w czasie rzeczywistym na M4 Pro, a SenseVoice 52× lub więcej: inny pomiar na innym materiale, ale wskazuje w tę samą stronę.

Qwen3-ASR jest pośrodku. W tym przebiegu na krótkich nagraniach nie był najwolniejszym silnikiem: najwolniejszy był Whisper Large V3 Turbo. Jego wyniki wahają się jednak między językami bardziej niż u pozostałych: od 2,7× w greckim do 12,4× w japońskim.

Ile pamięci i miejsca na dysku kosztuje Qwen3-ASR?

Szczytowe zużycie pamięci to największy ślad procesu zaobserwowany na pozycjach tego samego przebiegu FLEURS, jeden M5 MacBook Air, mowa czytana, krótkie nagrania.

Silnik Rozmiar pobierania Szczytowe zużycie pamięci w tym przebiegu
Parakeet TDT 0.6B v3 465 MB 0,09 GiB
Whisper Small 600 MB 0,87 GiB
SenseVoice Small 827 MB 0,95 GiB
Whisper Large V3 Turbo około 1,6 GB 1,87 GiB
Qwen3-ASR 1.7B około 2,5 GB 2,43 GiB

Na obu osiach Qwen3-ASR jest najcięższy z piątki: około 2,5 GB pobierania i 2,43 GiB szczytowej pamięci procesu w tym przebiegu, wobec około 1,6 GB i 1,87 GiB dla Whisper Large V3 Turbo.

Przy 8 GB pamięci jest lżejsze wyjście. Parakeet V3 pokrywa 25 języków w 465 MB i 0,09 GiB, a Whisper Small 101 języków w 600 MB i 0,87 GiB.

Jak mierzyliśmy: FLEURS, 30 języków, jeden Mac

Qwen3-ASR 1.7B działał jako build MLX 8-bit, a Whisper Large V3 Turbo jako build ggml dla whisper.cpp na Metalu. Dane to zbiór testowy Google FLEURS w rewizji 70bb2e84 (CC-BY-4.0): 83 z jego 102 języków, około 75 zdań i 15 minut na każdy, te same nagrania w tej samej kolejności dla każdego modelu; sparowane porównanie obejmuje 30 języków Qwena. WER dla języków rozdzielanych spacjami, CER dla chińskiego, kantońskiego, japońskiego, koreańskiego i tajskiego, nigdy nie łączone w jedną liczbę; przedziały błędu to bootstrap na poziomie pozycji z 10 000 losowań. Jeden M5 MacBook Air, 32 GB, macOS 26.5, żaden z modeli nie zwrócił pustych wyników ani błędów.

FLEURS to mowa czytana, nie spotkanie i nie dyktowanie. Rankingi z mowy czytanej dwa razy nie przetrwały u nas zderzenia z prawdziwym nagraniem, więc nie przenosimy ich na długie pliki: te tabele mówią, czy model jest wiarygodnym kandydatem dla Twojego języka, a nie jaką dokładność uzyskasz. Ocena Qwen3-ASR 1.7B na prawdziwych spotkaniach będzie osobnym wpisem.

Czy używać Qwen3-ASR zamiast Whisper Large V3?

Język po języku — tak byśmy na to odpowiedzieli wewnątrz Whisper Notes na Maca.

  • Jeśli transkrybujesz kantoński, hindi, tajski, wietnamski albo francuski: wybierz Qwen3-ASR 1.7B.
  • Jeśli transkrybujesz chiński, japoński, koreański, angielski, niemiecki, hiszpański albo włoski: prowadził o włos i tylko tyle będziemy twierdzić. Każdy z dwóch modeli jest w porządku, tak samo jak dla perskiego, arabskiego, indonezyjskiego, rosyjskiego, portugalskiego, macedońskiego i malajskiego.
  • Jeśli transkrybujesz fiński, węgierski, grecki, czeski, szwedzki, duński, polski, rumuński, filipiński, turecki albo niderlandzki: zostań przy Whisper Large V3 Turbo. Wszystkie jedenaście wygrał wyraźnie.
  • Jeśli liczy się dla Ciebie szybkość albo miejsce na dysku: nie ten silnik. Parakeet V3 i SenseVoice Small były o rząd wielkości szybsze przy ułamku rozmiaru pobierania, a Whisper Small pokrywa 101 języków w 600 MB przy 6,4×.
  • Jeśli korzystasz z iPhone'a albo z wersji z Mac App Store: tam tego silnika jeszcze nie ma. Na tych kanałach kantoński obsługuje SenseVoice.

To zrobiony w Whisper Notes na Maca port otwartego Qwen3-ASR od Alibaby na urządzenie: otwarte wagi przekonwertowane do Apple MLX w 8-bit, działające na GPU Twojego Maca, bez wysyłania dźwięku na serwery Alibaby. To nie ten sam model co 0.6B, który SenseVoice zastąpił w bezpośrednim pobraniu na Maca (DMG) 1.5.0.

Jak go włączyć (bezpośrednie pobranie na Maca, DMG 1.6.0 i nowsze): Ustawienia → Model transkrypcji → Qwen3-ASR 1.7B. Model pobiera się w aplikacji przy pierwszym użyciu i waży około 2,5 GB. Wymaga macOS 15 lub nowszego na Apple silicon, zalecane 16 GB pamięci; reszta aplikacji działa na macOS 14. Lista języków w podziale na silniki jest na stronie obsługiwanych języków. Lokalne CLI i serwer MCP przyjmują „qwen”, „qwen3” i „qwen3-asr”.

Jeśli wolisz nie zmieniać, nic zmieniać nie musisz: Parakeet V3 nadal jest domyślny.

Najczęściej zadawane pytania

Czy Qwen3-ASR jest dokładniejszy od Whisper Large V3 Turbo?

To zależy od języka, a podział jest niemal równy. W naszym własnym przebiegu FLEURS wewnątrz Whisper Notes na Maca, na 30 językach obsługiwanych przez oba modele, Qwen3-ASR 1.7B prowadził w 15, a Whisper Large V3 Turbo w 15. Qwen wygrał wyraźnie kantoński (6,00 % wobec 37,97 % CER), hindi (13,67 % wobec 30,42 % WER), tajski, wietnamski i francuski. Turbo wygrał wyraźnie fiński (6,54 % wobec 26,08 % WER), węgierski, grecki, czeski, szwedzki, duński, polski, rumuński, filipiński, turecki i niderlandzki. Czternaście z trzydziestu różnic mieści się w przedziałach błędu i należy je czytać jako remis. Wybierz Qwen3-ASR, jeśli Twój język jest w jego kolumnie wygranych i korzystasz z bezpośredniego pobrania Whisper Notes na Maca (DMG); w każdym innym przypadku i dla każdego języka spoza tych 30 wybierz Whisper Large V3 Turbo, bo Whisper obsługuje wszystkie 101 języków.

Czy mogę używać Qwen3-ASR na iPhonie albo z Mac App Store?

Dziś jest w bezpośrednim pobraniu Whisper Notes na Maca (DMG), od wersji 1.6.0. Wersja z Mac App Store ma dostać nowsze silniki w kolejnych wydaniach, ale nie mamy na to daty. Na razie aplikacja na iPhone'a i wersja z Mac App Store mają trzy rodziny silników — Whisper, Parakeet V3 i SenseVoice — a każdy język, który rozpoznaje Qwen, jest tam pokryty przez Whispera. Licząc modelami, wersja z Mac App Store oferuje dziś cztery, a bezpośrednie pobranie pięć, bo Whisper występuje i jako Small, i jako Large V3 Turbo. Jeśli potrzebujesz kantońskiego na iPhonie, użyj tam SenseVoice.

Qwen3-ASR czy SenseVoice do chińskiego, japońskiego i koreańskiego?

Pod względem dokładności są blisko siebie, pod względem szybkości — bardzo daleko. W naszym przebiegu FLEURS Qwen3-ASR uzyskał 5,69 % CER w chińskim, 5,39 % w japońskim i 3,51 % w koreańskim; SenseVoice Small na tych samych nagraniach 7,06 %, 6,85 % i 7,82 %. SenseVoice szedł w tym przebiegu z medianą 161× szybciej niż w czasie rzeczywistym wobec 8,7× u Qwena, pobiera 827 MB wobec około 2,5 GB i jest dostępny na iPhonie oraz w obu wersjach na Maca. Wybierz SenseVoice, chyba że transkrybujesz kantoński: tam Qwen3-ASR uzyskał 6,00 % CER wobec 36,71 % SenseVoice, a różnica jest na tyle duża, że warto poczekać.

Jakie są wymagania systemowe Qwen3-ASR 1.7B?

Mac z Apple silicon na macOS 15 lub nowszym, zalecane 16 GB pamięci, plus około 2,5 GB miejsca na dysku na sam model. To więcej niż reszta Whisper Notes na Maca, która działa na macOS 14 i nowszym. W naszym przebiegu model osiągnął szczyt 2,43 GiB pamięci procesu, najwięcej z pięciu silników. Na Macu z 8 GB tę samą listę 101 języków pokrywa Whisper Small w 600 MB, a 25 języków europejskich Parakeet V3 w 465 MB.

Czy dźwięk opuszcza mojego Maca, kiedy używam Qwen3-ASR?

Nie. Alibaba oferuje Qwen3-ASR również jako usługę w chmurze, przez API DashScope Real-time i FileTrans, gdzie dźwięk trafia na ich serwery. Whisper Notes z nich nie korzysta. Uruchamia otwarte wagi lokalnie, jako model MLX 8-bit na GPU Twojego Maca, bez konta i bez klucza API, a transkrypcja działa przy wyłączonej sieci. Tak samo działa każda rodzina silników w aplikacji, na każdym kanale.

Dlaczego te liczby nie zgadzają się z dokładnością, jaką dostaję na swoich nagraniach?

Bo FLEURS to krótka, czysta mowa czytana, a Twoje nagrania takie nie są. Nasz przebieg to kalibracja na publicznym zbiorze: około 75 zdań na język, jeden M5 MacBook Air, te same nagrania dla każdego modelu. Przydaje się do pytania, czy model jest wiarygodnym kandydatem dla danego języka, i nie jest prognozą Twojej dokładności na spotkaniu, na hałaśliwym nagraniu, przy akcencie ani na dwugodzinnym pliku.

Wypróbuj

Qwen3-ASR 1.7B jest w Whisper Notes na Maca 1.6.0 i nowszych, tylko w bezpośrednim pobraniu (DMG). Ustawienia → Model transkrypcji. Darmowy okres próbny obejmuje 10 000 słów: wystarczy, żeby przepuścić przez model własny język i nie zgodzić się z powyższymi tabelami.

Jeśli znajdziesz język, w którym nasze liczby nie zgadzają się z Twoim doświadczeniem, napisz na mac@whispernotes.app. Pełna lista zmian: whispernotes.app/changelog.

Źródła wszystkiego powyżej: nasz przebieg na zbiorze testowym Google FLEURS w rewizji 70bb2e84, karta modelu Qwen3-ASR 1.7B oraz tabela języków w podziale na silniki na stronie obsługiwanych języków, generowana z kodu źródłowego samej aplikacji.