Qwen3-ASR mot Whisper Large V3 Turbo: vilka språk vinner (Mac-test)

25 augusti 2026
·
11 min read
·Whisper Notes Team

Vi ville svara på en enda fråga: finns det en lokal modell som transkriberar ditt språk mer träffsäkert än Whisper Large V3? Så vi testade de här modellerna på datamängden FLEURS.

FLEURS är en datamängd från Google med uppläst tal på 102 språk. Vi tog ungefär 75 meningar från varje språk och körde samma klipp, i samma ordning, genom fem modeller:

  • Parakeet V3
  • Whisper Large V3 Turbo
  • SenseVoice Small
  • Whisper Small
  • Qwen3-ASR 1.7B

Så här ser resultatet ut.

Qwen3-ASR 1.7B mot Whisper Large V3 Turbo — vår egen FLEURS-körning, en M5 MacBook Air, uppläst tal, korta klipp.

Qwen3-ASR 1.7B Whisper Large V3 Turbo
Språkstöd 30 101
Tydliga fördelar Kantonesiska, hindi, thai, vietnamesiska, franska (5) Finska, ungerska, grekiska och 8 språk till (11)
Hastighet 8,7× realtid 2,4× realtid
Högsta minnesanvändning 2,43 GiB 1,87 GiB
Nedladdning cirka 2,5 GB cirka 1,6 GB

Utanför varje modells starka språk är skillnaden i träffsäkerhet liten.

Whisper Large V3 mot Qwen3-ASR: träffsäkerheten språk för språk

Alla 30 språken, sorterade från Qwens största försprång till dess största eftersläpning. I båda kolumnerna gäller: lägre är bättre.

Vår egen FLEURS-körning, en M5 MacBook Air, uppläst tal. CER för kinesiska, kantonesiska, japanska, koreanska och thai, WER för övriga; grönt markerar ett försprång som är större än de parade 95-procentiga felmarginalerna.

Språk Qwen3-ASR 1.7B Whisper Large V3 Turbo
Kantonesiska 6,00 37,97
Hindi 13,67 30,42
Thai 5,92 12,95
Vietnamesiska 5,07 9,79
Persiska 26,98 30,03
Arabiska 14,14 15,75
Indonesiska 4,97 6,50
Franska 3,98 5,39
Kinesiska 5,69 6,88
Engelska 5,07 5,92
Tyska 3,51 4,10
Japanska 5,39 5,71
Koreanska 3,51 3,70
Spanska 3,60 3,76
Italienska 2,98 3,05
Ryska 5,98 5,51
Portugisiska 5,64 4,91
Makedonska 17,81 16,64
Malajiska 11,60 10,18
Nederländska 7,65 5,63
Turkiska 8,34 5,53
Danska 20,12 14,92
Polska 12,78 5,32
Rumänska 18,97 8,22
Filippinska 20,44 9,37
Svenska 20,04 8,72
Tjeckiska 23,92 11,15
Grekiska 30,20 12,97
Finska 26,08 6,54
Ungerska 36,35 13,66

Vår egen parade körning på FLEURS testdel, revision 70bb2e84, ungefär 75 meningar per språk, en M5 MacBook Air.

De fem som Qwen3-ASR 1.7B vinner tydligt. Felfrekvens i procent, Qwen mot Turbo: kantonesiska (6,0 mot 38,0), hindi (13,7 mot 30,4), thai (5,9 mot 13,0), vietnamesiska (5,1 mot 9,8), franska (4,0 mot 5,4). Kantonesiska och thai poängsätts per tecken, resten per ord. Försprånget ligger hos de språk som poängsätts per tecken: över kinesiska, kantonesiska, japanska, koreanska och thai landade Qwen på 5,3 % i snitt mot Turbos 13,4 %. Över de övriga tjugofem, poängsatta per ord, blir det 14,0 % mot 10,2 %.

De elva som Whisper Large V3 Turbo vinner tydligt. Felfrekvens i procent, Qwen mot Turbo, allt poängsatt per ord: ungerska (36,4 mot 13,7), grekiska (30,2 mot 13,0), finska (26,1 mot 6,5), tjeckiska (23,9 mot 11,2), filippinska (20,4 mot 9,4), danska (20,1 mot 14,9), svenska (20,0 mot 8,7), rumänska (19,0 mot 8,2), polska (12,8 mot 5,3), turkiska (8,3 mot 5,5), nederländska (7,7 mot 5,6).

De fjorton som ligger nära eller jämnt. Engelska (5,1 mot 5,9), tyska (3,5 mot 4,1), spanska (3,6 mot 3,8), italienska (3,0 mot 3,1), ryska (6,0 mot 5,5), portugisiska (5,6 mot 4,9); kinesiska (5,7 mot 6,9), japanska (5,4 mot 5,7) och koreanska (3,5 mot 3,7) poängsätts per tecken. Därtill arabiska, indonesiska, persiska, malajiska och makedonska. Varje avstånd här är litet och ligger inom 95-procentsbandet. Den här körningen kan alltså inte skilja de två modellerna åt.

Kantonesiska är den enda raden som ändrar ett beslut: 6,00 % mot 37,97 %. Och SenseVoice Small, som vi hittills har publicerat som svaret för kantonesiska, hamnade på 36,71 % CER på samma klipp. På den här uppsättningen uppläst tal klarar ingen av dem ribban, så den äldre rekommendationen får från och med nu det förbehållet med sig.

Hur snabb är Qwen3-ASR 1.7B?

Alla fem motorerna, mätta i samma testuppställning på en och samma dator (M5 MacBook Air). Sinsemellan är siffrorna därmed åtminstone jämförbara.

Median för realtidsfaktorn över varje motors språk i samma FLEURS-körning, en M5 MacBook Air, uppläst tal.

Motor Språk Medianhastighet i den här körningen (korta klipp)
SenseVoice Small 6 språk 161,0×
Parakeet TDT 0.6B v3 25 82,9×
Qwen3-ASR 1.7B 30 angivna 8,7×
Whisper Small 101 6,4×
Whisper Large V3 Turbo 101 2,4×

Det här är siffror från en testuppställning med korta klipp och de ligger lägre än vad samma motorer gör på en lång inspelning. Använd kolumnen för att jämföra motorerna med varandra inom den här enda körningen, och till ingenting annat.

Parakeet V3 och SenseVoice Small är i samma testuppställning ungefär en storleksordning snabbare än Qwen3-ASR. På långa filer i stället för korta klipp har Parakeet kört i 103× realtid på en M4 Pro och SenseVoice i 52× eller mer — en annan mätning på annat ljud, som pekar åt samma håll.

Qwen3-ASR hamnar däremellan. Den var inte den långsammaste motorn i den här körningen med korta klipp, det var Whisper Large V3 Turbo. Däremot varierar den mer mellan språken än de andra: från 2,7× på grekiska till 12,4× på japanska.

Vad kostar Qwen3-ASR i minne och lagring?

Högsta minnesanvändning är det största processavtryck vi såg över de enskilda mätningarna i samma FLEURS-körning, en M5 MacBook Air, uppläst tal, korta klipp.

Motor Nedladdning Högsta minnesanvändning i körningen
Parakeet TDT 0.6B v3 465 MB 0,09 GiB
Whisper Small 600 MB 0,87 GiB
SenseVoice Small 827 MB 0,95 GiB
Whisper Large V3 Turbo cirka 1,6 GB 1,87 GiB
Qwen3-ASR 1.7B cirka 2,5 GB 2,43 GiB

På båda axlarna är Qwen3-ASR den tyngsta av de fem: cirka 2,5 GB att ladda ner och 2,43 GiB som högsta processminne i körningen, mot cirka 1,6 GB och 1,87 GiB för Whisper Large V3 Turbo.

På en dator med 8 GB finns en lättare väg. Parakeet V3 täcker 25 språk på 465 MB och 0,09 GiB, och Whisper Small täcker 101 på 600 MB och 0,87 GiB.

Så mätte vi: FLEURS, 30 språk, en Mac

Qwen3-ASR 1.7B kördes som ett MLX-bygge i 8 bitar, Whisper Large V3 Turbo som ett ggml-bygge från whisper.cpp på Metal. Datan är testdelen av Google FLEURS vid revision 70bb2e84 (CC-BY-4.0): 83 av dess 102 språk, ungefär 75 meningar och 15 minuter per språk, samma klipp i samma ordning för varje modell; den parade jämförelsen är Qwens 30. WER för språk som skiljer ord åt med mellanslag, CER för kinesiska, kantonesiska, japanska, koreanska och thai, aldrig sammanslaget till en enda siffra. Felmarginalerna kommer från en bootstrap med 10 000 dragningar på objektnivå. En M5 MacBook Air, 32 GB, macOS 26.5, inga tomma utdata och inga misslyckade klipp från någon av modellerna.

FLEURS är uppläst tal, inte ett möte och inte diktering. Rangordningar från uppläst tal har två gånger inte överlevt riktigt ljud i våra egna tester, så vi räknar inte upp dem till långa inspelningar: de här tabellerna säger om en modell är rimlig för ditt språk, inte vilken träffsäkerhet du kommer att få. Utvärderingen av Qwen3-ASR 1.7B på riktiga möten blir ett eget inlägg.

Ska du använda Qwen3-ASR i stället för Whisper Large V3?

Språk för språk skulle vi svara så här inne i Whisper Notes för Mac.

  • Transkriberar du kantonesiska, hindi, thai, vietnamesiska eller franska: välj Qwen3-ASR 1.7B.
  • Transkriberar du kinesiska, japanska, koreanska, engelska, tyska, spanska eller italienska: försprånget är hårfint, och mer än så påstår vi inte. Båda modellerna duger, precis som för persiska, arabiska, indonesiska, ryska, portugisiska, makedonska och malajiska.
  • Transkriberar du finska, ungerska, grekiska, tjeckiska, svenska, danska, polska, rumänska, filippinska, turkiska eller nederländska: stanna kvar på Whisper Large V3 Turbo. Alla elva vann den tydligt.
  • Är det hastighet eller lagringsutrymme du bryr dig om: då inte den här motorn. Parakeet V3 och SenseVoice Small var en storleksordning snabbare, på en bråkdel av nedladdningen, och Whisper Small täcker 101 språk på 600 MB i 6,4×.
  • Använder du iPhone eller versionen från Mac App Store: där finns motorn inte än. För kantonesiska är SenseVoice valet på de kanalerna.

Det här är Alibabas öppna Qwen3-ASR portat till enheten, så som Whisper Notes för Mac levererar det: de öppna vikterna, konverterade till Apple MLX i 8 bitar, körda på din egen Macs GPU, utan att ljud går till Alibabas servrar. Det är inte samma modell som den 0.6B som SenseVoice ersatte i version 1.5.0 (Direct Download / DMG).

Så använder du den (Mac, direkt nedladdning, DMG 1.6.0 och senare): Inställningar, sedan Transkriptionsmodell, sedan Qwen3-ASR 1.7B. Modellen laddas ned i appen första gången du använder den och är cirka 2,5 GB. Den kräver macOS 15 eller senare på Apple Silicon, med 16 GB minne rekommenderat; resten av appen kör på macOS 14. Vilket språk som hör till vilken motor står på vår sida om språkstöd. Det lokala CLI:t och MCP-servern tar emot "qwen", "qwen3" och "qwen3-asr".

Vill du hellre låta bli att byta behöver ingenting ändras: Parakeet V3 är fortfarande standard.

Vanliga frågor

Är Qwen3-ASR mer träffsäker än Whisper Large V3 Turbo?

Det beror på språket, och ställningen är nästan jämn. I vår egen FLEURS-körning inne i Whisper Notes för Mac låg Qwen3-ASR 1.7B före på 15 av de 30 språk som båda modellerna täcker, och Whisper Large V3 Turbo på 15. Qwen ledde tydligt på kantonesiska (6,00 % mot 37,97 % CER), hindi (13,67 % mot 30,42 % WER), thai, vietnamesiska och franska. Turbo ledde tydligt på finska (6,54 % mot 26,08 % WER), ungerska, grekiska, tjeckiska, svenska, danska, polska, rumänska, filippinska, turkiska och nederländska. Fjorton av de trettio avstånden ligger inom felmarginalerna och ska läsas som oavgjort. Välj Qwen3-ASR om ditt språk står i dess vinnande kolumn och du kör Whisper Notes för Mac som direkt nedladdning (DMG); välj Whisper Large V3 Turbo för allt annat, och för varje språk utanför Qwens 30, eftersom Whisper täcker alla 101 språken.

Kan jag använda Qwen3-ASR på iPhone eller från Mac App Store?

I dag finns den i Whisper Notes för Mac som direkt nedladdning (DMG), från version 1.6.0. Versionen från Mac App Store är tänkt att få de nyare motorerna i kommande versioner, och något datum har vi inte. Till dess har iPhone-appen och Mac App Store-versionen tre motorfamiljer — Whisper, Parakeet V3 och SenseVoice — och varje språk som Qwen känner igen täcks där också av Whisper. Räknat i modeller erbjuder Mac App Store-versionen fyra i dag och den direkta nedladdningen fem, eftersom Whisper finns både som Small och som Large V3 Turbo. Behöver du kantonesiska på iPhone är SenseVoice motorn att använda där.

Qwen3-ASR eller SenseVoice för kinesiska, japanska och koreanska?

På träffsäkerhet ligger de nära varandra, på hastighet långt isär. I vår FLEURS-körning landade Qwen3-ASR på 5,69 % CER för kinesiska, 5,39 % för japanska och 3,51 % för koreanska; SenseVoice Small på 7,06 %, 6,85 % och 7,82 % på samma klipp. SenseVoice körde i den körningen på en median om 161× realtid mot Qwens 8,7×, laddar ned 827 MB mot cirka 2,5 GB och finns på iPhone och i båda Mac-versionerna. Välj SenseVoice, om du inte transkriberar kantonesiska: där landade Qwen3-ASR på 6,00 % CER mot SenseVoices 36,71 %, och den skillnaden är värd väntan.

Vilka systemkrav har Qwen3-ASR 1.7B?

En Mac med Apple Silicon på macOS 15 eller senare, med 16 GB minne rekommenderat, plus cirka 2,5 GB lagring för modellen. Det är högre än för resten av Whisper Notes för Mac, som kör på macOS 14 och senare. I vår benchmark-körning toppade modellen på 2,43 GiB processminne, högst av de fem motorerna. På en Mac med 8 GB täcker Whisper Small samma lista med 101 språk på 600 MB, och Parakeet V3 täcker 25 europeiska språk på 465 MB.

Lämnar ljudet min Mac när jag använder Qwen3-ASR?

Nej. Alibaba erbjuder även Qwen3-ASR som molntjänst, via DashScope-API:erna för realtid och filtranskribering, och där laddas ljudet upp till deras servrar. Whisper Notes använder inte dem. Appen kör de öppna vikterna lokalt som en MLX-modell i 8 bitar på din Macs GPU, utan konto och utan API-nyckel, och transkriberingen fungerar med nätverket avstängt. Det gäller alla motorfamiljer i appen, på alla kanaler.

Varför stämmer inte de här siffrorna med träffsäkerheten jag får på mina inspelningar?

För att FLEURS är kort, rent, uppläst tal, och dina inspelningar är inte det. Vår körning är en kalibrering på en offentlig datamängd: ungefär 75 meningar per språk, en M5 MacBook Air, samma klipp för varje modell. Den duger för frågan om en modell är rimlig för ett språk. Den är ingen förutsägelse om din träffsäkerhet på ett möte, på brusigt ljud, på tal med brytning eller i en två timmar lång fil.

Prova själv

Qwen3-ASR 1.7B finns i Whisper Notes för Mac från 1.6.0, bara som direkt nedladdning (DMG). Inställningar, sedan Transkriptionsmodell. Den kostnadsfria provperioden räcker till 10 000 ord, tillräckligt för att köra ditt eget språk genom den och vara oense med tabellerna ovan.

Hittar du ett språk där våra siffror inte stämmer med din erfarenhet, mejla mac@whispernotes.app. Fullständiga versionsanteckningar: whispernotes.app/changelog.

Källorna till allt ovan: vår FLEURS-körning på testdelen av Google FLEURS vid revision 70bb2e84, modellkortet för Qwen3-ASR 1.7B och språktabellen per motor på vår sida om språkstöd, som genereras från appens egen källkod.