SenseVoice: 52× snabbare transkription för kinesiska, japanska och koreanska på Mac

12 maj 2026
·
7 min read
·Whisper Notes Team

TL;DR — Tre modeller på enheten jämförda

Parakeet V3 SenseVoice Small Whisper Large V3 Turbo
5 min engelska 2,91 s (103×) 5,8 s (52×) 20,92 s (14,3×)
27 min kinesiska 10,10 s (161×) 13,83 s (118×) 2 min 4 s (13,1×)
Språk 25 (europeiska) 5 (zh, en, ja, ko, yue) 100+
Nedladdning 465 MB 827 MB ~1,6 GB
Minne ~800 MB ~700 MB ~1,6 GB
Bäst för Engelska & europeiska språk Kinesiska, japanska, koreanska, kantonesiska Allt annat (100+ språk)

* Hastighetstester på Apple M4 Pro, 32 GB. 5-minuters engelsk podcast och 27-minuters kinesisk podcast. Realtidsfaktor = ljudlängd ÷ bearbetningstid (högre = snabbare). Testerna är från Mac-versionen; SenseVoice finns också på iPhone.

Från och med version 1.5.0 (Direct Download / DMG) levereras Whisper Notes för Mac med SenseVoice Small som dedikerad motor för transkription av kinesiska, japanska, koreanska och kantonesiska. Den ersätter Qwen3-ASR och körs på Apples GPU via MLX istället för CPU — en 27-minuters kinesisk podcast bearbetas på 13,83 sekunder istället för 3 minuter och 44 sekunder.

Varför vi ersatte Qwen3-ASR

Qwen3-ASR var en solid modell. Den stödde 30 språk plus 22 kinesiska dialekter, och dess kinesiska träffsäkerhet var nära den bästa som finns. Men den hade ett problem som blev värre ju längre ljudet var: hastigheten.

Qwen3 använde en autoregressiv arkitektur — samma angreppssätt som Whisper: ljudet bearbetas bildruta för bildruta, utan att hoppa framåt. På en 27-minuters kinesisk podcast tog det 224 sekunder. Användbart, men inte den där omedelbara upplevelsen som Parakeet V3 levererar för engelska.

Det djupare problemet var vår infrastruktur. Vår Qwen3-integration använde sherpa-onnx, ett C-bibliotek med en 2 249 rader lång Swift-wrapper som dirigerade allt genom CPU-kärnorna. GPU:n satt sysslolös medan din Macs CPU gjorde allt arbete.

SenseVoice löste båda problemen. Icke-autoregressiv arkitektur för hastighet. Apple MLX för GPU-acceleration. Resultatet: 16,2× snabbare på samma hårdvara, med en kodbas som krympte från 2 249 rader till 288.

Benchmarken

Alla tre modellerna körs på samma Apple M4 Pro, samma ljudfiler, samma förutsättningar. Inget moln. Inget internet. Bara kisel.

Modell 5 min engelska 27 min kinesiska Hastighet (RTFx)
Parakeet V3 2,91 s 10,10 s 103–161×
SenseVoice Small 5,8 s 13,83 s 52–118×
Whisper Large V3 Turbo 20,92 s 2 min 4 s 13–14×
Qwen3-ASR (borttagen) 224 s 7,2×

SenseVoice är ungefär hälften så snabb som Parakeet V3 — fortfarande extremt snabb. En 27-minuters podcast är klar på under 14 sekunder. Du trycker på transkribera, hinner andas ut en gång, och texten är där.

Jämför det med Whisper på 2 minuter och 4 sekunder, eller gamla Qwen3 på 3 minuter och 44 sekunder. Arkitekturen betyder mer än antalet parametrar.

Officiell jämförelsetabell över inferenshastighet från FunAudioLLM-artikeln: SenseVoice-Small (70 ms per 10 s ljud) vs Whisper-Small (518 ms) vs Whisper-Large-V3 (1281 ms) - visar modellarkitektur, parametrar, språkstöd, RTF och latens

Officiell inferensbenchmark från FunAudioLLM-artikeln: SenseVoice-Small bearbetar 10 s ljud på 70 ms (A800-GPU). Whisper-Large-V3 tar 1 281 ms. Det är en 18× skillnad i ren inferenslatens.

Modell Laddningstid Minne Nedladdningsstorlek
Parakeet V3 0,77 s ~800 MB 465 MB
SenseVoice Small 0,81 s ~700 MB 827 MB
Whisper Small 1,03 s ~487 MB 600 MB
Whisper Large V3 Turbo 3,18 s ~1,6 GB ~1,6 GB

* Laddningstid och minne uppmätta på Apple M4 Pro, 32 GB.

SenseVoice laddas på under en sekund och använder mindre minne än Parakeet. På en Mac med 8 GB körs den bekvämt vid sidan av dina andra program.

Varför SenseVoice är snabbare: arkitektur + körmiljö

Hastighetsgapet mellan Qwen3-ASR och SenseVoice kommer från två oberoende faktorer.

Faktor 1: Modellarkitektur. Qwen3-ASR är autoregressiv — den genererar text token för token, där varje token beror på den föregående. SenseVoice använder en icke-autoregressiv (NAR) encoder som bearbetar hela ljudet parallellt. Enbart denna arkitekturskillnad gör SenseVoice fundamentalt snabbare, oavsett vilken hårdvara du kör den på.

Faktor 2: Körmiljö. Vår Qwen3-ASR-integration använde sherpa-onnx, som kördes på CPU. SenseVoice körs genom Apple MLX och dirigerar beräkningarna till GPU:n. Skulle Qwen3 också kunna köras på MLX? Ja — men den skulle ändå vara långsammare än SenseVoice, eftersom den autoregressiva flaskhalsen sitter i arkitekturen, inte i körmiljön.

Qwen3-ASR (gammal) SenseVoice (ny)
Arkitektur Autoregressiv (token för token) Icke-autoregressiv (parallell)
Körmiljö sherpa-onnx (CPU) Apple MLX (GPU)
27 min kinesiska 224 sekunder 13,83 sekunder
Sammanlagd hastighetsökning baslinje 16,2× snabbare
Kodbas 168 MB C-ramverk + 2 249 rader Swift 288 rader Swift Actor

* Samma 27-minuters kinesiska podcast, Apple M4 Pro. Hastighetsökningen på 16,2× kombinerar både arkitektur- (NAR vs AR) och körmiljöförbättringar (GPU vs CPU).

Koden blev också enklare. Den nya SenseVoice-implementeringen är en enda Swift Actor på 288 rader som pratar direkt med MLX och ersätter ett 168 MB stort C-ramverk. Mindre kod, färre buggar, mindre app.

Fem språk, ordentligt gjorda

SenseVoice försöker inte göra allt. Den hanterar fem språk:

Språk SenseVoice-Small Whisper-Large-V3 Vinnare
Kinesiska (zh-CN) 10,78% CER 12,55% CER SenseVoice (-14%)
Kantonesiska (yue) 7,09% CER 10,41% CER SenseVoice (-32%)
Japanska (ja) 11,96% CER 10,34% CER Whisper (knappt)
Koreanska (ko) 8,28% CER 5,59% CER Whisper
Engelska (en) 14,71% WER 9,39% WER Whisper (använd Parakeet)

* CommonVoice-benchmark, CER = teckenfelfrekvens, WER = ordfelfrekvens. Lägre är bättre. Källa: FunAudioLLM-artikeln (2024). SenseVoice-Smalls inferenslatens: 70 ms per 10 s ljud (A800-GPU), mer än 15× snabbare än Whisper-Large-V3.

SenseVoice vs Whisper träffsäkerhetsjämförelse på CommonVoice-benchmark för kinesiska, kantonesiska, engelska, japanska, koreanska och 25 andra språk - WER/CER-stapeldiagram

CommonVoice-benchmark: SenseVoice-Small (gul) vs Whisper-Small (blå) vs Whisper-Large-V3 (orange). Lägre är bättre. Källa: FunAudioLLM-artikeln

Siffrorna berättar en ärlig historia. SenseVoice slår Whisper på kinesiska och kantonesiska med tydlig marginal, medan Whisper är mer träffsäker för japanska, koreanska och engelska. Men SenseVoice är mer än 15× snabbare än Whisper-Large-V3. I det mesta verkliga arbetet betyder hastighetsskillnaden mer än några procentenheters träffsäkerhet.

Resultatet för kantonesiska är värt att lyfta fram separat. Whisper-Small får 38,97% CER på kantonesiska — nästan oanvändbart. Till och med Whisper-Large-V3 når bara 10,41%. SenseVoice landar på 7,09%. Före SenseVoice fanns det inget bra sätt att transkribera kantonesiska lokalt på en Mac. Om du talar kantonesiska finns den här modellen för dig.

Koreanskt transkriptionsresultat med SenseVoice i Whisper Notes för Mac som visar korrekt koreansk text från en video

Koreansk transkription med SenseVoice: videoimport med tidsstämplade undertexter

Praktiskt test: 27-minuters kinesisk podcast

Vi transkriberade ett 27-minuters avsnitt av Thirteen Invitations (十三邀), en kinesisk intervjupodcast, med både SenseVoice och Whisper Large V3 Turbo på samma M4 Pro. ElevenLabs Scribe (moln) fungerade som referens. Båda modellerna på enheten gör ungefär lika många fel, men av olika slag:

SenseVoice Whisper Large V3
Tid 13,83 s 2 min 4 s
Fel (5 min urval) ~15–20 ~12–15
Värsta felet 时差→食堂 (tidszon→matsal) 西昌→西藏 (staden Xichang→Tibet, 4 000 km fel)
Felmönster Homofonförväxlingar Geografiska/faktafel

* Manuell jämförelse mot ElevenLabs Scribe (molnreferens, inte heller perfekt). Båda modellerna på enheten skrev "根深蒂固" korrekt där Scribe fick fel.

Jämförbar träffsäkerhet. 9× snabbare. För verklig kinesisk transkription ger SenseVoice dig ett användbart transkript innan Whisper hunnit laddas klart.

När du ska använda vilken modell

Whisper Notes för Mac levereras nu med fyra talmodeller. Var och en är optimerad för olika scenarier:

Du behöver... Använd denna modell Varför
Engelska eller europeiska språk, maximal hastighet Parakeet V3 103× realtid, lägst felfrekvens. Standardvalet.
Kinesiska, japanska, koreanska eller kantonesiska SenseVoice Small 52–118× realtid. Enda modellen med stöd för kantonesiska.
Något av 100+ språk (arabiska, thai, ryska m.fl.) Whisper Large V3 Turbo Bredast språkstöd. Långsammare men universell.
Lägre minnesanvändning (äldre Mac-datorer) Whisper Small 487 MB minne. Bra för 8 GB-Mac som kör andra program.
Whisper Notes Mac-modellväljare som visar Parakeet V3, SenseVoice Small, Whisper Small och Whisper Large V3 Turbo med nedladdningsstorlekar och språkstöd

Inställningar → Transkriptionsmodell: välj rätt motor för ditt språk

Modellväljaren i Inställningar visar alla fyra alternativen med nedladdningsstorlek, antal språk och minneskrav. SenseVoice laddas ner vid första användningen (~827 MB) och stannar på din enhet.

Avvägningarna

SenseVoice är ingen universalmodell. Här är vad den inte kan:

Bara 5 språk. Om du behöver thai, ryska, arabiska, hindi eller något annat språk utanför SenseVoices CJK-fokus, håll dig till Whisper.

Uppdatering: SenseVoice levererades ursprungligen enbart för Mac via Apple MLX, men finns nu även på iPhone — iOS har samma modelluppsättning som Mac: Parakeet V3, Whisper och SenseVoice.

Egenhet med tyst ljud. Vid mycket korta eller mycket tysta segment kan SenseVoice ibland falla tillbaka till kinesisk utskrift oavsett valt språk. Att ställa in språket manuellt (istället för "Auto") minskar detta.

Ingen strömning. Till skillnad från Whispers strömningsläge bearbetar SenseVoice hela ljudet efter inspelningen. För långa filer segmenterar den automatiskt vid tysta partier och visar resultaten löpande.

Detta är arkitektoniska begränsningar, inte buggar. En modell tränad på 5 språk gör dessa 5 språk extremt bra. Whispers täckning av 100+ språk kommer med lägre hastighet och ojämn träffsäkerhet mellan språken.

Vill du jämföra alla lokala alternativ? Varje tal-till-text-modell på enheten — Whisper-varianterna, Parakeet V3, SenseVoice och Voxtral — jämförs sida vid sida på vår jämförelsesida för Whisper-modeller. Ny på Whisper? Börja med Whisper-transkriptionsguiden — vad modellen är, alla sätt att köra den och vad den kostar.

Vanliga frågor

Vilket är det snabbaste Whisper-alternativet för transkription av kinesiska, japanska och koreanska?

SenseVoice Small finns i Whisper Notes på både Mac och iPhone. I vårt Mac-test på en M4 Pro transkriberade den en 27-minuters kinesisk podcast på 13,83 sekunder (52–118× realtid), medan Whisper Large V3 Turbo tog över 2 minuter för samma fil.

Är SenseVoice bättre än Whisper för kinesiska?

För kinesiska och kantonesiska, ja. På CommonVoice-benchmarken får SenseVoice 10,78% CER på kinesiska mot Whisper-Large-V3:s 12,55%, och den är mer än 15× snabbare. Whisper förblir något mer träffsäker för japanska och koreanska.

Kan jag transkribera kantonesiska lokalt på en Mac?

Ja. SenseVoice får 7,09% CER på kantonesiska, jämfört med 10,41% för Whisper-Large-V3 och nästan oanvändbara 38,97% för Whisper-Small. Före SenseVoice fanns det inget bra sätt att transkribera kantonesiska lokalt på en Mac.

Fungerar SenseVoice på iPhone?

Ja. Whisper Notes på iPhone har samma modelluppsättning som Mac — Parakeet V3, Whisper och SenseVoice — så du kan transkribera kinesiska, japanska, koreanska och kantonesiska lokalt även på din iPhone.

Prova själv

SenseVoice finns i Whisper Notes för Mac v1.5.0 (Direct Download / DMG) och senare, samt i den aktuella iPhone-appen. På Mac laddar du ner den via Inställningar → Transkriptionsmodell → SenseVoice Small (~827 MB). Mac-versionen kräver Apple Silicon (M1 eller senare).

Om du kör Parakeet V3 och mest dikterar på engelska finns det ingen anledning att byta. SenseVoice är till för när du behöver kinesiska, japanska, koreanska eller kantonesiska — och vill ha det snabbt.

Ladda ner för Mac

Fullständig ändringslogg: whispernotes.app/changelog

Frågor eller synpunkter: mac@whispernotes.app