SenseVoice: 52×-es gyorsabb kínai, japán és koreai átírás Mac-en

2026. május 12.
·
7 min read
·Whisper Notes Team

TL;DR — Három eszközön futó modell összehasonlítása

Parakeet V3 SenseVoice Small Whisper Large V3 Turbo
5 perc angol 2,91 mp (103×) 5,8 mp (52×) 20,92 mp (14,3×)
27 perc kínai 10,10 mp (161×) 13,83 mp (118×) 2 perc 4 mp (13,1×)
Nyelvek 25 (európai) 5 (zh, en, ja, ko, yue) 100+
Letöltés 465 MB 827 MB ~1,6 GB
Memória ~800 MB ~700 MB ~1,6 GB
Legjobb ehhez Angol & európai nyelvek Kínai, japán, koreai, kantoni Minden más (100+ nyelv)

* Sebességmérések Apple M4 Pro-n, 32 GB memóriával. 5 perces angol podcast és 27 perces kínai podcast. Valós idejű szorzó = hanganyag hossza ÷ feldolgozási idő (magasabb = gyorsabb). A mérések a Mac verzióból származnak; a SenseVoice iPhone-on is elérhető.

Az 1.5.0-s verziótól (Direct Download / DMG) kezdve a Mac-es Whisper Notes a SenseVoice Small modellt szállítja dedikált motorként a kínai, japán, koreai és kantoni átíráshoz. A Qwen3-ASR helyébe lép, és az Apple GPU-ján fut az MLX-en keresztül a CPU helyett — egy 27 perces kínai podcastot 13,83 másodperc alatt dolgoz fel 3 perc 44 másodperc helyett.

Miért cseréltük le a Qwen3-ASR-t

A Qwen3-ASR szilárd modell volt. 30 nyelvet és 22 kínai dialektust támogatott, kínai pontossága pedig közel járt a csúcsszínvonalhoz. Volt azonban egy problémája, amely a hanganyag hosszával csak súlyosbodott: a sebesség.

A Qwen3 autoregresszív architektúrát használt — ugyanazt a megközelítést, mint a Whisper: a hangot keretről keretre dolgozza fel, és sosem ugrik előre. Egy 27 perces kínai podcastnál 224 másodpercet vett igénybe. Használható, de nem az az azonnali eredményélmény, amit a Parakeet V3 nyújt angolra.

A mélyebb probléma az infrastruktúránk volt. A Qwen3 integrációnk a sherpa-onnx-et használta, egy C könyvtárat 2 249 soros Swift wrapperrel, amely mindent a CPU magokon keresztül futtatott. A GPU tétlenül állt, miközben a Mac CPU-ja végezte az összes munkát.

A SenseVoice mindkét problémát megoldotta. Nem-autoregresszív architektúra a sebességért. Apple MLX a GPU-gyorsításért. Az eredmény: 16,2-szeres sebességnövekedés ugyanazon a hardveren, miközben a kódbázis 2 249 sorról 288-ra csökkent.

A benchmark

Mindhárom modell ugyanazon az Apple M4 Pro-n futott, ugyanazokkal a hangfájlokkal, ugyanazokkal a feltételekkel. Nincs felhő. Nincs internet. Csak szilícium.

Modell 5 perc angol 27 perc kínai Sebesség (RTFx)
Parakeet V3 2,91 mp 10,10 mp 103–161×
SenseVoice Small 5,8 mp 13,83 mp 52–118×
Whisper Large V3 Turbo 20,92 mp 2 perc 4 mp 13–14×
Qwen3-ASR (eltávolítva) 224 mp 7,2×

A SenseVoice nagyjából fele olyan gyors, mint a Parakeet V3 — de még így is rendkívül gyors. Egy 27 perces podcast 14 másodpercen belül elkészül. Megnyomja az átírás gombot, vár egy lélegzetvételnyit, és a szöveg már ott is van.

Hasonlítsa össze ezt a Whisper 2 perc 4 másodpercével vagy a régi Qwen3 3 perc 44 másodpercével. Az architektúra többet számít, mint a paraméterek száma.

Hivatalos következtetési sebesség-összehasonlító táblázat a FunAudioLLM cikkből: SenseVoice-Small (70 ms 10 mp hangra) vs Whisper-Small (518 ms) vs Whisper-Large-V3 (1281 ms) — modellarchitektúra, paraméterek, támogatott nyelvek, RTF és késleltetés

Hivatalos következtetési benchmark a FunAudioLLM cikkből: a SenseVoice-Small 10 mp hangot 70 ms alatt dolgoz fel (A800 GPU). A Whisper-Large-V3-nak 1 281 ms kell. Ez 18-szoros különbség a nyers következtetési késleltetésben.

Modell Betöltési idő Memória Letöltés mérete
Parakeet V3 0,77 mp ~800 MB 465 MB
SenseVoice Small 0,81 mp ~700 MB 827 MB
Whisper Small 1,03 mp ~487 MB 600 MB
Whisper Large V3 Turbo 3,18 mp ~1,6 GB ~1,6 GB

* Betöltési idő és memória Apple M4 Pro-n, 32 GB memóriával mérve.

A SenseVoice egy másodperc alatt betöltődik, és kevesebb memóriát használ, mint a Parakeet. Egy 8 GB-os Macen kényelmesen fut a többi alkalmazás mellett.

Miért gyorsabb a SenseVoice: architektúra + futtatókörnyezet

A Qwen3-ASR és a SenseVoice közötti sebességkülönbség két független tényezőből ered.

1. tényező: modellarchitektúra. A Qwen3-ASR autoregresszív — a szöveget tokenről tokenre generálja, mindegyik az előzőtől függ. A SenseVoice nem-autoregresszív (NAR) kódolót használ, amely a teljes hangot párhuzamosan dolgozza fel. Ez az architekturális különbség önmagában alapvetően gyorsabbá teszi a SenseVoice-t, függetlenül attól, milyen hardveren futtatja.

2. tényező: futtatókörnyezet. A Qwen3-ASR integrációnk a sherpa-onnx-et használta, amely CPU-n futott. A SenseVoice az Apple MLX-en keresztül fut, a számításokat a GPU-ra irányítva. Futhatna a Qwen3 is MLX-en? Igen — de akkor is lassabb lenne a SenseVoice-nál, mert az autoregresszív szűk keresztmetszet az architektúrában van, nem a futtatókörnyezetben.

Qwen3-ASR (régi) SenseVoice (új)
Architektúra Autoregresszív (tokenről tokenre) Nem-autoregresszív (párhuzamos)
Futtatókörnyezet sherpa-onnx (CPU) Apple MLX (GPU)
27 perc kínai 224 másodperc 13,83 másodperc
Összesített gyorsulás kiindulási alap 16,2× gyorsabb
Kódbázis 168 MB C keretrendszer + 2 249 sor Swift 288 soros Swift Actor

* Ugyanaz a 27 perces kínai podcast, Apple M4 Pro. A 16,2× gyorsulás az architekturális (NAR vs AR) és a futtatókörnyezeti (GPU vs CPU) javulás együttes hatása.

A kód is egyszerűbb lett. Az új SenseVoice implementáció egyetlen 288 soros Swift Actor, amely közvetlenül az MLX-szel kommunikál, és egy 168 MB-os C keretrendszert vált ki. Kevesebb kód, kevesebb hiba, kisebb alkalmazás.

Öt nyelv, jól megcsinálva

A SenseVoice nem próbál mindent megcsinálni. Öt nyelvet kezel:

Nyelv SenseVoice-Small Whisper-Large-V3 Győztes
Kínai (zh-CN) 10,78% CER 12,55% CER SenseVoice (-14%)
Kantoni (yue) 7,09% CER 10,41% CER SenseVoice (-32%)
Japán (ja) 11,96% CER 10,34% CER Whisper (enyhén)
Koreai (ko) 8,28% CER 5,59% CER Whisper
Angol (en) 14,71% WER 9,39% WER Whisper (használjon Parakeet-et)

* CommonVoice benchmark, CER = karakterhiba-arány, WER = szóhiba-arány. Az alacsonyabb a jobb. Forrás: FunAudioLLM cikk (2024). A SenseVoice-Small következtetési késleltetése: 70 ms 10 mp hangra (A800 GPU), több mint 15-ször gyorsabb a Whisper-Large-V3-nál.

SenseVoice vs Whisper pontosság-összehasonlítás a CommonVoice benchmarkon kínai, kantoni, angol, japán, koreai és 25 további nyelven — WER/CER oszlopdiagram

CommonVoice benchmark: SenseVoice-Small (sárga) vs Whisper-Small (kék) vs Whisper-Large-V3 (narancssárga). Az alacsonyabb a jobb. Forrás: FunAudioLLM cikk

A számok őszinte történetet mesélnek. A SenseVoice jelentős különbséggel felülmúlja a Whispert kínai és kantoni pontosságban, míg a Whisper pontosabb japánra, koreaira és angolra. De a SenseVoice több mint 15-ször gyorsabb a Whisper-Large-V3-nál. A legtöbb valós felhasználásban a sebességkülönbség többet számít, mint néhány százalékpontnyi pontosság.

A kantoni eredmény külön kiemelést érdemel. A Whisper-Small 38,97% CER-t ér el kantonira — szinte használhatatlan. Még a Whisper-Large-V3 is csak 10,41%-ot tud. A SenseVoice 7,09%-ot hoz. A SenseVoice előtt nem volt jó módszer a kantoni helyi átírására Macen. Ha kantoniul beszél, ez a modell önnek készült.

SenseVoice koreai átírási eredménye a Mac-es Whisper Notes-ban, pontos koreai szöveggel egy videóból

Koreai átírás SenseVoice-szal: videóimportálás időbélyeges feliratokkal

Valós teszt: 27 perces kínai podcast

Átírtunk egy 27 perces epizódot a Thirteen Invitations (十三邀) kínai interjúpodcastból, SenseVoice-szal és Whisper Large V3 Turbóval is, ugyanazon az M4 Pro-n. Az ElevenLabs Scribe (felhő) szolgált referenciaként. A két eszközön futó modell nagyjából ugyanannyi hibát ejt, de eltérő típusúakat:

SenseVoice Whisper Large V3
Idő 13,83 mp 2 perc 4 mp
Hibák (5 perces minta) ~15–20 ~12–15
Legrosszabb hiba 时差→食堂 (időeltolódás→menza) 西昌→西藏 (Xichang város→Tibet, 4 000 km-es tévedés)
Hibamintázat Homofoncserék Földrajzi/ténybeli hibák

* Kézi összehasonlítás az ElevenLabs Scribe-bal (felhőreferencia, szintén nem tökéletes). A két eszközön futó modell helyesen írta a „根深蒂固” kifejezést ott, ahol a Scribe hibázott.

Összemérhető pontosság. 9× gyorsabb. Valós kínai átíráshoz a SenseVoice már használható átiratot ad, mire a Whisper egyáltalán betöltődne.

Mikor melyik modellt használja

A Mac-es Whisper Notes mostantól négy beszédmodellel érkezik. Mindegyik más forgatókönyvre van optimalizálva:

Amire szüksége van... Ezt a modellt használja Miért
Angol vagy európai nyelvek, maximális sebesség Parakeet V3 103× valós idejű, legalacsonyabb hibaarány. Az alapértelmezett.
Kínai, japán, koreai vagy kantoni SenseVoice Small 52–118× valós idejű. Az egyetlen modell kantoni támogatással.
A 100+ nyelv bármelyike (arab, thai, orosz stb.) Whisper Large V3 Turbo A legszélesebb nyelvi támogatás. Lassabb, de univerzális.
Alacsonyabb memóriahasználat (régebbi Macek) Whisper Small 487 MB memória. Jó választás 8 GB-os Macekre, ahol más alkalmazások is futnak.
A Whisper Notes Mac modellválasztója a Parakeet V3, SenseVoice Small, Whisper Small és Whisper Large V3 Turbo modellekkel, letöltési méretekkel és nyelvi támogatással

Beállítások → Átírási modell: válassza ki a nyelvének megfelelő motort

A Beállításokban található modellválasztó mind a négy opciót megjeleníti a letöltési méretekkel, a nyelvek számával és a memóriaigénnyel. A SenseVoice az első használatkor töltődik le (~827 MB), és az eszközén marad.

A kompromisszumok

A SenseVoice nem univerzális modell. Íme, amit nem tud:

Csak 5 nyelv. Ha thaira, oroszra, arabra, hindire vagy bármely más, a SenseVoice CJK-fókuszán kívüli nyelvre van szüksége, maradjon a Whispernél.

Frissítés: a SenseVoice eredetileg csak Macre jelent meg az Apple MLX-en keresztül, de mára iPhone-on is elérhető — az iOS ugyanazt a modellfelhozatalt támogatja, mint a Mac: Parakeet V3, Whisper és SenseVoice.

Halk hangok furcsasága. Nagyon rövid vagy nagyon halk szakaszoknál a SenseVoice a kiválasztott nyelvtől függetlenül néha kínai kimenetre válthat vissza. A nyelv kézi beállítása (az „Automatikus” helyett) csökkenti ennek esélyét.

Nincs streamelés. A Whisper streamelési módjával ellentétben a SenseVoice a felvétel után dolgozza fel a teljes hanganyagot. Hosszú fájloknál automatikusan szegmentál a csendes pontoknál, és fokozatosan jeleníti meg az eredményeket.

Ezek architekturális korlátok, nem hibák. Egy 5 nyelvre tanított modell azt az 5 nyelvet rendkívül jól kezeli. A Whisper 100+ nyelves lefedettsége lassabb sebességgel és nyelvenként egyenetlen pontossággal jár.

Az összes helyi lehetőséget összehasonlítaná? Minden eszközön futó beszédfelismerő modell — a Whisper-változatok, a Parakeet V3, a SenseVoice és a Voxtral — egymás mellett szerepel a Whisper modell-összehasonlító oldalunkon. Most ismerkedik magával a Whisperrel? Kezdje a Whisper átírási útmutatóval — mi ez a modell, hogyan futtatható, és mennyibe kerül.

Gyakran ismételt kérdések

Mi a leggyorsabb Whisper-alternatíva kínai, japán és koreai átíráshoz?

A SenseVoice Small a Whisper Notes-ban Macen és iPhone-on is elérhető. Mac-tesztünkben, egy M4 Pro-n, egy 27 perces kínai podcastot 13,83 másodperc alatt írt át (52–118× valós idejű sebesség), miközben a Whisper Large V3 Turbónak több mint 2 percre volt szüksége ugyanahhoz a fájlhoz.

Jobb a SenseVoice a Whispernél kínaihoz?

Kínaihoz és kantonihoz igen. A CommonVoice benchmarkon a SenseVoice 10,78% CER-t ér el kínaira a Whisper-Large-V3 12,55%-ával szemben, és több mint 15-ször gyorsabb. Japánra és koreaira a Whisper marad valamivel pontosabb.

Átírhatok kantonit helyben, Macen?

Igen. A SenseVoice 7,09% CER-t ér el kantonira, szemben a Whisper-Large-V3 10,41%-ával és a Whisper-Small szinte használhatatlan 38,97%-ával. A SenseVoice előtt nem volt jó módszer a kantoni helyi átírására Macen.

Működik a SenseVoice iPhone-on?

Igen. A Whisper Notes iPhone-on ugyanazt a modellfelhozatalt támogatja, mint Macen — Parakeet V3, Whisper és SenseVoice —, így kínait, japánt, koreait és kantonit iPhone-ján is helyben írhat át.

Próbálja ki

A SenseVoice a Mac-es Whisper Notes v1.5.0-s (Direct Download / DMG) és újabb verzióiban, valamint az aktuális iPhone-alkalmazásban érhető el. Macen a Beállítások → Átírási modell → SenseVoice Small (~827 MB) menüpontból töltheti le. A Mac verzióhoz Apple Silicon (M1 vagy újabb) szükséges.

Ha a Parakeet V3-at használja, és főleg angolul diktál, nincs szükség váltásra. A SenseVoice arra való, amikor kínaira, japánra, koreaira vagy kantonira van szüksége — és gyorsan akarja.

Letöltés Macre

Teljes változásnapló: whispernotes.app/changelog

Kérdés vagy visszajelzés: mac@whispernotes.app