SenseVoice vs Whisper: a legjobb modell japánhoz, koreaihoz és kínaihoz (Benchmark)

2026. május 12.
·
7 min read
·Whisper Notes Team

TL;DR — Három eszközön futó modell összehasonlítása

Parakeet V3 SenseVoice Small Whisper Large V3 Turbo
5 perc angol 2,91 mp (103×) 5,8 mp (52×) 20,92 mp (14,3×)
27 perc kínai Nincs kínai támogatás 13,83 mp (118×) 2 perc 4 mp (13,1×)
Nyelvek 25 (európai) 5 (zh, en, ja, ko, yue) 100+
Letöltés 465 MB 827 MB ~1,6 GB
Legjobb ehhez Angol & európai nyelvek Kínai, japán, koreai, kantoni Minden más (100+ nyelv)

* Sebességmérések Apple M4 Pro-n, 32 GB memóriával. 5 perces angol podcast és 27 perces kínai podcast. Valós idejű szorzó = hanganyag hossza ÷ feldolgozási idő (magasabb = gyorsabb). A mérések a Mac verzióból származnak; a SenseVoice iPhone-on is elérhető.

Az 1.5.0-s verziótól (Direct Download / DMG) kezdve a Mac-es Whisper Notes a SenseVoice Small modellt szállítja dedikált motorként a kínai, japán, koreai és kantoni átíráshoz. A Qwen3-ASR helyébe lép, és az Apple GPU-ján fut az MLX-en keresztül a CPU helyett — egy 27 perces kínai podcastot 13,83 másodperc alatt dolgoz fel 3 perc 44 másodperc helyett.

Miért cseréltük le a Qwen3-ASR-t

A Qwen3-ASR szilárd modell volt. 30 nyelvet és 22 kínai dialektust támogatott, kínai pontossága pedig közel járt a csúcsszínvonalhoz. Volt azonban egy problémája, amely a hanganyag hosszával csak súlyosbodott: a sebesség.

A Qwen3 autoregresszív architektúrát használt — ugyanazt a megközelítést, mint a Whisper: a hangot keretről keretre dolgozza fel, és sosem ugrik előre. Egy 27 perces kínai podcastnál 224 másodpercet vett igénybe. Használható, de nem az az azonnali eredményélmény, amit a Parakeet V3 nyújt angolra.

A mélyebb probléma az infrastruktúránk volt. A Qwen3 integrációnk a sherpa-onnx-et használta, egy C könyvtárat 2 249 soros Swift wrapperrel, amely mindent a CPU magokon keresztül futtatott. A GPU tétlenül állt, miközben a Mac CPU-ja végezte az összes munkát.

A SenseVoice mindkét problémát megoldotta. Nem-autoregresszív architektúra a sebességért. Apple MLX a GPU-gyorsításért. Az eredmény: 16,2-szeres sebességnövekedés ugyanazon a hardveren, miközben a kódbázis 2 249 sorról 288-ra csökkent.

A benchmark

Mindhárom modell ugyanazon az Apple M4 Pro-n futott, ugyanazokkal a hangfájlokkal, ugyanazokkal a feltételekkel. Nincs felhő. Nincs internet. Csak szilícium.

Modell 5 perc angol 27 perc kínai Sebesség (RTFx)
Parakeet V3 2,91 mp Nincs kínai támogatás 103×
SenseVoice Small 5,8 mp 13,83 mp 52–118×
Whisper Large V3 Turbo 20,92 mp 2 perc 4 mp 13–14×
Qwen3-ASR (eltávolítva) 224 mp 7,2×

Angolul a SenseVoice nagyjából fele olyan gyors, mint a Parakeet — de még így is rendkívül gyors. Kínaiul a Parakeet szóba sem jöhet, a SenseVoice pedig 14 másodpercen belül végez egy 27 perces podcasttal. Megnyomja az átírás gombot, vár egy lélegzetvételnyit, és a szöveg már ott is van.

Hasonlítsa össze ezt a Whisper 2 perc 4 másodpercével vagy a régi Qwen3 3 perc 44 másodpercével. Az architektúra többet számít, mint a paraméterek száma.

Hivatalos következtetési sebesség-összehasonlító táblázat a FunAudioLLM cikkből: SenseVoice-Small (70 ms 10 mp hangra) vs Whisper-Small (518 ms) vs Whisper-Large-V3 (1281 ms) — modellarchitektúra, paraméterek, támogatott nyelvek, RTF és késleltetés

Hivatalos következtetési benchmark a FunAudioLLM cikkből: a SenseVoice-Small 10 mp hangot 70 ms alatt dolgoz fel (A800 GPU). A Whisper-Large-V3-nak 1 281 ms kell ugyanazon a hardveren. Fontos: ez adatközponti GPU-n mért következtetési késleltetés, nem a fenti, eszközön mért értékek.

Modell Betöltési idő Letöltés mérete
Parakeet V3 0,77 mp 465 MB
SenseVoice Small 0,81 mp 827 MB
Whisper Small 1,03 mp 600 MB
Whisper Large V3 Turbo 3,18 mp ~1,6 GB

* Betöltési idő Apple M4 Pro-n, 32 GB memóriával mérve.

A SenseVoice egy másodperc alatt betöltődik. Egy 8 GB-os Macen kényelmesen fut a többi alkalmazás mellett.

Miért gyorsabb a SenseVoice: architektúra + futtatókörnyezet

A Qwen3-ASR és a SenseVoice közötti sebességkülönbség két független tényezőből ered.

1. tényező: modellarchitektúra. A Qwen3-ASR autoregresszív — a szöveget tokenről tokenre generálja, mindegyik az előzőtől függ. A SenseVoice nem-autoregresszív (NAR) kódolót használ, amely a teljes hangot párhuzamosan dolgozza fel. Ez az architekturális különbség önmagában alapvetően gyorsabbá teszi a SenseVoice-t, függetlenül attól, milyen hardveren futtatja.

2. tényező: futtatókörnyezet. A Qwen3-ASR integrációnk a sherpa-onnx-et használta, amely CPU-n futott. A SenseVoice az Apple MLX-en keresztül fut, a számításokat a GPU-ra irányítva. Futhatna a Qwen3 is MLX-en? Igen — de akkor is lassabb lenne a SenseVoice-nál, mert az autoregresszív szűk keresztmetszet az architektúrában van, nem a futtatókörnyezetben.

Qwen3-ASR (régi) SenseVoice (új)
Architektúra Autoregresszív (tokenről tokenre) Nem-autoregresszív (párhuzamos)
Futtatókörnyezet sherpa-onnx (CPU) Apple MLX (GPU)
27 perc kínai 224 másodperc 13,83 másodperc
Összesített gyorsulás kiindulási alap 16,2× gyorsabb
Kódbázis 168 MB C keretrendszer + 2 249 sor Swift 288 soros Swift Actor

* Ugyanaz a 27 perces kínai podcast, Apple M4 Pro. A 16,2× gyorsulás az architekturális (NAR vs AR) és a futtatókörnyezeti (GPU vs CPU) javulás együttes hatása.

A kód is egyszerűbb lett. Az új SenseVoice implementáció egyetlen 288 soros Swift Actor, amely közvetlenül az MLX-szel kommunikál, és egy 168 MB-os C keretrendszert vált ki. Kevesebb kód, kevesebb hiba, kisebb alkalmazás.

Öt nyelv, jól megcsinálva

A SenseVoice nem próbál mindent megcsinálni. Öt nyelvet kezel:

Nyelv SenseVoice-Small Whisper-Large-V3 Győztes
Kínai (zh-CN) 10,78% CER 12,55% CER SenseVoice (-14%)
Kantoni (yue) 7,09% CER 10,41% CER SenseVoice (-32%)
Japán (ja) 11,96% CER 10,34% CER Whisper (enyhén)
Koreai (ko) 8,28% CER 5,59% CER Whisper
Angol (en) 14,71% WER 9,39% WER Whisper (használjon Parakeet-et)

* CommonVoice benchmark, CER = karakterhiba-arány, WER = szóhiba-arány. Az alacsonyabb a jobb. Forrás: FunAudioLLM cikk (2024). A SenseVoice-Small következtetési késleltetése: 70 ms 10 mp hangra A800 GPU-n, szemben a Whisper-Large-V3 1 281 ms-ával ugyanazon a hardveren.

SenseVoice vs Whisper pontosság-összehasonlítás a CommonVoice benchmarkon kínai, kantoni, angol, japán, koreai és 25 további nyelven — WER/CER oszlopdiagram

CommonVoice benchmark: SenseVoice-Small (sárga) vs Whisper-Small (kék) vs Whisper-Large-V3 (narancssárga). Az alacsonyabb a jobb. Forrás: FunAudioLLM cikk

A számok őszinte történetet mesélnek. A SenseVoice jelentős különbséggel felülmúlja a Whispert kínai és kantoni pontosságban, míg a Whisper pontosabb japánra, koreaira és angolra. De a SenseVoice Apple Siliconon 52× valós idő fölött fut. A legtöbb valós felhasználásban a sebességkülönbség többet számít, mint néhány százalékpontnyi pontosság.

A kantoni eredmény külön kiemelést érdemel. A Whisper-Small 38,97% CER-t ér el kantonira — szinte használhatatlan. Még a Whisper-Large-V3 is csak 10,41%-ot tud. A SenseVoice 7,09%-ot hoz. A SenseVoice előtt nem volt jó módszer a kantoni helyi átírására Macen. Ha kantoniul beszél, ez a modell önnek készült.

SenseVoice koreai átírási eredménye a Mac-es Whisper Notes-ban, pontos koreai szöveggel egy videóból

Koreai átírás SenseVoice-szal: videóimportálás időbélyeges feliratokkal

Valós teszt: 27 perces kínai podcast

Átírtunk egy 27 perces epizódot a Thirteen Invitations (十三邀) kínai interjúpodcastból, SenseVoice-szal és Whisper Large V3 Turbóval is, ugyanazon az M4 Pro-n. Az ElevenLabs Scribe (felhő) szolgált referenciaként. A két eszközön futó modell nagyjából ugyanannyi hibát ejt, de eltérő típusúakat:

SenseVoice Whisper Large V3
Idő 13,83 mp 2 perc 4 mp
Hibák (5 perces minta) ~15–20 ~12–15
Legrosszabb hiba 时差→食堂 (időeltolódás→menza) 西昌→西藏 (Xichang város→Tibet, 4 000 km-es tévedés)
Hibamintázat Homofoncserék Földrajzi/ténybeli hibák

* Kézi összehasonlítás az ElevenLabs Scribe-bal (felhőreferencia, szintén nem tökéletes). A két eszközön futó modell helyesen írta a „根深蒂固” kifejezést ott, ahol a Scribe hibázott.

Összemérhető pontosság — az átirat pedig 13,83 másodperc alatt megvan, nem két perc alatt. Valós kínai átíráshoz a SenseVoice már használható átiratot ad, mire a Whisper egyáltalán betöltődne.

Mikor melyik modellt használja

A Mac-es Whisper Notes mostantól mindkét Mac-változatban négy beszédmodellel érkezik, a közvetlenül letölthető verzió (DMG) pedig 1.6.0-tól egy ötödiket is hoz: Qwen3-ASR 1.7B (Beta). Az alábbi négy mindegyike más forgatókönyvre van optimalizálva:

Amire szüksége van... Ezt a modellt használja Miért
Angol vagy európai nyelvek, maximális sebesség Parakeet V3 103× valós idejű, legalacsonyabb hibaarány. Az alapértelmezett.
Kínai, japán, koreai vagy kantoni SenseVoice Small 52–118× valós idejű. Az egyetlen kantoni támogatású modell iPhone-on és a Mac App Store-os változatban.
A 100+ nyelv bármelyike (arab, thai, orosz stb.) Whisper Large V3 Turbo A legszélesebb nyelvi támogatás. Lassabb, de univerzális.
Mind a 101 nyelv régebbi Macen Whisper Small 600 MB, a Whisper-modellek közül a legkönnyebb, és így is 101 nyelvet fed le.
A Whisper Notes Mac modellválasztója a Parakeet V3, SenseVoice Small, Whisper Small és Whisper Large V3 Turbo modellekkel, letöltési méretekkel és nyelvi támogatással

Beállítások → Átírási modell: válassza ki a nyelvének megfelelő motort

A Beállításokban található modellválasztó a saját változatában elérhető összes modellt megjeleníti a letöltési méretekkel, a nyelvek számával és a memóriaigénnyel. A SenseVoice az első használatkor töltődik le (~827 MB), és az eszközén marad.

A kompromisszumok

A SenseVoice nem univerzális modell. Íme, amit nem tud:

Csak 5 nyelv. Ha thaira, oroszra, arabra, hindire vagy bármely más, a SenseVoice CJK-fókuszán kívüli nyelvre van szüksége, maradjon a Whispernél.

Frissítés: a SenseVoice eredetileg csak Macre jelent meg az Apple MLX-en keresztül, de mára iPhone-on is elérhető — az iOS ugyanazt a modellfelhozatalt támogatja, mint a Mac: Parakeet V3, Whisper és SenseVoice.

Halk hangok furcsasága. Nagyon rövid vagy nagyon halk szakaszoknál a SenseVoice a kiválasztott nyelvtől függetlenül néha kínai kimenetre válthat vissza. A nyelv kézi beállítása (az „Automatikus” helyett) csökkenti ennek esélyét.

Nincs streamelés. A Whisper streamelési módjával ellentétben a SenseVoice a felvétel után dolgozza fel a teljes hanganyagot. Hosszú fájloknál automatikusan szegmentál a csendes pontoknál, és fokozatosan jeleníti meg az eredményeket.

Ezek architekturális korlátok, nem hibák. Egy 5 nyelvre tanított modell azt az 5 nyelvet rendkívül jól kezeli. A Whisper 100+ nyelves lefedettsége lassabb sebességgel és nyelvenként egyenetlen pontossággal jár.

Az összes helyi lehetőséget összehasonlítaná? Minden eszközön futó beszédfelismerő modell — a Whisper-változatok, a Parakeet V3, a SenseVoice és a Voxtral — egymás mellett szerepel a Whisper modell-összehasonlító oldalunkon. Most ismerkedik magával a Whisperrel? Kezdje a Whisper átírási útmutatóval — mi ez a modell, hogyan futtatható, és mennyibe kerül.

Gyakran ismételt kérdések

Mi a leggyorsabb Whisper-alternatíva kínai, japán és koreai átíráshoz?

A SenseVoice Small a Whisper Notes-ban Macen és iPhone-on is elérhető. Mac-tesztünkben, egy M4 Pro-n, egy 27 perces kínai podcastot 13,83 másodperc alatt írt át (52–118× valós idejű sebesség), miközben a Whisper Large V3 Turbónak több mint 2 percre volt szüksége ugyanahhoz a fájlhoz.

Jobb a SenseVoice a Whispernél kínaihoz?

Kínaihoz és kantonihoz igen. A CommonVoice benchmarkon a SenseVoice 10,78% CER-t ér el kínaira a Whisper-Large-V3 12,55%-ával szemben, az M4 Pro gépünkön pedig 13,83 másodperc alatt írt át egy 27 perces podcastot, a Whisper 2 perc 4 másodperce helyett. Japánra és koreaira a Whisper marad valamivel pontosabb — ha ezek a fő nyelvei, mindkét motor észszerű választás.

Átírhatok kantonit helyben, Macen?

Igen. A SenseVoice 7,09% CER-t ér el kantonira, szemben a Whisper-Large-V3 10,41%-ával és a Whisper-Small szinte használhatatlan 38,97%-ával. A SenseVoice előtt nem volt jó módszer a kantoni helyi átírására Macen.

Működik a SenseVoice iPhone-on?

Igen. A Whisper Notes iPhone-on ugyanazt a modellfelhozatalt támogatja, mint Macen — Parakeet V3, Whisper és SenseVoice —, így kínait, japánt, koreait és kantonit iPhone-ján is helyben írhat át.

Próbálja ki

A SenseVoice a Mac-es Whisper Notes v1.5.0-s (Direct Download / DMG) és újabb verzióiban, valamint az aktuális iPhone-alkalmazásban érhető el. Macen a Beállítások → Átírási modell → SenseVoice Small (~827 MB) menüpontból töltheti le. A Mac verzióhoz Apple Silicon (M1 vagy újabb) szükséges.

Ha a Parakeet V3-at használja, és főleg angolul diktál, nincs szükség váltásra. A SenseVoice arra való, amikor kínaira, japánra, koreaira vagy kantonira van szüksége — és gyorsan akarja.

Letöltés Macre

Teljes változásnapló: whispernotes.app/changelog

Kérdés vagy visszajelzés: mac@whispernotes.app