TL;DR — Három eszközön futó modell összehasonlítása
| Parakeet V3 | SenseVoice Small | Whisper Large V3 Turbo | |
|---|---|---|---|
| 5 perc angol | 2,91 mp (103×) | 5,8 mp (52×) | 20,92 mp (14,3×) |
| 27 perc kínai | 10,10 mp (161×) | 13,83 mp (118×) | 2 perc 4 mp (13,1×) |
| Nyelvek | 25 (európai) | 5 (zh, en, ja, ko, yue) | 100+ |
| Letöltés | 465 MB | 827 MB | ~1,6 GB |
| Memória | ~800 MB | ~700 MB | ~1,6 GB |
| Legjobb ehhez | Angol & európai nyelvek | Kínai, japán, koreai, kantoni | Minden más (100+ nyelv) |
* Sebességmérések Apple M4 Pro-n, 32 GB memóriával. 5 perces angol podcast és 27 perces kínai podcast. Valós idejű szorzó = hanganyag hossza ÷ feldolgozási idő (magasabb = gyorsabb). A mérések a Mac verzióból származnak; a SenseVoice iPhone-on is elérhető.
Az 1.5.0-s verziótól (Direct Download / DMG) kezdve a Mac-es Whisper Notes a SenseVoice Small modellt szállítja dedikált motorként a kínai, japán, koreai és kantoni átíráshoz. A Qwen3-ASR helyébe lép, és az Apple GPU-ján fut az MLX-en keresztül a CPU helyett — egy 27 perces kínai podcastot 13,83 másodperc alatt dolgoz fel 3 perc 44 másodperc helyett.
Miért cseréltük le a Qwen3-ASR-t
A Qwen3-ASR szilárd modell volt. 30 nyelvet és 22 kínai dialektust támogatott, kínai pontossága pedig közel járt a csúcsszínvonalhoz. Volt azonban egy problémája, amely a hanganyag hosszával csak súlyosbodott: a sebesség.
A Qwen3 autoregresszív architektúrát használt — ugyanazt a megközelítést, mint a Whisper: a hangot keretről keretre dolgozza fel, és sosem ugrik előre. Egy 27 perces kínai podcastnál 224 másodpercet vett igénybe. Használható, de nem az az azonnali eredményélmény, amit a Parakeet V3 nyújt angolra.
A mélyebb probléma az infrastruktúránk volt. A Qwen3 integrációnk a sherpa-onnx-et használta, egy C könyvtárat 2 249 soros Swift wrapperrel, amely mindent a CPU magokon keresztül futtatott. A GPU tétlenül állt, miközben a Mac CPU-ja végezte az összes munkát.
A SenseVoice mindkét problémát megoldotta. Nem-autoregresszív architektúra a sebességért. Apple MLX a GPU-gyorsításért. Az eredmény: 16,2-szeres sebességnövekedés ugyanazon a hardveren, miközben a kódbázis 2 249 sorról 288-ra csökkent.
A benchmark
Mindhárom modell ugyanazon az Apple M4 Pro-n futott, ugyanazokkal a hangfájlokkal, ugyanazokkal a feltételekkel. Nincs felhő. Nincs internet. Csak szilícium.
| Modell | 5 perc angol | 27 perc kínai | Sebesség (RTFx) |
|---|---|---|---|
| Parakeet V3 | 2,91 mp | 10,10 mp | 103–161× |
| SenseVoice Small | 5,8 mp | 13,83 mp | 52–118× |
| Whisper Large V3 Turbo | 20,92 mp | 2 perc 4 mp | 13–14× |
| Qwen3-ASR (eltávolítva) | — | 224 mp | 7,2× |
A SenseVoice nagyjából fele olyan gyors, mint a Parakeet V3 — de még így is rendkívül gyors. Egy 27 perces podcast 14 másodpercen belül elkészül. Megnyomja az átírás gombot, vár egy lélegzetvételnyit, és a szöveg már ott is van.
Hasonlítsa össze ezt a Whisper 2 perc 4 másodpercével vagy a régi Qwen3 3 perc 44 másodpercével. Az architektúra többet számít, mint a paraméterek száma.
Hivatalos következtetési benchmark a FunAudioLLM cikkből: a SenseVoice-Small 10 mp hangot 70 ms alatt dolgoz fel (A800 GPU). A Whisper-Large-V3-nak 1 281 ms kell. Ez 18-szoros különbség a nyers következtetési késleltetésben.
| Modell | Betöltési idő | Memória | Letöltés mérete |
|---|---|---|---|
| Parakeet V3 | 0,77 mp | ~800 MB | 465 MB |
| SenseVoice Small | 0,81 mp | ~700 MB | 827 MB |
| Whisper Small | 1,03 mp | ~487 MB | 600 MB |
| Whisper Large V3 Turbo | 3,18 mp | ~1,6 GB | ~1,6 GB |
* Betöltési idő és memória Apple M4 Pro-n, 32 GB memóriával mérve.
A SenseVoice egy másodperc alatt betöltődik, és kevesebb memóriát használ, mint a Parakeet. Egy 8 GB-os Macen kényelmesen fut a többi alkalmazás mellett.
Miért gyorsabb a SenseVoice: architektúra + futtatókörnyezet
A Qwen3-ASR és a SenseVoice közötti sebességkülönbség két független tényezőből ered.
1. tényező: modellarchitektúra. A Qwen3-ASR autoregresszív — a szöveget tokenről tokenre generálja, mindegyik az előzőtől függ. A SenseVoice nem-autoregresszív (NAR) kódolót használ, amely a teljes hangot párhuzamosan dolgozza fel. Ez az architekturális különbség önmagában alapvetően gyorsabbá teszi a SenseVoice-t, függetlenül attól, milyen hardveren futtatja.
2. tényező: futtatókörnyezet. A Qwen3-ASR integrációnk a sherpa-onnx-et használta, amely CPU-n futott. A SenseVoice az Apple MLX-en keresztül fut, a számításokat a GPU-ra irányítva. Futhatna a Qwen3 is MLX-en? Igen — de akkor is lassabb lenne a SenseVoice-nál, mert az autoregresszív szűk keresztmetszet az architektúrában van, nem a futtatókörnyezetben.
| Qwen3-ASR (régi) | SenseVoice (új) | |
|---|---|---|
| Architektúra | Autoregresszív (tokenről tokenre) | Nem-autoregresszív (párhuzamos) |
| Futtatókörnyezet | sherpa-onnx (CPU) | Apple MLX (GPU) |
| 27 perc kínai | 224 másodperc | 13,83 másodperc |
| Összesített gyorsulás | kiindulási alap | 16,2× gyorsabb |
| Kódbázis | 168 MB C keretrendszer + 2 249 sor Swift | 288 soros Swift Actor |
* Ugyanaz a 27 perces kínai podcast, Apple M4 Pro. A 16,2× gyorsulás az architekturális (NAR vs AR) és a futtatókörnyezeti (GPU vs CPU) javulás együttes hatása.
A kód is egyszerűbb lett. Az új SenseVoice implementáció egyetlen 288 soros Swift Actor, amely közvetlenül az MLX-szel kommunikál, és egy 168 MB-os C keretrendszert vált ki. Kevesebb kód, kevesebb hiba, kisebb alkalmazás.
Öt nyelv, jól megcsinálva
A SenseVoice nem próbál mindent megcsinálni. Öt nyelvet kezel:
| Nyelv | SenseVoice-Small | Whisper-Large-V3 | Győztes |
|---|---|---|---|
| Kínai (zh-CN) | 10,78% CER | 12,55% CER | SenseVoice (-14%) |
| Kantoni (yue) | 7,09% CER | 10,41% CER | SenseVoice (-32%) |
| Japán (ja) | 11,96% CER | 10,34% CER | Whisper (enyhén) |
| Koreai (ko) | 8,28% CER | 5,59% CER | Whisper |
| Angol (en) | 14,71% WER | 9,39% WER | Whisper (használjon Parakeet-et) |
* CommonVoice benchmark, CER = karakterhiba-arány, WER = szóhiba-arány. Az alacsonyabb a jobb. Forrás: FunAudioLLM cikk (2024). A SenseVoice-Small következtetési késleltetése: 70 ms 10 mp hangra (A800 GPU), több mint 15-ször gyorsabb a Whisper-Large-V3-nál.
CommonVoice benchmark: SenseVoice-Small (sárga) vs Whisper-Small (kék) vs Whisper-Large-V3 (narancssárga). Az alacsonyabb a jobb. Forrás: FunAudioLLM cikk
A számok őszinte történetet mesélnek. A SenseVoice jelentős különbséggel felülmúlja a Whispert kínai és kantoni pontosságban, míg a Whisper pontosabb japánra, koreaira és angolra. De a SenseVoice több mint 15-ször gyorsabb a Whisper-Large-V3-nál. A legtöbb valós felhasználásban a sebességkülönbség többet számít, mint néhány százalékpontnyi pontosság.
A kantoni eredmény külön kiemelést érdemel. A Whisper-Small 38,97% CER-t ér el kantonira — szinte használhatatlan. Még a Whisper-Large-V3 is csak 10,41%-ot tud. A SenseVoice 7,09%-ot hoz. A SenseVoice előtt nem volt jó módszer a kantoni helyi átírására Macen. Ha kantoniul beszél, ez a modell önnek készült.
Koreai átírás SenseVoice-szal: videóimportálás időbélyeges feliratokkal
Valós teszt: 27 perces kínai podcast
Átírtunk egy 27 perces epizódot a Thirteen Invitations (十三邀) kínai interjúpodcastból, SenseVoice-szal és Whisper Large V3 Turbóval is, ugyanazon az M4 Pro-n. Az ElevenLabs Scribe (felhő) szolgált referenciaként. A két eszközön futó modell nagyjából ugyanannyi hibát ejt, de eltérő típusúakat:
| SenseVoice | Whisper Large V3 | |
|---|---|---|
| Idő | 13,83 mp | 2 perc 4 mp |
| Hibák (5 perces minta) | ~15–20 | ~12–15 |
| Legrosszabb hiba | 时差→食堂 (időeltolódás→menza) | 西昌→西藏 (Xichang város→Tibet, 4 000 km-es tévedés) |
| Hibamintázat | Homofoncserék | Földrajzi/ténybeli hibák |
* Kézi összehasonlítás az ElevenLabs Scribe-bal (felhőreferencia, szintén nem tökéletes). A két eszközön futó modell helyesen írta a „根深蒂固” kifejezést ott, ahol a Scribe hibázott.
Összemérhető pontosság. 9× gyorsabb. Valós kínai átíráshoz a SenseVoice már használható átiratot ad, mire a Whisper egyáltalán betöltődne.
Mikor melyik modellt használja
A Mac-es Whisper Notes mostantól négy beszédmodellel érkezik. Mindegyik más forgatókönyvre van optimalizálva:
| Amire szüksége van... | Ezt a modellt használja | Miért |
|---|---|---|
| Angol vagy európai nyelvek, maximális sebesség | Parakeet V3 | 103× valós idejű, legalacsonyabb hibaarány. Az alapértelmezett. |
| Kínai, japán, koreai vagy kantoni | SenseVoice Small | 52–118× valós idejű. Az egyetlen modell kantoni támogatással. |
| A 100+ nyelv bármelyike (arab, thai, orosz stb.) | Whisper Large V3 Turbo | A legszélesebb nyelvi támogatás. Lassabb, de univerzális. |
| Alacsonyabb memóriahasználat (régebbi Macek) | Whisper Small | 487 MB memória. Jó választás 8 GB-os Macekre, ahol más alkalmazások is futnak. |
Beállítások → Átírási modell: válassza ki a nyelvének megfelelő motort
A Beállításokban található modellválasztó mind a négy opciót megjeleníti a letöltési méretekkel, a nyelvek számával és a memóriaigénnyel. A SenseVoice az első használatkor töltődik le (~827 MB), és az eszközén marad.
A kompromisszumok
A SenseVoice nem univerzális modell. Íme, amit nem tud:
• Csak 5 nyelv. Ha thaira, oroszra, arabra, hindire vagy bármely más, a SenseVoice CJK-fókuszán kívüli nyelvre van szüksége, maradjon a Whispernél.
• Frissítés: a SenseVoice eredetileg csak Macre jelent meg az Apple MLX-en keresztül, de mára iPhone-on is elérhető — az iOS ugyanazt a modellfelhozatalt támogatja, mint a Mac: Parakeet V3, Whisper és SenseVoice.
• Halk hangok furcsasága. Nagyon rövid vagy nagyon halk szakaszoknál a SenseVoice a kiválasztott nyelvtől függetlenül néha kínai kimenetre válthat vissza. A nyelv kézi beállítása (az „Automatikus” helyett) csökkenti ennek esélyét.
• Nincs streamelés. A Whisper streamelési módjával ellentétben a SenseVoice a felvétel után dolgozza fel a teljes hanganyagot. Hosszú fájloknál automatikusan szegmentál a csendes pontoknál, és fokozatosan jeleníti meg az eredményeket.
Ezek architekturális korlátok, nem hibák. Egy 5 nyelvre tanított modell azt az 5 nyelvet rendkívül jól kezeli. A Whisper 100+ nyelves lefedettsége lassabb sebességgel és nyelvenként egyenetlen pontossággal jár.
Az összes helyi lehetőséget összehasonlítaná? Minden eszközön futó beszédfelismerő modell — a Whisper-változatok, a Parakeet V3, a SenseVoice és a Voxtral — egymás mellett szerepel a Whisper modell-összehasonlító oldalunkon. Most ismerkedik magával a Whisperrel? Kezdje a Whisper átírási útmutatóval — mi ez a modell, hogyan futtatható, és mennyibe kerül.
Gyakran ismételt kérdések
Mi a leggyorsabb Whisper-alternatíva kínai, japán és koreai átíráshoz?
A SenseVoice Small a Whisper Notes-ban Macen és iPhone-on is elérhető. Mac-tesztünkben, egy M4 Pro-n, egy 27 perces kínai podcastot 13,83 másodperc alatt írt át (52–118× valós idejű sebesség), miközben a Whisper Large V3 Turbónak több mint 2 percre volt szüksége ugyanahhoz a fájlhoz.
Jobb a SenseVoice a Whispernél kínaihoz?
Kínaihoz és kantonihoz igen. A CommonVoice benchmarkon a SenseVoice 10,78% CER-t ér el kínaira a Whisper-Large-V3 12,55%-ával szemben, és több mint 15-ször gyorsabb. Japánra és koreaira a Whisper marad valamivel pontosabb.
Átírhatok kantonit helyben, Macen?
Igen. A SenseVoice 7,09% CER-t ér el kantonira, szemben a Whisper-Large-V3 10,41%-ával és a Whisper-Small szinte használhatatlan 38,97%-ával. A SenseVoice előtt nem volt jó módszer a kantoni helyi átírására Macen.
Működik a SenseVoice iPhone-on?
Igen. A Whisper Notes iPhone-on ugyanazt a modellfelhozatalt támogatja, mint Macen — Parakeet V3, Whisper és SenseVoice —, így kínait, japánt, koreait és kantonit iPhone-ján is helyben írhat át.
Próbálja ki
A SenseVoice a Mac-es Whisper Notes v1.5.0-s (Direct Download / DMG) és újabb verzióiban, valamint az aktuális iPhone-alkalmazásban érhető el. Macen a Beállítások → Átírási modell → SenseVoice Small (~827 MB) menüpontból töltheti le. A Mac verzióhoz Apple Silicon (M1 vagy újabb) szükséges.
Ha a Parakeet V3-at használja, és főleg angolul diktál, nincs szükség váltásra. A SenseVoice arra való, amikor kínaira, japánra, koreaira vagy kantonira van szüksége — és gyorsan akarja.
Teljes változásnapló: whispernotes.app/changelog
Kérdés vagy visszajelzés: mac@whispernotes.app