Kami mahu menjawab satu soalan: adakah model tempatan yang mentranskripsi bahasa anda lebih tepat daripada Whisper Large V3? Jadi kami menguji model-model ini pada set data FLEURS.
FLEURS ialah set data Google yang mengandungi pertuturan dibaca dalam 102 bahasa. Kami mengambil kira-kira 75 ayat daripada setiap bahasa lalu menjalankan klip yang sama, dalam susunan yang sama, melalui 5 model:
- Parakeet V3
- Whisper Large V3 Turbo
- SenseVoice Small
- Whisper Small
- Qwen3-ASR 1.7B
Hasilnya nampak begini.
Qwen3-ASR 1.7B berdepan Whisper Large V3 Turbo — larian FLEURS kami sendiri, satu MacBook Air M5, pertuturan dibaca, klip pendek.
| Qwen3-ASR 1.7B | Whisper Large V3 Turbo | |
|---|---|---|
| Bahasa yang disokong | 30 | 101 |
| Kelebihan jelas | Kantonis, Hindi, Thai, Vietnam, Perancis (5) | Finland, Hungary, Greek dan 8 bahasa lain (11) |
| Kelajuan | 8.7× masa nyata | 2.4× masa nyata |
| Memori puncak | 2.43 GiB | 1.87 GiB |
| Muat turun | kira-kira 2.5 GB | kira-kira 1.6 GB |
Di luar bahasa kuat setiap model, perbezaan ketepatannya kecil.
Whisper Large V3 lawan Qwen3-ASR: perbandingan terperinci
Kesemua 30 bahasa, disusun daripada kemenangan terbesar Qwen sehingga kekalahan terbesarnya. Kedua-dua lajur lebih rendah lebih baik.
Larian FLEURS kami sendiri, satu MacBook Air M5, pertuturan dibaca. CER untuk bahasa Mandarin, Kantonis, Jepun, Korea dan Thai, WER untuk selebihnya; warna hijau menandakan pendahuluan yang lebih lebar daripada palang ralat 95% berpasangan.
| Bahasa | Qwen3-ASR 1.7B | Whisper Large V3 Turbo |
|---|---|---|
| Kantonis | 6.00 | 37.97 |
| Hindi | 13.67 | 30.42 |
| Thai | 5.92 | 12.95 |
| Vietnam | 5.07 | 9.79 |
| Parsi | 26.98 | 30.03 |
| Arab | 14.14 | 15.75 |
| Indonesia | 4.97 | 6.50 |
| Perancis | 3.98 | 5.39 |
| Mandarin | 5.69 | 6.88 |
| Inggeris | 5.07 | 5.92 |
| Jerman | 3.51 | 4.10 |
| Jepun | 5.39 | 5.71 |
| Korea | 3.51 | 3.70 |
| Sepanyol | 3.60 | 3.76 |
| Itali | 2.98 | 3.05 |
| Rusia | 5.98 | 5.51 |
| Portugis | 5.64 | 4.91 |
| Macedonia | 17.81 | 16.64 |
| Melayu | 11.60 | 10.18 |
| Belanda | 7.65 | 5.63 |
| Turki | 8.34 | 5.53 |
| Denmark | 20.12 | 14.92 |
| Poland | 12.78 | 5.32 |
| Romania | 18.97 | 8.22 |
| Filipino | 20.44 | 9.37 |
| Sweden | 20.04 | 8.72 |
| Czech | 23.92 | 11.15 |
| Greek | 30.20 | 12.97 |
| Finland | 26.08 | 6.54 |
| Hungary | 36.35 | 13.66 |
Larian berpasangan kami sendiri pada belahan ujian FLEURS, semakan 70bb2e84, kira-kira 75 ayat setiap bahasa, satu MacBook Air M5.
5 bahasa yang dimenangi Qwen3-ASR 1.7B dengan jelas. Kadar ralat dalam peratus, Qwen berbanding Turbo: Kantonis (6.0 berbanding 38.0), Hindi (13.7 berbanding 30.4), Thai (5.9 berbanding 13.0), Vietnam (5.1 berbanding 9.8), Perancis (4.0 berbanding 5.4). Kantonis dan Thai dinilai mengikut aksara, selebihnya mengikut perkataan. Kelebihannya terletak pada bahasa yang dinilai mengikut aksara: merentasi Mandarin, Kantonis, Jepun, Korea dan Thai ia purata 5.3% berbanding 13.4% Turbo, manakala merentasi 25 bahasa lain yang dinilai mengikut perkataan ia purata 14.0% berbanding 10.2% Turbo.
11 bahasa yang dimenangi Whisper Large V3 Turbo dengan jelas. Kadar ralat dalam peratus, Qwen berbanding Turbo, semuanya dinilai mengikut perkataan: Hungary (36.4 berbanding 13.7), Greek (30.2 berbanding 13.0), Finland (26.1 berbanding 6.5), Czech (23.9 berbanding 11.2), Filipino (20.4 berbanding 9.4), Denmark (20.1 berbanding 14.9), Sweden (20.0 berbanding 8.7), Romania (19.0 berbanding 8.2), Poland (12.8 berbanding 5.3), Turki (8.3 berbanding 5.5), Belanda (7.7 berbanding 5.6).
14 bahasa yang rapat atau seri. Inggeris (5.1 berbanding 5.9), Jerman (3.5 berbanding 4.1), Sepanyol (3.6 berbanding 3.8), Itali (3.0 berbanding 3.1), Rusia (6.0 berbanding 5.5), Portugis (5.6 berbanding 4.9); Mandarin (5.7 berbanding 6.9), Jepun (5.4 berbanding 5.7) dan Korea (3.5 berbanding 3.7) dinilai mengikut aksara. Kemudian Arab, Indonesia, Parsi, Melayu dan Macedonia. Setiap jurang di sini kecil dan berada dalam jalur 95%, jadi larian ini tidak dapat memisahkan 2 model itu.
Kantonis ialah satu-satunya baris yang benar-benar mengubah keputusan: 6.00% berbanding 37.97%, dan SenseVoice Small — yang pernah kami terbitkan sebagai jawapan untuk Kantonis — mencatat 36.71% CER pada klip yang sama. Pada set pertuturan dibaca ini kedua-dua angka itu masih belum melepasi paras, jadi cadangan lama itu kini datang bersama syarat tersebut.
Sepantas mana Qwen3-ASR 1.7B?
Kesemua 5 enjin diukur dalam rangka ujian yang sama pada satu mesin (MacBook Air M5), jadi sekurang-kurangnya ia boleh dibandingkan sesama sendiri.
Median faktor masa nyata merentasi bahasa setiap enjin dalam larian FLEURS yang sama, satu MacBook Air M5, pertuturan dibaca.
| Enjin | Bahasa | Median kelajuan dalam larian ini (klip pendek) |
|---|---|---|
| SenseVoice Small | 6 pilihan | 161.0× |
| Parakeet TDT 0.6B v3 | 25 | 82.9× |
| Qwen3-ASR 1.7B | 30 tersenarai | 8.7× |
| Whisper Small | 101 | 6.4× |
| Whisper Large V3 Turbo | 101 | 2.4× |
Ini angka rangka ujian untuk klip pendek dan ia lebih rendah daripada apa yang enjin sama capai pada rakaman panjang. Gunakan lajur ini untuk membandingkan enjin sesama sendiri dalam larian ini sahaja, bukan untuk perkara lain.
Parakeet V3 dan SenseVoice Small kira-kira sepuluh kali ganda lebih pantas daripada Qwen3-ASR dalam rangka ujian yang sama. Pada fail panjang dan bukan klip pendek, Parakeet pernah berjalan pada 103× masa nyata di M4 Pro dan SenseVoice pada 52× atau lebih — ukuran berbeza pada audio berbeza, tetapi menunjuk arah yang sama.
Qwen3-ASR berada di tengah. Ia bukan enjin paling perlahan dalam larian klip pendek ini — Whisper Large V3 Turbo yang paling perlahan — tetapi ia lebih banyak berubah mengikut bahasa berbanding yang lain, daripada 2.7× pada bahasa Greek hingga 12.4× pada bahasa Jepun.
Berapa banyak memori dan ruang cakera yang diambil Qwen3-ASR?
Memori puncak ialah jejak proses tertinggi yang dicerap merentasi item dalam larian FLEURS yang sama, satu MacBook Air M5, pertuturan dibaca, klip pendek.
| Enjin | Muat turun | Memori puncak dalam larian ini |
|---|---|---|
| Parakeet TDT 0.6B v3 | 465 MB | 0.09 GiB |
| Whisper Small | 600 MB | 0.87 GiB |
| SenseVoice Small | 827 MB | 0.95 GiB |
| Whisper Large V3 Turbo | kira-kira 1.6 GB | 1.87 GiB |
| Qwen3-ASR 1.7B | kira-kira 2.5 GB | 2.43 GiB |
Pada kedua-dua paksi, Qwen3-ASR paling berat antara 5 model itu: kira-kira 2.5 GB untuk dimuat turun dan 2.43 GiB memori proses puncak dalam larian ini, berbanding kira-kira 1.6 GB dan 1.87 GiB untuk Whisper Large V3 Turbo.
Pada mesin 8 GB ada laluan yang lebih ringan. Parakeet V3 meliputi 25 bahasa dalam 465 MB dan 0.09 GiB, manakala Whisper Small meliputi 101 bahasa dalam 600 MB dan 0.87 GiB.
Cara kami mengukur: FLEURS, 30 bahasa, satu Mac
Qwen3-ASR 1.7B berjalan sebagai binaan MLX 8-bit, Whisper Large V3 Turbo sebagai binaan ggml whisper.cpp di Metal. Datanya ialah belahan ujian Google FLEURS pada semakan 70bb2e84 (CC-BY-4.0): 83 daripada 102 bahasanya, kira-kira 75 ayat dan 15 minit setiap satu, klip yang sama dalam susunan yang sama untuk setiap model; perbandingan berpasangannya ialah 30 bahasa milik Qwen. WER untuk bahasa yang dipisahkan ruang, CER untuk bahasa Mandarin, Kantonis, Jepun, Korea dan Thai, tidak pernah dicantumkan menjadi satu angka; palang ralat ialah bootstrap peringkat item dengan 10,000 persampelan semula. Satu MacBook Air M5, 32 GB, macOS 26.5, tiada keluaran kosong atau kegagalan daripada mana-mana model.
FLEURS ialah pertuturan dibaca, bukan mesyuarat dan bukan dikte. Kedudukan daripada pertuturan dibaca pernah gagal bertahan berdepan audio sebenar dua kali dalam ujian kami sendiri, jadi kami tidak mengunjurkannya kepada rakaman panjang: jadual ini memberitahu sama ada sesebuah model munasabah untuk bahasa anda, bukan ketepatan yang akan anda perolehi. Penilaian Qwen3-ASR 1.7B pada mesyuarat sebenar akan menjadi tulisan berasingan.
Patutkah anda guna Qwen3-ASR menggantikan Whisper Large V3?
Bahasa demi bahasa, begini kami akan menjawabnya di dalam Whisper Notes untuk Mac.
- Kalau anda mentranskripsi bahasa Kantonis, Hindi, Thai, Vietnam atau Perancis: pilih Qwen3-ASR 1.7B.
- Kalau anda mentranskripsi bahasa Mandarin, Jepun, Korea, Inggeris, Jerman, Sepanyol atau Itali: ia mendahului sehelai rambut sahaja, dan sehelai rambut itulah yang kami dakwa. Mana-mana model pun memadai, begitu juga untuk bahasa Parsi, Arab, Indonesia, Rusia, Portugis, Macedonia dan Melayu.
- Kalau anda mentranskripsi bahasa Finland, Hungary, Greek, Czech, Sweden, Denmark, Poland, Romania, Filipino, Turki atau Belanda: kekal dengan Whisper Large V3 Turbo. Ia menang jelas dalam kesemua 11 bahasa itu.
- Kalau kelajuan atau ruang cakera yang anda pentingkan: bukan enjin ini. Parakeet V3 dan SenseVoice Small kira-kira sepuluh kali ganda lebih pantas, dengan muat turun yang jauh lebih kecil, dan Whisper Small meliputi 101 bahasa dalam 600 MB pada 6.4×.
- Kalau anda menggunakan iPhone atau binaan Mac App Store: enjin ini belum sampai ke sana. SenseVoice ialah pilihan Kantonis pada saluran tersebut.
Ini ialah port pada peranti bagi Qwen3-ASR terbuka milik Alibaba dalam Whisper Notes untuk Mac: pemberat terbuka yang ditukar kepada Apple MLX pada 8-bit, berjalan pada GPU Mac anda sendiri, tanpa audio pergi ke pelayan Alibaba. Ia bukan model yang sama dengan 0.6B yang digantikan SenseVoice dalam Muat Turun Terus (DMG) 1.5.0.
Cara menggunakannya (Mac Muat Turun Terus, DMG 1.6.0 ke atas): Tetapan, kemudian Model Transkripsi, kemudian Qwen3-ASR 1.7B. Model dimuat turun dalam aplikasi pada penggunaan pertama dan bersaiz kira-kira 2.5 GB. Ia memerlukan macOS 15 ke atas pada Apple silicon, dengan memori 16 GB disyorkan; selebihnya aplikasi berjalan pada macOS 14. Senarai bahasa mengikut enjin ada pada halaman sokongan bahasa kami. CLI dan pelayan MCP tempatan menerima "qwen", "qwen3" dan "qwen3-asr".
Kalau anda lebih suka tidak bertukar, tiada apa yang perlu berubah: Parakeet V3 masih menjadi lalai.
Soalan Lazim
Adakah Qwen3-ASR lebih tepat daripada Whisper Large V3 Turbo?
Ia bergantung pada bahasa, dan pembahagiannya hampir sama rata. Dalam larian FLEURS kami sendiri di dalam Whisper Notes untuk Mac, merentasi 30 bahasa yang diliputi kedua-dua model, Qwen3-ASR 1.7B mendahului dalam 15 bahasa dan Whisper Large V3 Turbo dalam 15 bahasa. Qwen mendahului dengan jelas pada Kantonis (6.00% berbanding 37.97% CER), Hindi (13.67% berbanding 30.42% WER), Thai, Vietnam dan Perancis. Turbo mendahului dengan jelas pada Finland (6.54% berbanding 26.08% WER), Hungary, Greek, Czech, Sweden, Denmark, Poland, Romania, Filipino, Turki dan Belanda. 14 daripada 30 jurang itu berada dalam palang ralat dan patut dibaca sebagai seri. Pilih Qwen3-ASR kalau bahasa anda ada dalam lajur kemenangannya dan anda menggunakan binaan Mac Muat Turun Terus (DMG) Whisper Notes; pilih Whisper Large V3 Turbo untuk selainnya, dan untuk setiap bahasa di luar 30 milik Qwen, kerana Whisper menjangkau kesemua 101 pilihan.
Bolehkah saya guna Qwen3-ASR pada iPhone atau daripada Mac App Store?
Hari ini ia berada dalam binaan Mac Muat Turun Terus (DMG) Whisper Notes bermula versi 1.6.0. Versi Mac App Store dirancang menerima enjin yang lebih baharu dalam keluaran kemudian, dan kami belum ada tarikhnya. Sementara itu aplikasi iPhone dan binaan Mac App Store mempunyai 3 keluarga enjin — Whisper, Parakeet V3 dan SenseVoice — dan setiap bahasa yang dikenali Qwen turut diliputi Whisper di situ. Dikira sebagai model, binaan Mac App Store menawarkan 4 hari ini dan binaan Muat Turun Terus 5, kerana Whisper hadir sebagai Small dan juga Large V3 Turbo. Kalau anda perlukan Kantonis pada iPhone, SenseVoice ialah enjin yang digunakan di situ.
Qwen3-ASR atau SenseVoice untuk bahasa Mandarin, Jepun dan Korea?
Kedua-duanya rapat dari segi ketepatan dan sangat jauh dari segi kelajuan. Dalam larian FLEURS kami, Qwen3-ASR mencatat 5.69% CER untuk Mandarin, 5.39% untuk Jepun dan 3.51% untuk Korea; SenseVoice Small mencatat 7.06%, 6.85% dan 7.82% pada klip yang sama. SenseVoice berjalan pada median 161× masa nyata dalam larian itu berbanding 8.7× milik Qwen, muat turunnya 827 MB berbanding kira-kira 2.5 GB, dan ia tersedia pada iPhone serta kedua-dua binaan Mac. Pilih SenseVoice melainkan anda mentranskripsi bahasa Kantonis, di mana Qwen3-ASR mencatat 6.00% CER berbanding 36.71% SenseVoice dan jurang itu cukup besar untuk berbaloi menunggu.
Apakah keperluan sistem untuk Qwen3-ASR 1.7B?
Sebuah Mac Apple silicon pada macOS 15 ke atas, dengan memori 16 GB disyorkan, serta kira-kira 2.5 GB ruang cakera untuk modelnya. Itu lebih tinggi daripada selebihnya Whisper Notes untuk Mac, yang berjalan pada macOS 14 ke atas. Dalam larian penanda aras kami, model itu memuncak pada 2.43 GiB memori proses, tertinggi antara 5 enjin tersebut. Pada Mac 8 GB, Whisper Small meliputi senarai 101 bahasa yang sama dalam 600 MB dan Parakeet V3 meliputi 25 bahasa Eropah dalam 465 MB.
Adakah audio meninggalkan Mac saya apabila saya guna Qwen3-ASR?
Tidak. Alibaba turut menawarkan Qwen3-ASR sebagai perkhidmatan awan melalui API DashScope Real-time dan FileTrans, di mana audio dimuat naik ke pelayan mereka. Whisper Notes tidak menggunakan API tersebut. Ia menjalankan pemberat terbuka secara tempatan sebagai model MLX 8-bit pada GPU Mac anda, tanpa akaun dan tanpa API key, dan transkripsi berfungsi walaupun rangkaian dimatikan. Itu benar bagi setiap keluarga enjin dalam aplikasi ini, pada semua saluran.
Kenapa angka-angka ini tidak sepadan dengan ketepatan yang saya dapat pada rakaman saya?
Kerana FLEURS ialah pertuturan dibaca, pendek dan bersih, manakala rakaman anda tidak. Larian kami ialah penentukuran pada set data awam: kira-kira 75 ayat setiap bahasa, satu MacBook Air M5, klip yang sama untuk setiap model. Ia berguna untuk bertanya sama ada sesebuah model munasabah untuk sesuatu bahasa, dan ia bukan ramalan ketepatan anda pada mesyuarat, pada audio bising, pada pertuturan berloghat atau pada fail 2 jam.
Cuba Sekarang
Qwen3-ASR 1.7B ada dalam Whisper Notes untuk Mac 1.6.0 ke atas, Muat Turun Terus (DMG) sahaja. Tetapan, kemudian Model Transkripsi. Percubaan percuma merangkumi 10,000 perkataan, cukup untuk anda menjalankan bahasa anda sendiri melaluinya lalu membantah jadual di atas.
Kalau anda jumpa bahasa yang angka kami tidak sepadan dengan pengalaman anda, emel ke mac@whispernotes.app. Nota keluaran penuh: whispernotes.app/changelog.
Sumber untuk semua di atas: larian FLEURS kami pada belahan ujian Google FLEURS semakan 70bb2e84, kad model Qwen3-ASR 1.7B, dan jadual bahasa mengikut enjin pada halaman sokongan bahasa kami, yang dijana daripada kod sumber aplikasi itu sendiri.