Kami ingin menjawab satu pertanyaan: adakah model lokal yang mentranskripsi bahasa Anda lebih akurat daripada Whisper Large V3? Jadi kami menguji model-model ini pada dataset FLEURS.
FLEURS adalah dataset Google berisi ucapan yang dibacakan dalam 102 bahasa. Kami mengambil sekitar 75 kalimat dari tiap bahasa lalu menjalankan klip yang sama, dalam urutan yang sama, lewat 5 model:
- Parakeet V3
- Whisper Large V3 Turbo
- SenseVoice Small
- Whisper Small
- Qwen3-ASR 1.7B
Hasilnya seperti ini.
Qwen3-ASR 1.7B melawan Whisper Large V3 Turbo — uji FLEURS kami sendiri, satu MacBook Air M5, ucapan yang dibacakan, klip pendek.
| Qwen3-ASR 1.7B | Whisper Large V3 Turbo | |
|---|---|---|
| Bahasa yang didukung | 30 | 101 |
| Keunggulan jelas | Kanton, Hindi, Thai, Vietnam, Prancis (5) | Finlandia, Hungaria, Yunani dan 8 bahasa lainnya (11) |
| Kecepatan | 8.7× realtime | 2.4× realtime |
| Memori puncak | 2.43 GiB | 1.87 GiB |
| Unduhan | sekitar 2.5 GB | sekitar 1.6 GB |
Di luar bahasa-bahasa kuat masing-masing model, selisih akurasinya kecil.
Whisper Large V3 vs Qwen3-ASR: perbandingan rincinya
Semua 30 bahasa, diurutkan dari kemenangan terbesar Qwen sampai kekalahan terbesarnya. Kedua kolom sama-sama makin rendah makin bagus.
Uji FLEURS kami sendiri, satu MacBook Air M5, ucapan yang dibacakan. CER untuk bahasa Mandarin, Kanton, Jepang, Korea dan Thai, WER untuk sisanya; warna hijau menandai keunggulan yang lebih lebar daripada rentang galat 95% berpasangan.
| Bahasa | Qwen3-ASR 1.7B | Whisper Large V3 Turbo |
|---|---|---|
| Kanton | 6.00 | 37.97 |
| Hindi | 13.67 | 30.42 |
| Thai | 5.92 | 12.95 |
| Vietnam | 5.07 | 9.79 |
| Persia | 26.98 | 30.03 |
| Arab | 14.14 | 15.75 |
| Indonesia | 4.97 | 6.50 |
| Prancis | 3.98 | 5.39 |
| Mandarin | 5.69 | 6.88 |
| Inggris | 5.07 | 5.92 |
| Jerman | 3.51 | 4.10 |
| Jepang | 5.39 | 5.71 |
| Korea | 3.51 | 3.70 |
| Spanyol | 3.60 | 3.76 |
| Italia | 2.98 | 3.05 |
| Rusia | 5.98 | 5.51 |
| Portugis | 5.64 | 4.91 |
| Makedonia | 17.81 | 16.64 |
| Melayu | 11.60 | 10.18 |
| Belanda | 7.65 | 5.63 |
| Turki | 8.34 | 5.53 |
| Denmark | 20.12 | 14.92 |
| Polandia | 12.78 | 5.32 |
| Rumania | 18.97 | 8.22 |
| Filipino | 20.44 | 9.37 |
| Swedia | 20.04 | 8.72 |
| Ceko | 23.92 | 11.15 |
| Yunani | 30.20 | 12.97 |
| Finlandia | 26.08 | 6.54 |
| Hungaria | 36.35 | 13.66 |
Uji berpasangan kami sendiri pada split tes FLEURS, revisi 70bb2e84, sekitar 75 kalimat per bahasa, satu MacBook Air M5.
5 bahasa yang dimenangkan Qwen3-ASR 1.7B dengan jelas. Tingkat kesalahan dalam persen, Qwen berbanding Turbo: Kanton (6,0 vs 38,0), Hindi (13,7 vs 30,4), Thai (5,9 vs 13,0), Vietnam (5,1 vs 9,8), Prancis (4,0 vs 5,4). Kanton dan Thai dinilai per karakter, sisanya per kata. Keunggulannya ada pada bahasa yang dinilai per karakter: di Mandarin, Kanton, Jepang, Korea dan Thai ia rata-rata 5,3% berbanding 13,4% milik Turbo, sedangkan di 25 bahasa lain yang dinilai per kata ia rata-rata 14,0% berbanding 10,2% milik Turbo.
11 bahasa yang dimenangkan Whisper Large V3 Turbo dengan jelas. Tingkat kesalahan dalam persen, Qwen berbanding Turbo, semuanya dinilai per kata: Hungaria (36,4 vs 13,7), Yunani (30,2 vs 13,0), Finlandia (26,1 vs 6,5), Ceko (23,9 vs 11,2), Filipino (20,4 vs 9,4), Denmark (20,1 vs 14,9), Swedia (20,0 vs 8,7), Rumania (19,0 vs 8,2), Polandia (12,8 vs 5,3), Turki (8,3 vs 5,5), Belanda (7,7 vs 5,6).
14 bahasa yang berdekatan atau setara. Inggris (5,1 vs 5,9), Jerman (3,5 vs 4,1), Spanyol (3,6 vs 3,8), Italia (3,0 vs 3,1), Rusia (6,0 vs 5,5), Portugis (5,6 vs 4,9); Mandarin (5,7 vs 6,9), Jepang (5,4 vs 5,7) dan Korea (3,5 vs 3,7) dinilai per karakter. Lalu ada Arab, Indonesia, Persia, Melayu dan Makedonia. Semua selisih di sini kecil dan berada di dalam rentang 95%, jadi uji ini tidak bisa memisahkan 2 model itu.
Kanton adalah satu-satunya baris yang mengubah sebuah keputusan: 6,00% berbanding 37,97%, dan SenseVoice Small — yang pernah kami terbitkan sebagai jawaban untuk Kanton — mencetak 36,71% CER pada klip yang sama. Pada set ucapan yang dibacakan ini keduanya belum melewati ambang, jadi rekomendasi lama itu kini datang dengan catatan tersebut.
Seberapa cepat Qwen3-ASR 1.7B?
Semua 5 engine diukur dalam harness yang sama di satu mesin (MacBook Air M5), jadi setidaknya semuanya sebanding satu sama lain.
Median faktor realtime di seluruh bahasa tiap engine dalam uji FLEURS yang sama, satu MacBook Air M5, ucapan yang dibacakan.
| Engine | Bahasa | Median kecepatan dalam uji ini (klip pendek) |
|---|---|---|
| SenseVoice Small | 6 pilihan | 161.0× |
| Parakeet TDT 0.6B v3 | 25 | 82.9× |
| Qwen3-ASR 1.7B | 30 tercantum | 8.7× |
| Whisper Small | 101 | 6.4× |
| Whisper Large V3 Turbo | 101 | 2.4× |
Ini angka harness untuk klip pendek dan lebih rendah daripada yang dicapai engine yang sama pada rekaman panjang. Pakai kolom ini hanya untuk membandingkan engine satu sama lain di dalam uji ini, bukan untuk hal lain.
Parakeet V3 dan SenseVoice Small kira-kira satu orde besaran lebih cepat daripada Qwen3-ASR dalam harness yang sama. Pada file panjang alih-alih klip pendek, Parakeet pernah berjalan pada 103× realtime di M4 Pro dan SenseVoice pada 52× atau lebih — pengukuran berbeda pada audio berbeda, tapi menunjuk ke arah yang sama.
Qwen3-ASR ada di tengah. Ia bukan engine paling lambat dalam uji klip pendek ini — Whisper Large V3 Turbo yang paling lambat — tapi ia lebih berayun antarbahasa dibanding yang lain, dari 2,7× pada bahasa Yunani sampai 12,4× pada bahasa Jepang.
Berapa memori dan ruang disk yang dipakai Qwen3-ASR?
Memori puncak adalah jejak proses terbesar yang teramati di seluruh item dalam uji FLEURS yang sama, satu MacBook Air M5, ucapan yang dibacakan, klip pendek.
| Engine | Unduhan | Memori puncak dalam uji ini |
|---|---|---|
| Parakeet TDT 0.6B v3 | 465 MB | 0.09 GiB |
| Whisper Small | 600 MB | 0.87 GiB |
| SenseVoice Small | 827 MB | 0.95 GiB |
| Whisper Large V3 Turbo | sekitar 1.6 GB | 1.87 GiB |
| Qwen3-ASR 1.7B | sekitar 2.5 GB | 2.43 GiB |
Di kedua sumbu, Qwen3-ASR adalah yang paling berat di antara 5 model: sekitar 2,5 GB untuk diunduh dan 2,43 GiB memori proses puncak dalam uji ini, berbanding sekitar 1,6 GB dan 1,87 GiB untuk Whisper Large V3 Turbo.
Di mesin 8 GB ada jalur yang lebih ringan. Parakeet V3 mencakup 25 bahasa dalam 465 MB dan 0,09 GiB, dan Whisper Small mencakup 101 bahasa dalam 600 MB dan 0,87 GiB.
Cara kami mengukur: FLEURS, 30 bahasa, satu Mac
Qwen3-ASR 1.7B berjalan sebagai build MLX 8-bit, Whisper Large V3 Turbo sebagai build ggml whisper.cpp di Metal. Datanya adalah split tes Google FLEURS revisi 70bb2e84 (CC-BY-4.0): 83 dari 102 bahasanya, masing-masing sekitar 75 kalimat dan 15 menit, klip yang sama dalam urutan yang sama untuk setiap model; perbandingan berpasangannya adalah 30 bahasa milik Qwen. WER untuk bahasa yang dipisah spasi, CER untuk Mandarin, Kanton, Jepang, Korea dan Thai, tidak pernah digabung jadi satu angka; rentang galat berasal dari bootstrap tingkat item dengan 10.000 pengambilan ulang. Satu MacBook Air M5, 32 GB, macOS 26.5, tidak ada keluaran kosong atau kegagalan dari model mana pun.
FLEURS adalah ucapan yang dibacakan, bukan rapat dan bukan dikte. Peringkat dari ucapan yang dibacakan sudah dua kali gagal bertahan di hadapan audio nyata dalam pengujian kami sendiri, jadi kami tidak mengekstrapolasinya ke rekaman panjang: tabel-tabel ini mengatakan apakah sebuah model masuk akal untuk bahasa Anda, bukan akurasi yang akan Anda dapat. Evaluasi Qwen3-ASR 1.7B pada rapat sungguhan akan jadi tulisan tersendiri.
Haruskah Anda memakai Qwen3-ASR menggantikan Whisper Large V3?
Bahasa demi bahasa, begini cara kami menjawabnya di dalam Whisper Notes untuk Mac.
- Kalau Anda mentranskripsi bahasa Kanton, Hindi, Thai, Vietnam atau Prancis: pilih Qwen3-ASR 1.7B.
- Kalau Anda mentranskripsi bahasa Mandarin, Jepang, Korea, Inggris, Jerman, Spanyol atau Italia: unggulnya cuma setipis rambut, dan setipis itu pula yang kami klaim. Model mana pun sama-sama layak, begitu juga untuk bahasa Persia, Arab, Indonesia, Rusia, Portugis, Makedonia dan Melayu.
- Kalau Anda mentranskripsi bahasa Finlandia, Hungaria, Yunani, Ceko, Swedia, Denmark, Polandia, Rumania, Filipino, Turki atau Belanda: tetaplah di Whisper Large V3 Turbo. Ia menang jelas di semua 11 bahasa itu.
- Kalau yang Anda pedulikan adalah kecepatan atau ruang disk: bukan engine ini. Parakeet V3 dan SenseVoice Small satu orde besaran lebih cepat dengan unduhan yang jauh lebih kecil, dan Whisper Small mencakup 101 bahasa dalam 600 MB pada 6,4×.
- Kalau Anda memakai iPhone atau build Mac App Store: engine ini belum sampai ke sana. SenseVoice adalah pilihan untuk Kanton di kanal-kanal itu.
Ini adalah port on-device Qwen3-ASR terbuka milik Alibaba di Whisper Notes untuk Mac: bobot terbuka yang dikonversi ke Apple MLX pada 8-bit, berjalan di GPU Mac Anda sendiri, tanpa audio yang pergi ke server Alibaba. Ini bukan model yang sama dengan 0.6B yang digantikan SenseVoice di Unduhan Langsung (DMG) 1.5.0.
Cara memakainya (Mac Unduhan Langsung, DMG 1.6.0 ke atas): Pengaturan, lalu Model Transkripsi, lalu Qwen3-ASR 1.7B. Model diunduh di dalam aplikasi saat pertama kali dipakai dan besarnya sekitar 2,5 GB. Ia butuh macOS 15 ke atas di Apple silicon, dengan memori 16 GB yang disarankan; sisa aplikasinya jalan di macOS 14. Daftar bahasa per engine ada di halaman dukungan bahasa kami. CLI dan server MCP lokal menerima "qwen", "qwen3" dan "qwen3-asr".
Kalau Anda lebih suka tidak berpindah, tidak ada yang perlu berubah: Parakeet V3 tetap jadi default.
Pertanyaan yang Sering Diajukan
Apakah Qwen3-ASR lebih akurat daripada Whisper Large V3 Turbo?
Tergantung bahasanya, dan hasilnya nyaris imbang. Pada uji FLEURS kami sendiri di dalam Whisper Notes untuk Mac, dari 30 bahasa yang dicakup kedua model, Qwen3-ASR 1.7B unggul di 15 bahasa dan Whisper Large V3 Turbo di 15 bahasa. Qwen unggul jelas di Kanton (6,00% vs 37,97% CER), Hindi (13,67% vs 30,42% WER), Thai, Vietnam dan Prancis. Turbo unggul jelas di Finlandia (6,54% vs 26,08% WER), Hungaria, Yunani, Ceko, Swedia, Denmark, Polandia, Rumania, Filipino, Turki dan Belanda. 14 dari 30 selisihnya berada di dalam rentang galat dan sebaiknya dibaca sebagai imbang. Pilih Qwen3-ASR kalau bahasa Anda ada di kolom kemenangannya dan Anda memakai build Mac Unduhan Langsung (DMG) Whisper Notes; pilih Whisper Large V3 Turbo untuk selebihnya, dan untuk setiap bahasa di luar 30 milik Qwen, karena Whisper menjangkau seluruh 101 pilihan.
Bisakah saya memakai Qwen3-ASR di iPhone atau dari Mac App Store?
Hari ini ia ada di build Mac Unduhan Langsung (DMG) Whisper Notes sejak versi 1.6.0. Versi Mac App Store direncanakan menyusul dengan engine yang lebih baru pada rilis berikutnya, dan kami belum punya tanggalnya. Sementara itu aplikasi iPhone dan build Mac App Store punya 3 keluarga engine — Whisper, Parakeet V3 dan SenseVoice — dan setiap bahasa yang dikenali Qwen juga dicakup Whisper di sana. Dihitung sebagai model, build Mac App Store menawarkan 4 hari ini dan build Unduhan Langsung 5, karena Whisper hadir dalam Small maupun Large V3 Turbo. Kalau Anda butuh Kanton di iPhone, SenseVoice adalah engine yang dipakai di sana.
Qwen3-ASR atau SenseVoice untuk bahasa Mandarin, Jepang dan Korea?
Keduanya berdekatan soal akurasi dan berjauhan soal kecepatan. Pada uji FLEURS kami, Qwen3-ASR mencetak 5,69% CER untuk Mandarin, 5,39% untuk Jepang dan 3,51% untuk Korea; SenseVoice Small mencetak 7,06%, 6,85% dan 7,82% pada klip yang sama. SenseVoice berjalan pada median 161× realtime dalam uji itu berbanding 8,7× milik Qwen, unduhannya 827 MB berbanding sekitar 2,5 GB, dan tersedia di iPhone maupun kedua build Mac. Pilih SenseVoice kecuali Anda mentranskripsi bahasa Kanton. Untuk bahasa itu Qwen3-ASR mencetak 6,00% CER berbanding 36,71% milik SenseVoice, dan selisihnya cukup besar untuk sepadan dengan waktu tunggunya.
Apa kebutuhan sistem untuk Qwen3-ASR 1.7B?
Mac Apple silicon dengan macOS 15 ke atas, memori 16 GB yang disarankan, plus sekitar 2,5 GB ruang disk untuk modelnya. Itu lebih tinggi daripada sisa Whisper Notes untuk Mac, yang jalan di macOS 14 ke atas. Dalam uji benchmark kami, model itu memuncak di 2,43 GiB memori proses, tertinggi di antara 5 engine. Di Mac 8 GB, Whisper Small mencakup daftar 101 bahasa yang sama dalam 600 MB dan Parakeet V3 mencakup 25 bahasa Eropa dalam 465 MB.
Apakah audio meninggalkan Mac saya saat memakai Qwen3-ASR?
Tidak. Alibaba juga menawarkan Qwen3-ASR sebagai layanan cloud lewat API DashScope Real-time dan FileTrans, yang mengunggah audio ke server mereka. Whisper Notes tidak memakai API itu. Ia menjalankan bobot terbuka secara lokal sebagai model MLX 8-bit di GPU Mac Anda, tanpa akun dan tanpa API key, dan transkripsi tetap jalan dengan jaringan dimatikan. Itu berlaku untuk setiap keluarga engine di aplikasi ini, di semua kanal.
Kenapa angka-angka ini tidak cocok dengan akurasi yang saya dapat pada rekaman saya?
Karena FLEURS adalah ucapan yang dibacakan, pendek dan bersih, sedangkan rekaman Anda tidak. Uji kami adalah kalibrasi pada dataset publik: sekitar 75 kalimat per bahasa, satu MacBook Air M5, klip yang sama untuk setiap model. Itu berguna untuk menanyakan apakah sebuah model masuk akal untuk sebuah bahasa, dan itu bukan ramalan akurasi Anda pada rapat, pada audio berisik, pada ucapan beraksen atau pada file 2 jam.
Coba Sekarang
Qwen3-ASR 1.7B ada di Whisper Notes untuk Mac 1.6.0 ke atas, hanya Unduhan Langsung (DMG). Pengaturan, lalu Model Transkripsi. Uji coba gratisnya mencakup 10.000 kata, cukup untuk menjalankan bahasa Anda sendiri lewat model itu lalu membantah tabel-tabel di atas.
Kalau Anda menemukan bahasa yang angkanya tidak cocok dengan pengalaman Anda, kirim email ke mac@whispernotes.app. Catatan rilis lengkap: whispernotes.app/changelog.
Sumber untuk semua di atas: uji FLEURS kami pada split tes Google FLEURS revisi 70bb2e84, kartu model Qwen3-ASR 1.7B, dan tabel bahasa per engine di halaman dukungan bahasa kami, yang dihasilkan dari kode sumber aplikasinya sendiri.