Bọn mình muốn trả lời một câu hỏi: có mô hình cục bộ nào phiên âm ngôn ngữ của bạn chính xác hơn Whisper Large V3 không? Vậy nên bọn mình đã cho những mô hình này chạy trên bộ dữ liệu FLEURS.
FLEURS là bộ dữ liệu của Google gồm giọng đọc trong 102 ngôn ngữ. Bọn mình lấy khoảng 75 câu ở mỗi ngôn ngữ, rồi cho 5 mô hình nghe cùng một loạt đoạn ghi âm, theo cùng thứ tự:
- Parakeet V3
- Whisper Large V3 Turbo
- SenseVoice Small
- Whisper Small
- Qwen3-ASR 1.7B
Kết quả trông như thế này.
Qwen3-ASR 1.7B đối đầu Whisper Large V3 Turbo — lượt chạy FLEURS của bọn mình, một chiếc MacBook Air M5, giọng đọc, đoạn ngắn.
| Qwen3-ASR 1.7B | Whisper Large V3 Turbo | |
|---|---|---|
| Ngôn ngữ hỗ trợ | 30 | 101 |
| Ưu thế rõ rệt | Tiếng Quảng Đông, Hindi, Thái, Việt, Pháp (5) | Tiếng Phần Lan, Hungary, Hy Lạp và 8 ngôn ngữ khác (11) |
| Tốc độ | 8,7× thời gian thực | 2,4× thời gian thực |
| Bộ nhớ đỉnh | 2,43 GiB | 1,87 GiB |
| Dung lượng tải | khoảng 2,5 GB | khoảng 1,6 GB |
Ngoài nhóm ngôn ngữ mạnh của từng mô hình, khác biệt về độ chính xác không đáng kể.
Whisper Large V3 và Qwen3-ASR: so sánh chi tiết
Cả 30 ngôn ngữ, xếp từ chỗ Qwen thắng đậm nhất tới chỗ thua đậm nhất. Cả hai cột đều càng thấp càng tốt.
Lượt chạy FLEURS của bọn mình, một chiếc MacBook Air M5, giọng đọc. CER cho tiếng Trung, Quảng Đông, Nhật, Hàn và Thái, WER cho phần còn lại; màu xanh đánh dấu khoảng cách rộng hơn dải sai số 95% ghép cặp.
| Ngôn ngữ | Qwen3-ASR 1.7B | Whisper Large V3 Turbo |
|---|---|---|
| Tiếng Quảng Đông | 6,00 | 37,97 |
| Tiếng Hindi | 13,67 | 30,42 |
| Tiếng Thái | 5,92 | 12,95 |
| Tiếng Việt | 5,07 | 9,79 |
| Tiếng Ba Tư | 26,98 | 30,03 |
| Tiếng Ả Rập | 14,14 | 15,75 |
| Tiếng Indonesia | 4,97 | 6,50 |
| Tiếng Pháp | 3,98 | 5,39 |
| Tiếng Trung | 5,69 | 6,88 |
| Tiếng Anh | 5,07 | 5,92 |
| Tiếng Đức | 3,51 | 4,10 |
| Tiếng Nhật | 5,39 | 5,71 |
| Tiếng Hàn | 3,51 | 3,70 |
| Tiếng Tây Ban Nha | 3,60 | 3,76 |
| Tiếng Ý | 2,98 | 3,05 |
| Tiếng Nga | 5,98 | 5,51 |
| Tiếng Bồ Đào Nha | 5,64 | 4,91 |
| Tiếng Macedonia | 17,81 | 16,64 |
| Tiếng Mã Lai | 11,60 | 10,18 |
| Tiếng Hà Lan | 7,65 | 5,63 |
| Tiếng Thổ Nhĩ Kỳ | 8,34 | 5,53 |
| Tiếng Đan Mạch | 20,12 | 14,92 |
| Tiếng Ba Lan | 12,78 | 5,32 |
| Tiếng Romania | 18,97 | 8,22 |
| Tiếng Filipino | 20,44 | 9,37 |
| Tiếng Thụy Điển | 20,04 | 8,72 |
| Tiếng Séc | 23,92 | 11,15 |
| Tiếng Hy Lạp | 30,20 | 12,97 |
| Tiếng Phần Lan | 26,08 | 6,54 |
| Tiếng Hungary | 36,35 | 13,66 |
Lượt chạy ghép cặp của bọn mình trên tập test FLEURS, bản 70bb2e84, khoảng 75 câu mỗi ngôn ngữ, một chiếc MacBook Air M5.
5 ngôn ngữ Qwen3-ASR 1.7B thắng rõ. Tỷ lệ lỗi tính theo phần trăm, Qwen so với Turbo: tiếng Quảng Đông (6,0 so với 38,0), Hindi (13,7 so với 30,4), Thái (5,9 so với 13,0), Việt (5,1 so với 9,8), Pháp (4,0 so với 5,4). Tiếng Quảng Đông và tiếng Thái chấm theo ký tự, phần còn lại chấm theo từ. Ưu thế của nó nằm ở nhóm chấm theo ký tự: trên tiếng Trung, Quảng Đông, Nhật, Hàn và Thái, nó đạt trung bình 5,3% so với 13,4% của Turbo; còn trên 25 ngôn ngữ chấm theo từ, nó đạt trung bình 14,0% so với 10,2% của Turbo.
11 ngôn ngữ Whisper Large V3 Turbo thắng rõ. Tỷ lệ lỗi tính theo phần trăm, Qwen so với Turbo, tất cả đều chấm theo từ: tiếng Hungary (36,4 so với 13,7), Hy Lạp (30,2 so với 13,0), Phần Lan (26,1 so với 6,5), Séc (23,9 so với 11,2), Filipino (20,4 so với 9,4), Đan Mạch (20,1 so với 14,9), Thụy Điển (20,0 so với 8,7), Romania (19,0 so với 8,2), Ba Lan (12,8 so với 5,3), Thổ Nhĩ Kỳ (8,3 so với 5,5), Hà Lan (7,7 so với 5,6).
14 ngôn ngữ sát nhau hoặc ngang nhau. Tiếng Anh (5,1 so với 5,9), Đức (3,5 so với 4,1), Tây Ban Nha (3,6 so với 3,8), Ý (3,0 so với 3,1), Nga (6,0 so với 5,5), Bồ Đào Nha (5,6 so với 4,9); tiếng Trung (5,7 so với 6,9), Nhật (5,4 so với 5,7) và Hàn (3,5 so với 3,7) chấm theo ký tự. Rồi tới tiếng Ả Rập, Indonesia, Ba Tư, Mã Lai và Macedonia. Mọi khoảng cách ở nhóm này đều nhỏ và nằm trong dải 95%, nên lượt chạy này không tách được 2 mô hình.
Quảng Đông là hàng duy nhất làm thay đổi một quyết định: 6,00% so với 37,97%, và SenseVoice Small — thứ bọn mình từng công bố là lời giải cho tiếng Quảng Đông — đạt 36,71% CER trên cùng loạt đoạn ghi âm. Trên bộ giọng đọc này, cả hai con số sau đều chưa qua được ngưỡng, nên khuyến nghị cũ từ giờ đi kèm điều kiện đó.
Qwen3-ASR 1.7B nhanh cỡ nào?
Cả 5 engine đều đo trong cùng một bộ khung trên cùng một máy (MacBook Air M5), nên ít nhất chúng so được với nhau.
Trung vị hệ số thời gian thực trên các ngôn ngữ của từng engine trong cùng lượt chạy FLEURS, một chiếc MacBook Air M5, giọng đọc.
| Engine | Ngôn ngữ | Trung vị tốc độ trong lượt chạy này (đoạn ngắn) |
|---|---|---|
| SenseVoice Small | 6 lựa chọn | 161,0× |
| Parakeet TDT 0.6B v3 | 25 | 82,9× |
| Qwen3-ASR 1.7B | 30 công bố | 8,7× |
| Whisper Small | 101 | 6,4× |
| Whisper Large V3 Turbo | 101 | 2,4× |
Đây là số liệu đoạn ngắn trên bộ khung đo, thấp hơn mức chính các engine đó đạt được với một bản ghi dài. Cột này chỉ dùng để so các engine với nhau bên trong lượt chạy này, không dùng cho việc gì khác.
Parakeet V3 và SenseVoice Small nhanh hơn Qwen3-ASR khoảng một bậc độ lớn trong cùng bộ khung. Với tệp dài thay vì đoạn ngắn, Parakeet đã chạy ở 103× thời gian thực trên M4 Pro và SenseVoice ở 52× trở lên — một phép đo khác trên âm thanh khác, nhưng chỉ về cùng một hướng.
Qwen3-ASR nằm ở giữa. Nó không phải engine chậm nhất trong lượt chạy đoạn ngắn này — Whisper Large V3 Turbo mới là — nhưng nó dao động theo ngôn ngữ nhiều hơn các engine còn lại, từ 2,7× ở tiếng Hy Lạp đến 12,4× ở tiếng Nhật.
Qwen3-ASR tốn bao nhiêu bộ nhớ và dung lượng đĩa?
Bộ nhớ đỉnh là mức chiếm dụng tiến trình lớn nhất quan sát được qua các mục trong cùng lượt chạy FLEURS, một chiếc MacBook Air M5, giọng đọc, đoạn ngắn.
| Engine | Dung lượng tải | Bộ nhớ đỉnh trong lượt chạy này |
|---|---|---|
| Parakeet TDT 0.6B v3 | 465 MB | 0,09 GiB |
| Whisper Small | 600 MB | 0,87 GiB |
| SenseVoice Small | 827 MB | 0,95 GiB |
| Whisper Large V3 Turbo | khoảng 1,6 GB | 1,87 GiB |
| Qwen3-ASR 1.7B | khoảng 2,5 GB | 2,43 GiB |
Trên cả hai trục, Qwen3-ASR đều là mô hình nặng nhất trong 5 mô hình: khoảng 2,5 GB để tải và 2,43 GiB bộ nhớ tiến trình đỉnh trong lượt chạy này, so với khoảng 1,6 GB và 1,87 GiB của Whisper Large V3 Turbo.
Trên máy 8 GB có một hướng nhẹ hơn. Parakeet V3 phủ 25 ngôn ngữ trong 465 MB và 0,09 GiB, còn Whisper Small phủ 101 ngôn ngữ trong 600 MB và 0,87 GiB.
Bọn mình đo thế nào: FLEURS, 30 ngôn ngữ, một chiếc Mac
Qwen3-ASR 1.7B chạy ở bản dựng MLX 8-bit, Whisper Large V3 Turbo chạy ở bản dựng ggml của whisper.cpp trên Metal. Dữ liệu là tập test Google FLEURS bản 70bb2e84 (CC-BY-4.0): 83 trong số 102 ngôn ngữ của nó, mỗi ngôn ngữ khoảng 75 câu và 15 phút, cùng những đoạn ghi âm đó theo cùng thứ tự cho mọi mô hình; phần so sánh ghép cặp là 30 ngôn ngữ của Qwen. WER cho các ngôn ngữ tách từ bằng dấu cách, CER cho tiếng Trung, Quảng Đông, Nhật, Hàn và Thái, không bao giờ gộp lại thành một con số; dải sai số là bootstrap ở mức từng mục với 10.000 lần lấy mẫu lại. Một chiếc MacBook Air M5, 32 GB, macOS 26.5, không mô hình nào cho đầu ra rỗng hay lỗi.
FLEURS là giọng đọc, không phải một cuộc họp và cũng không phải đọc chính tả. Thứ hạng trên giọng đọc đã hai lần không trụ được trước âm thanh thật trong chính các bài thử của bọn mình, nên bọn mình không ngoại suy chúng sang bản ghi dài: những bảng này nói cho bạn biết một mô hình có khả thi với ngôn ngữ của bạn hay không, chứ không phải độ chính xác bạn sẽ nhận được. Bài đánh giá Qwen3-ASR 1.7B trên cuộc họp thật sẽ là một bài riêng.
Có nên dùng Qwen3-ASR thay cho Whisper Large V3?
Xét theo từng ngôn ngữ, đây là cách bọn mình sẽ trả lời câu đó bên trong Whisper Notes cho Mac.
- Nếu bạn phiên âm tiếng Quảng Đông, Hindi, Thái, Việt hoặc Pháp: chọn Qwen3-ASR 1.7B.
- Nếu bạn phiên âm tiếng Trung, Nhật, Hàn, Anh, Đức, Tây Ban Nha hoặc Ý: nó chỉ dẫn trước một chút, và bọn mình cũng chỉ dám nói đúng một chút đó. Mô hình nào cũng ổn, tiếng Ba Tư, Ả Rập, Indonesia, Nga, Bồ Đào Nha, Macedonia và Mã Lai cũng vậy.
- Nếu bạn phiên âm tiếng Phần Lan, Hungary, Hy Lạp, Séc, Thụy Điển, Đan Mạch, Ba Lan, Romania, Filipino, Thổ Nhĩ Kỳ hoặc Hà Lan: hãy ở lại với Whisper Large V3 Turbo. Nó thắng rõ cả 11 ngôn ngữ.
- Nếu thứ bạn quan tâm là tốc độ hay dung lượng đĩa: không phải engine này. Parakeet V3 và SenseVoice Small nhanh hơn một bậc độ lớn với dung lượng tải chỉ bằng một phần nhỏ, còn Whisper Small phủ 101 ngôn ngữ trong 600 MB ở 6,4×.
- Nếu bạn dùng iPhone hoặc bản Mac App Store: engine này chưa có ở đó. SenseVoice là lựa chọn cho tiếng Quảng Đông trên hai kênh ấy.
Đây là bản chuyển Qwen3-ASR mã nguồn mở của Alibaba sang chạy trên thiết bị của Whisper Notes cho Mac: trọng số mở được chuyển sang Apple MLX ở 8-bit, chạy trên chính GPU của Mac bạn, không có âm thanh nào đi tới máy chủ của Alibaba. Nó không phải cùng một mô hình với bản 0.6B mà SenseVoice đã thay thế trong bản tải trực tiếp (DMG) 1.5.0.
Cách dùng (bản Mac tải trực tiếp, DMG 1.6.0 trở lên): Cài đặt, rồi Mô hình phiên âm, rồi Qwen3-ASR 1.7B. Mô hình được tải ngay trong app ở lần dùng đầu tiên và nặng khoảng 2,5 GB. Nó cần macOS 15 trở lên trên Apple silicon, khuyến nghị 16 GB bộ nhớ; phần còn lại của app chạy trên macOS 14. Danh sách ngôn ngữ theo từng engine nằm trên trang hỗ trợ ngôn ngữ của bọn mình. CLI và máy chủ MCP chạy cục bộ chấp nhận "qwen", "qwen3" và "qwen3-asr".
Nếu bạn không muốn đổi thì không cần thay đổi gì cả: Parakeet V3 vẫn là mặc định.
Câu hỏi thường gặp
Qwen3-ASR có chính xác hơn Whisper Large V3 Turbo không?
Còn tùy ngôn ngữ, và tỷ số gần như hòa. Trong lượt chạy FLEURS của chính bọn mình bên trong Whisper Notes cho Mac, trên 30 ngôn ngữ mà cả hai mô hình cùng phủ, Qwen3-ASR 1.7B dẫn ở 15 ngôn ngữ và Whisper Large V3 Turbo dẫn ở 15. Qwen dẫn rõ ở tiếng Quảng Đông (6,00% so với 37,97% CER), Hindi (13,67% so với 30,42% WER), Thái, Việt và Pháp. Turbo dẫn rõ ở tiếng Phần Lan (6,54% so với 26,08% WER), Hungary, Hy Lạp, Séc, Thụy Điển, Đan Mạch, Ba Lan, Romania, Filipino, Thổ Nhĩ Kỳ và Hà Lan. 14 trong 30 khoảng cách nằm trong dải sai số và nên đọc là hòa. Hãy chọn Qwen3-ASR nếu ngôn ngữ của bạn nằm ở cột thắng của nó và bạn đang dùng bản Mac tải trực tiếp (DMG) của Whisper Notes; chọn Whisper Large V3 Turbo cho mọi trường hợp còn lại, và cho mọi ngôn ngữ ngoài 30 ngôn ngữ của Qwen, vì Whisper với tới cả 101 lựa chọn.
Tôi dùng được Qwen3-ASR trên iPhone hay từ Mac App Store không?
Hiện tại nó nằm trong bản Mac tải trực tiếp (DMG) của Whisper Notes từ phiên bản 1.6.0 trở đi. Bản Mac App Store dự kiến nhận các engine mới hơn ở những bản phát hành sau, và bọn mình chưa có ngày cụ thể. Trong lúc đó, app iPhone và bản Mac App Store có 3 họ engine — Whisper, Parakeet V3 và SenseVoice — và mọi ngôn ngữ Qwen nhận ra thì Whisper ở đó cũng phủ. Tính theo số mô hình, bản Mac App Store hiện có 4 và bản tải trực tiếp có 5, vì Whisper đi kèm cả Small lẫn Large V3 Turbo. Nếu bạn cần tiếng Quảng Đông trên iPhone, SenseVoice là engine dùng ở đó.
Tiếng Trung, Nhật và Hàn nên chọn Qwen3-ASR hay SenseVoice?
Hai bên sát nhau về độ chính xác và cách nhau rất xa về tốc độ. Trong lượt chạy FLEURS của bọn mình, Qwen3-ASR đạt 5,69% CER ở tiếng Trung, 5,39% ở tiếng Nhật và 3,51% ở tiếng Hàn; SenseVoice Small đạt 7,06%, 6,85% và 7,82% trên cùng loạt đoạn ghi âm. SenseVoice chạy ở trung vị 161× thời gian thực trong lượt chạy đó so với 8,7× của Qwen, tải về 827 MB so với khoảng 2,5 GB, và có mặt trên iPhone lẫn cả hai bản Mac. Hãy chọn SenseVoice, trừ khi bạn phiên âm tiếng Quảng Đông — chỗ Qwen3-ASR đạt 6,00% CER so với 36,71% của SenseVoice, khoảng cách đủ lớn để đáng chờ thêm.
Yêu cầu hệ thống của Qwen3-ASR 1.7B là gì?
Một chiếc Mac Apple silicon chạy macOS 15 trở lên, khuyến nghị 16 GB bộ nhớ, cộng thêm khoảng 2,5 GB dung lượng đĩa cho mô hình. Mức đó cao hơn phần còn lại của Whisper Notes cho Mac, vốn chạy từ macOS 14 trở lên. Trong lượt chạy benchmark của bọn mình, mô hình chạm đỉnh 2,43 GiB bộ nhớ tiến trình, cao nhất trong 5 engine. Trên một chiếc Mac 8 GB, Whisper Small phủ đúng danh sách 101 ngôn ngữ đó trong 600 MB và Parakeet V3 phủ 25 ngôn ngữ châu Âu trong 465 MB.
Âm thanh có rời khỏi máy Mac của tôi khi dùng Qwen3-ASR không?
Không. Alibaba cũng cung cấp Qwen3-ASR dưới dạng dịch vụ đám mây qua các API DashScope Real-time và FileTrans, nơi âm thanh được tải lên máy chủ của họ. Whisper Notes không dùng những API đó. Nó chạy trọng số mở ngay trên máy dưới dạng mô hình MLX 8-bit trên GPU của Mac bạn, không cần tài khoản và không cần API key, và việc phiên âm vẫn chạy khi tắt mạng. Mọi họ engine trong app đều như vậy, trên mọi kênh.
Vì sao những con số này không khớp với độ chính xác tôi nhận được trên bản ghi của mình?
Vì FLEURS là giọng đọc ngắn và sạch, còn bản ghi của bạn thì không. Lượt chạy của bọn mình là một phép hiệu chuẩn trên bộ dữ liệu công khai: khoảng 75 câu mỗi ngôn ngữ, một chiếc MacBook Air M5, cùng những đoạn ghi âm đó cho mọi mô hình. Nó hữu ích để hỏi xem một mô hình có khả thi với một ngôn ngữ hay không, và nó không phải dự báo cho độ chính xác của bạn trên một cuộc họp, trên âm thanh ồn, trên giọng có accent hay trên một tệp 2 giờ.
Dùng thử
Qwen3-ASR 1.7B có trong Whisper Notes cho Mac 1.6.0 trở lên, chỉ ở bản tải trực tiếp (DMG). Vào Cài đặt, rồi Mô hình phiên âm. Bản dùng thử miễn phí gồm 10.000 từ, đủ để bạn cho ngôn ngữ của mình chạy qua nó rồi phản bác những bảng ở trên.
Nếu bạn tìm được một ngôn ngữ mà số của bọn mình không khớp với trải nghiệm của bạn, hãy viết thư tới mac@whispernotes.app. Ghi chú phát hành đầy đủ: whispernotes.app/changelog.
Nguồn cho mọi thứ ở trên: lượt chạy FLEURS của bọn mình trên tập test Google FLEURS bản 70bb2e84, thẻ mô hình Qwen3-ASR 1.7B, và bảng ngôn ngữ theo từng engine trên trang hỗ trợ ngôn ngữ của bọn mình — bảng đó được sinh ra từ chính mã nguồn của app.