TL;DR — So sánh ba mô hình chạy trên thiết bị
| Parakeet V3 | SenseVoice Small | Whisper Large V3 Turbo | |
|---|---|---|---|
| 5 phút tiếng Anh | 2,91s (103×) | 5,8s (52×) | 20,92s (14,3×) |
| 27 phút tiếng Trung | 10,10s (161×) | 13,83s (118×) | 2 phút 4s (13,1×) |
| Ngôn ngữ | 25 (châu Âu) | 5 (zh, en, ja, ko, yue) | 100+ |
| Dung lượng tải | 465 MB | 827 MB | ~1,6 GB |
| Bộ nhớ | ~800 MB | ~700 MB | ~1,6 GB |
| Phù hợp nhất | Tiếng Anh & châu Âu | Tiếng Trung, Nhật, Hàn, Quảng Đông | Mọi ngôn ngữ còn lại (100+) |
* Benchmark tốc độ trên Apple M4 Pro, 32 GB. Podcast tiếng Anh 5 phút và podcast tiếng Trung 27 phút. Hệ số thời gian thực = thời lượng âm thanh ÷ thời gian xử lý (càng cao càng nhanh). Số liệu đo trên phiên bản Mac; SenseVoice cũng có sẵn trên iPhone.
Bắt đầu từ phiên bản 1.5.0 (Direct Download / DMG), Whisper Notes cho Mac tích hợp SenseVoice Small làm engine chuyên dụng để phiên âm tiếng Trung, Nhật, Hàn và Quảng Đông. Nó thay thế Qwen3-ASR và chạy trên GPU của Apple thông qua MLX thay vì CPU — xử lý một podcast tiếng Trung 27 phút trong 13,83 giây thay vì 3 phút 44 giây.
Tại sao chúng tôi thay thế Qwen3-ASR
Qwen3-ASR là một mô hình tốt. Nó hỗ trợ 30 ngôn ngữ cùng 22 phương ngữ tiếng Trung, và độ chính xác tiếng Trung gần đạt mức hàng đầu. Nhưng nó có một vấn đề ngày càng tệ khi âm thanh dài hơn: tốc độ.
Qwen3 dùng kiến trúc tự hồi quy — cùng cách tiếp cận như Whisper, xử lý âm thanh từng khung một, không bao giờ nhảy cóc. Với podcast tiếng Trung 27 phút, nó mất 224 giây. Dùng được, nhưng không phải trải nghiệm kết quả tức thì mà Parakeet V3 mang lại cho tiếng Anh.
Vấn đề sâu hơn nằm ở hạ tầng của chúng tôi. Tích hợp Qwen3 dùng sherpa-onnx, một thư viện C với wrapper Swift dài 2.249 dòng, đẩy toàn bộ tính toán qua nhân CPU. GPU của Mac ngồi không trong khi CPU gánh hết việc.
SenseVoice giải quyết cả hai vấn đề. Kiến trúc phi tự hồi quy cho tốc độ. Apple MLX cho tăng tốc GPU. Kết quả: nhanh hơn 16,2 lần trên cùng phần cứng, với codebase giảm từ 2.249 dòng xuống 288.
Benchmark
Cả ba mô hình chạy trên cùng một chiếc Apple M4 Pro, cùng file âm thanh, cùng điều kiện. Không cloud. Không internet. Chỉ có silicon.
| Mô hình | 5 phút tiếng Anh | 27 phút tiếng Trung | Tốc độ (RTFx) |
|---|---|---|---|
| Parakeet V3 | 2,91s | 10,10s | 103–161× |
| SenseVoice Small | 5,8s | 13,83s | 52–118× |
| Whisper Large V3 Turbo | 20,92s | 2 phút 4s | 13–14× |
| Qwen3-ASR (đã gỡ bỏ) | — | 224s | 7,2× |
SenseVoice chậm hơn Parakeet V3 khoảng một nửa — nhưng vẫn nhanh khủng khiếp. Một podcast 27 phút xong trong chưa đầy 14 giây. Bạn nhấn nút phiên âm, chờ đúng một nhịp thở, và văn bản đã ở đó.
So sánh với 2 phút 4 giây của Whisper, hay 3 phút 44 giây của Qwen3 cũ. Kiến trúc quan trọng hơn số lượng tham số.
Benchmark suy luận chính thức từ bài báo FunAudioLLM: SenseVoice-Small xử lý 10s âm thanh trong 70ms (GPU A800). Whisper-Large-V3 mất 1.281ms. Chênh lệch 18 lần về độ trễ suy luận thuần.
| Mô hình | Thời gian nạp | Bộ nhớ | Dung lượng tải |
|---|---|---|---|
| Parakeet V3 | 0,77s | ~800 MB | 465 MB |
| SenseVoice Small | 0,81s | ~700 MB | 827 MB |
| Whisper Small | 1,03s | ~487 MB | 600 MB |
| Whisper Large V3 Turbo | 3,18s | ~1,6 GB | ~1,6 GB |
* Thời gian nạp và bộ nhớ đo trên Apple M4 Pro, 32 GB.
SenseVoice nạp trong chưa đầy một giây và dùng ít bộ nhớ hơn Parakeet. Trên Mac 8 GB, nó chạy thoải mái bên cạnh các ứng dụng khác của bạn.
Tại sao SenseVoice nhanh hơn: Kiến trúc + Runtime
Khoảng cách tốc độ giữa Qwen3-ASR và SenseVoice đến từ hai yếu tố độc lập.
Yếu tố 1: Kiến trúc mô hình. Qwen3-ASR là mô hình tự hồi quy — sinh văn bản từng token một, token sau phụ thuộc vào token trước. SenseVoice dùng bộ mã hóa phi tự hồi quy (NAR) xử lý toàn bộ âm thanh song song. Chỉ riêng khác biệt kiến trúc này đã khiến SenseVoice nhanh hơn về bản chất, bất kể bạn chạy trên phần cứng nào.
Yếu tố 2: Runtime. Tích hợp Qwen3-ASR của chúng tôi dùng sherpa-onnx, chạy trên CPU. SenseVoice chạy qua Apple MLX, đưa tính toán sang GPU. Qwen3 có thể chạy trên MLX không? Có — nhưng vẫn sẽ chậm hơn SenseVoice, vì nút thắt tự hồi quy nằm ở kiến trúc chứ không phải runtime.
| Qwen3-ASR (cũ) | SenseVoice (mới) | |
|---|---|---|
| Kiến trúc | Tự hồi quy (từng token) | Phi tự hồi quy (song song) |
| Runtime | sherpa-onnx (CPU) | Apple MLX (GPU) |
| 27 phút tiếng Trung | 224 giây | 13,83 giây |
| Tăng tốc tổng hợp | mốc so sánh | Nhanh hơn 16,2 lần |
| Codebase | Framework C 168 MB + 2.249 dòng Swift | 288 dòng Swift Actor |
* Cùng podcast tiếng Trung 27 phút, Apple M4 Pro. Mức tăng tốc 16,2 lần kết hợp cả cải tiến kiến trúc (NAR vs AR) lẫn runtime (GPU vs CPU).
Code cũng đơn giản hơn. Bản triển khai SenseVoice mới là một Swift Actor 288 dòng nói chuyện trực tiếp với MLX, thay thế framework C nặng 168 MB. Ít code hơn, ít bug hơn, ứng dụng nhỏ hơn.
Năm ngôn ngữ, làm thật tốt
SenseVoice không cố gắng làm tất cả. Nó xử lý năm ngôn ngữ:
| Ngôn ngữ | SenseVoice-Small | Whisper-Large-V3 | Bên thắng |
|---|---|---|---|
| Tiếng Trung (zh-CN) | 10,78% CER | 12,55% CER | SenseVoice (-14%) |
| Tiếng Quảng Đông (yue) | 7,09% CER | 10,41% CER | SenseVoice (-32%) |
| Tiếng Nhật (ja) | 11,96% CER | 10,34% CER | Whisper (nhỉnh hơn) |
| Tiếng Hàn (ko) | 8,28% CER | 5,59% CER | Whisper |
| Tiếng Anh (en) | 14,71% WER | 9,39% WER | Whisper (nên dùng Parakeet) |
* Benchmark CommonVoice, CER = tỷ lệ lỗi ký tự, WER = tỷ lệ lỗi từ. Càng thấp càng tốt. Nguồn: bài báo FunAudioLLM (2024). Độ trễ suy luận của SenseVoice-Small: 70ms cho 10s âm thanh (GPU A800), nhanh gấp hơn 15 lần Whisper-Large-V3.
Benchmark CommonVoice: SenseVoice-Small (vàng) vs Whisper-Small (xanh dương) vs Whisper-Large-V3 (cam). Càng thấp càng tốt. Nguồn: bài báo FunAudioLLM
Những con số kể một câu chuyện trung thực. SenseVoice vượt Whisper về độ chính xác tiếng Trung và tiếng Quảng Đông với cách biệt đáng kể, trong khi Whisper chính xác hơn cho tiếng Nhật, Hàn và Anh. Nhưng SenseVoice nhanh gấp hơn 15 lần Whisper-Large-V3. Với hầu hết nhu cầu thực tế, chênh lệch tốc độ quan trọng hơn vài điểm phần trăm độ chính xác.
Kết quả tiếng Quảng Đông đáng được nhấn mạnh riêng. Whisper-Small đạt 38,97% CER với tiếng Quảng Đông — gần như không dùng được. Ngay cả Whisper-Large-V3 cũng chỉ đạt 10,41%. SenseVoice đạt 7,09%. Trước SenseVoice, không có cách nào tốt để phiên âm tiếng Quảng Đông ngay trên máy Mac. Nếu bạn nói tiếng Quảng Đông, mô hình này sinh ra dành cho bạn.
Phiên âm tiếng Hàn với SenseVoice: nhập video kèm phụ đề có mốc thời gian
Thử nghiệm thực tế: Podcast tiếng Trung 27 phút
Chúng tôi phiên âm một tập 27 phút của Thirteen Invitations (十三邀), một podcast phỏng vấn tiếng Trung, bằng cả SenseVoice và Whisper Large V3 Turbo trên cùng chiếc M4 Pro. ElevenLabs Scribe (cloud) được dùng làm tham chiếu. Hai mô hình trên thiết bị mắc số lỗi xấp xỉ nhau, nhưng khác nhau về loại lỗi:
| SenseVoice | Whisper Large V3 | |
|---|---|---|
| Thời gian | 13,83s | 2 phút 4s |
| Số lỗi (mẫu 5 phút) | ~15–20 | ~12–15 |
| Lỗi tệ nhất | 时差→食堂 (múi giờ→nhà ăn) | 西昌→西藏 (thành phố Tây Xương→Tây Tạng, lệch 4.000 km) |
| Kiểu lỗi | Nhầm từ đồng âm | Lỗi địa lý/dữ kiện |
* So sánh thủ công với ElevenLabs Scribe (tham chiếu cloud, cũng không hoàn hảo). Cả hai mô hình trên thiết bị đều viết đúng "根深蒂固" trong khi Scribe viết sai.
Độ chính xác tương đương. Nhanh hơn 9 lần. Với việc phiên âm tiếng Trung ngoài đời thực, SenseVoice trả cho bạn một bản ghi dùng được trước cả khi Whisper nạp xong.
Khi nào dùng mô hình nào
Whisper Notes cho Mac hiện đi kèm bốn mô hình giọng nói. Mỗi mô hình được tối ưu cho các tình huống khác nhau:
| Bạn cần... | Dùng mô hình này | Lý do |
|---|---|---|
| Tiếng Anh hoặc ngôn ngữ châu Âu, tốc độ tối đa | Parakeet V3 | 103× thời gian thực, tỷ lệ lỗi thấp nhất. Lựa chọn mặc định. |
| Tiếng Trung, Nhật, Hàn hoặc Quảng Đông | SenseVoice Small | 52–118× thời gian thực. Mô hình duy nhất hỗ trợ tiếng Quảng Đông. |
| Bất kỳ ngôn ngữ nào trong hơn 100 ngôn ngữ (Ả Rập, Thái, Nga, v.v.) | Whisper Large V3 Turbo | Hỗ trợ ngôn ngữ rộng nhất. Chậm hơn nhưng đa năng. |
| Dùng ít bộ nhớ hơn (Mac đời cũ) | Whisper Small | 487 MB bộ nhớ. Hợp với Mac 8 GB đang chạy nhiều ứng dụng khác. |
Cài đặt → Mô hình phiên âm: chọn đúng engine cho ngôn ngữ của bạn
Bộ chọn mô hình trong Cài đặt hiển thị cả bốn tùy chọn kèm dung lượng tải, số ngôn ngữ và yêu cầu bộ nhớ. SenseVoice được tải về khi dùng lần đầu (~827 MB) và nằm lại trên thiết bị của bạn.
Những đánh đổi
SenseVoice không phải mô hình vạn năng. Đây là những gì nó không làm được:
• Chỉ 5 ngôn ngữ. Nếu bạn cần tiếng Thái, Nga, Ả Rập, Hindi hay một ngôn ngữ khác ngoài trọng tâm CJK của SenseVoice, hãy tiếp tục dùng Whisper.
• Cập nhật: SenseVoice ban đầu chỉ có trên Mac thông qua Apple MLX, nhưng nay đã có mặt trên cả iPhone — iOS hỗ trợ cùng dàn mô hình như Mac: Parakeet V3, Whisper và SenseVoice.
• Hiện tượng lạ với âm thanh nhỏ. Với các đoạn rất ngắn hoặc rất nhỏ tiếng, SenseVoice đôi khi trả về tiếng Trung bất kể ngôn ngữ đã chọn. Đặt ngôn ngữ thủ công (thay vì "Tự động") giúp giảm hiện tượng này.
• Không có streaming. Khác với chế độ streaming của Whisper, SenseVoice xử lý toàn bộ âm thanh sau khi ghi xong. Với file dài, nó tự chia đoạn tại các điểm im lặng và hiển thị kết quả dần dần.
Đây là ràng buộc kiến trúc, không phải bug. Một mô hình được huấn luyện cho 5 ngôn ngữ làm 5 ngôn ngữ đó cực kỳ tốt. Độ phủ hơn 100 ngôn ngữ của Whisper đi kèm tốc độ chậm hơn và độ chính xác không đồng đều giữa các ngôn ngữ.
Muốn so sánh tất cả các lựa chọn chạy cục bộ? Mọi mô hình chuyển giọng nói thành văn bản trên thiết bị — các biến thể Whisper, Parakeet V3, SenseVoice và Voxtral — được đặt cạnh nhau trên trang so sánh các mô hình Whisper của chúng tôi. Mới làm quen với Whisper? Hãy bắt đầu từ Hướng dẫn phiên âm với Whisper — mô hình này là gì, mọi cách để chạy nó và chi phí bao nhiêu.
Câu hỏi thường gặp
Giải pháp thay thế Whisper nhanh nhất để phiên âm tiếng Trung, Nhật và Hàn là gì?
SenseVoice Small, có sẵn trong Whisper Notes trên cả Mac và iPhone. Trong bài test trên Mac M4 Pro, nó phiên âm một podcast tiếng Trung 27 phút trong 13,83 giây (52–118× thời gian thực), trong khi Whisper Large V3 Turbo mất hơn 2 phút cho cùng file đó.
SenseVoice có tốt hơn Whisper cho tiếng Trung không?
Với tiếng Trung và tiếng Quảng Đông thì có. Trên benchmark CommonVoice, SenseVoice đạt 10,78% CER cho tiếng Trung so với 12,55% của Whisper-Large-V3, và nhanh gấp hơn 15 lần. Whisper vẫn nhỉnh hơn đôi chút về độ chính xác cho tiếng Nhật và tiếng Hàn.
Tôi có thể phiên âm tiếng Quảng Đông ngay trên máy Mac không?
Có. SenseVoice đạt 7,09% CER với tiếng Quảng Đông, so với 10,41% của Whisper-Large-V3 và mức gần như không dùng được 38,97% của Whisper-Small. Trước SenseVoice, không có cách nào tốt để phiên âm tiếng Quảng Đông ngay trên máy Mac.
SenseVoice có hoạt động trên iPhone không?
Có. Whisper Notes trên iPhone hỗ trợ cùng dàn mô hình như trên Mac — Parakeet V3, Whisper và SenseVoice — nên bạn cũng có thể phiên âm tiếng Trung, Nhật, Hàn và Quảng Đông ngay trên chiếc iPhone của mình.
Dùng thử
SenseVoice có sẵn trong Whisper Notes cho Mac từ v1.5.0 (Direct Download / DMG) trở lên, và trong ứng dụng iPhone hiện tại. Trên Mac, tải mô hình từ Cài đặt → Mô hình phiên âm → SenseVoice Small (~827 MB). Phiên bản Mac yêu cầu Apple Silicon (M1 trở lên).
Nếu bạn đang dùng Parakeet V3 và chủ yếu đọc chính tả bằng tiếng Anh, không cần đổi. SenseVoice dành cho lúc bạn cần tiếng Trung, Nhật, Hàn hoặc Quảng Đông — và muốn có kết quả thật nhanh.
Nhật ký thay đổi đầy đủ: whispernotes.app/changelog
Câu hỏi hoặc góp ý: mac@whispernotes.app