SenseVoice: Phiên âm tiếng Trung, Nhật & Hàn nhanh hơn 52× trên Mac

12 tháng 5, 2026
·
7 min read
·Whisper Notes Team

TL;DR — So sánh ba mô hình chạy trên thiết bị

Parakeet V3 SenseVoice Small Whisper Large V3 Turbo
5 phút tiếng Anh 2,91s (103×) 5,8s (52×) 20,92s (14,3×)
27 phút tiếng Trung 10,10s (161×) 13,83s (118×) 2 phút 4s (13,1×)
Ngôn ngữ 25 (châu Âu) 5 (zh, en, ja, ko, yue) 100+
Dung lượng tải 465 MB 827 MB ~1,6 GB
Bộ nhớ ~800 MB ~700 MB ~1,6 GB
Phù hợp nhất Tiếng Anh & châu Âu Tiếng Trung, Nhật, Hàn, Quảng Đông Mọi ngôn ngữ còn lại (100+)

* Benchmark tốc độ trên Apple M4 Pro, 32 GB. Podcast tiếng Anh 5 phút và podcast tiếng Trung 27 phút. Hệ số thời gian thực = thời lượng âm thanh ÷ thời gian xử lý (càng cao càng nhanh). Số liệu đo trên phiên bản Mac; SenseVoice cũng có sẵn trên iPhone.

Bắt đầu từ phiên bản 1.5.0 (Direct Download / DMG), Whisper Notes cho Mac tích hợp SenseVoice Small làm engine chuyên dụng để phiên âm tiếng Trung, Nhật, Hàn và Quảng Đông. Nó thay thế Qwen3-ASR và chạy trên GPU của Apple thông qua MLX thay vì CPU — xử lý một podcast tiếng Trung 27 phút trong 13,83 giây thay vì 3 phút 44 giây.

Tại sao chúng tôi thay thế Qwen3-ASR

Qwen3-ASR là một mô hình tốt. Nó hỗ trợ 30 ngôn ngữ cùng 22 phương ngữ tiếng Trung, và độ chính xác tiếng Trung gần đạt mức hàng đầu. Nhưng nó có một vấn đề ngày càng tệ khi âm thanh dài hơn: tốc độ.

Qwen3 dùng kiến trúc tự hồi quy — cùng cách tiếp cận như Whisper, xử lý âm thanh từng khung một, không bao giờ nhảy cóc. Với podcast tiếng Trung 27 phút, nó mất 224 giây. Dùng được, nhưng không phải trải nghiệm kết quả tức thì mà Parakeet V3 mang lại cho tiếng Anh.

Vấn đề sâu hơn nằm ở hạ tầng của chúng tôi. Tích hợp Qwen3 dùng sherpa-onnx, một thư viện C với wrapper Swift dài 2.249 dòng, đẩy toàn bộ tính toán qua nhân CPU. GPU của Mac ngồi không trong khi CPU gánh hết việc.

SenseVoice giải quyết cả hai vấn đề. Kiến trúc phi tự hồi quy cho tốc độ. Apple MLX cho tăng tốc GPU. Kết quả: nhanh hơn 16,2 lần trên cùng phần cứng, với codebase giảm từ 2.249 dòng xuống 288.

Benchmark

Cả ba mô hình chạy trên cùng một chiếc Apple M4 Pro, cùng file âm thanh, cùng điều kiện. Không cloud. Không internet. Chỉ có silicon.

Mô hình 5 phút tiếng Anh 27 phút tiếng Trung Tốc độ (RTFx)
Parakeet V3 2,91s 10,10s 103–161×
SenseVoice Small 5,8s 13,83s 52–118×
Whisper Large V3 Turbo 20,92s 2 phút 4s 13–14×
Qwen3-ASR (đã gỡ bỏ) 224s 7,2×

SenseVoice chậm hơn Parakeet V3 khoảng một nửa — nhưng vẫn nhanh khủng khiếp. Một podcast 27 phút xong trong chưa đầy 14 giây. Bạn nhấn nút phiên âm, chờ đúng một nhịp thở, và văn bản đã ở đó.

So sánh với 2 phút 4 giây của Whisper, hay 3 phút 44 giây của Qwen3 cũ. Kiến trúc quan trọng hơn số lượng tham số.

Bảng so sánh tốc độ suy luận chính thức từ bài báo FunAudioLLM: SenseVoice-Small (70ms cho 10s âm thanh) vs Whisper-Small (518ms) vs Whisper-Large-V3 (1281ms) - hiển thị kiến trúc mô hình, tham số, ngôn ngữ hỗ trợ, RTF và độ trễ

Benchmark suy luận chính thức từ bài báo FunAudioLLM: SenseVoice-Small xử lý 10s âm thanh trong 70ms (GPU A800). Whisper-Large-V3 mất 1.281ms. Chênh lệch 18 lần về độ trễ suy luận thuần.

Mô hình Thời gian nạp Bộ nhớ Dung lượng tải
Parakeet V3 0,77s ~800 MB 465 MB
SenseVoice Small 0,81s ~700 MB 827 MB
Whisper Small 1,03s ~487 MB 600 MB
Whisper Large V3 Turbo 3,18s ~1,6 GB ~1,6 GB

* Thời gian nạp và bộ nhớ đo trên Apple M4 Pro, 32 GB.

SenseVoice nạp trong chưa đầy một giây và dùng ít bộ nhớ hơn Parakeet. Trên Mac 8 GB, nó chạy thoải mái bên cạnh các ứng dụng khác của bạn.

Tại sao SenseVoice nhanh hơn: Kiến trúc + Runtime

Khoảng cách tốc độ giữa Qwen3-ASR và SenseVoice đến từ hai yếu tố độc lập.

Yếu tố 1: Kiến trúc mô hình. Qwen3-ASR là mô hình tự hồi quy — sinh văn bản từng token một, token sau phụ thuộc vào token trước. SenseVoice dùng bộ mã hóa phi tự hồi quy (NAR) xử lý toàn bộ âm thanh song song. Chỉ riêng khác biệt kiến trúc này đã khiến SenseVoice nhanh hơn về bản chất, bất kể bạn chạy trên phần cứng nào.

Yếu tố 2: Runtime. Tích hợp Qwen3-ASR của chúng tôi dùng sherpa-onnx, chạy trên CPU. SenseVoice chạy qua Apple MLX, đưa tính toán sang GPU. Qwen3 có thể chạy trên MLX không? Có — nhưng vẫn sẽ chậm hơn SenseVoice, vì nút thắt tự hồi quy nằm ở kiến trúc chứ không phải runtime.

Qwen3-ASR (cũ) SenseVoice (mới)
Kiến trúc Tự hồi quy (từng token) Phi tự hồi quy (song song)
Runtime sherpa-onnx (CPU) Apple MLX (GPU)
27 phút tiếng Trung 224 giây 13,83 giây
Tăng tốc tổng hợp mốc so sánh Nhanh hơn 16,2 lần
Codebase Framework C 168 MB + 2.249 dòng Swift 288 dòng Swift Actor

* Cùng podcast tiếng Trung 27 phút, Apple M4 Pro. Mức tăng tốc 16,2 lần kết hợp cả cải tiến kiến trúc (NAR vs AR) lẫn runtime (GPU vs CPU).

Code cũng đơn giản hơn. Bản triển khai SenseVoice mới là một Swift Actor 288 dòng nói chuyện trực tiếp với MLX, thay thế framework C nặng 168 MB. Ít code hơn, ít bug hơn, ứng dụng nhỏ hơn.

Năm ngôn ngữ, làm thật tốt

SenseVoice không cố gắng làm tất cả. Nó xử lý năm ngôn ngữ:

Ngôn ngữ SenseVoice-Small Whisper-Large-V3 Bên thắng
Tiếng Trung (zh-CN) 10,78% CER 12,55% CER SenseVoice (-14%)
Tiếng Quảng Đông (yue) 7,09% CER 10,41% CER SenseVoice (-32%)
Tiếng Nhật (ja) 11,96% CER 10,34% CER Whisper (nhỉnh hơn)
Tiếng Hàn (ko) 8,28% CER 5,59% CER Whisper
Tiếng Anh (en) 14,71% WER 9,39% WER Whisper (nên dùng Parakeet)

* Benchmark CommonVoice, CER = tỷ lệ lỗi ký tự, WER = tỷ lệ lỗi từ. Càng thấp càng tốt. Nguồn: bài báo FunAudioLLM (2024). Độ trễ suy luận của SenseVoice-Small: 70ms cho 10s âm thanh (GPU A800), nhanh gấp hơn 15 lần Whisper-Large-V3.

So sánh độ chính xác SenseVoice vs Whisper trên benchmark CommonVoice cho tiếng Trung, Quảng Đông, Anh, Nhật, Hàn và 25 ngôn ngữ khác - biểu đồ cột WER/CER

Benchmark CommonVoice: SenseVoice-Small (vàng) vs Whisper-Small (xanh dương) vs Whisper-Large-V3 (cam). Càng thấp càng tốt. Nguồn: bài báo FunAudioLLM

Những con số kể một câu chuyện trung thực. SenseVoice vượt Whisper về độ chính xác tiếng Trung và tiếng Quảng Đông với cách biệt đáng kể, trong khi Whisper chính xác hơn cho tiếng Nhật, Hàn và Anh. Nhưng SenseVoice nhanh gấp hơn 15 lần Whisper-Large-V3. Với hầu hết nhu cầu thực tế, chênh lệch tốc độ quan trọng hơn vài điểm phần trăm độ chính xác.

Kết quả tiếng Quảng Đông đáng được nhấn mạnh riêng. Whisper-Small đạt 38,97% CER với tiếng Quảng Đông — gần như không dùng được. Ngay cả Whisper-Large-V3 cũng chỉ đạt 10,41%. SenseVoice đạt 7,09%. Trước SenseVoice, không có cách nào tốt để phiên âm tiếng Quảng Đông ngay trên máy Mac. Nếu bạn nói tiếng Quảng Đông, mô hình này sinh ra dành cho bạn.

Kết quả phiên âm tiếng Hàn bằng SenseVoice trong Whisper Notes cho Mac, hiển thị văn bản tiếng Hàn chính xác từ một video

Phiên âm tiếng Hàn với SenseVoice: nhập video kèm phụ đề có mốc thời gian

Thử nghiệm thực tế: Podcast tiếng Trung 27 phút

Chúng tôi phiên âm một tập 27 phút của Thirteen Invitations (十三邀), một podcast phỏng vấn tiếng Trung, bằng cả SenseVoice và Whisper Large V3 Turbo trên cùng chiếc M4 Pro. ElevenLabs Scribe (cloud) được dùng làm tham chiếu. Hai mô hình trên thiết bị mắc số lỗi xấp xỉ nhau, nhưng khác nhau về loại lỗi:

SenseVoice Whisper Large V3
Thời gian 13,83s 2 phút 4s
Số lỗi (mẫu 5 phút) ~15–20 ~12–15
Lỗi tệ nhất 时差→食堂 (múi giờ→nhà ăn) 西昌→西藏 (thành phố Tây Xương→Tây Tạng, lệch 4.000 km)
Kiểu lỗi Nhầm từ đồng âm Lỗi địa lý/dữ kiện

* So sánh thủ công với ElevenLabs Scribe (tham chiếu cloud, cũng không hoàn hảo). Cả hai mô hình trên thiết bị đều viết đúng "根深蒂固" trong khi Scribe viết sai.

Độ chính xác tương đương. Nhanh hơn 9 lần. Với việc phiên âm tiếng Trung ngoài đời thực, SenseVoice trả cho bạn một bản ghi dùng được trước cả khi Whisper nạp xong.

Khi nào dùng mô hình nào

Whisper Notes cho Mac hiện đi kèm bốn mô hình giọng nói. Mỗi mô hình được tối ưu cho các tình huống khác nhau:

Bạn cần... Dùng mô hình này Lý do
Tiếng Anh hoặc ngôn ngữ châu Âu, tốc độ tối đa Parakeet V3 103× thời gian thực, tỷ lệ lỗi thấp nhất. Lựa chọn mặc định.
Tiếng Trung, Nhật, Hàn hoặc Quảng Đông SenseVoice Small 52–118× thời gian thực. Mô hình duy nhất hỗ trợ tiếng Quảng Đông.
Bất kỳ ngôn ngữ nào trong hơn 100 ngôn ngữ (Ả Rập, Thái, Nga, v.v.) Whisper Large V3 Turbo Hỗ trợ ngôn ngữ rộng nhất. Chậm hơn nhưng đa năng.
Dùng ít bộ nhớ hơn (Mac đời cũ) Whisper Small 487 MB bộ nhớ. Hợp với Mac 8 GB đang chạy nhiều ứng dụng khác.
Bộ chọn mô hình của Whisper Notes cho Mac hiển thị Parakeet V3, SenseVoice Small, Whisper Small và Whisper Large V3 Turbo cùng dung lượng tải và ngôn ngữ hỗ trợ

Cài đặt → Mô hình phiên âm: chọn đúng engine cho ngôn ngữ của bạn

Bộ chọn mô hình trong Cài đặt hiển thị cả bốn tùy chọn kèm dung lượng tải, số ngôn ngữ và yêu cầu bộ nhớ. SenseVoice được tải về khi dùng lần đầu (~827 MB) và nằm lại trên thiết bị của bạn.

Những đánh đổi

SenseVoice không phải mô hình vạn năng. Đây là những gì nó không làm được:

Chỉ 5 ngôn ngữ. Nếu bạn cần tiếng Thái, Nga, Ả Rập, Hindi hay một ngôn ngữ khác ngoài trọng tâm CJK của SenseVoice, hãy tiếp tục dùng Whisper.

Cập nhật: SenseVoice ban đầu chỉ có trên Mac thông qua Apple MLX, nhưng nay đã có mặt trên cả iPhone — iOS hỗ trợ cùng dàn mô hình như Mac: Parakeet V3, Whisper và SenseVoice.

Hiện tượng lạ với âm thanh nhỏ. Với các đoạn rất ngắn hoặc rất nhỏ tiếng, SenseVoice đôi khi trả về tiếng Trung bất kể ngôn ngữ đã chọn. Đặt ngôn ngữ thủ công (thay vì "Tự động") giúp giảm hiện tượng này.

Không có streaming. Khác với chế độ streaming của Whisper, SenseVoice xử lý toàn bộ âm thanh sau khi ghi xong. Với file dài, nó tự chia đoạn tại các điểm im lặng và hiển thị kết quả dần dần.

Đây là ràng buộc kiến trúc, không phải bug. Một mô hình được huấn luyện cho 5 ngôn ngữ làm 5 ngôn ngữ đó cực kỳ tốt. Độ phủ hơn 100 ngôn ngữ của Whisper đi kèm tốc độ chậm hơn và độ chính xác không đồng đều giữa các ngôn ngữ.

Muốn so sánh tất cả các lựa chọn chạy cục bộ? Mọi mô hình chuyển giọng nói thành văn bản trên thiết bị — các biến thể Whisper, Parakeet V3, SenseVoice và Voxtral — được đặt cạnh nhau trên trang so sánh các mô hình Whisper của chúng tôi. Mới làm quen với Whisper? Hãy bắt đầu từ Hướng dẫn phiên âm với Whisper — mô hình này là gì, mọi cách để chạy nó và chi phí bao nhiêu.

Câu hỏi thường gặp

Giải pháp thay thế Whisper nhanh nhất để phiên âm tiếng Trung, Nhật và Hàn là gì?

SenseVoice Small, có sẵn trong Whisper Notes trên cả Mac và iPhone. Trong bài test trên Mac M4 Pro, nó phiên âm một podcast tiếng Trung 27 phút trong 13,83 giây (52–118× thời gian thực), trong khi Whisper Large V3 Turbo mất hơn 2 phút cho cùng file đó.

SenseVoice có tốt hơn Whisper cho tiếng Trung không?

Với tiếng Trung và tiếng Quảng Đông thì có. Trên benchmark CommonVoice, SenseVoice đạt 10,78% CER cho tiếng Trung so với 12,55% của Whisper-Large-V3, và nhanh gấp hơn 15 lần. Whisper vẫn nhỉnh hơn đôi chút về độ chính xác cho tiếng Nhật và tiếng Hàn.

Tôi có thể phiên âm tiếng Quảng Đông ngay trên máy Mac không?

Có. SenseVoice đạt 7,09% CER với tiếng Quảng Đông, so với 10,41% của Whisper-Large-V3 và mức gần như không dùng được 38,97% của Whisper-Small. Trước SenseVoice, không có cách nào tốt để phiên âm tiếng Quảng Đông ngay trên máy Mac.

SenseVoice có hoạt động trên iPhone không?

Có. Whisper Notes trên iPhone hỗ trợ cùng dàn mô hình như trên Mac — Parakeet V3, Whisper và SenseVoice — nên bạn cũng có thể phiên âm tiếng Trung, Nhật, Hàn và Quảng Đông ngay trên chiếc iPhone của mình.

Dùng thử

SenseVoice có sẵn trong Whisper Notes cho Mac từ v1.5.0 (Direct Download / DMG) trở lên, và trong ứng dụng iPhone hiện tại. Trên Mac, tải mô hình từ Cài đặt → Mô hình phiên âm → SenseVoice Small (~827 MB). Phiên bản Mac yêu cầu Apple Silicon (M1 trở lên).

Nếu bạn đang dùng Parakeet V3 và chủ yếu đọc chính tả bằng tiếng Anh, không cần đổi. SenseVoice dành cho lúc bạn cần tiếng Trung, Nhật, Hàn hoặc Quảng Đông — và muốn có kết quả thật nhanh.

Tải cho Mac

Nhật ký thay đổi đầy đủ: whispernotes.app/changelog

Câu hỏi hoặc góp ý: mac@whispernotes.app