Whisper Large-v3 Turbo của OpenAI cắt giảm decoder từ 32 lớp xuống 4, đưa số tham số từ 1,55B xuống 809M. Trong các bài kiểm tra của chúng tôi trên Apple Silicon, mô hình phiên âm cùng một đoạn âm thanh nhanh hơn khoảng 5 lần với độ chính xác gần như tương đương. Whisper Notes tích hợp mô hình này trên cả Mac và iPhone.
V3 Turbo vs V3: Điều gì đã thay đổi
Turbo không phải là một kiến trúc mới. Đây chính là mô hình Whisper Large-v3 với decoder được cắt tỉa từ 32 lớp xuống 4, sau đó fine-tune lại để khôi phục độ chính xác. Encoder được giữ nguyên.
| Large-v3 Turbo | Large-v3 | |
|---|---|---|
| Tham số | 809M | 1,55B |
| Số lớp decoder | 4 | 32 |
| Ngôn ngữ | 100+ | 100+ |
| Tác vụ dịch | Không hỗ trợ | Hỗ trợ |
| Giấy phép | MIT | Apache 2.0 |
Phương pháp đo: cùng một tệp âm thanh dài 10 phút được phiên âm trên cùng một bản dựng Whisper Notes cho từng thiết bị nêu tên. Thời gian là số giây thực tế từ lúc bắt đầu phiên âm đến khi có văn bản cuối cùng; giữa V3 và Turbo chỉ có mô hình thay đổi.
Tác vụ dịch đã được loại bỏ một cách chủ đích khỏi dữ liệu huấn luyện của Turbo. Mô hình Large-v3 đầy đủ hỗ trợ tính năng này, nhưng Whisper Notes chỉ dùng Turbo — việc dịch được xử lý riêng thông qua Apple Intelligence.
Mô hình gốc: Whisper Large-v3 là gì?
Whisper Large-v3 là mô hình nhận dạng giọng nói mã nguồn mở chủ lực của OpenAI, phát hành tháng 11 năm 2023. Mô hình có 1,55 tỷ tham số, dùng đầu vào spectrogram 128 mel-bin, được huấn luyện trên 5 triệu giờ âm thanh (1 triệu giờ gắn nhãn yếu + 4 triệu giờ gắn nhãn giả) và hỗ trợ hơn 100 ngôn ngữ. Trên bảng xếp hạng Hugging Face Open ASR Leaderboard, mô hình đạt tỷ lệ lỗi từ (WER) trung bình khoảng 7,4% — mức trần độ chính xác mà Turbo được so sánh xuyên suốt bài viết này. Để xem Large-v3 đứng ở đâu so với mọi mô hình chạy trên thiết bị khác, hãy đọc bảng so sánh các mô hình Whisper của chúng tôi.
Benchmark tốc độ: Whisper Notes trên Apple Silicon
Trong Whisper Notes cho Mac, Turbo chạy qua CoreML trên Neural Engine. Xử lý 10 phút âm thanh:
| Thiết bị | Whisper V3 | V3 Turbo | Tăng tốc |
|---|---|---|---|
| iPhone 15 Pro | 425 s | 82 s | 5,2× |
| iPad Pro M2 | 380 s | 71 s | 5,4× |
| MacBook Pro M2 | 316 s | 63 s | 5,0× |
Mức tăng tốc 5× là đặc thù của Whisper Notes trên Apple Silicon, nơi decoder nhỏ hơn hưởng lợi từ tối ưu hóa Neural Engine. Trên GPU với các framework như faster-whisper, khoảng cách thu hẹp còn ~2,7× (xem benchmark cộng đồng bên dưới).
Độ chính xác: So sánh WER
Hugging Face Open ASR Leaderboard kiểm tra cả hai mô hình trên cùng các bộ dữ liệu tiếng Anh. Tỷ lệ lỗi từ của Turbo chỉ chênh chưa đến nửa điểm so với V3 trên mọi benchmark:
| Bộ dữ liệu | WER V3 Turbo | WER V3 |
|---|---|---|
| LibriSpeech Clean | 2,10% | 2,01% |
| LibriSpeech Other | 4,24% | 3,91% |
| GigaSpeech | 10,14% | 10,02% |
| Earnings22 | 11,63% | 11,29% |
| AMI | 16,13% | 15,95% |
| WER trung bình | 7,83% | 7,44% |
V3 chính xác hơn một chút trên mọi bộ dữ liệu, nhưng khoảng cách rất nhỏ — trung bình 0,39 điểm phần trăm. Với hầu hết các bản phiên âm thực tế, bạn sẽ không nhận ra sự khác biệt.
Trên bài đánh giá âm thanh dài YouTube-commons (một trong những benchmark ASR mã nguồn mở lớn nhất), Turbo đạt 13,40% WER so với 13,20% của V3 — trong khi chạy ở hệ số thời gian thực 129,5× so với 55,3×. Tức là nhanh hơn 2,3 lần với độ chính xác gần như giống hệt trên âm thanh thực tế.
Turbo chính xác đến đâu với tiếng Hàn, tiếng Nga và các ngôn ngữ khác?
Các benchmark ở trên là tiếng Anh. Theo model card của OpenAI, decoder 4 lớp đã cắt tỉa của Turbo làm giảm độ chính xác ở các ngôn ngữ ngoài tiếng Anh nhiều hơn một chút so với tiếng Anh, với mức suy giảm lớn nhất ở các ngôn ngữ ít tài nguyên. Với tiếng Nga và hầu hết các ngôn ngữ châu Âu, Turbo vẫn bám sát Large-v3 đầy đủ — và nếu bạn dùng Whisper Notes, Parakeet V3 hỗ trợ tiếng Nga cùng 24 ngôn ngữ châu Âu khác với tốc độ gấp 10 lần Whisper.
Với tiếng Hàn, tiếng Nhật, tiếng Trung và tiếng Quảng Đông, một mô hình chuyên dụng vừa nhanh hơn vừa chấm câu tốt hơn: SenseVoice phiên âm CJK ở tốc độ 52 lần thời gian thực. Whisper Notes cung cấp SenseVoice song song với Turbo trên cả Mac và iOS, nên bạn có thể chọn đúng mô hình cho từng ngôn ngữ thay vì ép tất cả qua một mô hình duy nhất.
Benchmark cộng đồng: GPU và CPU
Các benchmark độc lập từ cộng đồng faster-whisper và whisper.cpp cho kết quả nhất quán trên nhiều loại phần cứng. Phiên âm 13 phút âm thanh với faster-whisper trên GPU:
| Mô hình | Độ chính xác số | Thời gian | Bộ nhớ GPU | WER |
|---|---|---|---|---|
| Large-v3 Turbo | fp16 | 19,2 s | 2.537 MB | 1,92% |
| Large-v3 | fp16 | 52,0 s | 4.521 MB | 2,88% |
| Large-v3 Turbo | int8 | 19,6 s | 1.545 MB | 1,92% |
| Distil-Large-v3 | fp16 | 26,1 s | 2.409 MB | 2,39% |
Nguồn: benchmark faster-whisper trên GPU NVIDIA, tập validation LibriSpeech clean. Turbo int8 chỉ dùng 1,5 GB VRAM — vừa vặn trên GPU 2 GB.
Suy luận theo lô trên RTX 3060 Laptop (6 GB VRAM, độ chính xác int8) còn đẩy lợi thế đi xa hơn:
| Mô hình | Tuần tự | Theo lô (10) | WER theo lô |
|---|---|---|---|
| Large-v3 Turbo | 46,1 s | 18,7 s | 7,7% |
| Large-v3 | 230,8 s | 43,0 s | 7,9% |
| Large-v2 | 178,3 s | 43,2 s | 8,8% |
| Medium | 113,3 s | 26,3 s | 8,9% |
Nguồn: benchmark NilaierMusic, Intel i7-12650H + RTX 3060 Laptop 6 GB, âm thanh tiếng Pháp, độ chính xác int8.
Với xử lý theo lô, Turbo đạt WER tốt nhất trong mọi mô hình được thử nghiệm (7,7%) đồng thời là mô hình nhanh nhất. Đây rõ ràng là điểm cân bằng lý tưởng cho môi trường production.
Turbo vs Medium vs mọi kích cỡ mô hình Whisper
Trước khi có Turbo, Medium là lựa chọn thỏa hiệp quen thuộc: độ chính xác chấp nhận được ở tốc độ chịu đựng được. Turbo khiến sự đánh đổi đó trở nên lỗi thời — với 809M tham số, nó chỉ nhỉnh hơn Medium (769M) một chút nhưng mang lại độ chính xác cỡ large ở tốc độ nhanh gấp nhiều lần. Dưới đây là toàn bộ họ mô hình đặt cạnh nhau:
| Mô hình | Tham số | Dung lượng đĩa | Tốc độ tương đối | Mức độ chính xác |
|---|---|---|---|---|
| tiny | 39M | ~75 MB | ~10× | Thấp nhất |
| base | 74M | ~142 MB | ~7× | Thấp |
| small | 244M | ~466 MB | ~4× | Trung bình |
| medium | 769M | ~1,5 GB | ~2× | Cao |
| large-v3 | 1,55B | ~2,9 GB | 1× (chuẩn so sánh) | Cao nhất |
| large-v3-turbo | 809M | ~1,6 GB | ~5× trên Apple Silicon | Gần cao nhất |
Phát hành ngày 30 tháng 9 năm 2024, Turbo có 809M tham số. Nếu trước đây bạn chọn Medium để tiết kiệm dung lượng hoặc tăng tốc, thì giờ Turbo vượt nó cả về độ chính xác lẫn tốc độ với dung lượng gần như tương đương.
Hạn chế đã biết (và cách Whisper Notes xử lý)
Không có tính năng dịch tích hợp
Turbo được huấn luyện không có dữ liệu dịch. Nó chỉ phiên âm bằng ngôn ngữ gốc — khác với Large-v3 vốn hỗ trợ dịch âm thanh sang tiếng Anh.
Whisper Notes — Apple Intelligence tự động dịch bản phiên âm sang ngôn ngữ bạn chọn, cho bạn đầu ra song ngữ bất kể bạn dùng mô hình nào.
Ảo giác nhiều hơn với âm thanh nhiễu
Báo cáo từ cộng đồng cho thấy Turbo sinh ảo giác nhiều hơn V3 trên các đoạn clip rất ngắn hoặc bản ghi nhiễu. Điều này dễ hiểu với decoder đã thu gọn (4 lớp so với 32).
Whisper Notes — chạy Pyannote VAD trước khi phiên âm, phát hiện các đoạn có giọng nói và loại bỏ khoảng lặng/tạp âm để mô hình chỉ xử lý giọng nói thực.
Bạn nên dùng mô hình nào?
| Tiếng Anh / châu Âu | Parakeet V3 — nhanh gấp 10 lần Whisper, độ chính xác tốt hơn |
| Tiếng Trung / Nhật / Hàn | SenseVoice — chuyên cho CJK, tốc độ 52× |
| Ngôn ngữ khác | Whisper Large V3 Turbo — hơn 100 ngôn ngữ, độ chính xác cao, chậm hơn |
FAQ về Whisper Large-v3 Turbo
Whisper Large-v3 và Large-v3 Turbo khác nhau thế nào?
Large-v3 Turbo giữ nguyên encoder của Large-v3 nhưng giảm decoder từ 32 lớp xuống 4. Nhờ vậy nó nhanh hơn nhiều mà độ chính xác phiên âm vẫn bám sát Large-v3. Đánh đổi là Turbo không hỗ trợ tác vụ dịch tích hợp của Whisper.
faster-whisper có hỗ trợ Large-v3 Turbo không?
Có. faster-whisper hỗ trợ Large-v3 Turbo thông qua bản chuyển đổi CTranslate2, và các benchmark cộng đồng cho thấy Turbo là lựa chọn mạnh khi VRAM hạn chế. Trong benchmark ở trên, Turbo int8 dùng khoảng 1,5 GB VRAM.
whisper.cpp có hỗ trợ Large-v3 Turbo không?
Có. whisper.cpp có thể chạy các phiên bản GGML/GGUF đã chuyển đổi của Whisper Large-v3 Turbo. Nếu bạn tự dựng pipeline phiên âm cục bộ, Turbo thường dễ vừa vặn trên phần cứng phổ thông hơn Large-v3 đầy đủ.
Tải openai/whisper-large-v3-turbo ở đâu?
Trọng số mô hình chính thức được OpenAI phát hành trên Hugging Face. Người dùng Whisper Notes không cần tải thủ công: ứng dụng Mac tự xử lý việc thiết lập mô hình cục bộ ngay trong giao diện.
Muốn so sánh tất cả các lựa chọn cục bộ? Mọi mô hình chuyển giọng nói thành văn bản trên thiết bị — các biến thể Whisper, Parakeet V3, SenseVoice và Voxtral — được đặt cạnh nhau trên trang so sánh các mô hình Whisper của chúng tôi. Mới làm quen với Whisper? Hãy bắt đầu với Hướng dẫn phiên âm bằng Whisper — mô hình là gì, mọi cách chạy nó và chi phí ra sao.