Mistral đã phát hành Voxtral, họ mô hình open-weight đầu tiên của hãng dành cho phiên âm và hiểu âm thanh. Các benchmark chính thức cho thấy khả năng nhận dạng giọng nói đa ngôn ngữ và hỏi đáp trên âm thanh rất mạnh, trong khi hai kích cỡ mô hình lại có yêu cầu phần cứng rất khác nhau. Dưới đây là những gì bản phát hành này thực sự hỗ trợ và lý do Whisper Notes vẫn dùng các mô hình nhỏ hơn, chuyên cho phiên âm, trên phần cứng Apple phổ thông.
Hai mô hình
Mistral đã phát hành hai checkpoint theo giấy phép Apache 2.0 vào tháng 7 năm 2025:
Voxtral Small 24B
- •24 tỷ tham số
- •Phiên âm, dịch, hỏi đáp trên âm thanh và tóm tắt
- •Cửa sổ ngữ cảnh 32k
- •Cần khoảng 55 GB RAM GPU ở bf16/fp16
Voxtral Mini 3B
- •3 tỷ tham số
- •Cùng nhóm tác vụ âm thanh và văn bản trong một checkpoint nhỏ hơn
- •Được định vị chính thức cho triển khai cục bộ và biên (edge)
- •Cần khoảng 9,5 GB RAM GPU ở bf16/fp16
Trọng số mở và giấy phép
Cả hai checkpoint năm 2025 đều là trọng số mở theo giấy phép Apache 2.0. Bạn có thể tự tải về và chạy chúng:
- ✓ Toàn bộ trọng số mô hình được công khai
- ✓ Tự host hoặc tùy biến trong phạm vi giấy phép Apache 2.0
- ✓ Không mất phí API của Mistral khi tự host; bạn vẫn phải trả chi phí điện toán của riêng mình
- ✓ Xử lý âm thanh ngay trên máy chủ của bạn
Nguồn: thông báo phát hành Voxtral của Mistral, model card chính thức của Voxtral Small và model card chính thức của Voxtral Mini.
Benchmark
Bản công bố của Mistral so sánh tỷ lệ lỗi từ (WER) trung bình vĩ mô trên các bộ tiếng Anh dạng ngắn và dạng dài, Mozilla Common Voice, FLEURS và Multilingual LibriSpeech. Trong kết quả FLEURS mà Mistral báo cáo, Voxtral Small vượt Whisper ở mọi tác vụ được đánh giá. WER càng thấp càng tốt:
WER trên FLEURS từ benchmark công bố khi ra mắt của Mistral, đối chiếu với giá API ước tính; cả kết quả benchmark lẫn giá đều có thể thay đổi
FLEURS chỉ là một lát cắt của chất lượng phiên âm. Đây là kết quả do chính nhà cung cấp công bố, vì vậy hãy đối chiếu định nghĩa benchmark đã được công bố và tự thử nghiệm với ngôn ngữ, micro và điều kiện ghi âm của bạn trước khi chọn mô hình.
Voxtral hay Whisper: Nên dùng mô hình nào?
Benchmark chỉ kể một phần câu chuyện. Dưới đây là cách hai họ mô hình so kè nhau trên những yếu tố thực sự quan trọng nếu bạn muốn tự chạy một trong số chúng:
| Voxtral Small | Voxtral Mini | Whisper Large v3 | Whisper Large-v3 Turbo | |
|---|---|---|---|---|
| Ngôn ngữ | 8 ngôn ngữ chính | 8 ngôn ngữ chính | Hơn 100 | Hơn 100 |
| Mã nguồn mở | Có | Có | Có | Có |
| Kích thước mô hình | 24 tỷ tham số; ~55 GB RAM GPU ở bf16/fp16 | 3 tỷ tham số; ~9,5 GB RAM GPU ở bf16/fp16 | 1,55 tỷ tham số | 809M tham số (~1,6 GB) |
| Khả thi trên Mac phổ thông | Không, nếu chạy full precision trên phần cứng thông thường | Có thể, với runtime tương thích; nặng hơn Turbo | Có | Có |
Kết luận: Voxtral Small báo cáo kết quả WER ấn tượng và bổ sung khả năng hiểu âm thanh mà Whisper không nhắm tới. Voxtral Mini là checkpoint được Mistral định vị cho triển khai cục bộ và biên, nhưng model card chính thức của nó vẫn ghi khoảng 9,5 GB RAM GPU ở bf16/fp16. Với một ứng dụng phiên âm cho người dùng phổ thông, Whisper Large-v3 Turbo vẫn dễ đóng gói hơn và phủ nhiều ngôn ngữ hơn hẳn. Đó là lý do Whisper Notes hiện kết hợp Whisper Turbo với Parakeet V3 và SenseVoice thay vì Voxtral.
Chi phí API và tự host
Theo kiểm tra ngày 10 tháng 7 năm 2026, model card của Mistral niêm yết giá đầu vào âm thanh của Voxtral Small ở mức $0.004 mỗi phút. Đầu vào văn bản và văn bản sinh ra được tính phí riêng đối với các yêu cầu hiểu âm thanh. Nếu bạn tự host trọng số Apache 2.0, sẽ không có phí API của Mistral, nhưng bạn phải trả chi phí phần cứng và vận hành.
API của Mistral
Trọng số tự host
Cách hoạt động
Model card chính thức mô tả Voxtral là một backbone mô hình ngôn ngữ đi kèm bộ mã hóa âm thanh và chế độ phiên âm chuyên dụng. Những giới hạn quan trọng của sản phẩm đều rất cụ thể:
1. Kiến trúc đa phương thức
Voxtral nhận cả âm thanh lẫn văn bản trong cùng một hội thoại thay vì chỉ đóng vai trò bộ giải mã giọng nói thành văn bản:
- •Chế độ chuyên dụng cho phiên âm trực tiếp
- •Hỏi đáp trên âm thanh và tóm tắt có cấu trúc
- •Nhiều đầu vào âm thanh và hội thoại âm thanh nhiều lượt
Giới hạn âm thanh dài
Cửa sổ ngữ cảnh 32k hỗ trợ tối đa 30 phút âm thanh cho phiên âm hoặc 40 phút cho các tác vụ hiểu âm thanh rộng hơn.
2. Ngôn ngữ và đánh giá
Mistral liệt kê tám ngôn ngữ chính với khả năng tự động nhận dạng ngôn ngữ:
- •Tiếng Anh, Tây Ban Nha, Pháp, Bồ Đào Nha, Hindi, Đức, Hà Lan và Ý
- •Các benchmark gồm FLEURS, Mozilla Common Voice và Multilingual LibriSpeech
- •Bản công bố cũng đánh giá riêng âm thanh tiếng Anh dạng ngắn và dạng dài
3. Yêu cầu triển khai
Trọng số mở không có nghĩa là mọi checkpoint đều đủ nhỏ cho mọi thiết bị:
- •Voxtral Small cần khoảng 55 GB RAM GPU ở bf16/fp16 theo model card của nó
- •Voxtral Mini là checkpoint 3B dành cho triển khai cục bộ và biên
- •Mistral khuyến nghị dùng vLLM để phục vụ các checkpoint đã phát hành
4. Tính năng chính
Hiểu theo ngữ cảnh
Có thể trả lời câu hỏi và tạo bản tóm tắt trực tiếp từ âm thanh, trong giới hạn ngữ cảnh 32k.
Đa ngôn ngữ
Tự động nhận dạng và phiên âm tám ngôn ngữ chính: tiếng Anh, Tây Ban Nha, Pháp, Bồ Đào Nha, Hindi, Đức, Hà Lan và Ý.
Xử lý tiếng ồn
Bộ đánh giá chính thức bao gồm nhiều tập dữ liệu giọng nói đa dạng, nhưng Mistral không đưa ra bảo đảm chung cho mọi bản ghi nhiều tạp âm.
Triển khai biên
Voxtral Mini là lựa chọn cho môi trường cục bộ và biên. Model card chính thức của nó ghi khoảng 9,5 GB RAM GPU ở bf16/fp16.
5. Kiến trúc
Ba thành phần chính:
- 1. Bộ mã hóa âm thanh: Chuyển dạng sóng thành các biểu diễn âm thanh đã học
- 2. Projector: Ánh xạ biểu diễn âm thanh vào không gian ẩn của mô hình ngôn ngữ
- 3. Backbone mô hình ngôn ngữ: Sinh bản phiên âm, câu trả lời, bản tóm tắt hoặc lệnh gọi công cụ
Thiết kế đó lý giải vì sao Voxtral làm được nhiều hơn phiên âm, nhưng nó cũng phải mang theo phần trọng số mô hình ngôn ngữ lớn hơn nhiều so với một mô hình thuần phiên âm như Whisper Turbo.
Vì sao Whisper Notes vẫn là lựa chọn hợp lý
Voxtral và Whisper Notes giải quyết hai bài toán khác nhau. Voxtral kết hợp phiên âm với hiểu âm thanh; Whisper Notes tập trung vào phiên âm riêng tư, dễ chạy trên phần cứng Apple phổ thông.
Whisper Notes mang lại gì
Quyền riêng tư
- •Xử lý 100% ngoại tuyến
- •Không truyền dữ liệu ra ngoài
- •Không phụ thuộc đám mây
Hiệu năng
- •Công nghệ Whisper, độ chính xác đã được kiểm chứng
- •Tối ưu cho Apple Silicon
- •Kết quả ổn định, đáng tin cậy
Chi phí
- •$6.99 thanh toán một lần cho từng nền tảng; bản Mac kèm bản dùng thử 10.000 từ
- •Không tính phí theo phút
- •Phiên âm không giới hạn
Trải nghiệm người dùng
- •Giao diện đơn giản
- •Cập nhật thường xuyên
- •Cải tiến liên tục
Yêu cầu dung lượng
Ở full precision, Voxtral Small là mô hình cấp máy chủ: model card chính thức ghi khoảng 55 GB RAM GPU. Voxtral Mini được nhắm riêng cho môi trường cục bộ và biên, nhưng card của nó vẫn ghi khoảng 9,5 GB RAM GPU ở bf16/fp16. Trong khi đó, bản tải về của Whisper Turbo trong ứng dụng chỉ khoảng 1,6 GB — phù hợp hơn với sản phẩm Whisper Notes hiện tại.
Whisper Notes dùng Whisper Large-v3 Turbo — mô hình cân bằng giữa hiệu năng, tốc độ và yêu cầu VRAM cho nhu cầu sử dụng hằng ngày. Chúng tôi sẽ nâng cấp lên các mô hình tốt hơn khi chúng xuất hiện với yêu cầu tài nguyên hợp lý.
Voxtral hấp dẫn khi bạn cần hỏi đáp trên âm thanh, tóm tắt, hoặc triển khai tự host trên máy chủ. Whisper Notes hướng đến người dùng cá nhân muốn phiên âm riêng tư và không phải trả phí thuê bao định kỳ.
Điều này có ý nghĩa gì
Voxtral là một bước tiến open-weight quan trọng vượt ra ngoài nhận dạng giọng nói thuần túy, vì nó có thể suy luận trên âm thanh chứ không chỉ phiên âm.
Với nhu cầu phiên âm ngoại tuyến, riêng tư trên Mac và iPhone, các engine chuyên biệt nhỏ hơn vẫn dễ đóng gói và vận hành ổn định hơn.
Muốn so sánh mọi lựa chọn chạy cục bộ? Tất cả các mô hình chuyển giọng nói thành văn bản trên thiết bị — các biến thể Whisper, Parakeet V3, SenseVoice và Voxtral — đều được đặt cạnh nhau trên trang so sánh các mô hình Whisper của chúng tôi.
Câu hỏi thường gặp
Mistral Voxtral là gì?
Voxtral là họ mô hình open-weight của Mistral dành cho phiên âm giọng nói và hiểu âm thanh. Bản phát hành tháng 7 năm 2025 gồm Voxtral Small 24B cho khối lượng công việc cấp máy chủ và Voxtral Mini 3B cho triển khai cục bộ và biên. Cả hai checkpoint đều dùng giấy phép Apache 2.0.
Voxtral có chạy cục bộ trên Mac được không?
Trọng số tải về được có thể tự host, nhưng hai kích cỡ có yêu cầu khác nhau. Voxtral Small cần khoảng 55 GB RAM GPU ở bf16/fp16, nên đây là lựa chọn cấp máy chủ. Voxtral Mini là checkpoint cho môi trường cục bộ và biên; model card của nó ghi khoảng 9,5 GB ở bf16/fp16, còn tốc độ và mức dùng bộ nhớ thực tế trên Mac phụ thuộc vào runtime và mức lượng tử hóa.
Whisper Notes có dùng Voxtral không?
Không. Whisper Notes chạy Parakeet V3 (mô hình mặc định trên Mac), Whisper Large-v3 Turbo và SenseVoice — những mô hình được chọn vì cân bằng giữa hiệu năng, tốc độ và yêu cầu VRAM cho nhu cầu hằng ngày trên Apple Silicon. Chúng tôi sẽ áp dụng các mô hình tốt hơn ngay khi chúng đủ thực tế để chạy trên phần cứng phổ thông.
Voxtral hỗ trợ bao nhiêu ngôn ngữ?
Model card chính thức liệt kê tám ngôn ngữ chính với khả năng tự động nhận dạng: tiếng Anh, Tây Ban Nha, Pháp, Bồ Đào Nha, Hindi, Đức, Hà Lan và Ý. Mistral cũng đánh giá tiếng Ả Rập trong FLEURS, nhưng ngôn ngữ này không nằm trong danh sách ngôn ngữ chính của model card.
Mistral Voxtral được phát hành khi nào?
Mistral phát hành Voxtral vào ngày 15 tháng 7 năm 2025. Các checkpoint Apache 2.0 ban đầu là Voxtral Small 24B và Voxtral Mini 3B.