Từ macOS 26 và iOS 26, Apple đã cung cấp một thế hệ nhận dạng giọng nói mới chạy trên thiết bị — SpeechAnalyzer và SpeechTranscriber, dưới đây gọi tắt là Apple Speech. Công cụ này chính xác hơn rõ rệt so với hệ thống đọc chính tả cũ. Vì vậy, bọn mình muốn biết: tính năng nhận dạng giọng nói tích hợp của Apple hiện đã đủ tốt để bạn có thể bỏ hẳn ứng dụng phiên âm chưa? Và nó còn cách các mô hình mở chạy trên thiết bị trong Whisper Notes — Whisper, Parakeet, SenseVoice và Qwen3-ASR — bao xa? Bọn mình đã tiến hành một phép thử nghiêm ngặt. Đây là kết quả. Trong mười ngôn ngữ bọn mình đã thử, Apple Speech chưa bao giờ có tỷ lệ lỗi thấp nhất, cách công cụ dẫn đầu không quá 1,5 điểm ở tiếng Hàn, tiếng Nhật và tiếng Trung, và hoàn toàn không có mô hình cho tiếng Hà Lan, tiếng Nga hay tiếng Ba Lan.
Apple Speech còn cách các mô hình bạn tải về bao xa?
| Ngôn ngữ | Apple Speech | Qwen3-ASR | Whisper Large | Whisper Small | Parakeet | SenseVoice |
|---|---|---|---|---|---|---|
| Tiếng Anh | 8,80 | 4,49 | 5,49 | 7,04 | 6,89 | 8,46 |
| Tiếng Đức | 6,26 | 2,85 | 4,05 | 8,67 | 6,26 | — |
| Tiếng Hà Lan | — | 7,36 | 5,69 | 16,75 | 8,58 | — |
| Tiếng Nga | — | 5,65 | 5,13 | 11,37 | 7,12 | — |
| Tiếng Ba Lan | — | 12,59 | 5,45 | 15,81 | 8,30 | — |
| Tiếng Nhật | 6,36 | 5,74 | 5,30 | 11,37 | — | 6,78 |
| Tiếng Hàn | 4,31 | 3,54 | 4,25 | 7,30 | — | 7,85 |
| Tiếng Pháp | 7,61 | 4,57 | 5,97 | 13,24 | 5,83 | — |
| Tiếng Trung | 7,97 | 6,49 | 7,97 | 20,50 | — | 7,69 |
| Tiếng Tây Ban Nha (Mỹ Latinh) | 5,41 | 3,38 | 3,62 | 6,22 | 4,86 | — |
Mười trong số những ngôn ngữ được sử dụng nhiều nhất, mỗi cột là một công cụ. Mỗi ô là tỷ lệ lỗi của công cụ đó, càng thấp càng tốt; màu xanh lá đánh dấu giá trị thấp nhất trong hàng, màu trắng là thấp thứ hai. Dùng CER cho tiếng Nhật, tiếng Hàn và tiếng Trung, WER cho các ngôn ngữ còn lại; không bao giờ gộp thành một con số. Lần chạy FLEURS do nhóm Whisper Notes thực hiện, trên một chiếc M5 MacBook Air, với giọng đọc.
Tên ngắn: Qwen3-ASR = Qwen3-ASR 1.7B, Whisper Large = Whisper Large V3 Turbo, Parakeet = Parakeet V3, SenseVoice = SenseVoice Small. Dấu gạch ngang có nghĩa là công cụ không có mô hình cho ngôn ngữ đó.
Qwen3-ASR 1.7B đã có tỷ lệ lỗi thấp nhất ở sáu trong mười ngôn ngữ, Whisper Large V3 Turbo đã dẫn đầu bốn ngôn ngữ còn lại. Apple Speech đã kém công cụ dẫn đầu hàng 0,77 điểm ở tiếng Hàn, 1,06 ở tiếng Nhật và 1,48 ở tiếng Trung, nơi nó ngang với Whisper Large V3 Turbo ở 7,97. Trong bảy ngôn ngữ mà công cụ này hỗ trợ, nó đã xếp sau công cụ dẫn đầu hàng từ 0,8 đến 4,3 điểm, xa nhất ở tiếng Anh: 8,80 so với 4,49. Tiếng Hà Lan, tiếng Ba Lan và tiếng Nga không có kết quả Apple Speech.
Apple Speech hỗ trợ những ngôn ngữ nào?
Apple Speech đã trả kết quả cho 21 trong số 83 cấu hình ngôn ngữ ở lần chạy này. Cả hai mô hình Whisper đều hỗ trợ toàn bộ 83, Qwen3-ASR 1.7B hỗ trợ 30 và Parakeet V3 hỗ trợ 25. Trong mười ngôn ngữ trên, công cụ này không có mô hình cho tiếng Hà Lan, tiếng Ba Lan hay tiếng Nga. Không có danh sách cố định để trích dẫn: tài nguyên ngôn ngữ thuộc về macOS, nên ứng dụng phải hỏi trong thời gian chạy xem một máy cụ thể có những ngôn ngữ nào.
| Ngôn ngữ | Apple Speech | Qwen3-ASR | Whisper Large | Whisper Small | Parakeet | SenseVoice |
|---|---|---|---|---|---|---|
| Tiếng Ý | 4,39 | 2,58 | 2,58 | 7,64 | 3,43 | — |
| Tiếng Quảng Đông | 8,69 | 6,44 | 36,75 | 119,01 | — | 37,23 |
| Tiếng Bồ Đào Nha (Brasil) | 9,35 | 5,17 | 5,44 | 8,61 | 6,49 | — |
| Tiếng Hindi | 101,50 | 13,19 | 29,64 | 61,26 | — | — |
| Tiếng Telugu | 101,63 | — | 81,74 | 103,19 | — | — |
| Tiếng Urdu | 101,69 | — | 23,39 | 38,83 | — | — |
| Tiếng Punjabi | 101,75 | — | 92,05 | 103,40 | — | — |
| Tiếng Bengali | 102,00 | — | 83,52 | 117,37 | — | — |
| Tiếng Nepali | 102,13 | — | 88,59 | 118,84 | — | — |
| Tiếng Malayalam | 102,18 | — | 107,34 | 167,16 | — | — |
| Tiếng Marathi | 102,23 | — | 82,69 | 109,95 | — | — |
| Tiếng Kannada | 103,83 | — | 72,07 | 116,10 | — | — |
| Tiếng Gujarati | 104,52 | — | 75,31 | 108,91 | — | — |
| Tiếng Tamil | 113,01 | — | 71,28 | 79,77 | — | — |
Mười bốn ngôn ngữ khác mà Apple Speech đã trả kết quả, sắp xếp theo tỷ lệ lỗi của chính nó. Cột, màu sắc và tên ngắn giống như trên; đối với tiếng Quảng Đông sử dụng CER, còn lại là WER. Một tỷ lệ lỗi có thể vượt quá 100% vì việc chèn thêm được tính vào tử số.
Ở mười một hàng cuối, từ tiếng Hindi đến tiếng Tamil, Apple Speech đã trả lời bằng chữ Latin phiên âm thay vì hệ chữ bản địa. Vì vậy, tỷ lệ lỗi ở đó đo sự không khớp về hệ chữ chứ không phải độ chính xác nhận dạng, và các ô đó không được tính vào xếp hạng trong hàng; giá trị của các mô hình khác ở những hàng này là phép đo thông thường.
SpeechAnalyzer hoạt động như thế nào
Apple đã có API nhận dạng giọng nói từ iOS 10. API đó, SFSpeechRecognizer, là công cụ đứng sau luồng đọc chính tả cũ. SpeechAnalyzer thay thế nó, được giới thiệu trong macOS 26 và iOS 26, đồng thời có trên mọi nền tảng Apple ngoại trừ watchOS.
API này xoay quanh một phiên làm việc. Bạn tạo một SpeechAnalyzer, cung cấp cho nó một hoặc nhiều mô-đun rồi đưa âm thanh vào; SpeechTranscriber là mô-đun chuyển lời nói thành văn bản. Âm thanh đi vào dưới dạng một chuỗi bất đồng bộ do bạn tự điền, kết quả trở về dưới dạng chuỗi thứ hai, và hai chuỗi thường chạy trên các tác vụ khác nhau. Bộ phân tích chỉ nhận một chuỗi đầu vào tại một thời điểm. Mọi bộ đệm và mọi kết quả đều có mã thời gian theo dòng thời gian riêng của âm thanh, nên kết quả có thể được đặt lại đúng vị trí ban đầu.
Một phiên, ba tác vụ: âm thanh đi vào dưới dạng AsyncSequence, SpeechAnalyzer và SpeechTranscriber phân tích nó, còn kết quả trở về dưới dạng AsyncSequence thứ hai để giao diện đọc. Nguồn: Apple, phiên 277 của WWDC25.
Kết quả được gửi về hai lần. Mọi nội dung nằm trong vùng mà Apple gọi là phạm vi khả biến vẫn có thể được thay bằng kết quả tốt hơn; mọi nội dung bên ngoài vùng đó là kết quả cuối cùng. Nhờ vậy, ứng dụng có thể hiển thị bản chép thô khi bạn vẫn đang nói rồi sửa lại sau đó.
Apple nêu năm mục tiêu thiết kế cho mô hình SpeechTranscriber: âm thanh dài, lời nói hội thoại, người nói ở xa, độ trễ thấp và quyền riêng tư, tức là mô hình chạy trên thiết bị. Ghi chú, Ghi âm, Nhật ký và tính năng tóm tắt cuộc gọi đều được xây dựng trên mô hình này.
Năm mục tiêu thiết kế mà Apple công bố cho mô hình SpeechTranscriber. Nguồn: Apple, phiên 277 của WWDC25.
Các mô hình không thuộc về bất kỳ ứng dụng nào. Chúng được tải từ máy chủ của Apple thông qua AssetInventory, được hệ thống lưu trữ và cập nhật, đồng thời dùng chung giữa các ứng dụng. Chúng không làm tăng dung lượng tải xuống hay không gian bộ nhớ của ứng dụng, và quá trình giải mã diễn ra bên ngoài tiến trình gọi. Khi SpeechTranscriber không có mô hình cho một ngôn ngữ hoặc thiết bị, DictationTranscriber sẽ tiếp quản bằng cùng các mô hình như tính năng đọc chính tả của hệ thống.
Bọn mình đo như thế nào
Mỗi công cụ trong bài viết này đã phiên âm cùng các đoạn âm thanh, theo cùng thứ tự, lần lượt từng đoạn, trên một chiếc M5 MacBook Air (32 GB, macOS 27.0). Âm thanh là phần kiểm thử của Google FLEURS ở bản sửa đổi 70bb2e84, khoảng 150 câu và 30 phút cho mỗi ngôn ngữ. Một mã băm cố định từ ID mục của chính tập dữ liệu xác định thứ tự, và bọn mình lấy lượt chạy gồm các mục nguyên vẹn ngắn nhất vượt qua ba mươi phút; đầu ra của mô hình không tham gia vào lựa chọn đó. Mỗi ô đã được dựng lại từ bản ghi kiểm chứng riêng và kiểm tra lần nữa; cả 285 ô đều đã đạt.
Điểm số là tỷ lệ lỗi từ đối với các ngôn ngữ tách từ bằng dấu cách, và tỷ lệ lỗi ký tự cho tiếng Nhật, tiếng Hàn, tiếng Trung và tiếng Quảng Đông. FLEURS là giọng đọc, không phải cuộc họp hay đọc chính tả. Các bảng này cho biết một công cụ có phù hợp với ngôn ngữ của bạn hay không, chứ không dự đoán kết quả trên bản ghi của riêng bạn.
Tốt hơn bao nhiêu so với Apple Dictation cũ?
Apple cung cấp hai chế độ phiên âm và bọn mình đã đo cả hai. SpeechTranscriber là chế độ mới, được bài viết này gọi là Apple Speech. DictationTranscriber là chế độ tương thích, tức luồng đọc chính tả mà máy Mac từng dùng trước đây.
| Ngôn ngữ | Apple Dictation | Apple Speech |
|---|---|---|
| Tiếng Hàn | 7,11 | 4,31 |
| Tiếng Ý | 6,93 | 4,39 |
| Tiếng Tây Ban Nha (Mỹ Latinh) | 8,43 | 5,41 |
| Tiếng Đức | 12,69 | 6,26 |
| Tiếng Nhật | 9,37 | 6,36 |
| Tiếng Pháp | 17,10 | 7,61 |
| Tiếng Trung | 10,28 | 7,97 |
| Tiếng Quảng Đông | 10,18 | 8,69 |
| Tiếng Anh | 13,83 | 8,80 |
| Tiếng Bồ Đào Nha (Brasil) | 10,85 | 9,35 |
Mọi ngôn ngữ mà cả hai chế độ của Apple đều đo được rõ ràng, được xếp theo tỷ lệ lỗi của Apple Speech; màu xanh lá đánh dấu giá trị tốt hơn trong hàng. Cùng một lượt chạy, cùng các đoạn âm thanh, cùng một máy Mac. Dùng CER cho tiếng Nhật, tiếng Hàn, tiếng Trung và tiếng Quảng Đông, WER cho các ngôn ngữ còn lại.
Apple Speech chính xác hơn ở cả mười ngôn ngữ. Ngôn ngữ trung vị giảm khoảng một phần ba số lỗi, tiếng Pháp và tiếng Đức giảm hơn một nửa, còn tiếng Bồ Đào Nha Brasil và tiếng Quảng Đông giảm khoảng một lỗi trong bảy lỗi.
Đó là phép so sánh với chính quá khứ của Apple. So với các mô hình bạn tải xuống, thứ hạng cao nhất của nó trên một ngôn ngữ được đo rõ ràng là hạng hai, ở tiếng Quảng Đông. Dictation hỗ trợ nhiều ngôn ngữ hơn: 33 cấu hình so với 21 trong lần chạy này, bao gồm cả ba ngôn ngữ mà công cụ mới còn thiếu ở đây.
Công cụ tích hợp mang lại cho bạn điều gì?
| Công cụ | Tốc độ | Bộ nhớ đỉnh | Dung lượng tải xuống |
|---|---|---|---|
| SenseVoice Small | 162,3× thời gian thực | 0,95 GiB | 827 MB |
| Parakeet V3 | 75,6× thời gian thực | 0,09 GiB | 465 MB |
| Apple Speech | 30,8× thời gian thực | không được báo cáo | gói ngôn ngữ do macOS tải xuống, không phải ứng dụng |
| Qwen3-ASR 1.7B | 11,1× thời gian thực | 2,43 GiB | khoảng 2,5 GB |
| Whisper Small | 7,9× thời gian thực | 0,87 GiB | 600 MB |
| Whisper Large V3 Turbo | 3,0× thời gian thực | 1,87 GiB | khoảng 1,6 GB |
Tốc độ là giá trị trung vị của từng công cụ trên mười ba ngôn ngữ mà bài viết này đo được rõ ràng, chỉ tính những ngôn ngữ công cụ đó đã chạy — thông lượng khi xử lý từng mục riêng lẻ, một chỉ số chẩn đoán chứ không phải độ trễ của sản phẩm. Bộ nhớ đỉnh là mức cao nhất của nhóm tiến trình trong lần chạy này. Apple Speech giải mã bên trong một dịch vụ macOS không thuộc về ứng dụng gọi, nên bất kỳ con số nào ở đó cũng không mang cùng ý nghĩa với năm công cụ còn lại.
Tài nguyên ngôn ngữ của Apple Speech được hệ thống tải xuống một lần và dùng chung cho mọi ứng dụng. Không có gì được đóng gói trong ứng dụng, và không có gì được cấp phát trong tiến trình riêng của ứng dụng. Dịch vụ hệ thống vẫn dùng bộ nhớ khi hoạt động, nhưng bọn mình không thể quy phần đó một cách chính xác, nên không báo cáo con số nào thay vì ghi số không. Công cụ đã chạy ở tốc độ 30,8× thời gian thực, sau Parakeet V3 và SenseVoice Small.
Whisper Large V3 Turbo đã dẫn đầu bốn trong mười hàng và là công cụ chậm nhất ở đây, chậm hơn Apple Speech khoảng mười lần, với khoảng 1,6 GB trên đĩa. Qwen3-ASR 1.7B đã dẫn đầu sáu hàng còn lại, dùng khoảng 2,5 GB và 2,43 GiB bộ nhớ. Parakeet V3 cần 465 MB và 0,09 GiB, đã vượt Turbo ở tiếng Pháp, xếp sau ở tiếng Ba Lan, đồng thời không hỗ trợ tiếng Nhật, tiếng Hàn, tiếng Trung hay tiếng Quảng Đông. Whisper Small là đối tượng so sánh gần nhất với dung lượng 600 MB, và Apple Speech đã chính xác hơn ở tám trong mười ngôn ngữ mà cả hai đều được đo rõ ràng.
Bạn có nên dùng Apple Speech thay cho mô hình tải xuống không?
Theo từng ngôn ngữ:
- Tiếng Anh: không phù hợp. Apple Speech đã đạt 8,80; Qwen3-ASR 1.7B (4,49) hoặc Whisper Large V3 Turbo (5,49) rõ ràng chính xác hơn.
- Tiếng Đức: không phù hợp. Apple Speech đã đạt 6,26; Qwen3-ASR 1.7B (2,85) hoặc Whisper Large V3 Turbo (4,05) rõ ràng chính xác hơn.
- Tiếng Hà Lan, tiếng Nga và tiếng Ba Lan: Apple Speech không có mô hình cho ba ngôn ngữ này. Whisper Large V3 Turbo đã chính xác nhất ở cả ba, lần lượt đạt 5,69, 5,13 và 5,45.
- Tiếng Nhật: dùng được. Apple Speech đã đạt 6,36, xếp sau Whisper Large V3 Turbo ở mức 5,30.
- Tiếng Hàn: dùng được. Apple Speech đã đạt 4,31, xếp sau Qwen3-ASR 1.7B ở mức 3,54.
- Tiếng Pháp: không phù hợp. Apple Speech đã đạt 7,61; Qwen3-ASR 1.7B (4,57) hoặc Parakeet V3 (5,83) rõ ràng chính xác hơn.
- Tiếng Trung: dùng được. Apple Speech đã đạt 7,97, ngang với Whisper Large V3 Turbo; công cụ chính xác nhất là Qwen3-ASR 1.7B ở mức 6,49.
- Tiếng Tây Ban Nha: không phù hợp. Apple Speech đã đạt 5,41; Qwen3-ASR 1.7B (3,38) hoặc Whisper Large V3 Turbo (3,62) rõ ràng chính xác hơn.
Apple Speech là cách bài viết này gọi tắt SpeechTranscriber của Apple, API chạy trên thiết bị mà mọi ứng dụng Mac đều có thể gọi trên macOS 26 trở lên. Đây không phải là một trong các mô hình mà Whisper Notes cho Mac tải xuống: bản Mac tải trực tiếp (DMG) có Whisper, Parakeet V3, SenseVoice và Qwen3-ASR; bản trên iPhone và Mac App Store có Whisper, Parakeet V3 và SenseVoice. Bảng theo từng công cụ nằm trên trang hỗ trợ ngôn ngữ.
Không có điều gì ở đây thay đổi cách Whisper Notes cho Mac hoạt động hiện nay: Parakeet V3 vẫn là mô hình mặc định.
Câu hỏi thường gặp
Apple Speech có chính xác bằng Whisper không?
Không phải ở phần lớn ngôn ngữ mà cả hai cùng hỗ trợ. Trong lượt chạy FLEURS của riêng bọn mình, xét bảy trong mười ngôn ngữ này mà Apple Speech hỗ trợ, Whisper Large V3 Turbo đã chính xác hơn ở sáu ngôn ngữ và hai công cụ đã bằng nhau hoàn toàn ở tiếng Trung, cùng đạt CER 7,97%. So với Whisper Small, thứ tự đã đảo ngược: Apple Speech đã dẫn trước ở sáu trong bảy ngôn ngữ và chỉ thua tiếng Anh, WER 8,80% so với 7,04%. Nó đã không dẫn đầu bất kỳ ngôn ngữ nào được đo rõ ràng trong lần chạy này và gần nhất ở tiếng Hàn, CER 4,31% so với 3,54% của công cụ dẫn đầu hàng. Tiếng Quảng Đông là ngôn ngữ duy nhất được đo rõ ràng mà nó đã vượt Whisper Large V3 Turbo, CER 8,69% so với 36,75%. Hãy dùng công cụ tích hợp khi nó hỗ trợ ngôn ngữ của bạn và bạn muốn macOS quản lý gói ngôn ngữ; dùng Whisper Large V3 Turbo để có kết quả chính xác nhất, hoặc khi ngôn ngữ của bạn là một trong ba ngôn ngữ Apple Speech còn thiếu ở đây.
Apple Speech hỗ trợ những ngôn ngữ nào?
macOS quyết định danh sách, không phải bất kỳ ứng dụng nào. Trong lần chạy này, Apple Speech đã cho kết quả ở 21 trong 83 cấu hình ngôn ngữ mà bọn mình thử, so với 83 cho cả hai bản Whisper, 30 cho Qwen3-ASR 1.7B và 25 cho Parakeet V3. Trong mười ngôn ngữ thuộc nhóm được sử dụng rộng rãi ở bảng chính, nó có tiếng Anh, tiếng Đức, tiếng Nhật, tiếng Hàn, tiếng Pháp, tiếng Trung và tiếng Tây Ban Nha, nhưng không có tiếng Hà Lan, tiếng Ba Lan hay tiếng Nga. Bảng thứ hai chứa mười bốn cấu hình còn lại: tiếng Ý, tiếng Quảng Đông, tiếng Bồ Đào Nha Brasil và mười một ngôn ngữ mà nó đã trả lời bằng chữ Latin phiên âm thay vì hệ chữ bản địa. Ứng dụng phải hỏi macOS trong thời gian chạy xem một máy cụ thể có những ngôn ngữ nào. Nếu thiếu ngôn ngữ của bạn, Whisper hỗ trợ mọi ngôn ngữ trong danh sách của ứng dụng trên mọi kênh phân phối.
Apple Speech hay Parakeet V3 — nên chọn công cụ nào?
Parakeet V3, ở mọi ngôn ngữ châu Âu mà cả hai cùng hỗ trợ. Nó đã đạt 6,89 so với 8,80 ở tiếng Anh, 5,83 so với 7,61 ở tiếng Pháp, 4,86 so với 5,41 ở tiếng Tây Ban Nha, 3,43 so với 4,39 ở tiếng Ý và 6,49 so với 9,35 ở tiếng Bồ Đào Nha Brasil; hai công cụ đã bằng nhau ở tiếng Đức với 6,26. Parakeet V3 không hỗ trợ tiếng Nhật, tiếng Hàn, tiếng Trung hay tiếng Quảng Đông, nên ở đó Apple Speech là lựa chọn duy nhất trong hai công cụ, và cách công cụ dẫn đầu hàng không quá 1,5 điểm ở tiếng Nhật, tiếng Hàn và tiếng Trung. Parakeet V3 cần tải xuống 465 MB và đã chạy ở 75,6× thời gian thực với bộ nhớ đỉnh 0,09 GiB; gói ngôn ngữ của Apple Speech do macOS tải xuống, còn công cụ đã chạy ở 30,8× với bộ nhớ mà bọn mình không báo cáo.
SpeechAnalyzer là gì, và có giống Apple Dictation không?
SpeechAnalyzer là API bao trùm mà Apple đã giới thiệu tại WWDC 2025 và đã phát hành trong macOS 26 cùng iOS 26. SpeechTranscriber là chế độ phiên âm bên trong API đó, cũng là thứ bọn mình đã đo và bài viết này gọi là Apple Speech. Dictation là chế độ tương thích và bọn mình cũng đã chạy nó: Apple Speech đã chính xác hơn ở cả mười ngôn ngữ mà hai chế độ đều xử lý rõ ràng, loại bỏ khoảng một phần ba số lỗi ở ngôn ngữ trung vị và hơn một nửa ở tiếng Pháp và tiếng Đức. Dictation hỗ trợ nhiều ngôn ngữ hơn, 33 cấu hình so với 21, nên đây là công cụ hệ thống cho tiếng Hà Lan, tiếng Ba Lan hoặc tiếng Nga nếu bạn chấp nhận WER 17,34%, 13,50% và 13,13%. Whisper Large V3 Turbo đã đạt 5,69%, 5,45% và 5,13% trên cùng các đoạn âm thanh.
Âm thanh có rời khỏi máy Mac khi tôi dùng Apple Speech không?
Apple mô tả SpeechTranscriber là tính năng nhận dạng giọng nói trên thiết bị: macOS tải tài nguyên ngôn ngữ xuống một lần và quá trình nhận dạng diễn ra cục bộ. Bọn mình đã đo độ chính xác và tốc độ, không đo hành vi mạng, nên mô tả phần này theo cách Apple mô tả. Các công cụ mà Whisper Notes tự tải xuống — Whisper, Parakeet V3, SenseVoice và Qwen3-ASR — chạy trên GPU hoặc Neural Engine của chính máy Mac mà không cần tài khoản hay API key; phiên âm hoạt động khi tắt mạng trên mọi kênh phân phối.
Tại sao các con số này không khớp với độ chính xác trên bản ghi của tôi?
Vì FLEURS là giọng đọc ngắn và sạch, còn bản ghi của bạn thì không. Lần chạy của bọn mình là phép hiệu chuẩn trên một tập dữ liệu công khai: khoảng 150 câu và 30 phút âm thanh cho mỗi ngôn ngữ, trên một chiếc M5 MacBook Air, với cùng các đoạn âm thanh cho mọi công cụ. Nó cho biết một công cụ có phù hợp với ngôn ngữ hay không, chứ không dự đoán kết quả của bạn trong cuộc họp, với âm thanh nhiễu, giọng có âm sắc vùng miền hay tệp dài hai giờ.
Tại sao các phép đo khác lại nói Apple Speech vượt Whisper?
Vì họ so sánh với Whisper Small, và chỉ trên tiếng Anh. Với Whisper Small thì lượt chạy của bọn mình cũng cho kết quả tương tự: Apple Speech đã thắng ở tám trong mười ngôn ngữ mà cả hai đều được đo rõ ràng. Tiếng Anh là một trong hai ngôn ngữ nó đã thua, 8,80 so với 7,04. Kết quả đó không còn đúng với Whisper Large V3 Turbo: Apple Speech đã xếp sau ở tám trong mười ngôn ngữ đó, hòa ở tiếng Trung với 7,97 và chỉ dẫn đầu ở tiếng Quảng Đông. Chọn phiên bản Whisper nào để so sánh sẽ quyết định dòng tiêu đề.
Thử ngay
Năm mô hình có thể tải xuống ở đây — Whisper Small, Whisper Large V3 Turbo, Parakeet V3, SenseVoice Small và Qwen3-ASR 1.7B — đều có trong Whisper Notes cho Mac, bản tải trực tiếp (DMG), tại Cài đặt, rồi Mô hình phiên âm.
Nếu các con số của bọn mình không khớp với trải nghiệm của bạn ở một ngôn ngữ, hãy gửi email đến mac@whispernotes.app. Ghi chú phát hành đầy đủ: whispernotes.app/changelog.
Nguồn: lượt chạy của bọn mình trên phần kiểm thử của Google FLEURS ở bản sửa đổi 70bb2e84, tài liệu SpeechAnalyzer của Apple, và lượt chạy Qwen3-ASR ba mươi ngôn ngữ trước đó.