從 macOS 26 和 iOS 26 開始,Apple 推出了新一代裝置端語音辨識——SpeechAnalyzer 和 SpeechTranscriber,下文統稱 Apple Speech。它比舊的聽寫引擎準確許多。於是我們想知道: Apple 內建的語音辨識,現在是否已經好到可以完全不用轉錄 App? 它和 Whisper Notes 裡的裝置端開放模型——Whisper、Parakeet、SenseVoice 和 Qwen3-ASR——還差多遠?我們進行了一次嚴格測試,以下是結果。我們測的十種語言裡,Apple Speech 沒有一種錯誤率最低,韓語、日語和中文距離第一名不到 1.5 點,荷蘭語、俄語和波蘭語則根本沒有模型。
Apple Speech 和下載模型相差多遠?
| 語言 | Apple Speech | Qwen3-ASR | Whisper Large | Whisper Small | Parakeet | SenseVoice |
|---|---|---|---|---|---|---|
| 英語 | 8.80 | 4.49 | 5.49 | 7.04 | 6.89 | 8.46 |
| 德語 | 6.26 | 2.85 | 4.05 | 8.67 | 6.26 | — |
| 荷蘭語 | — | 7.36 | 5.69 | 16.75 | 8.58 | — |
| 俄語 | — | 5.65 | 5.13 | 11.37 | 7.12 | — |
| 波蘭語 | — | 12.59 | 5.45 | 15.81 | 8.30 | — |
| 日語 | 6.36 | 5.74 | 5.30 | 11.37 | — | 6.78 |
| 韓語 | 4.31 | 3.54 | 4.25 | 7.30 | — | 7.85 |
| 法語 | 7.61 | 4.57 | 5.97 | 13.24 | 5.83 | — |
| 中文 | 7.97 | 6.49 | 7.97 | 20.50 | — | 7.69 |
| 西班牙語(拉丁美洲) | 5.41 | 3.38 | 3.62 | 6.22 | 4.86 | — |
最常用語言中的十種,每個引擎各佔一欄。每格是該引擎的錯誤率,越低越好;綠色是該行最低,白色是第二低。日語、韓語和中文採字錯率,其餘採詞錯率,兩者不合併成一個分數。這是 Whisper Notes 團隊自己跑的 FLEURS 測試,一台 M5 MacBook Air,朗讀語音。
表頭簡稱:Qwen3-ASR = Qwen3-ASR 1.7B,Whisper Large = Whisper Large V3 Turbo,Parakeet = Parakeet V3,SenseVoice = SenseVoice Small。破折號代表該引擎沒有這種語言的模型。
十種語言裡,Qwen3-ASR 1.7B 在六種的錯誤率最低,另外四種由 Whisper Large V3 Turbo 領先。Apple Speech 距離該行第一名最近的是韓語的 0.77 點、日語的 1.06 點和中文的 1.48 點,中文上它和 Whisper Large V3 Turbo 同為 7.97。它支援的七種語言裡,比該行第一名高 0.8 到 4.3 點,差距最大的是英語,8.80 對 4.49。荷蘭語、波蘭語和俄語沒有 Apple Speech 的結果。
Apple Speech 支援哪些語言?
這次測試中,Apple Speech 在 83 個語言設定裡有 21 個傳回結果。兩個 Whisper 模型涵蓋全部 83 個,Qwen3-ASR 1.7B 涵蓋 30 個,Parakeet V3 涵蓋 25 個。上面的十種語言裡,它沒有荷蘭語、波蘭語或俄語模型。也沒有一份固定清單可以引用:語言資源由 macOS 管理,所以 App 必須在執行時查詢這台機器有哪些資源。
| 語言 | Apple Speech | Qwen3-ASR | Whisper Large | Whisper Small | Parakeet | SenseVoice |
|---|---|---|---|---|---|---|
| 義大利語 | 4.39 | 2.58 | 2.58 | 7.64 | 3.43 | — |
| 粵語 | 8.69 | 6.44 | 36.75 | 119.01 | — | 37.23 |
| 葡萄牙語(巴西) | 9.35 | 5.17 | 5.44 | 8.61 | 6.49 | — |
| 印地語 | 101.50 | 13.19 | 29.64 | 61.26 | — | — |
| 泰盧固語 | 101.63 | — | 81.74 | 103.19 | — | — |
| 烏爾都語 | 101.69 | — | 23.39 | 38.83 | — | — |
| 旁遮普語 | 101.75 | — | 92.05 | 103.40 | — | — |
| 孟加拉語 | 102.00 | — | 83.52 | 117.37 | — | — |
| 尼泊爾語 | 102.13 | — | 88.59 | 118.84 | — | — |
| 馬拉雅拉姆語 | 102.18 | — | 107.34 | 167.16 | — | — |
| 馬拉地語 | 102.23 | — | 82.69 | 109.95 | — | — |
| 坎那達語 | 103.83 | — | 72.07 | 116.10 | — | — |
| 古吉拉特語 | 104.52 | — | 75.31 | 108.91 | — | — |
| 泰米爾語 | 113.01 | — | 71.28 | 79.77 | — | — |
Apple Speech 有傳回結果的其餘十四種語言,依它自己的錯誤率排序。引擎欄、配色和簡稱同上;粵語採字錯率,其餘採詞錯率。由於插入錯誤也算在分子內,錯誤率可能超過 100%。
最後十一行從印地語到泰米爾語,Apple Speech 傳回的是拉丁字母轉寫而不是原生文字,因此那裡的錯誤率衡量的是文字系統不符,不是辨識準確率;這些格子不列入該行排名。同一行其他引擎的數值則是正常測量結果。
SpeechAnalyzer 的運作方式
Apple 從 iOS 10 起就有語音辨識 API。當時的 SFSpeechRecognizer 是舊聽寫路徑背後的引擎。SpeechAnalyzer 取代了它,隨 macOS 26 和 iOS 26 推出,除了 watchOS 之外的所有 Apple 平台都能使用。
這套 API 以工作階段為核心。你建立一個 SpeechAnalyzer,加入一個或多個模組,再送入音訊;將語音轉成文字的模組是 SpeechTranscriber。音訊以你自行填入的非同步序列送入,結果以另一個序列傳回,兩者通常在不同工作上執行。分析器一次只接收一個輸入序列。每個緩衝區和每筆結果都有對應音訊本身時間軸的時間碼,因此結果能放回原本的位置。
一個工作階段、三項工作:音訊以 AsyncSequence 送入,由 SpeechAnalyzer 和 SpeechTranscriber 分析,結果再以另一個 AsyncSequence 傳回介面。來源:Apple, WWDC25 第 277 場。
結果會抵達兩次。Apple 所稱 volatile range 的可變範圍內,內容仍可能被更好的結果取代;範圍之外則是最終結果。App 因此能在你還在說話時先顯示粗略逐字稿,之後再修正。
Apple 為 SpeechTranscriber 模型列出五項設計目標:長音訊、對話語音、遠距說話者、低延遲,以及隱私,也就是在裝置上執行。備忘錄、語音備忘錄、日誌和通話摘要都以它為基礎。
Apple 為 SpeechTranscriber 模型列出的五項設計目標。來源:Apple, WWDC25 第 277 場。
模型不屬於任何一個 App。它們透過 AssetInventory 從 Apple 伺服器下載,由系統儲存和更新,並在 App 之間共享。它們不增加 App 的下載大小,也不佔用 App 的記憶體空間,解碼則在呼叫端行程之外進行。SpeechTranscriber 若沒有某種語言或裝置的模型,DictationTranscriber 就會接手,使用和系統聽寫相同的模型。
我們怎麼測試
本文每個引擎都在一台 M5 MacBook Air(32 GB、macOS 27.0)上,以相同順序、一次一段轉錄同一批片段。音訊來自 Google FLEURS 測試集版本 70bb2e84,每種語言約 150 句、約 30 分鐘。資料集自身的項目 ID 經固定雜湊後決定順序,我們取剛好超過三十分鐘的最短完整項目區段;模型輸出完全不參與這項選擇。每一格都從各自的紀錄重新計算並再次核對,285 格全部通過。
以空格分詞的語言採詞錯率,日語、韓語、中文和粵語採字錯率。FLEURS 是朗讀語音,不是會議,也不是聽寫。這些表能說明某個引擎在你的語言上是否值得一試,不能預測你用自己的錄音會得到什麼結果。
比舊版 Apple Dictation 好多少?
Apple 提供兩個轉錄工作點,我們兩個都測了。SpeechTranscriber 是新的工作點,也就是本文所稱的 Apple Speech。 DictationTranscriber 是相容性工作點,也是它出現前 Mac 採用的聽寫路徑。
| 語言 | Apple Dictation | Apple Speech |
|---|---|---|
| 韓語 | 7.11 | 4.31 |
| 義大利語 | 6.93 | 4.39 |
| 西班牙語(拉丁美洲) | 8.43 | 5.41 |
| 德語 | 12.69 | 6.26 |
| 日語 | 9.37 | 6.36 |
| 法語 | 17.10 | 7.61 |
| 中文 | 10.28 | 7.97 |
| 粵語 | 10.18 | 8.69 |
| 英語 | 13.83 | 8.80 |
| 葡萄牙語(巴西) | 10.85 | 9.35 |
兩個 Apple 工作點都乾淨測到的全部語言,依 Apple Speech 的錯誤率排序;綠色是該行較好的數值。同一次測試、同一批片段、同一台 Mac。日語、韓語、中文和粵語採字錯率,其餘採詞錯率。
十種語言裡,Apple Speech 全部更準。中位數語言的錯誤約少三分之一,法語和德語少一半以上,巴西葡萄牙語和粵語則約每七個錯誤少一個。
這是和 Apple 自己的過去相比。和下載模型比較,它在乾淨測到的語言裡最佳名次是粵語第二名。Dictation 涵蓋更多語言:這次測試是 33 個設定對 21 個,也包含新引擎在這裡缺少的全部三種語言。
內建引擎帶來什麼?
| 引擎 | 速度 | 峰值記憶體 | 下載大小 |
|---|---|---|---|
| SenseVoice Small | 即時速度的 162.3 倍 | 0.95 GiB | 827 MB |
| Parakeet V3 | 即時速度的 75.6 倍 | 0.09 GiB | 465 MB |
| Apple Speech | 即時速度的 30.8 倍 | 不列數值 | 語言套件由 macOS 下載,不由 App 下載 |
| Qwen3-ASR 1.7B | 即時速度的 11.1 倍 | 2.43 GiB | 約 2.5 GB |
| Whisper Small | 即時速度的 7.9 倍 | 0.87 GiB | 600 MB |
| Whisper Large V3 Turbo | 即時速度的 3.0 倍 | 1.87 GiB | 約 1.6 GB |
速度是各引擎在本文乾淨測到的十三種語言中,僅計實際執行語言後的中位數——這是逐項隔離處理的吞吐量,屬於診斷值,不是產品延遲。峰值記憶體是這次測試的行程群組峰值。Apple Speech 在呼叫端 App 無法掌控的 macOS 服務裡解碼,因此那一格無論填什麼數字,都不會和另外五個引擎代表同一件事。
Apple Speech 的語言資源由系統下載一次,供所有 App 共享。App 本身不帶模型,也不會在自己的行程裡配置記憶體。系統服務運作時仍會使用記憶體,但我們無法精確歸屬,所以那一格不列數字,而不是填零。它以即時速度的 30.8 倍執行,慢於 Parakeet V3 和 SenseVoice Small。
Whisper Large V3 Turbo 拿下十行中的四個第一名,同時是這裡最慢的引擎,比 Apple Speech 慢約十倍,磁碟佔用約 1.6 GB。Qwen3-ASR 1.7B 拿下其餘六行,下載約 2.5 GB,記憶體 2.43 GiB。Parakeet V3 是 465 MB 和 0.09 GiB,法語比 Turbo 準,波蘭語比它差,而且沒有日語、韓語、中文或粵語模型。最接近的比較對象是 600 MB 的 Whisper Small;兩者都乾淨測到的十種語言裡,有八種是 Apple Speech 更準。
該用 Apple Speech 還是下載一個模型?
按語言來看:
- 英語:不適合。Apple Speech 的錯誤率是 8.80; Qwen3-ASR 1.7B (4.49)或 Whisper Large V3 Turbo (5.49)明顯更準。
- 德語:不適合。Apple Speech 的錯誤率是 6.26; Qwen3-ASR 1.7B (2.85)或 Whisper Large V3 Turbo (4.05)明顯更準。
- 荷蘭語、俄語和波蘭語:Apple Speech 沒有這三種語言的模型。 Whisper Large V3 Turbo 在三種語言上都是最準的,分別為 5.69、5.13 和 5.45。
- 日語:可以使用。Apple Speech 的錯誤率是 6.36,落後 Whisper Large V3 Turbo 的 5.30。
- 韓語:可以使用。Apple Speech 的錯誤率是 4.31,落後 Qwen3-ASR 1.7B 的 3.54。
- 法語:不適合。Apple Speech 的錯誤率是 7.61; Qwen3-ASR 1.7B (4.57)或 Parakeet V3 (5.83)明顯更準。
- 中文:可以使用。Apple Speech 的錯誤率是 7.97,和 Whisper Large V3 Turbo 相同;最準的是 Qwen3-ASR 1.7B 的 6.49。
- 西班牙語:不適合。Apple Speech 的錯誤率是 5.41; Qwen3-ASR 1.7B (3.38)或 Whisper Large V3 Turbo (3.62)明顯更準。
Apple Speech 是本文對 Apple 的 SpeechTranscriber 所用的簡稱,這套裝置端 API 可由任何執行 macOS 26 或更新版本的 Mac App 呼叫。它不在 Mac 版 Whisper Notes 下載的模型之列:Mac 直接下載版(DMG)有 Whisper、Parakeet V3、SenseVoice 和 Qwen3-ASR;iPhone 版和 Mac App Store 版有 Whisper、Parakeet V3 和 SenseVoice。各引擎的表格可見 語言支援頁。
這些結果不會改變 Mac 版 Whisper Notes 目前的運作方式: Parakeet V3 仍是預設模型。
常見問題
Apple Speech 和 Whisper 一樣準嗎?
兩者都支援的語言裡,大多數上它並不如 Whisper 準。在我們自己跑的 FLEURS 測試中,這十種語言裡 Apple Speech 支援的七種,Whisper Large V3 Turbo 有六種更準,中文則完全打平,兩者字錯率都是 7.97%。和 Whisper Small 比較時順序反轉:七種裡 Apple Speech 領先六種,只在英語以 8.80% 對 7.04% 的詞錯率落後。乾淨測到的語言裡它沒有拿下任何第一名,最接近的是韓語,字錯率 4.31%,該行第一名是 3.54%。粵語是乾淨測到的語言中唯一一個 Apple Speech 勝過 Whisper Large V3 Turbo 的,字錯率 8.69% 對 36.75%。如果你的語言在支援範圍內,而且希望讓 macOS 管理語言套件,可使用內建引擎;若要最準的結果,或你的語言正是它在這裡缺少的三種之一,請使用 Whisper Large V3 Turbo。
Apple Speech 支援哪些語言?
清單由 macOS 決定,不由任何 App 決定。這次測試裡 Apple Speech 在我們測試的 83 個語言設定中有 21 個產生結果,兩個 Whisper 版本都是 83 個,Qwen3-ASR 1.7B 是 30 個,Parakeet V3 是 25 個。主表的十種最常用語言中,它有英語、德語、日語、韓語、法語、中文和西班牙語,沒有荷蘭語、波蘭語或俄語。第二張表列出其餘十四個設定:義大利語、粵語、巴西葡萄牙語,以及十一種它以拉丁字母轉寫而非原生文字作答的語言。App 必須在執行時向 macOS 查詢指定機器有哪些語言。如果你的語言不在其中,Whisper 在每個管道都涵蓋 App 清單內的所有語言。
Apple Speech 和 Parakeet V3 該選哪一個?
兩者都支援的每種歐洲語言都應選 Parakeet V3。英語是 6.89 對 8.80、法語 5.83 對 7.61、西班牙語 4.86 對 5.41、義大利語 3.43 對 4.39、巴西葡萄牙語 6.49 對 9.35;德語兩者同為 6.26。Parakeet V3 沒有日語、韓語、中文或粵語模型,所以這幾種語言只有 Apple Speech 有結果,而日語、韓語和中文距離該行第一名不到 1.5 點。Parakeet V3 需下載 465 MB,以即時速度的 75.6 倍執行,峰值記憶體為 0.09 GiB;Apple Speech 的語言套件由 macOS 下載,速度為即時的 30.8 倍,記憶體數值不列。
SpeechAnalyzer 是什麼?和 Apple Dictation 一樣嗎?
SpeechAnalyzer 是 Apple 在 WWDC 2025 發表、隨 macOS 26 和 iOS 26 推出的整體 API。SpeechTranscriber 是其中的轉錄工作點,也是我們測量並在本文稱為 Apple Speech 的對象。Dictation 是相容性工作點,我們也測了:兩者都乾淨測到的十種語言裡,Apple Speech 全部更準,中位數語言的錯誤約少三分之一,法語和德語則少一半以上。Dictation 涵蓋更多語言,這次是 33 個設定對 21 個,因此如果你能接受 17.34%、13.50% 和 13.13% 的詞錯率,它就是荷蘭語、波蘭語或俄語的系統引擎。同一批片段上,Whisper Large V3 Turbo 分別是 5.69%、5.45% 和 5.13%。
使用 Apple Speech 時,音訊會離開我的 Mac 嗎?
Apple 將 SpeechTranscriber 記載為裝置端語音辨識:macOS 會下載一次語言資源,辨識在本機執行。我們測量的是準確率和速度,不是網路行為,因此這部分依照 Apple 的說明。Whisper Notes 自己下載的引擎——Whisper、Parakeet V3、SenseVoice 和 Qwen3-ASR——在你自己 Mac 的 GPU 或 Neural Engine 上執行,不需帳號或 API key;每個管道都能在斷網時轉錄。
為什麼這些數字和我在自己錄音裡得到的準確率不同?
因為 FLEURS 是短句、乾淨的朗讀語音,而你的錄音不是。我們這次是在公開資料集上校準:每種語言約 150 句、約 30 分鐘音訊,一台 M5 MacBook Air,所有引擎使用相同片段。它能說明某個引擎在一種語言上是否值得一試,不能預測會議、嘈雜音訊、帶口音語音或兩小時檔案上的結果。
為什麼別的評測說 Apple Speech 比 Whisper 準?
因為它們比的是 Whisper Small,而且只測英語。和 Whisper Small 比,我們的結果一致:兩者都乾淨測到的十種語言裡,有八種是 Apple Speech 更準。英語正是它輸掉的兩種之一,8.80 對 7.04。換成 Whisper Large V3 Turbo 就不成立了:同樣這十種語言裡,Apple Speech 有八種落後,中文以 7.97 打平,只在粵語領先。拿哪一個 Whisper 來比,就決定了標題怎麼寫。
試用看看
這裡五個可下載模型——Whisper Small、Whisper Large V3 Turbo、Parakeet V3、SenseVoice Small 和 Qwen3-ASR 1.7B——全都在 Mac 版 Whisper Notes 的直接下載版(DMG)中,位置是設定 → 轉錄模型。
如果某種語言上,我們的數字和你的實際體驗不符,請寄信到 mac@whispernotes.app。完整版本說明: whispernotes.app/changelog。
資料來源:我們在 Google FLEURS 測試集版本 70bb2e84 上進行的測試、Apple 的 SpeechAnalyzer 文件,以及先前的 三十種語言 Qwen3-ASR 測試。