从 macOS 26 和 iOS 26 开始,苹果有了新一代的设备端语音识别 API——SpeechAnalyzer 和 SpeechTranscriber,下文简称 Apple Speech。Whisper Notes 里同时装着 Whisper、Parakeet、SenseVoice、Qwen3-ASR,每一个都有它存在的理由:有的极快,有的在某几种语言上更准。所以这个问题值得认真问一次:苹果自带的语音识别,现在够用了吗?它和这些设备端的开源模型,差距还有多大?我们做了一次严格的实测,下面是结果。
Apple Speech 和你下载的模型,差多远?
| 语言 | Apple Speech | Qwen3-ASR | Whisper Large | Whisper Small | Parakeet | SenseVoice |
|---|---|---|---|---|---|---|
| 英语 | 8.80 | 4.49 | 5.49 | 7.04 | 6.89 | 8.46 |
| 德语 | 6.26 | 2.85 | 4.05 | 8.67 | 6.26 | — |
| 荷兰语 | — | 7.36 | 5.69 | 16.75 | 8.58 | — |
| 俄语 | — | 5.65 | 5.13 | 11.37 | 7.12 | — |
| 波兰语 | — | 12.59 | 5.45 | 15.81 | 8.30 | — |
| 日语 | 6.36 | 5.74 | 5.30 | 11.37 | — | 6.78 |
| 韩语 | 4.31 | 3.54 | 4.25 | 7.30 | — | 7.85 |
| 法语 | 7.61 | 4.57 | 5.97 | 13.24 | 5.83 | — |
| 中文 | 7.97 | 6.49 | 7.97 | 20.50 | — | 7.69 |
| 西班牙语(拉美) | 5.41 | 3.38 | 3.62 | 6.22 | 4.86 | — |
十种最常用的语言,一个引擎一列。每一格是该引擎的错误率,越低越好;标绿的是该行最低,标白的是次低。日语、韩语和中文为字错率,其余为词错率,两者不合并成一个总分。我们自己跑的 FLEURS,一台 M5 MacBook Air,朗读语音。
表头简称:Qwen3-ASR = Qwen3-ASR 1.7B,Whisper Large = Whisper Large V3 Turbo,Parakeet = Parakeet V3,SenseVoice = SenseVoice Small。破折号表示该引擎没有这种语言的模型。
十个第一名只属于两个引擎。Qwen3-ASR 1.7B 拿下六行,Whisper Large V3 Turbo 拿下另外四行。Apple Speech 一个都没拿到。但在韩语、日语和中文上,它离第一名不到一分半,中文上还和 Whisper Large V3 Turbo 精确打平,都是 7.97。西班牙语和法语差得更多,德语更远。英语是底:8.80 对 4.49,六个里最后一名,凡是你本可以下载的模型都赢过它,包括体积最小的那个。还有三行根本没有 Apple 的格子,那是下一节的事。结论有两半:在它熟的语言上已经够用,而在我们能比的每一种语言上,它离开源模型还差着一档。
Apple Speech 支持哪些语言?
二十多种:这一轮里 Apple Speech 在 83 个语言配置中的 21 个上返回了结果,两个 Whisper 版本都是 83 个,Qwen3-ASR 1.7B 是 30 个,Parakeet V3 是 25 个。上面那十种语言里它缺三种——荷兰语、波兰语、俄语——API 直接回答没有模型,也就无从测起。也没有一份固定的清单可以引用:语言资源属于 macOS,app 只能在运行时问这台机器上到底装了哪些。
| 语言 | Apple Speech | Qwen3-ASR | Whisper Large | Whisper Small | Parakeet | SenseVoice |
|---|---|---|---|---|---|---|
| 意大利语 | 4.39 | 2.58 | 2.58 | 7.64 | 3.43 | — |
| 粤语 | 8.69 | 6.44 | 36.75 | 119.01 | — | 37.23 |
| 葡萄牙语(巴西) | 9.35 | 5.17 | 5.44 | 8.61 | 6.49 | — |
Apple Speech 在这里干净测到的其余语言,按它自己的错误率排序。引擎列、配色和简称同上;粤语为字错率,另外两种为词错率。错误率可以超过 100%,因为多出来的插入也算进分子。
它跑过但没有发布的还有十一个配置——孟加拉语、古吉拉特语、印地语、卡纳达语、马拉雅拉姆语、马拉地语、尼泊尔语、旁遮普语、泰米尔语、泰卢固语和乌尔都语——因为 Apple Speech 返回的是拉丁转写而不是本族文字,那里算出来的错误率量的是文字,不是识别。
我们怎么测的
先说公平。所有引擎听的是同一批片段、同样的顺序,一次只跑一条,机器只有一台:M5 MacBook Air,32 GB,macOS 27.0,所以苹果这边用的是它当下的引擎。音频是 Google FLEURS 测试集 70bb2e84 版,每种语言约 150 句、约 30 分钟。句子不是我们挑的:按数据集自带的条目 ID 做一次固定哈希排序,取刚好越过三十分钟的最短整条前缀。模型输出不参与这个选择。每一格都从它自己的收据重算并复核过才留下,285 格全部通过。
分数上,用空格分词的语言算词错率,日语、韩语、中文和粤语算字错率;两者不合并成一个总分。还有一条比上面都重要的限制:FLEURS 是朗读语音,不是会议,也不是听写。这些表能告诉你某个引擎在你的语言上值不值得一试。它们不能预测你在自己的录音上会拿到多少。
比旧版 Apple Dictation 进步了多少?
苹果一共提供两个转录工作点,我们两个都测了。SpeechTranscriber 是新的那个,也就是本文说的 Apple Speech。DictationTranscriber 是兼容的那个,是它出现之前 Mac 上的听写路径。
| 语言 | Apple Dictation | Apple Speech |
|---|---|---|
| 韩语 | 7.11 | 4.31 |
| 意大利语 | 6.93 | 4.39 |
| 西班牙语(拉美) | 8.43 | 5.41 |
| 德语 | 12.69 | 6.26 |
| 日语 | 9.37 | 6.36 |
| 法语 | 17.10 | 7.61 |
| 中文 | 10.28 | 7.97 |
| 粤语 | 10.18 | 8.69 |
| 英语 | 13.83 | 8.80 |
| 葡萄牙语(巴西) | 10.85 | 9.35 |
两个苹果工作点都干净测到的全部语言,按 Apple Speech 的错误率排序;标绿的是该行更好的那个。同一轮测试,同一批片段,同一台 Mac。日语、韩语、中文和粤语为字错率,其余为词错率。
十种语言,Apple Speech 全部更准。中位的那种语言少掉大约三分之一的错误,法语和德语少掉一半以上。进步最小的是巴西葡萄牙语和粤语,大约每七个错误消掉一个。如果你对苹果语音识别的印象还停留在过去的听写上,那个印象已经过期了。
不过这是跟苹果自己的过去比,不是跟同场的模型比。在本文出现的每一种语言上,Apple Speech 都没有拿到过第一,它最好的名次是粤语上的第二。旧的听写倒是覆盖更多语言——这一轮里是 33 个配置对 21 个,包括新引擎在这里缺的那三种。
用系统自带的这个,换来什么?
| 引擎 | 速度 | 峰值内存 | 下载体积 |
|---|---|---|---|
| SenseVoice Small | 162.3x 倍实时 | 0.95 GiB | 827 MB |
| Parakeet V3 | 75.6x 倍实时 | 0.09 GiB | 465 MB |
| Apple Speech | 30.8x 倍实时 | 不报 | 不用下载,系统自带 |
| Qwen3-ASR 1.7B | 11.1x 倍实时 | 2.43 GiB | 约 2.5 GB |
| Whisper Small | 7.9x 倍实时 | 0.87 GiB | 600 MB |
| Whisper Large V3 Turbo | 3.0x 倍实时 | 1.87 GiB | 约 1.6 GB |
速度取中位数,范围是本文这些语言里该引擎实际跑过的那些——单条隔离测量的处理吞吐,是诊断值,不是产品延迟。峰值内存是这一轮的进程组峰值。Apple Speech 的解码发生在调用方 app 管不着的 macOS 系统服务里,那一格填什么数字都和另外五个不是一回事。
Apple Speech 既不用装,也不用留。没有模型文件,没有下载,app 自己的进程里也不分配内存。最后这条不等于零:系统服务工作时确实要用内存,而我们没法把它精确归给谁,所以那一格我们不报数字,而不是报零。它也快——这里大约三十倍实时,只慢于 Parakeet V3 和 SenseVoice Small。对不少人来说这就是全部理由,而在它擅长的语言上,准确率也撑得住这个理由。
赢过它的那几个,都得拿别的东西来换。Whisper Large V3 Turbo 拿下十行里的四个第一,同时是这次最慢的引擎,比 Apple Speech 慢十倍左右,磁盘上约 1.6 GB。Qwen3-ASR 1.7B 拿下另外六个,代价是约 2.5 GB 下载和 2.43 GiB 内存。Parakeet V3 是反例,465 MB、0.09 GiB,而它的代价时轻时重:法语上比 Turbo 还准,波兰语上差得多,日语、韩语、中文和粤语则一个都没有。最接近的比较对象是 Whisper Small,那也是对苹果最有利的一次——我们为两者都干净测到的十种语言里,有八种 Apple Speech 更准,而 Whisper Small 是一个你得一直留着的 600 MB 文件。
该用 Apple Speech 还是下载一个模型?
按语言来看,我们会这样回答。
- 如果你转写荷兰语、波兰语或俄语:Apple Speech 不是选项,它没有这些语言的模型。这三种最准的都是 Whisper Large V3 Turbo。
- 如果磁盘或下载体积是你的约束:Apple Speech 什么都不用装。我们为两者都干净测到的十种语言里,有八种它比 Whisper Small 更准,例外是英语和巴西葡萄牙语。
- 如果你转写韩语、日语或中文,又想用系统自带的:这三种它离该行最准的模型都不到一分半,中文上还和 Whisper Large V3 Turbo 打平。在你还不需要抠最后一两分之前,这个成绩站得住。
- 如果你转写英语:它在六个里排最后,8.80,而 Qwen3-ASR 1.7B 是 4.49、Whisper Large V3 Turbo 是 5.49。下一个吧。
- 如果你转写粤语:Apple Speech 是第二,8.69,第一是 Qwen3-ASR 1.7B 的 6.44——粤语也是两个 Whisper 都用不了的那一行,36.75 和 119.01。
- 如果你只要每种语言最准的那个,不在乎下载:Qwen3-ASR 1.7B 赢下英语、德语、韩语、法语、中文和西班牙语;Whisper Large V3 Turbo 赢下荷兰语、俄语、波兰语和日语。
- 如果你用的是 iPhone 版或 Mac App Store 版:Whisper Notes 在那两个渠道提供的引擎是 Whisper、Parakeet V3 和 SenseVoice。
Apple Speech 是本文对苹果自家 SpeechTranscriber 的简称,这是 macOS 26 和 iOS 26 引入的设备端 API,任何 Mac app 都能调用。它是系统的引擎,不是我们的:磁盘上没有模型文件,语言资源由 macOS 管理,要 macOS 26 及以上。它不在 Mac 版 Whisper Notes 需要你下载的那几个模型之列——那几个模型系列,Mac 直接下载版(DMG)是 Whisper、Parakeet V3、SenseVoice 和 Qwen3-ASR,iPhone 版和 Mac App Store 版是 Whisper、Parakeet V3 和 SenseVoice。这几个引擎的语言表在语言支持页上。
这些数字不改变 Mac 版 Whisper Notes 今天的样子,Parakeet V3 仍是默认。
常见问题
Apple Speech 和 Whisper 一样准吗?
两者都支持的语言里,大多数上它还差一截,但差距比传闻小。在我们自己跑的 FLEURS 测试里,这十种语言中 Apple Speech 支持的七种,Whisper Large V3 Turbo 赢六种,中文精确打平,都是 7.97% 字错率。换成体积更小的 Whisper Small,结果反过来:同样这七种里 Apple Speech 赢六种,只输英语,8.80% 对 7.04% 词错率。在这次测试里 Apple Speech 没有拿到过第一。它离第一最近的是韩语(4.31% 字错率对该行最准的 3.54%)、日语(6.36% 对 5.30%)和中文(7.97% 对 6.49%),离得最远的是英语,8.80% 对 4.49% 词错率。粤语是我们干净测到的语言中唯一一个 Apple Speech 赢过 Whisper Large V3 Turbo 的,8.69% 对 36.75% 字错率。如果你完全不想下载模型、语言又在它覆盖范围内,系统自带的这个够用;如果你要最准的结果,或者你的语言正好是它在这里缺的那三种之一,那就用 Whisper Large V3 Turbo。
Apple Speech 支持哪些语言?
二十多种,但清单不在 app 手里,是 macOS 说了算。我们这一轮里它在 83 个语言配置中的 21 个上返回了结果,两个 Whisper 版本都是 83 个,Qwen3-ASR 1.7B 是 30 个,Parakeet V3 是 25 个。本文那张主表取的是十种最常用的语言,好让所有引擎在同样的行里比:这十种里它有英语、德语、日语、韩语、法语、中文和西班牙语,没有荷兰语、波兰语和俄语。意大利语、巴西葡萄牙语和粤语它也支持,那几行在第二张表里。也没有一份固定的清单可以公布:app 只能在运行时向系统查询这台机器上装了哪些语言,因为这些资源是 macOS 下载和管理的,不归 app 管。如果你的语言不在里面,Whisper 覆盖 app 语言表里的全部语言,每个渠道都有。
磁盘紧张时该选 Apple Speech 还是 Whisper Small?
我们为两者都干净测到的十种语言里,八种该选 Apple Speech。韩语它是 4.31% 字错率,Whisper Small 是 7.30%;意大利语 4.39% 对 7.64% 词错率;西班牙语 5.41% 对 6.22%;德语 6.26% 对 8.67%;日语 6.36% 对 11.37% 字错率;法语 7.61% 对 13.24%;中文 7.97% 对 20.50% 字错率;粤语 8.69% 对 119.01% 字错率。Whisper Small 领先的是英语,7.04% 对 8.80%,还有巴西葡萄牙语,8.61% 对 9.35%。而且 Apple Speech 什么都不用下载,Whisper Small 是一个 600 MB 的模型文件。仍然值得留着 Whisper Small 的理由是广度:它覆盖 app 语言表里的全部语言,包括 Apple Speech 在这里缺的那三种,而且它在每个渠道都能用——iPhone、Mac App Store 版和直接下载版都有。
SpeechAnalyzer 是什么?它和苹果的听写是一回事吗?
SpeechAnalyzer 是苹果在 WWDC 2025 发布、随 macOS 26 和 iOS 26 一起交付的总的 API。SpeechTranscriber 是它里面的转录工作点,我们测的就是这个,本文说的 Apple Speech 也是它。听写是另一个工作点,兼容的那个,我们也跑了:两者都干净测到的十种语言,Apple Speech 全部更准,中位的那种语言少掉大约三分之一的错误,法语和德语少掉一半以上。逐语言的表在上面那一节里。听写覆盖的语言确实更多——我们这一轮里是 33 个配置对 21 个——所以如果你需要一个系统引擎来做荷兰语、波兰语或俄语,又能接受 17.34%、13.50% 和 13.13% 的词错率,它就是那个选项;同一批片段上 Whisper Large V3 Turbo 是 5.69%、5.45% 和 5.13%。
用 Apple Speech 时音频会离开我的 Mac 吗?
苹果把 SpeechTranscriber 写成设备端语音识别,我们这次测的就是这个 API:语言资源由 macOS 下载一次,识别本身在本地跑。我们这篇测的是准确率和速度,不是网络行为,所以这部分我们按苹果自己的说法转述。Whisper Notes 自己下载的那几个引擎——Whisper、Parakeet V3、SenseVoice 和 Qwen3-ASR——跑在你 Mac 自己的 GPU 或神经引擎上,不需要账号,不需要 API key,断网也能转写,每个渠道都是如此。
为什么这些数字和我在自己的录音上得到的准确率对不上?
因为 FLEURS 是短句、干净的朗读语音,而你的录音不是。我们这一轮是在公开数据集上做的校准:每种语言约 150 句、约 30 分钟音频,一台 M5 MacBook Air,所有引擎听同样的片段。它适合判断某个引擎在某种语言上值不值得一试,不能用来预测你在会议、噪声环境、带口音的语音或两小时长文件上的准确率。
去试试
这次对比里需要下载的那五个模型——Whisper Small、Whisper Large V3 Turbo、Parakeet V3、SenseVoice Small 和 Qwen3-ASR 1.7B——在 Mac 版 Whisper Notes 的直接下载版(DMG)里都有,位置是设置 → 转录模型。朗读语音只是个起点,你自己的音频才是真正的考题。
某种语言上我们的数字和你的实际体验对不上,写信到 mac@whispernotes.app 告诉我们。完整更新说明:whispernotes.app/changelog。
以上所有数据的来源:我们在 Google FLEURS 测试集 70bb2e84 版本上的测试、苹果的 SpeechAnalyzer 文档,以及在此之前那次三十种语言的 Qwen3-ASR 测试。