我们想探究一个问题:有哪个本地模型,在你使用的语言上比 Whisper Large V3 更准?于是我们在 FLEURS 数据集上测试了这几个模型。
FLEURS 是 Google 的数据集,包含 102 种语言的朗读音频。我们从每种语言中挑选约 150 句,让这五个模型听同一批片段、同样的顺序:
- Parakeet V3
- Whisper Large V3 Turbo
- SenseVoice Small
- Whisper Small
- Qwen3-ASR 1.7B
大概结果是这样的。
Qwen3-ASR 1.7B 对 Whisper Large V3 Turbo——我们自己跑的 FLEURS,一台 M5 MacBook Air,朗读语音,短片段。
| Qwen3-ASR 1.7B | Whisper Large V3 Turbo | |
|---|---|---|
| 支持语言 | 30 种 | 101 种 |
| 显著优势 | 粤语、印地语、泰语、越南语、法语等(7 种) | 芬兰语、匈牙利语、希腊语等 11 种 |
| 速度 | 9.6 倍实时 | 2.6 倍实时 |
| 峰值内存 | 2.43 GiB | 1.87 GiB |
| 下载体积 | 约 2.5 GB | 约 1.6 GB |
除了各自的优势语言外,二者的准确率差异不大。
Whisper Large V3 和 Qwen3-ASR 详细对比
全部 30 种语言,按 Qwen 领先最多到落后最多排,两列都是越低越好。
我们自己跑的 FLEURS,一台 M5 MacBook Air,朗读语音。中文、粤语、日语、韩语、泰语为字错率,其余为词错率;标绿表示领先超出配对 95% 误差范围。
| 语言 | Qwen3-ASR 1.7B | Whisper Large V3 Turbo |
|---|---|---|
| 粤语 | 6.44 | 36.75 |
| 印地语 | 13.19 | 29.64 |
| 泰语 | 6.53 | 13.40 |
| 越南语 | 4.91 | 8.10 |
| 中文 | 6.49 | 7.97 |
| 印尼语 | 4.91 | 6.31 |
| 阿拉伯语 | 14.32 | 15.72 |
| 法语 | 4.57 | 5.97 |
| 德语 | 2.85 | 4.05 |
| 英语 | 4.49 | 5.49 |
| 韩语 | 3.54 | 4.25 |
| 波斯语 | 30.32 | 30.93 |
| 葡萄牙语 | 5.17 | 5.44 |
| 西班牙语 | 3.38 | 3.62 |
| 意大利语 | 2.58 | 2.58 |
| 日语 | 5.74 | 5.30 |
| 俄语 | 5.65 | 5.13 |
| 马其顿语 | 18.57 | 17.46 |
| 马来语 | 10.62 | 9.22 |
| 荷兰语 | 7.36 | 5.69 |
| 土耳其语 | 8.81 | 5.95 |
| 波兰语 | 12.59 | 5.45 |
| 丹麦语 | 22.24 | 13.63 |
| 瑞典语 | 19.80 | 8.78 |
| 罗马尼亚语 | 20.20 | 8.36 |
| 捷克语 | 24.59 | 11.94 |
| 菲律宾语 | 23.31 | 9.72 |
| 希腊语 | 30.22 | 13.94 |
| 芬兰语 | 27.71 | 7.11 |
| 匈牙利语 | 36.63 | 14.59 |
我们自己的配对测试,FLEURS 测试集版本 70bb2e84,每种语言约 150 句,一台 M5 MacBook Air。
Qwen3-ASR 1.7B 明确赢下的 7 种。错误率百分比(Qwen 对 Turbo):粤语(6.4 对 36.8)、印地语(13.2 对 29.6)、泰语(6.5 对 13.4)、越南语(4.9 对 8.1)、法语(4.6 对 6.0)、德语(2.9 对 4.1)、英语(4.5 对 5.5)。粤语、泰语为字错率,其余为词错率。它的优势集中在按字计分的语言上:中文、粤语、日语、韩语、泰语这五种它平均 5.7%,Turbo 是 13.5%;按词计分的另外二十五种反过来,它平均 14.4%,Turbo 是 10.2%。
Whisper Large V3 Turbo 明确赢下的 11 种。错误率百分比(Qwen 对 Turbo),都是词错率:匈牙利语(36.6 对 14.6)、希腊语(30.2 对 13.9)、芬兰语(27.7 对 7.1)、捷克语(24.6 对 11.9)、菲律宾语(23.3 对 9.7)、丹麦语(22.2 对 13.6)、罗马尼亚语(20.2 对 8.4)、瑞典语(19.8 对 8.8)、波兰语(12.6 对 5.5)、土耳其语(8.8 对 6.0)、荷兰语(7.4 对 5.7)。
接近或持平的 12 种。西班牙语(3.4 对 3.6)、意大利语(2.6 对 2.6)、俄语(5.7 对 5.1)、葡萄牙语(5.2 对 5.4);中文(6.5 对 8.0)、日语(5.7 对 5.3)、韩语(3.5 对 4.3)为字错率。此外还有阿拉伯语、印尼语、波斯语、马来语、马其顿语。这一档的差距都很小,全落在 95% 区间以内,本轮数据分不出高下。
粤语是唯一一行真会改变选择的。同一批音频上,Whisper Large V3 Turbo 是 36.75% 字错率,我们此前推荐用来做粤语的 SenseVoice Small 是 37.23%,两个都在 37% 上下;Qwen3-ASR 1.7B 是 6.44%。在这套朗读语音上,前两个数字都撑不住粤语,所以旧的推荐从现在起带上这个限定。
Qwen3-ASR 1.7B 有多快?
五个引擎在同一套测试、同一台机器(M5 Air)上测得,彼此之间至少是可比的。
同一次 FLEURS 测试里,各引擎在自己支持的语言上的实时倍率中位数,一台 M5 MacBook Air,朗读语音。
| 引擎 | 语言数 | 本轮速度中位数(短片段) |
|---|---|---|
| SenseVoice Small | 6 个选项 | 162.3 倍 |
| Parakeet TDT 0.6B v3 | 25 | 83.0 倍 |
| Qwen3-ASR 1.7B | 标称 30 种 | 9.6 倍 |
| Whisper Small | 101 | 7.0 倍 |
| Whisper Large V3 Turbo | 101 | 2.6 倍 |
这些是短片段的测试台数据,比同样的引擎处理长录音时要低。这一列只用来在这一轮里横向比较各引擎,别处不作数。
同一套测试里,Parakeet V3 和 SenseVoice Small 比 Qwen3-ASR 快了大约一个数量级。换成长文件而不是短片段,Parakeet 在 M4 Pro 上跑到过 103 倍实时,SenseVoice 是 52 倍以上(另一套音频上的另一种测量,但指向一致)。
Qwen3-ASR 落在中间。本轮短片段测试里它不是最慢的,最慢的是 Whisper Large V3 Turbo。但它在语言之间的波动比谁都大,希腊语 2.8 倍,日语 13.4 倍。
Qwen3-ASR 占多少内存和磁盘?
峰值内存是同一次 FLEURS 测试中逐条目观测到的进程最大占用,一台 M5 MacBook Air,朗读语音,短片段。
| 引擎 | 下载体积 | 本轮峰值内存 |
|---|---|---|
| Parakeet TDT 0.6B v3 | 465 MB | 0.09 GiB |
| Whisper Small | 600 MB | 0.87 GiB |
| SenseVoice Small | 827 MB | 0.95 GiB |
| Whisper Large V3 Turbo | 约 1.6 GB | 1.87 GiB |
| Qwen3-ASR 1.7B | 约 2.5 GB | 2.43 GiB |
两条轴上 Qwen3-ASR 都是五个里最重的:下载约 2.5 GB,本轮进程峰值内存 2.43 GiB;Whisper Large V3 Turbo 是约 1.6 GB 和 1.87 GiB。
8 GB 内存的机器上有更轻的路。Parakeet V3 用 465 MB 和 0.09 GiB 覆盖 25 种语言,Whisper Small 用 600 MB 和 0.87 GiB 覆盖 101 种。
我们怎么测的:FLEURS、30 种语言、一台 Mac
Qwen3-ASR 1.7B 用的是 MLX 8-bit 版本,Whisper Large V3 Turbo 用的是 whisper.cpp 的 ggml 版本,跑在 Metal 上。数据是 Google FLEURS 测试集 70bb2e84 版(CC-BY-4.0),102 种语言里跑了 83 种,所有模型听同一批片段、同样的顺序;配对对比是 Qwen 标称的那 30 种,每种约 150 句、约 30 分钟音频。空格分词的语言用词错率,中文、粤语、日语、韩语、泰语用字错率,两者不合并成一个总分;误差范围是每格 10,000 次条目级自助重采样。机器是一台 M5 MacBook Air,32 GB,macOS 27.0,两个模型都没有空输出或失败。
FLEURS 是朗读语音,不是会议,也不是听写。朗读集排名在真实音频面前失效过两次,所以我们不往长录音上外推:这些表用来判断一个模型在你的语言上值不值得一试,不是你能拿到的准确率。真实会议上的评测跑完会另写一篇。
该不该用 Qwen3-ASR 替代 Whisper Large V3?
按语言来看,在 Mac 版 Whisper Notes 里,我们会这样回答。
- 如果你转写粤语、印地语、泰语、越南语、法语、德语或英语:选 Qwen3-ASR 1.7B。
- 如果你转写中文、韩语或西班牙语:它只领先一点点,我们也只敢说这一点点。两个模型都可以用,日语、意大利语、波斯语、阿拉伯语、印尼语、俄语、葡萄牙语、马其顿语和马来语也是。
- 如果你转写芬兰语、匈牙利语、希腊语、捷克语、瑞典语、丹麦语、波兰语、罗马尼亚语、菲律宾语、土耳其语或荷兰语:继续用 Whisper Large V3 Turbo,这十一种它都明确胜出。
- 如果你在意的是速度和占用:这个引擎不适合你。同一套测试里 Parakeet V3 和 SenseVoice Small 快了一个数量级,体积也只有它的零头;Whisper Small 用 600 MB 覆盖 101 种语言,本轮 7.0 倍。
- 如果你用的是 iPhone 版或 Mac App Store 版:这个引擎目前还没有到那两个渠道,粤语在那里用 SenseVoice。
这是 Mac 版 Whisper Notes 把阿里巴巴开源的 Qwen3-ASR 移植到设备上的版本:开放权重转成 Apple MLX 的 8-bit,跑在你自己 Mac 的 GPU 上,不需要把音频上传给阿里巴巴的服务器。它和 Mac 直接下载版(DMG)1.5.0 里被 SenseVoice 换掉的那个 0.6B 不是同一个模型。
基本使用方法(Mac 直接下载版 DMG 1.6.0 及以后):设置 → 转录模型 → Qwen3-ASR 1.7B。模型首次使用时在 app 内下载,约 2.5 GB。它要 macOS 15 及以上、Apple 芯片,建议 16 GB 内存;app 的其余部分在 macOS 14 上就能跑。按引擎划分的语言表在语言支持页上。本地 CLI 和 MCP 服务接受 qwen、qwen3、qwen3-asr 三个名字。
不想换的话什么都不用改,Parakeet V3 仍是默认。
常见问题
Qwen3-ASR 比 Whisper Large V3 Turbo 更准吗?
取决于语言,而且比分接近对半。在我们自己用 Mac 版 Whisper Notes 跑的 FLEURS 测试中,两个模型共同覆盖的 30 种语言里,Qwen3-ASR 1.7B 赢 14 种,Whisper Large V3 Turbo 赢 15 种,意大利语是一个精确的平局——我们保留的每一位小数都相同。Qwen 明确领先的是粤语(6.44% 对 36.75% 字错率)、印地语(13.19% 对 29.64% 词错率)、泰语、越南语、法语、德语和英语。Turbo 明确领先的是芬兰语(7.11% 对 27.71% 词错率)、匈牙利语、希腊语、捷克语、瑞典语、丹麦语、波兰语、罗马尼亚语、菲律宾语、土耳其语和荷兰语。30 个差距里有 12 个落在误差范围内,应当视为平手。如果你的语言在 Qwen 领先的那一列,而且你用的是 Whisper Notes 的 Mac 直接下载版(DMG),就选 Qwen3-ASR;其余情况、以及 Qwen 那 30 种之外的所有语言,选 Whisper Large V3 Turbo——它覆盖全部 101 个语言选项。
iPhone 版或 Mac App Store 版能用 Qwen3-ASR 吗?
目前它在 Whisper Notes 的 Mac 直接下载版(DMG)1.6.0 及以后的版本里。Mac App Store 版计划在后续版本中逐步支持新引擎,具体时间我们还说不准。在那之前,iPhone 版和 Mac App Store 版有三个引擎系列——Whisper、Parakeet V3、SenseVoice——而 Qwen 能识别的每一种语言,这些渠道的 Whisper 也都覆盖。按模型数量算,Mac App Store 版目前是四个,直接下载版是五个,因为 Whisper 有 Small 和 Large V3 Turbo 两档。如果你需要在 iPhone 上转写粤语,那里用 SenseVoice。
中文、日语、韩语该选 Qwen3-ASR 还是 SenseVoice?
准确率很接近,速度差得很远。我们的 FLEURS 测试中,Qwen3-ASR 中文字错率 6.49%、日语 5.74%、韩语 3.54%;SenseVoice Small 在同一批音频上分别是 7.69%、6.78%、7.85%。但同一轮里 SenseVoice 的实时倍率中位数是 162 倍,Qwen 是 9.6 倍;下载体积是 827 MB 对约 2.5 GB;而且 SenseVoice 在 iPhone 和两个 Mac 版本上都能用。除非你转写的是粤语——那里 Qwen3-ASR 是 6.44% 字错率、SenseVoice 是 37.23%,差距大到值得多等一会儿——否则选 SenseVoice。
Qwen3-ASR 1.7B 的系统要求是什么?
需要一台 Apple 芯片的 Mac,macOS 15 或更高版本,建议 16 GB 内存,另需约 2.5 GB 磁盘空间存放模型。这比 Mac 版 Whisper Notes 其余部分的要求更高——app 本身在 macOS 14 及以上就能运行。我们的测试中该模型进程峰值内存为 2.43 GiB,是五个引擎里最高的。如果你的 Mac 是 8 GB 内存,Whisper Small 用 600 MB 覆盖同样的 101 种语言,Parakeet V3 用 465 MB 覆盖 25 种欧洲语言。
用 Qwen3-ASR 时音频会离开我的 Mac 吗?
不会。阿里巴巴确实也把 Qwen3-ASR 做成云服务,通过百炼(DashScope)的实时 API 和录音文件转写 API 提供,那条路径需要把音频上传到他们的服务器。Whisper Notes 不使用这些接口。它把开放权重作为 MLX 8-bit 模型跑在你 Mac 自己的 GPU 上,不需要账号,不需要 API key,断网也能转写。app 里每个引擎系列、每个渠道都是如此。
为什么这些数字和我在自己的录音上得到的准确率对不上?
因为 FLEURS 是短句、干净的朗读语音,而你的录音不是。我们这一轮是在公开数据集上做的校准:每种语言约 150 句,一台 M5 MacBook Air,所有模型听同样的片段。它适合判断某个模型在某种语言上值不值得一试,不能用来预测你在会议、噪声环境、带口音的语音或两小时长文件上的准确率。
去试试
Qwen3-ASR 1.7B 在 Mac 版 Whisper Notes 1.6.0 及以后的直接下载版(DMG)里。位置是设置 → 转录模型。每周免费额度是 5,000 字,够你把自己的语言跑一遍,然后来反驳上面那几张表。
某种语言上我们的数字和你的实际体验对不上,写信到 mac@whispernotes.app 告诉我们。完整更新说明:whispernotes.app/changelog。
以上所有数据的来源:我们在 Google FLEURS 测试集 70bb2e84 版本上的测试、Qwen3-ASR 1.7B 模型卡,以及语言支持页上按引擎划分的语言表——那张表由 app 源码生成。