Qwen3-ASR 1.7B 对比 Whisper Large V3 Turbo:哪些语言更准(Mac 实测)

2026年8月25日
·
11 min read
·Whisper Notes Team

我们想探究一个问题:有哪个本地模型,在你使用的语言上比 Whisper Large V3 更准?于是我们在 FLEURS 数据集上测试了这几个模型。

FLEURS 是 Google 的数据集,包含 102 种语言的朗读音频。我们从每种语言中挑选约 150 句,让这五个模型听同一批片段、同样的顺序:

  • Parakeet V3
  • Whisper Large V3 Turbo
  • SenseVoice Small
  • Whisper Small
  • Qwen3-ASR 1.7B

大概结果是这样的。

Qwen3-ASR 1.7B 对 Whisper Large V3 Turbo——我们自己跑的 FLEURS,一台 M5 MacBook Air,朗读语音,短片段。

Qwen3-ASR 1.7B Whisper Large V3 Turbo
支持语言 30 种 101 种
显著优势 粤语、印地语、泰语、越南语、法语等(7 种) 芬兰语、匈牙利语、希腊语等 11 种
速度 9.6 倍实时 2.6 倍实时
峰值内存 2.43 GiB 1.87 GiB
下载体积 约 2.5 GB 约 1.6 GB

除了各自的优势语言外,二者的准确率差异不大。

Whisper Large V3 和 Qwen3-ASR 详细对比

全部 30 种语言,按 Qwen 领先最多到落后最多排,两列都是越低越好。

我们自己跑的 FLEURS,一台 M5 MacBook Air,朗读语音。中文、粤语、日语、韩语、泰语为字错率,其余为词错率;标绿表示领先超出配对 95% 误差范围。

语言 Qwen3-ASR 1.7B Whisper Large V3 Turbo
粤语 6.44 36.75
印地语 13.19 29.64
泰语 6.53 13.40
越南语 4.91 8.10
中文 6.49 7.97
印尼语 4.91 6.31
阿拉伯语 14.32 15.72
法语 4.57 5.97
德语 2.85 4.05
英语 4.49 5.49
韩语 3.54 4.25
波斯语 30.32 30.93
葡萄牙语 5.17 5.44
西班牙语 3.38 3.62
意大利语 2.58 2.58
日语 5.74 5.30
俄语 5.65 5.13
马其顿语 18.57 17.46
马来语 10.62 9.22
荷兰语 7.36 5.69
土耳其语 8.81 5.95
波兰语 12.59 5.45
丹麦语 22.24 13.63
瑞典语 19.80 8.78
罗马尼亚语 20.20 8.36
捷克语 24.59 11.94
菲律宾语 23.31 9.72
希腊语 30.22 13.94
芬兰语 27.71 7.11
匈牙利语 36.63 14.59

我们自己的配对测试,FLEURS 测试集版本 70bb2e84,每种语言约 150 句,一台 M5 MacBook Air。

Qwen3-ASR 1.7B 明确赢下的 7 种。错误率百分比(Qwen 对 Turbo):粤语(6.4 对 36.8)、印地语(13.2 对 29.6)、泰语(6.5 对 13.4)、越南语(4.9 对 8.1)、法语(4.6 对 6.0)、德语(2.9 对 4.1)、英语(4.5 对 5.5)。粤语、泰语为字错率,其余为词错率。它的优势集中在按字计分的语言上:中文、粤语、日语、韩语、泰语这五种它平均 5.7%,Turbo 是 13.5%;按词计分的另外二十五种反过来,它平均 14.4%,Turbo 是 10.2%。

Whisper Large V3 Turbo 明确赢下的 11 种。错误率百分比(Qwen 对 Turbo),都是词错率:匈牙利语(36.6 对 14.6)、希腊语(30.2 对 13.9)、芬兰语(27.7 对 7.1)、捷克语(24.6 对 11.9)、菲律宾语(23.3 对 9.7)、丹麦语(22.2 对 13.6)、罗马尼亚语(20.2 对 8.4)、瑞典语(19.8 对 8.8)、波兰语(12.6 对 5.5)、土耳其语(8.8 对 6.0)、荷兰语(7.4 对 5.7)。

接近或持平的 12 种。西班牙语(3.4 对 3.6)、意大利语(2.6 对 2.6)、俄语(5.7 对 5.1)、葡萄牙语(5.2 对 5.4);中文(6.5 对 8.0)、日语(5.7 对 5.3)、韩语(3.5 对 4.3)为字错率。此外还有阿拉伯语、印尼语、波斯语、马来语、马其顿语。这一档的差距都很小,全落在 95% 区间以内,本轮数据分不出高下。

粤语是唯一一行真会改变选择的。同一批音频上,Whisper Large V3 Turbo 是 36.75% 字错率,我们此前推荐用来做粤语的 SenseVoice Small 是 37.23%,两个都在 37% 上下;Qwen3-ASR 1.7B 是 6.44%。在这套朗读语音上,前两个数字都撑不住粤语,所以旧的推荐从现在起带上这个限定。

Qwen3-ASR 1.7B 有多快?

五个引擎在同一套测试、同一台机器(M5 Air)上测得,彼此之间至少是可比的。

同一次 FLEURS 测试里,各引擎在自己支持的语言上的实时倍率中位数,一台 M5 MacBook Air,朗读语音。

引擎 语言数 本轮速度中位数(短片段)
SenseVoice Small 6 个选项 162.3 倍
Parakeet TDT 0.6B v3 25 83.0 倍
Qwen3-ASR 1.7B 标称 30 种 9.6 倍
Whisper Small 101 7.0 倍
Whisper Large V3 Turbo 101 2.6 倍

这些是短片段的测试台数据,比同样的引擎处理长录音时要低。这一列只用来在这一轮里横向比较各引擎,别处不作数。

同一套测试里,Parakeet V3 和 SenseVoice Small 比 Qwen3-ASR 快了大约一个数量级。换成长文件而不是短片段,Parakeet 在 M4 Pro 上跑到过 103 倍实时,SenseVoice 是 52 倍以上(另一套音频上的另一种测量,但指向一致)。

Qwen3-ASR 落在中间。本轮短片段测试里它不是最慢的,最慢的是 Whisper Large V3 Turbo。但它在语言之间的波动比谁都大,希腊语 2.8 倍,日语 13.4 倍。

Qwen3-ASR 占多少内存和磁盘?

峰值内存是同一次 FLEURS 测试中逐条目观测到的进程最大占用,一台 M5 MacBook Air,朗读语音,短片段。

引擎 下载体积 本轮峰值内存
Parakeet TDT 0.6B v3 465 MB 0.09 GiB
Whisper Small 600 MB 0.87 GiB
SenseVoice Small 827 MB 0.95 GiB
Whisper Large V3 Turbo 约 1.6 GB 1.87 GiB
Qwen3-ASR 1.7B 约 2.5 GB 2.43 GiB

两条轴上 Qwen3-ASR 都是五个里最重的:下载约 2.5 GB,本轮进程峰值内存 2.43 GiB;Whisper Large V3 Turbo 是约 1.6 GB 和 1.87 GiB。

8 GB 内存的机器上有更轻的路。Parakeet V3 用 465 MB 和 0.09 GiB 覆盖 25 种语言,Whisper Small 用 600 MB 和 0.87 GiB 覆盖 101 种。

我们怎么测的:FLEURS、30 种语言、一台 Mac

Qwen3-ASR 1.7B 用的是 MLX 8-bit 版本,Whisper Large V3 Turbo 用的是 whisper.cpp 的 ggml 版本,跑在 Metal 上。数据是 Google FLEURS 测试集 70bb2e84 版(CC-BY-4.0),102 种语言里跑了 83 种,所有模型听同一批片段、同样的顺序;配对对比是 Qwen 标称的那 30 种,每种约 150 句、约 30 分钟音频。空格分词的语言用词错率,中文、粤语、日语、韩语、泰语用字错率,两者不合并成一个总分;误差范围是每格 10,000 次条目级自助重采样。机器是一台 M5 MacBook Air,32 GB,macOS 27.0,两个模型都没有空输出或失败。

FLEURS 是朗读语音,不是会议,也不是听写。朗读集排名在真实音频面前失效过两次,所以我们不往长录音上外推:这些表用来判断一个模型在你的语言上值不值得一试,不是你能拿到的准确率。真实会议上的评测跑完会另写一篇。

该不该用 Qwen3-ASR 替代 Whisper Large V3?

按语言来看,在 Mac 版 Whisper Notes 里,我们会这样回答。

  • 如果你转写粤语、印地语、泰语、越南语、法语、德语或英语:选 Qwen3-ASR 1.7B。
  • 如果你转写中文、韩语或西班牙语:它只领先一点点,我们也只敢说这一点点。两个模型都可以用,日语、意大利语、波斯语、阿拉伯语、印尼语、俄语、葡萄牙语、马其顿语和马来语也是。
  • 如果你转写芬兰语、匈牙利语、希腊语、捷克语、瑞典语、丹麦语、波兰语、罗马尼亚语、菲律宾语、土耳其语或荷兰语:继续用 Whisper Large V3 Turbo,这十一种它都明确胜出。
  • 如果你在意的是速度和占用:这个引擎不适合你。同一套测试里 Parakeet V3 和 SenseVoice Small 快了一个数量级,体积也只有它的零头;Whisper Small 用 600 MB 覆盖 101 种语言,本轮 7.0 倍。
  • 如果你用的是 iPhone 版或 Mac App Store 版:这个引擎目前还没有到那两个渠道,粤语在那里用 SenseVoice。

这是 Mac 版 Whisper Notes 把阿里巴巴开源的 Qwen3-ASR 移植到设备上的版本:开放权重转成 Apple MLX 的 8-bit,跑在你自己 Mac 的 GPU 上,不需要把音频上传给阿里巴巴的服务器。它和 Mac 直接下载版(DMG)1.5.0 里被 SenseVoice 换掉的那个 0.6B 不是同一个模型。

基本使用方法(Mac 直接下载版 DMG 1.6.0 及以后):设置 → 转录模型 → Qwen3-ASR 1.7B。模型首次使用时在 app 内下载,约 2.5 GB。它要 macOS 15 及以上、Apple 芯片,建议 16 GB 内存;app 的其余部分在 macOS 14 上就能跑。按引擎划分的语言表在语言支持页上。本地 CLI 和 MCP 服务接受 qwen、qwen3、qwen3-asr 三个名字。

不想换的话什么都不用改,Parakeet V3 仍是默认。

常见问题

Qwen3-ASR 比 Whisper Large V3 Turbo 更准吗?

取决于语言,而且比分接近对半。在我们自己用 Mac 版 Whisper Notes 跑的 FLEURS 测试中,两个模型共同覆盖的 30 种语言里,Qwen3-ASR 1.7B 赢 14 种,Whisper Large V3 Turbo 赢 15 种,意大利语是一个精确的平局——我们保留的每一位小数都相同。Qwen 明确领先的是粤语(6.44% 对 36.75% 字错率)、印地语(13.19% 对 29.64% 词错率)、泰语、越南语、法语、德语和英语。Turbo 明确领先的是芬兰语(7.11% 对 27.71% 词错率)、匈牙利语、希腊语、捷克语、瑞典语、丹麦语、波兰语、罗马尼亚语、菲律宾语、土耳其语和荷兰语。30 个差距里有 12 个落在误差范围内,应当视为平手。如果你的语言在 Qwen 领先的那一列,而且你用的是 Whisper Notes 的 Mac 直接下载版(DMG),就选 Qwen3-ASR;其余情况、以及 Qwen 那 30 种之外的所有语言,选 Whisper Large V3 Turbo——它覆盖全部 101 个语言选项。

iPhone 版或 Mac App Store 版能用 Qwen3-ASR 吗?

目前它在 Whisper Notes 的 Mac 直接下载版(DMG)1.6.0 及以后的版本里。Mac App Store 版计划在后续版本中逐步支持新引擎,具体时间我们还说不准。在那之前,iPhone 版和 Mac App Store 版有三个引擎系列——Whisper、Parakeet V3、SenseVoice——而 Qwen 能识别的每一种语言,这些渠道的 Whisper 也都覆盖。按模型数量算,Mac App Store 版目前是四个,直接下载版是五个,因为 Whisper 有 Small 和 Large V3 Turbo 两档。如果你需要在 iPhone 上转写粤语,那里用 SenseVoice。

中文、日语、韩语该选 Qwen3-ASR 还是 SenseVoice?

准确率很接近,速度差得很远。我们的 FLEURS 测试中,Qwen3-ASR 中文字错率 6.49%、日语 5.74%、韩语 3.54%;SenseVoice Small 在同一批音频上分别是 7.69%、6.78%、7.85%。但同一轮里 SenseVoice 的实时倍率中位数是 162 倍,Qwen 是 9.6 倍;下载体积是 827 MB 对约 2.5 GB;而且 SenseVoice 在 iPhone 和两个 Mac 版本上都能用。除非你转写的是粤语——那里 Qwen3-ASR 是 6.44% 字错率、SenseVoice 是 37.23%,差距大到值得多等一会儿——否则选 SenseVoice。

Qwen3-ASR 1.7B 的系统要求是什么?

需要一台 Apple 芯片的 Mac,macOS 15 或更高版本,建议 16 GB 内存,另需约 2.5 GB 磁盘空间存放模型。这比 Mac 版 Whisper Notes 其余部分的要求更高——app 本身在 macOS 14 及以上就能运行。我们的测试中该模型进程峰值内存为 2.43 GiB,是五个引擎里最高的。如果你的 Mac 是 8 GB 内存,Whisper Small 用 600 MB 覆盖同样的 101 种语言,Parakeet V3 用 465 MB 覆盖 25 种欧洲语言。

用 Qwen3-ASR 时音频会离开我的 Mac 吗?

不会。阿里巴巴确实也把 Qwen3-ASR 做成云服务,通过百炼(DashScope)的实时 API 和录音文件转写 API 提供,那条路径需要把音频上传到他们的服务器。Whisper Notes 不使用这些接口。它把开放权重作为 MLX 8-bit 模型跑在你 Mac 自己的 GPU 上,不需要账号,不需要 API key,断网也能转写。app 里每个引擎系列、每个渠道都是如此。

为什么这些数字和我在自己的录音上得到的准确率对不上?

因为 FLEURS 是短句、干净的朗读语音,而你的录音不是。我们这一轮是在公开数据集上做的校准:每种语言约 150 句,一台 M5 MacBook Air,所有模型听同样的片段。它适合判断某个模型在某种语言上值不值得一试,不能用来预测你在会议、噪声环境、带口音的语音或两小时长文件上的准确率。

去试试

Qwen3-ASR 1.7B 在 Mac 版 Whisper Notes 1.6.0 及以后的直接下载版(DMG)里。位置是设置 → 转录模型。每周免费额度是 5,000 字,够你把自己的语言跑一遍,然后来反驳上面那几张表。

某种语言上我们的数字和你的实际体验对不上,写信到 mac@whispernotes.app 告诉我们。完整更新说明:whispernotes.app/changelog。

以上所有数据的来源:我们在 Google FLEURS 测试集 70bb2e84 版本上的测试、Qwen3-ASR 1.7B 模型卡,以及语言支持页上按引擎划分的语言表——那张表由 app 源码生成。