录音不会离开这台设备
大多数打着 Whisper 名号的应用,是把你的音频传到服务器上跑模型。Whisper Notes 在你的 iPhone 或 Mac 上跑——这个做法开发起来更难,但要解释清楚就简单多了。
为什么要把模型放在设备上跑?
每个转录应用在做别的决定之前,都先做了一个决定:音频在哪里被处理。传到服务器上是更容易的做法,而且能用上最大的模型,那些模型到今天仍然稍微更准一些。让模型在手机或笔记本上跑要难做得多,但换来的是:录音没有地方可去。
我们选了后者,理由比"保护隐私"这种口号要具体。声音是生物特征,密码泄露了可以改,声音不行。音频一旦落在别人的基础设施上,它就同时受制于对方的泄露记录、留存策略,以及条款里关于训练数据的那几行——这三件事只要文件还在,你就得一直盯着。
Whisper Notes 把 Whisper Large V3 Turbo、Parakeet V3 或 SenseVoice 跑在你设备的神经网络引擎上,链路里根本没有转录服务器。没有队列,没有上传,开飞行模式和连着 Wi-Fi 是一样的。最后这一条,与其信我们,不如你自己试一下。
免费的 Whisper 应用,代价是什么?
一个不收钱的转录工具,通常是这样运转的:音频传到服务器,模型在那边跑,录音留存的时间足够长,长到对运营方有用。对很多人来说这笔交换是划算的。只是值得知道,你确实做了这笔交换。
为什么录音和密码不是一回事
密码泄露只是麻烦一下午,因为你可以改掉它。声音泄露是永久的,因为用来识别你的东西就是声音本身,而几秒钟的音频,携带的声学特征已经足够在别处把你认出来。
最近变了的,是攻击者需要的音频变得很少。把一个人的声音克隆到能骗过人,现在只要几秒钟的样本,而不再是几分钟。2025 年就有人用克隆的意大利国防部长的声音,向几位商人行骗。我们不是说这大概率会发生在你身上,只是想指出:这是唯一一类泄露之后你没法更换的数据。
所以音频送去转录服务时,被存下来的不是一份文档,而是一段生物特征——存在一个留存策略不由你定的地方。
转录数据到底是怎么泄露的
出事的方式很少是那种戏剧性的入侵。真实情况是,音频和转录稿经过的系统,比任何架构图上画的都多:转录服务商、它背后的模型提供方、一层日志、一条分析管线、一份备份。每一处都可能因为一个配置错误就把私密变成公开;环节越多,越没有人能说清某一份录音此刻究竟在哪。
医疗行业给出了最清楚的例子——受保护的健康信息通过转录集成和配置错误的存储泄露出去,而不是因为什么称得上"攻击"的事。客服中心给出了另一个:转录稿流向模型,账号却没打码就进了调试日志。
这些都不是在说云端转录很鲁莽。它们说的是:该数的是"有多少个系统各存了一份",而设备端处理把这个数字压到了 1。
风往哪边吹?
2025 年 3 月,亚马逊把 Echo 上的"不发送语音录音"这个开关取消了。此后对 Alexa 说的每一句话都会送到亚马逊的服务器,也不再有关掉它的地方。
一个产品去掉一个开关算不上趋势,但背后的动机是长期存在的:训练数据有价值,而一个会减少数据收集量的开关,就永远处在商业压力之下。隐私设置本质上是一个承诺,而承诺可以在某一版发布说明里被改写。
Whisper Notes 的做法是让这种开关根本不存在。没有服务器可以发送音频,所以"不要发送"不是我们在遵守的一项偏好设置,而是对这个应用能力边界的描述。
免费工具三年下来花多少
不收钱的网页工具,一般都在条款里保留了"用你的音频改进模型"的权利,而那份条款几乎没人读。按分钟计费的 API 看起来很便宜,$0.006 到 $0.40 一分钟,直到你每周转一小时的音频,一年的账单就到了几百美元。订阅制反而是这套安排里最诚实的版本:Otter 一年大约 $99,而且它明说了。
Whisper Notes 是 App Store $7.99、官网直下 Mac 版 $14,都只付一次。下面这张表就是全部的价格论证,而重点在第四行:免费那个选项和付一次那个选项,三年下来花的钱差不多,区别在于录音去了哪。
每年成本
| 服务类型 | 第1年 | 第2年 | 第3年 | 数据处理 |
|---|---|---|---|---|
| Whisper Notes | $7.99 | $0 | $0 | 永不离开设备 |
| 订阅服务 | $99 | $99 | $99 | 云端处理 |
| 按分钟云API | $120-480 | $120-480 | $120-480 | 云端处理 |
| "免费"网页工具 | $0 | $0 | $0 | 用于AI训练 |
什么情况下你该去用云服务
在干净音频上,云端的大模型确实还要更准一些,因为它们跑在任何手机和笔记本都装不下的尺寸上;它们也能做到边说边出字幕,这一点设备端目前还追不上。这些是真实的优势,我们不打算装作看不见。
如果你需要实时字幕,或者要几个人在会议进行中同时改同一份转录稿,又或者最后那一点点准确率比"音频存在哪"更重要,那云服务就是更合适的工具,我们宁愿你去用。
我们想反驳的只是一件事:不要把准确率的差距当成决策里唯一的数字。做的是有保密义务的活——病历、涉密材料、对消息源的采访——"音频去了哪"是你必须能回答的问题,而最经得起追问的答案,是它哪儿也没去。
浏览器工具、云 API,还是原生应用?
搜"Whisper app",返回的是三种顶着同一个名字、行为却相当不同的东西:在浏览器标签页里跑模型的网页、把模型跑在别人服务器上的 API,以及为你手上这台设备编译的应用。它们的差别大到——先看它属于哪一类,比看功能列表更有用。
浏览器工具
网页工具说自己"本地处理",这通常是真的:音频确实留在标签页里。限制不在于它诚不诚实,而在于一个标签页能做什么。多数浏览器的 WebAssembly 内存上限在 4GB 左右,这就给模型大小封了顶;而通过 JavaScript 做推理,要付出原生代码不必付的速度代价。
真正会让人卡住的限制更具体、也更烦人:你一切到别的应用,它就没法继续跑;硬件加速就算能用也用得别扭;不小心关掉标签页,这一趟就白跑了,没有可续的地方。拿来试模型很合适,拿来存工作就很折磨。
| 处理 | 浏览器中的WebAssembly/TensorFlow.js |
| 模型大小 | 受浏览器内存限制(~4GB) |
| 速度 | 因JavaScript开销而较慢 |
| 隐私 | 比云端好,但浏览器可访问 |
| 可靠性 | 标签页可能崩溃,无后台处理 |
原生应用
Whisper Notes 是为 macOS 和 iOS 编译的,直接跟神经网络引擎打交道——就是驱动 Face ID 和计算摄影的那块专用芯片。这一页上的速度数字之所以可能,全靠它:在 M4 Pro 上,Parakeet V3 处理完 35 分钟的音频大约要 18 秒。
剩下的差别不好看,但更影响日常。你切到别的应用,转录还在跑;被打断之后,它能干净地接上;操作系统的沙盒把它挡在其他应用的数据之外。你的录音和转录文字没有上传通道,这一条你花三十秒就能自己验证:打开飞行模式,转一个文件试试。
| 处理 | 直接访问Apple神经引擎 |
| 模型大小 | Whisper Large V3 Turbo,约 1.5GB |
| 速度 | Parakeet V3 在我们的 M5 Air 上约 60 倍实时 |
| 隐私 | 沙盒化,无网络权限 |
| 可靠性 | 后台处理,系统集成 |
云 API
服务器资源基本没有上限,所以云 API 能跑最大的模型,也能做那些吃算力的功能,实时字幕就是其中之一。在干净音频上,它会是这一页里最准的那个选项。
你让渡的是"知道录音在哪"。它要过公网,在一台不归你管的机器上被处理,按一份不是你写的、而且可以不通知你就改的留存策略保存着。
对有保密义务的心理咨询师、经手涉密材料的律师、要保护消息源的记者来说,评估通常到这里就结束了——不是因为准确率不好,而是因为"你能告诉我这段录音现在在哪吗"这个问题没有好答案。
| 处理 | 远程服务器(无限计算) |
| 模型大小 | 最大可用模型 |
| 速度 | 取决于网络和服务器队列 |
| 隐私 | 音频上传并可能被存储 |
| 可靠性 | 需要网络,受速率限制 |
这样做,我们放弃了什么
做成原生应用,是让隐私这件事从"合同承诺"变成"结构约束"的唯一办法。"先本地处理再同步"和"传输过程加密"都是真话,但这两种系统最后仍然留着你音频的一份副本;我们想要的是那个没有副本可留的版本。
代价体现在功能上。我们做不到边录边出字幕,因为能把这件事做好的模型装不进手机。我们跑不了比你设备容量更大的模型。我们也提供不了多人协同编辑或团队工作区,因为那些都需要一台服务器,而我们没有。
这三件事里只要有一件在你的清单上,那这就不是合适的应用,某个云服务才是。与其让你买完才发现,不如现在就写在这里。
干活的到底是哪个模型?
三个引擎,以及怎么选
技术规格
| AI 模型 | Parakeet V3(默认)、Whisper Large V3 Turbo(Mac)或 Whisper Small(iPhone)、SenseVoice |
| 语言 | Whisper 有 101 个语言选项,Parakeet V3 有 25 种欧洲语言,SenseVoice 有 6 个 |
| 音频格式 | MP3, WAV, M4A, FLAC, AAC, OGG, WMA |
| 处理速度 | Parakeet V3 在我们的 M5 Air 上约 60 倍实时;Whisper Turbo 路线约 11 倍 |
| 文件大小限制 | 应用本身不设限制 |
| 平台 | iOS 18+, macOS 11+(针对Apple Silicon优化) |
它到底能做什么?
日常用得最多的是三件事:把音频弄进来,把文字弄出去,以及让这两件事都留在设备上的那条约束。
离线文件导入
导入音频文件或完成的录音进行高精度离线AI转录。这个离线语音转文字应用使用完整上下文分析处理文件,与在线语音转文字服务相比提供卓越的结果。
- ✓从各种来源导入音频文件(文件、语音备忘录等)
- ✓先录制音频,然后转录以获得最佳准确性
- ✓在使用其他应用时后台离线语音转文字处理
- ✓自动文件组织和转录管理
高级导出选项
为不同用例量身定制的专业级输出格式,从简单文本文档到视频内容的字幕文件。
- ✓可自定义格式的纯文本
- ✓用于视频的SRT和VTT字幕文件
- ✓带时间戳的转录用于参考
- ✓说话者识别和标记
- ✓自定义段落分割
隐私保护:真正的离线语音转文字处理
音频没有上传通道,这不是一项设置,而是这个应用的技术约束——打开飞行模式就能自己验证。
- ✓完全离线语音转文字处理(无数据传输)
- ✓链路里没有需要签 BAA 的第三方数据处理者
- ✓所有离线AI转录的加密本地存储
- ✓无云依赖离线转录软件
- ✓企业离线语音转文字环境的审计追踪
到底有多准,这个数字是哪来的?
公开基准,加上我们自己在指名机器上的实测
我们不做自家的准确率测试——厂商给自己判卷,没什么参考价值。下面的词错误率来自 Hugging Face Open ASR Leaderboard 和 FLEURS 基准,两个都是公开的,也都由跟这款应用没有利害关系的人在维护。速度数字是我们自己测的,机器型号写在下面。
各模型的词错误率
| 模型 | 来源 | 错误率 | 说明 |
|---|---|---|---|
| Parakeet V3(Mac 默认) | Open ASR Leaderboard | 英语 WER 6.32% | 覆盖 25 种欧洲语言;在 FLEURS 上这 25 种平均 12.0% |
| Whisper Large V3 Turbo | Open ASR Leaderboard | 英语 WER 7.83% | 三者中覆盖最广:101 个语言选项 |
| SenseVoice Small | 我们自测,M4 Pro | 27 分钟播客 13.83 秒 | 专为中文、日语、韩语和粤语打造 |
Key Findings
- •Parakeet V3 在 M4 Pro 上把 35 分钟音频转完只要 18 秒;同一个文件 Whisper Turbo 要三分钟左右
- •在英语上,三个模型之间的词错误率差距不到两个百分点
- •这些数字测的是朗读和有准备的讲话。你自己的录音会更差,而且麦克风和几个人抢话对结果的影响,比选哪个模型大得多
在干净音频上,云端大模型仍然领先一点点,因为它们跑在任何手机和笔记本都装不下的尺寸上。这段差距就是「音频永远不离开设备」的代价。如果你的活儿不需要最后那一个百分点,这笔交换通常值。如果需要,那老实说你该用云端服务。
跟其他方案比起来怎么样?
对上云服务、你设备上已有的工具,以及企业软件
这张表里的大部分内容,你花几分钟就能自己核实。要仔细读的是准确率那一行——这四类产品并不是在同一个基准上测出来的。
功能对比
| 功能 | Whisper Notes应用 | 云服务 | 内置工具 | 企业软件 |
|---|---|---|---|---|
| 准确率(英语 WER) | 6.32-7.83%(Open ASR Leaderboard) | 厂商自报,多数没上这个榜单 | 未公布 | 未公布 |
| 音频在哪里被处理 | 在你的设备上 | 厂商的服务器 | 因厂商而异 | 可本地部署 |
| 价格 | iPhone $7.99,Mac $14,只付一次 | $0.006-0.40/分钟 | 免费(有限) | $500-2000/许可证 |
| 语言 | 101 个语言选项 | 50-100种语言 | 10-30种语言 | 20-50种语言 |
| 文件长度限制 | 应用本身不设限制 | 通常1-2小时 | 5-10分钟 | 各异 |
| 需要互联网 | 否 | 是 | 有时 | 本地部署:否 |
Market Position: 三个选项并排放着,这笔交换就清楚了。前沿云 API 在干净音频上仍然更准一点,代价是每分钟 $0.006 到 $0.40,以及你的录音存在别人的硬盘上。企业级的本地部署转录把音频留在你自己的网络里,起步价大约每个席位 $500。Whisper Notes 把这些开源模型跑在你已经拥有的硬件上,iPhone $7.99、Mac $14,代价是放弃实时字幕、多人协同编辑,以及最后那一点点准确率。这三样里只要有一样在你的清单上,另外两个选项之一才是更该买的。
哪些工作适合用它?
三类录音不能外传的工作
医疗保健
医生用 Whisper Notes 记问诊、写临床笔记、转录研究访谈。音频从来没到过我们的服务器,所以链路里没有需要 BAA 覆盖的第三方处理者。整套流程是否满足 HIPAA,仍然取决于这台设备本身怎么管;而如果同事们需要打开同一份笔记并批注,一个签了 BAA 的云服务反而更实际。
Use Cases
- •患者咨询文档
- •医疗程序记录和观察
- •研究访谈转录
- •远程医疗会话记录
- •临床培训内容
Benefits
- ✓没有需要你去信任的数据共享政策,因为什么都没发出去
- ✓可自定义词库,收录临床术语和药品名
- ✓PHI 不会离开设备,因为根本没有上传通道
- ✓20 分钟的问诊,在 Apple Silicon Mac 上不到一分钟就转完
法律
律师用 Whisper Notes 做证词、客户访谈和案件准备。录音留在设备上,所以没有哪个厂商手里存着一份。它替你解决不了的是你自己的义务:某套流程是否满足你所在辖区的保密规则,仍然取决于这台设备、它的备份和它的导出是怎么处理的。
Use Cases
- •客户访谈文档
- •证词和听证会转录
- •案件研究和准备记录
- •法律程序记录
- •调查访谈转录
Benefits
- ✓我们手里没有录音,也没有转录稿
- ✓可自定义词库,收录案件名称和法律术语
- ✓带时间戳的转录稿,可导出为文本、SRT、VTT 或 JSON
- ✓iPhone $7.99 或 Mac $14,只付一次,对比按分钟计费的外包转录
新闻业
记者用 Whisper Notes 转录消息源采访和现场录音。没有服务器存着这段音频,所以副本只在你自己的设备上。这等于把消息源保护从我们的留存策略(你没法验证)挪到了你自己的设备安全(这个你能验证)。如果编辑部需要几个人在活动进行中同时改同一份转录稿,那是云端工具的活。
Use Cases
- •消息源采访转录
- •现场录音记录
- •新闻发布会记录
- •研究访谈存档
- •播客制作
Benefits
- ✓录音和转录稿都不会被发到任何地方
- ✓断网也能用,而这也正是你验证这句话的方式
- ✓不需要账号,所以没有登录记录把某次采访和你关联起来
- ✓可导出为文本、SRT、VTT 或 JSON,接编辑部现成的工具
它有多快,又在哪里不行?
我们实测出来的数字,以及这个设计注定做不到的事
我们测了什么,在什么机器上测的
速度取决于机器和你选的引擎,所以给整个应用一个统一的倍数会误导人。下面是我们自己跑的,从开始到出最终文字的实际耗时,机器型号都写出来。
Parakeet V3,默认引擎
一段 17.5 分钟的会议录音,在我们的 M5 Air 上 16.7 秒转完——约 60 倍实时
25 种欧洲语言;我们自己跑的,一台机器
Whisper Turbo 这条路线
同一条路径上,Whisper Large V3 Turbo 接近 11 倍实时,这是它那 101 个语言选项的代价
我们自己跑的;Turbo 是覆盖最广的那条路线,不是最快的那条
更老、更小的设备
iPhone 跑完一个文件比 Apple Silicon Mac 慢,芯片越老差距越大。长文件照样能跑完,只是时间按比例拉长
iPhone 12 或更新机型,或者一台 Apple Silicon Mac
存储
转录稿很小,每小时音频约 0.1MB。真正占地方的是模型:Whisper Large V3 Turbo 约 1.5GB,另外两个更小
Parakeet V3 内置在 iPhone 应用里;另外两个模型在应用内下载
已知限制
把模型放在设备上跑会带来一些硬性的限制,而这些限制买之前验证比买之后容易。Mac 版每周免费 5,000 词,正是为了这个。
设备要求
需要 iPhone 12 或更新机型,或者一台 Apple Silicon Mac。更老的硬件在神经网络引擎上的性能不足以让这件事变得实用。
Impact: 四五年以上的设备不兼容
处理时间
处理时间随录音长度成比例增长。设备端计算的物理限制绕不过去。
Impact: 按上面的速率,四小时的文件在 Mac 上是几分钟,在 iPhone 上更久
音频质量决定上限
音频差或背景噪音大都会拉低准确率,而信号里没有的信息,模型也补不回来。
Impact: 麦克风的摆位和几个人抢话,对错误率的影响比选哪个模型更大
没有实时字幕
应用是在录音结束之后转录,而不是边说边出字幕。要做到那种质量的实时字幕,需要一类装不进手机的模型;而且整份文件一起处理,也给了模型更多上下文。
Impact: 如果你要的是活动进行中就在屏幕上出字幕,这不是合适的工具
语言混合
在单个录音中快速切换语言时表现困难
Impact: 在整个录音中使用一致语言时效果最佳
那么,这个应用适合谁?
离线 AI 转录 - 仅需 $7.99
设备端。零上传。零订阅。
$7.99 买断 • 零订阅 • 无限 • 零上传