录音不会离开这台设备

大多数打着 Whisper 名号的应用,是把你的音频传到服务器上跑模型。Whisper Notes 在你的 iPhone 或 Mac 上跑——这个做法开发起来更难,但要解释清楚就简单多了。

更新于 2026 年 8 月•8 分钟阅读

为什么要把模型放在设备上跑?

每个转录应用在做别的决定之前,都先做了一个决定:音频在哪里被处理。传到服务器上是更容易的做法,而且能用上最大的模型,那些模型到今天仍然稍微更准一些。让模型在手机或笔记本上跑要难做得多,但换来的是:录音没有地方可去。

我们选了后者,理由比"保护隐私"这种口号要具体。声音是生物特征,密码泄露了可以改,声音不行。音频一旦落在别人的基础设施上,它就同时受制于对方的泄露记录、留存策略,以及条款里关于训练数据的那几行——这三件事只要文件还在,你就得一直盯着。

Whisper Notes 把 Whisper Large V3 Turbo、Parakeet V3 或 SenseVoice 跑在你设备的神经网络引擎上,链路里根本没有转录服务器。没有队列,没有上传,开飞行模式和连着 Wi-Fi 是一样的。最后这一条,与其信我们,不如你自己试一下。

免费的 Whisper 应用,代价是什么?

一个不收钱的转录工具,通常是这样运转的:音频传到服务器,模型在那边跑,录音留存的时间足够长,长到对运营方有用。对很多人来说这笔交换是划算的。只是值得知道,你确实做了这笔交换。

为什么录音和密码不是一回事

密码泄露只是麻烦一下午,因为你可以改掉它。声音泄露是永久的,因为用来识别你的东西就是声音本身,而几秒钟的音频,携带的声学特征已经足够在别处把你认出来。

最近变了的,是攻击者需要的音频变得很少。把一个人的声音克隆到能骗过人,现在只要几秒钟的样本,而不再是几分钟。2025 年就有人用克隆的意大利国防部长的声音,向几位商人行骗。我们不是说这大概率会发生在你身上,只是想指出:这是唯一一类泄露之后你没法更换的数据。

所以音频送去转录服务时,被存下来的不是一份文档,而是一段生物特征——存在一个留存策略不由你定的地方。

转录数据到底是怎么泄露的

出事的方式很少是那种戏剧性的入侵。真实情况是,音频和转录稿经过的系统,比任何架构图上画的都多:转录服务商、它背后的模型提供方、一层日志、一条分析管线、一份备份。每一处都可能因为一个配置错误就把私密变成公开;环节越多,越没有人能说清某一份录音此刻究竟在哪。

医疗行业给出了最清楚的例子——受保护的健康信息通过转录集成和配置错误的存储泄露出去,而不是因为什么称得上"攻击"的事。客服中心给出了另一个:转录稿流向模型,账号却没打码就进了调试日志。

这些都不是在说云端转录很鲁莽。它们说的是:该数的是"有多少个系统各存了一份",而设备端处理把这个数字压到了 1。

风往哪边吹?

2025 年 3 月,亚马逊把 Echo 上的"不发送语音录音"这个开关取消了。此后对 Alexa 说的每一句话都会送到亚马逊的服务器,也不再有关掉它的地方。

一个产品去掉一个开关算不上趋势,但背后的动机是长期存在的:训练数据有价值,而一个会减少数据收集量的开关,就永远处在商业压力之下。隐私设置本质上是一个承诺,而承诺可以在某一版发布说明里被改写。

Whisper Notes 的做法是让这种开关根本不存在。没有服务器可以发送音频,所以"不要发送"不是我们在遵守的一项偏好设置,而是对这个应用能力边界的描述。

免费工具三年下来花多少

不收钱的网页工具,一般都在条款里保留了"用你的音频改进模型"的权利,而那份条款几乎没人读。按分钟计费的 API 看起来很便宜,$0.006 到 $0.40 一分钟,直到你每周转一小时的音频,一年的账单就到了几百美元。订阅制反而是这套安排里最诚实的版本:Otter 一年大约 $99,而且它明说了。

Whisper Notes 是 App Store $7.99、官网直下 Mac 版 $14,都只付一次。下面这张表就是全部的价格论证,而重点在第四行:免费那个选项和付一次那个选项,三年下来花的钱差不多,区别在于录音去了哪。

每年成本

服务类型第1年第2年第3年数据处理
Whisper Notes$7.99$0$0永不离开设备
订阅服务$99$99$99云端处理
按分钟云API$120-480$120-480$120-480云端处理
"免费"网页工具$0$0$0用于AI训练

什么情况下你该去用云服务

在干净音频上,云端的大模型确实还要更准一些,因为它们跑在任何手机和笔记本都装不下的尺寸上;它们也能做到边说边出字幕,这一点设备端目前还追不上。这些是真实的优势,我们不打算装作看不见。

如果你需要实时字幕,或者要几个人在会议进行中同时改同一份转录稿,又或者最后那一点点准确率比"音频存在哪"更重要,那云服务就是更合适的工具,我们宁愿你去用。

我们想反驳的只是一件事:不要把准确率的差距当成决策里唯一的数字。做的是有保密义务的活——病历、涉密材料、对消息源的采访——"音频去了哪"是你必须能回答的问题,而最经得起追问的答案,是它哪儿也没去。

浏览器工具、云 API,还是原生应用?

搜"Whisper app",返回的是三种顶着同一个名字、行为却相当不同的东西:在浏览器标签页里跑模型的网页、把模型跑在别人服务器上的 API,以及为你手上这台设备编译的应用。它们的差别大到——先看它属于哪一类,比看功能列表更有用。

浏览器工具

网页工具说自己"本地处理",这通常是真的:音频确实留在标签页里。限制不在于它诚不诚实,而在于一个标签页能做什么。多数浏览器的 WebAssembly 内存上限在 4GB 左右,这就给模型大小封了顶;而通过 JavaScript 做推理,要付出原生代码不必付的速度代价。

真正会让人卡住的限制更具体、也更烦人:你一切到别的应用,它就没法继续跑;硬件加速就算能用也用得别扭;不小心关掉标签页,这一趟就白跑了,没有可续的地方。拿来试模型很合适,拿来存工作就很折磨。

处理浏览器中的WebAssembly/TensorFlow.js
模型大小受浏览器内存限制(~4GB)
速度因JavaScript开销而较慢
隐私比云端好,但浏览器可访问
可靠性标签页可能崩溃,无后台处理

原生应用

Whisper Notes 是为 macOS 和 iOS 编译的,直接跟神经网络引擎打交道——就是驱动 Face ID 和计算摄影的那块专用芯片。这一页上的速度数字之所以可能,全靠它:在 M4 Pro 上,Parakeet V3 处理完 35 分钟的音频大约要 18 秒。

剩下的差别不好看,但更影响日常。你切到别的应用,转录还在跑;被打断之后,它能干净地接上;操作系统的沙盒把它挡在其他应用的数据之外。你的录音和转录文字没有上传通道,这一条你花三十秒就能自己验证:打开飞行模式,转一个文件试试。

处理直接访问Apple神经引擎
模型大小Whisper Large V3 Turbo,约 1.5GB
速度Parakeet V3 在我们的 M5 Air 上约 60 倍实时
隐私沙盒化,无网络权限
可靠性后台处理,系统集成

云 API

服务器资源基本没有上限,所以云 API 能跑最大的模型,也能做那些吃算力的功能,实时字幕就是其中之一。在干净音频上,它会是这一页里最准的那个选项。

你让渡的是"知道录音在哪"。它要过公网,在一台不归你管的机器上被处理,按一份不是你写的、而且可以不通知你就改的留存策略保存着。

对有保密义务的心理咨询师、经手涉密材料的律师、要保护消息源的记者来说,评估通常到这里就结束了——不是因为准确率不好,而是因为"你能告诉我这段录音现在在哪吗"这个问题没有好答案。

处理远程服务器(无限计算)
模型大小最大可用模型
速度取决于网络和服务器队列
隐私音频上传并可能被存储
可靠性需要网络,受速率限制

这样做,我们放弃了什么

做成原生应用,是让隐私这件事从"合同承诺"变成"结构约束"的唯一办法。"先本地处理再同步"和"传输过程加密"都是真话,但这两种系统最后仍然留着你音频的一份副本;我们想要的是那个没有副本可留的版本。

代价体现在功能上。我们做不到边录边出字幕,因为能把这件事做好的模型装不进手机。我们跑不了比你设备容量更大的模型。我们也提供不了多人协同编辑或团队工作区,因为那些都需要一台服务器,而我们没有。

这三件事里只要有一件在你的清单上,那这就不是合适的应用,某个云服务才是。与其让你买完才发现,不如现在就写在这里。

干活的到底是哪个模型?

三个引擎,以及怎么选

Whisper Notes 内置三个语音识别引擎,全部在设备上跑。默认是 Parakeet V3。Whisper 这条路线在 Mac 上是 Whisper Large V3 Turbo,在 iPhone 上是 Whisper Small——同样的 101 个语言选项,只是模型尺寸按手机配。SenseVoice 是你自己去选的引擎,用于中文、粤语、日语和韩语;没有任何机制会自动把你切过去,所以如果你主要处理这几种语言,装完之后第一件事就是去改引擎。
三个引擎各管什么: Parakeet V3 覆盖 25 种欧洲语言,在 Open ASR Leaderboard 上的英语词错误率是 6.32%,三者里最低。按我们自己的实测,它跑完一个文件比 Whisper Large V3 Turbo 快大约五倍。Turbo 的理由是覆盖面:101 个语言选项,在同一个榜单上英语词错误率 7.83%。SenseVoice 只有六个选项——英语、简体中文、繁体中文、粤语、日语、韩语——按我们自己的实测约为 52 倍实时速度,这也是处理 CJK 材料时该选它的原因。
它在设备上怎么跑: 模型被转换成 Apple 的 Core ML 格式,在神经网络引擎上执行,也就是 Face ID 和计算摄影背后的那块芯片。链路里没有转录服务器,所以转录一个文件的过程中不会发出任何网络请求。这句话你不用信,可以自己查:开始之前先打开飞行模式。
为什么是三个引擎而不是一个: 目前没有哪个开源模型样样都最好。在欧洲语言上最快的那个,不是覆盖一百种语言的那个,而这两个也都不是为中文和日语造的那个。装三个让你自己选,不如直接宣布一个最佳模型来得干净,但这正是这个应用在单一语系之外仍然靠得住的原因。

技术规格

AI 模型Parakeet V3(默认)、Whisper Large V3 Turbo(Mac)或 Whisper Small(iPhone)、SenseVoice
语言Whisper 有 101 个语言选项,Parakeet V3 有 25 种欧洲语言,SenseVoice 有 6 个
音频格式MP3, WAV, M4A, FLAC, AAC, OGG, WMA
处理速度Parakeet V3 在我们的 M5 Air 上约 60 倍实时;Whisper Turbo 路线约 11 倍
文件大小限制应用本身不设限制
平台iOS 18+, macOS 11+(针对Apple Silicon优化)

它到底能做什么?

日常用得最多的是三件事:把音频弄进来,把文字弄出去,以及让这两件事都留在设备上的那条约束。

离线文件导入

导入音频文件或完成的录音进行高精度离线AI转录。这个离线语音转文字应用使用完整上下文分析处理文件,与在线语音转文字服务相比提供卓越的结果。

  • ✓从各种来源导入音频文件(文件、语音备忘录等)
  • ✓先录制音频,然后转录以获得最佳准确性
  • ✓在使用其他应用时后台离线语音转文字处理
  • ✓自动文件组织和转录管理

高级导出选项

为不同用例量身定制的专业级输出格式,从简单文本文档到视频内容的字幕文件。

  • ✓可自定义格式的纯文本
  • ✓用于视频的SRT和VTT字幕文件
  • ✓带时间戳的转录用于参考
  • ✓说话者识别和标记
  • ✓自定义段落分割

隐私保护:真正的离线语音转文字处理

音频没有上传通道,这不是一项设置,而是这个应用的技术约束——打开飞行模式就能自己验证。

  • ✓完全离线语音转文字处理(无数据传输)
  • ✓链路里没有需要签 BAA 的第三方数据处理者
  • ✓所有离线AI转录的加密本地存储
  • ✓无云依赖离线转录软件
  • ✓企业离线语音转文字环境的审计追踪

到底有多准,这个数字是哪来的?

公开基准,加上我们自己在指名机器上的实测

我们不做自家的准确率测试——厂商给自己判卷,没什么参考价值。下面的词错误率来自 Hugging Face Open ASR Leaderboard 和 FLEURS 基准,两个都是公开的,也都由跟这款应用没有利害关系的人在维护。速度数字是我们自己测的,机器型号写在下面。

各模型的词错误率

模型来源错误率说明
Parakeet V3(Mac 默认)Open ASR Leaderboard英语 WER 6.32%覆盖 25 种欧洲语言;在 FLEURS 上这 25 种平均 12.0%
Whisper Large V3 TurboOpen ASR Leaderboard英语 WER 7.83%三者中覆盖最广:101 个语言选项
SenseVoice Small我们自测,M4 Pro27 分钟播客 13.83 秒专为中文、日语、韩语和粤语打造

Key Findings

  • •Parakeet V3 在 M4 Pro 上把 35 分钟音频转完只要 18 秒;同一个文件 Whisper Turbo 要三分钟左右
  • •在英语上,三个模型之间的词错误率差距不到两个百分点
  • •这些数字测的是朗读和有准备的讲话。你自己的录音会更差,而且麦克风和几个人抢话对结果的影响,比选哪个模型大得多

在干净音频上,云端大模型仍然领先一点点,因为它们跑在任何手机和笔记本都装不下的尺寸上。这段差距就是「音频永远不离开设备」的代价。如果你的活儿不需要最后那一个百分点,这笔交换通常值。如果需要,那老实说你该用云端服务。

跟其他方案比起来怎么样?

对上云服务、你设备上已有的工具,以及企业软件

这张表里的大部分内容,你花几分钟就能自己核实。要仔细读的是准确率那一行——这四类产品并不是在同一个基准上测出来的。

功能对比

功能Whisper Notes应用云服务内置工具企业软件
准确率(英语 WER)6.32-7.83%(Open ASR Leaderboard)厂商自报,多数没上这个榜单未公布未公布
音频在哪里被处理在你的设备上厂商的服务器因厂商而异可本地部署
价格iPhone $7.99,Mac $14,只付一次$0.006-0.40/分钟免费(有限)$500-2000/许可证
语言101 个语言选项50-100种语言10-30种语言20-50种语言
文件长度限制应用本身不设限制通常1-2小时5-10分钟各异
需要互联网否是有时本地部署:否

Market Position: 三个选项并排放着,这笔交换就清楚了。前沿云 API 在干净音频上仍然更准一点,代价是每分钟 $0.006 到 $0.40,以及你的录音存在别人的硬盘上。企业级的本地部署转录把音频留在你自己的网络里,起步价大约每个席位 $500。Whisper Notes 把这些开源模型跑在你已经拥有的硬件上,iPhone $7.99、Mac $14,代价是放弃实时字幕、多人协同编辑,以及最后那一点点准确率。这三样里只要有一样在你的清单上,另外两个选项之一才是更该买的。

哪些工作适合用它?

三类录音不能外传的工作

医疗保健

医生用 Whisper Notes 记问诊、写临床笔记、转录研究访谈。音频从来没到过我们的服务器,所以链路里没有需要 BAA 覆盖的第三方处理者。整套流程是否满足 HIPAA,仍然取决于这台设备本身怎么管;而如果同事们需要打开同一份笔记并批注,一个签了 BAA 的云服务反而更实际。

Use Cases
  • •患者咨询文档
  • •医疗程序记录和观察
  • •研究访谈转录
  • •远程医疗会话记录
  • •临床培训内容
Benefits
  • ✓没有需要你去信任的数据共享政策,因为什么都没发出去
  • ✓可自定义词库,收录临床术语和药品名
  • ✓PHI 不会离开设备,因为根本没有上传通道
  • ✓20 分钟的问诊,在 Apple Silicon Mac 上不到一分钟就转完

法律

律师用 Whisper Notes 做证词、客户访谈和案件准备。录音留在设备上,所以没有哪个厂商手里存着一份。它替你解决不了的是你自己的义务:某套流程是否满足你所在辖区的保密规则,仍然取决于这台设备、它的备份和它的导出是怎么处理的。

Use Cases
  • •客户访谈文档
  • •证词和听证会转录
  • •案件研究和准备记录
  • •法律程序记录
  • •调查访谈转录
Benefits
  • ✓我们手里没有录音,也没有转录稿
  • ✓可自定义词库,收录案件名称和法律术语
  • ✓带时间戳的转录稿,可导出为文本、SRT、VTT 或 JSON
  • ✓iPhone $7.99 或 Mac $14,只付一次,对比按分钟计费的外包转录

新闻业

记者用 Whisper Notes 转录消息源采访和现场录音。没有服务器存着这段音频,所以副本只在你自己的设备上。这等于把消息源保护从我们的留存策略(你没法验证)挪到了你自己的设备安全(这个你能验证)。如果编辑部需要几个人在活动进行中同时改同一份转录稿,那是云端工具的活。

Use Cases
  • •消息源采访转录
  • •现场录音记录
  • •新闻发布会记录
  • •研究访谈存档
  • •播客制作
Benefits
  • ✓录音和转录稿都不会被发到任何地方
  • ✓断网也能用,而这也正是你验证这句话的方式
  • ✓不需要账号,所以没有登录记录把某次采访和你关联起来
  • ✓可导出为文本、SRT、VTT 或 JSON,接编辑部现成的工具

它有多快,又在哪里不行?

我们实测出来的数字,以及这个设计注定做不到的事

我们测了什么,在什么机器上测的

速度取决于机器和你选的引擎,所以给整个应用一个统一的倍数会误导人。下面是我们自己跑的,从开始到出最终文字的实际耗时,机器型号都写出来。

Parakeet V3,默认引擎

一段 17.5 分钟的会议录音,在我们的 M5 Air 上 16.7 秒转完——约 60 倍实时

25 种欧洲语言;我们自己跑的,一台机器

Whisper Turbo 这条路线

同一条路径上,Whisper Large V3 Turbo 接近 11 倍实时,这是它那 101 个语言选项的代价

我们自己跑的;Turbo 是覆盖最广的那条路线,不是最快的那条

更老、更小的设备

iPhone 跑完一个文件比 Apple Silicon Mac 慢,芯片越老差距越大。长文件照样能跑完,只是时间按比例拉长

iPhone 12 或更新机型,或者一台 Apple Silicon Mac

存储

转录稿很小,每小时音频约 0.1MB。真正占地方的是模型:Whisper Large V3 Turbo 约 1.5GB,另外两个更小

Parakeet V3 内置在 iPhone 应用里;另外两个模型在应用内下载

已知限制

把模型放在设备上跑会带来一些硬性的限制,而这些限制买之前验证比买之后容易。Mac 版每周免费 5,000 词,正是为了这个。

设备要求

需要 iPhone 12 或更新机型,或者一台 Apple Silicon Mac。更老的硬件在神经网络引擎上的性能不足以让这件事变得实用。

Impact: 四五年以上的设备不兼容

处理时间

处理时间随录音长度成比例增长。设备端计算的物理限制绕不过去。

Impact: 按上面的速率,四小时的文件在 Mac 上是几分钟,在 iPhone 上更久

音频质量决定上限

音频差或背景噪音大都会拉低准确率,而信号里没有的信息,模型也补不回来。

Impact: 麦克风的摆位和几个人抢话,对错误率的影响比选哪个模型更大

没有实时字幕

应用是在录音结束之后转录,而不是边说边出字幕。要做到那种质量的实时字幕,需要一类装不进手机的模型;而且整份文件一起处理,也给了模型更多上下文。

Impact: 如果你要的是活动进行中就在屏幕上出字幕,这不是合适的工具

语言混合

在单个录音中快速切换语言时表现困难

Impact: 在整个录音中使用一致语言时效果最佳

那么,这个应用适合谁?

Whisper Notes 把 Whisper Large V3 Turbo、Parakeet V3 和 SenseVoice 跑在你自己的设备上。链路里没有转录服务器——这既是它的全部设计,也是它的全部限制。
你得到的: 英语词错误率 6.32% 到 7.83%(Open ASR Leaderboard),在 M4 Pro 上 35 分钟音频约 18 秒转完,以及一段没有地方可去的录音。App Store $7.99,涵盖 iPhone、iPad 和 Mac App Store 版;官网直下 Mac 版 $14,每周免费 5,000 词。
你放弃的: 边说边出的实时字幕、会议进行中的多人协同编辑,以及只有云端那种体量的模型才够得着的最后一点准确率。这三样都不会有,因为三样都需要服务器。
老实说的建议: 如果你的团队需要一起读、一起批注转录稿,去用 Otter 或 Notta。如果你想在 Mac 上要最全的功能、也从不在手机上干活,去看 MacWhisper。如果你要的是录音留在它被录下来的地方——病历、涉密材料、对消息源的采访——那正是这个应用被造出来要解决的情况,而且这个说法你三十秒就能用飞行模式验证。

离线 AI 转录 - 仅需 $7.99

设备端。零上传。零订阅。

$7.99 买断 • 零订阅 • 无限 • 零上传