本机运行 · 文件不上传服务器

录音转文字

把音频拖进来,出一份带时间戳、能点着跳播的文字稿。Whisper 模型就跑在这个标签页里——录音不出你的电脑,不用注册、不排队、不按分钟计量。

转写操作区

把音频拖到页面任意位置

也可以按 ⌘V 粘贴、从磁盘里选,或者直接按录音键录一段。

mp3 · m4a · wav · ogg · flac · webm · mp4(取音轨)——单个文件 100 MB、30 分钟以内

手边没有文件?试试:

正在看这台机器支持什么…

三步做完

  1. 选一段录音

    拖进来、粘贴、从磁盘里选,或者按录音键现录。文件只被这个页面读取,没有「上传中」这一步要等。

  2. 模型下载一次

    首次使用会把大约 278 MB 的 Whisper 权重存进浏览器缓存。之后每次打开都在一秒内就绪,断网照用。

  3. 在你自己的机器上算

    音频按 30 秒切块,逐块交给显卡或 CPU 转写,每跑完一块,那一段文字就立刻出现在下面。

具体能做到什么

单个文件30 分钟、100 MB 以内,一次处理一个。
支持的格式浏览器能解码的都行:mp3、m4a(微信语音、iPhone 语音备忘录)、wav、ogg、flac、webm、mp4(只取音轨)。
模型Whisper base,7400 万参数,认得 99 种语言,权重与 OpenAI 官方发布的一致。
首次下载量WebGPU 路径 278 MB,CPU 路径 197 MB,之后走缓存。
速度在 Apple M2 上,30 秒片段 WebGPU 约 1.6 秒、CPU 单线程约 13 秒;10 分钟的音频分别在 40 秒上下和不到 4 分钟。
输出可点击跳播的分段文字,外加 .txt / .srt / .vtt 下载和一键复制。

上面的数字都是在这个页面上用示例音频实测出来的,不是抄模型卡。中文长会议、要分清谁在说话,网页版做不了——那是 Mac 版的活。

模型与许可证

页面跑的是 openai/whisper-base,由 onnx-community 转成 ONNX 格式,经 Transformers.js 在 ONNX Runtime Web 上执行。权重以 Apache-2.0 发布,允许商用;OpenAI 的 Whisper 源代码则是 MIT。两份许可证原文,连同 Transformers.js 与 ONNX Runtime 的许可证,都完整收录在下面这个文件里。

常见问题

录音真的不会传出去吗?怎么验证?

不会。文件由这个标签页里的 JavaScript 直接读取,用浏览器自带的解码器解成波形,再交给本机的 Web Worker 做推理。整个页面只从网络取两样东西:页面本身和模型权重。想自己验证很容易:打开开发者工具的「网络」面板跑一次,或者等模型缓存好以后直接断网,转写照样能跑完。

中文转得准吗?

一般般,要有心理准备。whisper-base 只有 7400 万参数,中文是它的弱项:普通话清晰、单人说话的录音大意不会错,但人名、专有名词、数字经常写错,同音字尤其容易出问题——本页那段中文示例里,「半双工第四十七期」就被听成了「半双公帝47期」。方言、多人抢话、背景噪音大的会议录音基本指望不上。要准的话,用 Pro 档的更大模型,或者用 Mac 版。

微信语音、iPhone 语音备忘录能直接用吗?

能。微信导出的多是 m4a/aac,语音备忘录是 m4a,浏览器都能解码,拖进来就行。少数用 amr、silk 这类老编码的文件浏览器解不了,页面会直接告诉你「解码失败」,用任意转换工具转成 mp3 或 wav 再拖进来即可。视频文件(mp4/webm)也可以,只会读里面的音轨。

为什么第一次要下载将近 300 MB?

因为模型是在你电脑上跑的,不是在服务器上,浏览器必须先拿到真正的权重文件:78 MB 的编码器加 200 MB 的解码器。它们会存进浏览器的 Cache Storage,第二次打开一秒内就绪,断网也能用。CPU 路径用的是 4-bit 量化的解码器,只要 197 MB。想删掉的话,清除本站数据即可。

我的电脑没有独立显卡,能跑吗?要多久?

能。没有可用的 WebGPU 时会自动退到 WebAssembly,在单个 CPU 线程上跑——Firefox、Safari 以及显卡驱动被 WebGPU 拒绝的机器走的都是这条路。代价是速度:10 分钟的录音要将近 4 分钟,而不是 40 秒。同一台机器上换 Chrome 或 Edge,通常就能走上 WebGPU。

能不能分出谁在说话,或者转更长的会议?

网页版做不到。Whisper 本身不做说话人分离,需要另外一套模型;30 分钟以上的录音也已经超出一个浏览器标签页该承担的内存范围,所以免费档卡在 30 分钟。要做几小时的会议记录、要区分 A 说了什么 B 说了什么,那是 Mac 版的场景。