本机运行 · 文件不上传服务器
录音转文字
把音频拖进来,出一份带时间戳、能点着跳播的文字稿。Whisper 模型就跑在这个标签页里——录音不出你的电脑,不用注册、不排队、不按分钟计量。
转写操作区
把音频拖到页面任意位置
也可以按 ⌘V 粘贴、从磁盘里选,或者直接按录音键录一段。
mp3 · m4a · wav · ogg · flac · webm · mp4(取音轨)——单个文件 100 MB、30 分钟以内
手边没有文件?试试:
正在看这台机器支持什么…
文字稿
这个视图里不显示时间戳,但导出的 .srt / .vtt 里仍然带着;把开关勾回去,可点击跳播的分段会立刻回来,不用重跑。
三步做完
选一段录音
拖进来、粘贴、从磁盘里选,或者按录音键现录。文件只被这个页面读取,没有「上传中」这一步要等。
模型下载一次
首次使用会把大约 278 MB 的 Whisper 权重存进浏览器缓存。之后每次打开都在一秒内就绪,断网照用。
在你自己的机器上算
音频按 30 秒切块,逐块交给显卡或 CPU 转写,每跑完一块,那一段文字就立刻出现在下面。
具体能做到什么
| 单个文件 | 30 分钟、100 MB 以内,一次处理一个。 |
|---|---|
| 支持的格式 | 浏览器能解码的都行:mp3、m4a(微信语音、iPhone 语音备忘录)、wav、ogg、flac、webm、mp4(只取音轨)。 |
| 模型 | Whisper base,7400 万参数,认得 99 种语言,权重与 OpenAI 官方发布的一致。 |
| 首次下载量 | WebGPU 路径 278 MB,CPU 路径 197 MB,之后走缓存。 |
| 速度 | 在 Apple M2 上,30 秒片段 WebGPU 约 1.6 秒、CPU 单线程约 13 秒;10 分钟的音频分别在 40 秒上下和不到 4 分钟。 |
| 输出 | 可点击跳播的分段文字,外加 .txt / .srt / .vtt 下载和一键复制。 |
上面的数字都是在这个页面上用示例音频实测出来的,不是抄模型卡。中文长会议、要分清谁在说话,网页版做不了——那是 Mac 版的活。
模型与许可证
页面跑的是 openai/whisper-base,由 onnx-community 转成 ONNX 格式,经 Transformers.js 在 ONNX Runtime Web 上执行。权重以 Apache-2.0 发布,允许商用;OpenAI 的 Whisper 源代码则是 MIT。两份许可证原文,连同 Transformers.js 与 ONNX Runtime 的许可证,都完整收录在下面这个文件里。
常见问题
录音真的不会传出去吗?怎么验证?
不会。文件由这个标签页里的 JavaScript 直接读取,用浏览器自带的解码器解成波形,再交给本机的 Web Worker 做推理。整个页面只从网络取两样东西:页面本身和模型权重。想自己验证很容易:打开开发者工具的「网络」面板跑一次,或者等模型缓存好以后直接断网,转写照样能跑完。
中文转得准吗?
一般般,要有心理准备。whisper-base 只有 7400 万参数,中文是它的弱项:普通话清晰、单人说话的录音大意不会错,但人名、专有名词、数字经常写错,同音字尤其容易出问题——本页那段中文示例里,「半双工第四十七期」就被听成了「半双公帝47期」。方言、多人抢话、背景噪音大的会议录音基本指望不上。要准的话,用 Pro 档的更大模型,或者用 Mac 版。
微信语音、iPhone 语音备忘录能直接用吗?
能。微信导出的多是 m4a/aac,语音备忘录是 m4a,浏览器都能解码,拖进来就行。少数用 amr、silk 这类老编码的文件浏览器解不了,页面会直接告诉你「解码失败」,用任意转换工具转成 mp3 或 wav 再拖进来即可。视频文件(mp4/webm)也可以,只会读里面的音轨。
为什么第一次要下载将近 300 MB?
因为模型是在你电脑上跑的,不是在服务器上,浏览器必须先拿到真正的权重文件:78 MB 的编码器加 200 MB 的解码器。它们会存进浏览器的 Cache Storage,第二次打开一秒内就绪,断网也能用。CPU 路径用的是 4-bit 量化的解码器,只要 197 MB。想删掉的话,清除本站数据即可。
我的电脑没有独立显卡,能跑吗?要多久?
能。没有可用的 WebGPU 时会自动退到 WebAssembly,在单个 CPU 线程上跑——Firefox、Safari 以及显卡驱动被 WebGPU 拒绝的机器走的都是这条路。代价是速度:10 分钟的录音要将近 4 分钟,而不是 40 秒。同一台机器上换 Chrome 或 Edge,通常就能走上 WebGPU。
能不能分出谁在说话,或者转更长的会议?
网页版做不到。Whisper 本身不做说话人分离,需要另外一套模型;30 分钟以上的录音也已经超出一个浏览器标签页该承担的内存范围,所以免费档卡在 30 分钟。要做几小时的会议记录、要区分 A 说了什么 B 说了什么,那是 Mac 版的场景。
更长的录音,以及「这句是谁说的」
Whisper 本身分不出说话人,半小时以上的会议录音对浏览器标签页也太吃力。Mac 版把这两件事补上了:说话人分离、几小时的长录音、整个文件夹批量处理。
打开 Mac 版