视频去背景:免费、带声音,全程在你的浏览器里

把片段拖进来就行。每一帧都在你自己的电脑上抠,原来的声音也一起带走。

视频与导出设置

把视频拖到这里

也可以直接 Ctrl+V / ⌘V 粘贴

支持 mp4 · mov · webm,免费版 30 秒、720p、200 MB 以内。超出时自动截前 30 秒、缩到 720p,不会直接拒收。

导出格式
边缘精细度

你的视频经历了什么

  1. 1 · 解码

    浏览器自带的视频解码器(WebCodecs)一帧一帧地把视频解开。内存里同一时间只放一帧,所以 30 秒的视频也不需要几个 G 的内存。

  2. 2 · 抠像

    每一帧缩到短边 320–512 像素交给 MODNet——一个专门做人像抠图的网络——得到一张带半透明过渡的遮罩,再放大回原尺寸与画面相乘。

  3. 3 · 编码

    抠好的画面重新编码:WebM 用带 Alpha 的 VP9,MP4 用 H.264;原文件里的音频数据包直接搬进新文件。

要等多久

用页面上那段 6 秒 720p 示例(180 帧)、「标准」精细度实测。视频越长,时间按比例增加。

机器模型每帧6 秒示例30 秒视频(估算)
Apple M2 Max,WebGPU55 毫秒11 秒约 55 秒
同一台机器,只用 CPU(单线程)660 毫秒约 2 分 10 秒约 11 分钟

没有 WebGPU 的老电脑或低功耗笔记本,还会比上面 CPU 那一行更慢。嫌慢就先把视频剪短——每少一秒,模型就少看 30 帧。

用的是什么模型

抠像由 MODNet(Ke 等,AAAI 2022)完成,这是一个专门把人从环境里分出来的网络,ONNX 版本来自 Xenova/modnet。有 WebGPU 时用 25.9 MB 的全精度权重跑在显卡上;没有时用 13.0 MB 的半精度权重跑在 CPU 上。6.6 MB 的 8 位量化版我们也试过:浅蓝衬衫站在白墙前,整个人都被当成了背景,所以没用。

MODNet 以 Apache License 2.0 发布,允许商用,许可证全文随页面提供:LICENSE-model.txt。视频编解码用的是 Mediabunny(MPL-2.0)。

常见问题

视频会被上传吗?

不会。页面只下载一次模型,之后解码、抠像、编码全在这个浏览器标签页里完成。服务器只往你这边发文件,根本没有接收上传的接口。模型加载完以后断网,在同一个标签页里照样可以继续处理视频。

导出的透明 WebM,为什么有的播放器里背景是黑的?

透明信息是作为画面旁边的第二路 VP9 数据存的。Chrome、Edge、Firefox 会读它;QuickTime、Windows「照片」、手机相册和不少桌面剪辑软件不读,就画成黑色。文件本身没问题。如果你的剪辑软件不认 WebM 透明通道,就导出 PNG 序列帧(所有剪辑软件都能按图像序列导入),或者导出抠像绿 MP4 再在软件里抠一次。

声音会保留吗?

会。导 MP4 时,音频数据包从原文件原样复制,没有任何音质损失。WebM 装不了 AAC,所以透明 WebM 的声音会转成 Opus。PNG 序列帧会把音频作为单独文件放进压缩包。有的在线工具免费档导出是不带声音的,这里不会。

为什么第一次要下载 13–26 MB?

那是 MODNet 模型本身:WebGPU 用 25.9 MB 的全精度版,CPU 用 13.0 MB 的半精度版。下载后存在浏览器缓存里,第二次打开大约一秒就加载好,不会再下载。

电脑没有 WebGPU 能用吗?要多久?

能用。没有 WebGPU 时模型通过 WebAssembly 在 CPU 上单线程运行。Apple M2 Max 上「标准」精细度一帧大约 660 毫秒,30 秒、30 帧/秒的视频(900 帧)要十分钟左右;老一点的笔记本更久。把精细度调成「快速」(一帧约 410 毫秒),时间能省下三分之一左右。

最长能处理多长的视频?为什么要限制?

免费版是 30 秒、720p、200 MB 以内。更长的视频自动截取前 30 秒,更大的画面自动缩到 1280×720 以内,照样出结果。之所以限制,是因为所有计算都在你自己的电脑上:一分钟的 1080p 是 1800 张全尺寸画面,CPU 上会很慢,浏览器标签页的内存也吃不消。

什么样的视频效果最好?

MODNet 是用人像训练的,口播、讲解、跳舞、对着镜头说话的人效果最好;宠物、汽车、商品它抠不了。头发和背景颜色太接近、动作快到有拖影、人在画面里特别小,这几种情况边缘会发虚或者缺块——时间线会标出哪些帧里没识别到人。

只需要处理一张图?图片去背景按原分辨率处理单张照片。