去除图片上的文字
把照片、截图或海报拖进来:检测模型先把字幕、配字、标签一段段圈出来,你取消想留的,修补模型把其余的字抹掉并补上背景——全程在你的浏览器里。
图片不出这个标签页
工作台
手边没图?先拿这几张试试
你的图片会经过哪几步
- 1 · 找字
PP-OCRv5 的文字检测模型(4.8 MB,Apache-2.0 许可)标出哪里有字,中英日韩、深底浅字、浅底深字都能找。它只管「字在哪」,不识别内容,也不记录。示例截图上这一步大约 0.1 秒。
- 2 · 你来挑
每处文字变成图上的一条修正带。想留的点掉;字的描边粗就把带子调宽;检测漏掉的,自己拖框补上。
- 3 · 补背景
LaMa 修补模型(三星研究院,Apache-2.0 许可)按周围的像素把带子下面补出来,一次处理 512×512 的一块:有 WebGPU 的显卡上每块约 0.3 秒,CPU 单线程约 11 秒。只有修正带盖住的地方会变,其余部分原样保留。
它做不好的地方
- 高度不到 8 像素左右的小字、花体和涂鸦类的艺术字,常常检测不到,需要自己框。
- 字后面原来是什么,LaMa 是「猜」出来的。天空、墙面、水面上基本看不出痕迹;如果一大段字压在人脸、花纹衣服或者另一块招牌字上,补出来的是一个说得过去的样子,不是原本的样子。
- 整页都是字的图(小票、扫描的信件)会被切成很多块,CPU 模式下一等就是好些分钟。能做,但这个页面不是为它设计的。
- 一次一张,单张不超过 1200 万像素;不限每天次数,不用注册。
常见问题
图片会上传到服务器吗?
不会。页面只下载两个模型文件(文字检测和 LaMa),在这个浏览器标签页里用 WebAssembly 或 WebGPU 运行。图片从你的磁盘读进内存,在内存里处理,再由浏览器存回你的电脑,全程没有服务器经手。第一次加载完之后,断开网络也能在同一个标签页里继续处理。
它是怎么找到字的?漏掉了怎么办?
PP-OCRv5 的检测模型会算出一张「哪里像字」的热力图,每一块连在一起的区域就是一条修正带。拉丁字母、中文、日文、韩文都认,深底浅字和浅底深字也都行。容易漏的是很小的字和装饰性很强的字体:打开「框出漏掉的字」,在图上拖一个框,它就和其他修正带一样进到列表里。
能只去字幕、保留台标和署名吗?
可以,列表就是干这个的。每一段字都是单独的一条,带勾选框和那段字的缩略图,一眼能看出是哪段。把台标、频道名、价签的勾去掉,就只抹其余的;没勾的区域和原图一个字节都不差。
背景复杂的时候效果怎么样?
取决于字底下原来是什么。压在水面、天空、草地、白墙上的字幕,基本抹得不留痕迹;表情包那种粗描边大字压在毛发或花纹上,补出来可信但会软一点;大字压在人脸或别的文字上,原本的像素已经没了,补出来的是模型编的。用前后对比滑块看,不满意就「回去调整修正带」,调宽或者跳过某一行。
能去水印吗?
不提供。水印是别人对这张图的版权标记,去掉它不是这个页面的用途。请用在你自己的照片和截图上:你自己加的说明文字、自己相机打的日期、自己剪的视频的字幕。
和 Picsart、cleanup.pictures 这类网站有什么不一样?
它们要把图传到自家服务器上处理;cleanup.pictures 免费版只能导出 720p,还有不少网站一天只给一两张或者按积分扣。这里的文字检测是自动的,导出和原图一样大、不加任何标记,也没有每天的次数限制——因为活是你自己的电脑干的。
为什么有的电脑上很慢?
没有 WebGPU 时模型在 CPU 上单线程跑:找字仍然不到 1 秒,但补背景每一块 512×512 要 11 秒左右,有 WebGPU 时约 0.3 秒。一行字幕一般是一到两块。桌面版 Chrome 和 Edge 都支持 WebGPU;「抹掉」按钮下面会写当前是哪种模式。
整个文件夹、视频截帧、更大的图
Mac 版 ConceptCut 可以一次处理一批照片里的文字和杂物,也能处理从视频里截出来的帧,不受这个页面 1200 万像素的限制。
在 Mac App Store 查看 ConceptCut相关工具
去除照片中的物体 — 要去的是路人、电线、杂物而不是文字时用它:自己用画笔涂。
图片转文字 — 反过来的活:留下文字,把它从图里提取出来。