从图片里提取文字
粘贴一张截图,或把照片拖进来。识别在你自己的机器上跑完,图片不会离开这个标签页。
添加图片
把图片拖到这里
⌘V 直接粘贴刚截的图
或者
支持 JPG、PNG、WebP、GIF、BMP · 一次最多 10 张 · 单张不超过 800 万像素、15 MB
识别结果
每一行都能直接改:改完再点复制或下载,带走的是你改过的版本。
这张图里没找到文字。
- 截图前先放大:字高至少要有十来个像素,检测模型才认得出来。
- 把对比度拉开——浅灰色的字压在照片背景上,是识别不出东西最常见的原因。
- 把大块图形和水印裁掉,它们会跟真正的文字抢检测框。
识别是怎么做到的
- 图片留在本机图片在这个标签页里被解码成画布数据。打开浏览器的网络面板盯着看:除了模型文件,不会再有别的请求。
- 两个小模型接力先用检测模型把每一块文字框出来,再把每个框裁下来交给识别模型逐字读,最后用 CTC 解码拼成字符串。
- 改一改再拿走结果按阅读顺序排好,每行给一个把握度。个别字认错就地改掉,然后复制,或者导出 .txt、导出带框坐标的 .json。
这一页用的模型
- 检测模型
- PP-OCRv5_mobile_det · 4.83 MB
- 识别模型
- PP-OCRv5_mobile_rec · 16.68 MB
- 许可证
- Apache-2.0 · PaddlePaddle
- 字符覆盖
- 拉丁字母、简体与繁体中文、日文假名、数字和标点——一份字典 18,383 个字符
PP-OCRv5 mobile 是 PaddleOCR 的轻量文字识别流水线,ONNX 版由 PaddlePaddle 官方导出。两个文件加起来约 21.5 MB,所以这一页在手机上也敢承诺跑得动。中英混排不用切语言:识别模型本来就是在同一份中英日字典上训练的。
常见问题
我的图片会被传到服务器吗?
不会。整页只下载两个模型文件(约 21.5 MB,第一次之后就在浏览器缓存里),图片本身只是在这个标签页里解码成画布数据,交给页面内的 Worker 处理。截图、身份证、合同、检查单这类最不该外传的图,就是这个页面存在的理由。
能识别哪些语言?
一个模型同时认拉丁字母、简体与繁体中文、日文假名和常见标点,一份字典 18,383 个字符,所以一行里中英混排不用选语言。韩文、泰文、阿拉伯文、西里尔字母和印度系文字不在这份字典里,硬识别出来的是乱码。
手写体能认吗?
只有写得端正的手写字能勉强认,而且不稳。PP-OCRv5 官方自己的评测里,手写中文约 0.74,印刷中文 0.91。这一页擅长的是截图、扫描件、小票、幻灯片和招牌;医生的手写处方别指望。
比在线 OCR 网站快在哪,又慢在哪?
快在没有上传、没有排队:一张截图 WebGPU 上约 0.4 秒,CPU 路径 2–3 秒(都是 Apple M2 Max 上的实测),跟网速和对方服务器忙不忙都无关。慢在第一次:21.5 MB 模型文件下完才能开始。下完之后连断网都能用。
能直接识别 PDF 吗?
不能,这一页收的是图片文件。只有一页的话,截图或导出成 PNG 再拖进来就行。多页 PDF、一次十张以上的批量、以及精度更高的服务器级模型,留给付费档。
表格和分栏能保留吗?
只保留阅读顺序,不保留结构。行按从上到下、从左到右归并,看得见的空行会保留成空行,所以小票、表单这类读起来是顺的;但宽表格的列会散掉,左右分栏的页面会串行。要自己还原版式的话,.json 里每个文字块都带四个角的坐标。