从图片里提取文字

粘贴一张截图,或把照片拖进来。识别在你自己的机器上跑完,图片不会离开这个标签页。

添加图片

把图片拖到这里

⌘V 直接粘贴刚截的图

或者

支持 JPG、PNG、WebP、GIF、BMP · 一次最多 10 张 · 单张不超过 800 万像素、15 MB

手边没有图?先拿这几张试:

识别是怎么做到的

  1. 图片留在本机图片在这个标签页里被解码成画布数据。打开浏览器的网络面板盯着看:除了模型文件,不会再有别的请求。
  2. 两个小模型接力先用检测模型把每一块文字框出来,再把每个框裁下来交给识别模型逐字读,最后用 CTC 解码拼成字符串。
  3. 改一改再拿走结果按阅读顺序排好,每行给一个把握度。个别字认错就地改掉,然后复制,或者导出 .txt、导出带框坐标的 .json。

这一页用的模型

检测模型
PP-OCRv5_mobile_det · 4.83 MB
识别模型
PP-OCRv5_mobile_rec · 16.68 MB
许可证
Apache-2.0 · PaddlePaddle
字符覆盖
拉丁字母、简体与繁体中文、日文假名、数字和标点——一份字典 18,383 个字符

PP-OCRv5 mobile 是 PaddleOCR 的轻量文字识别流水线,ONNX 版由 PaddlePaddle 官方导出。两个文件加起来约 21.5 MB,所以这一页在手机上也敢承诺跑得动。中英混排不用切语言:识别模型本来就是在同一份中英日字典上训练的。

常见问题

我的图片会被传到服务器吗?

不会。整页只下载两个模型文件(约 21.5 MB,第一次之后就在浏览器缓存里),图片本身只是在这个标签页里解码成画布数据,交给页面内的 Worker 处理。截图、身份证、合同、检查单这类最不该外传的图,就是这个页面存在的理由。

能识别哪些语言?

一个模型同时认拉丁字母、简体与繁体中文、日文假名和常见标点,一份字典 18,383 个字符,所以一行里中英混排不用选语言。韩文、泰文、阿拉伯文、西里尔字母和印度系文字不在这份字典里,硬识别出来的是乱码。

手写体能认吗?

只有写得端正的手写字能勉强认,而且不稳。PP-OCRv5 官方自己的评测里,手写中文约 0.74,印刷中文 0.91。这一页擅长的是截图、扫描件、小票、幻灯片和招牌;医生的手写处方别指望。

比在线 OCR 网站快在哪,又慢在哪?

快在没有上传、没有排队:一张截图 WebGPU 上约 0.4 秒,CPU 路径 2–3 秒(都是 Apple M2 Max 上的实测),跟网速和对方服务器忙不忙都无关。慢在第一次:21.5 MB 模型文件下完才能开始。下完之后连断网都能用。

能直接识别 PDF 吗?

不能,这一页收的是图片文件。只有一页的话,截图或导出成 PNG 再拖进来就行。多页 PDF、一次十张以上的批量、以及精度更高的服务器级模型,留给付费档。

表格和分栏能保留吗?

只保留阅读顺序,不保留结构。行按从上到下、从左到右归并,看得见的空行会保留成空行,所以小票、表单这类读起来是顺的;但宽表格的列会散掉,左右分栏的页面会串行。要自己还原版式的话,.json 里每个文字块都带四个角的坐标。