截图转表格 · 在你自己的电脑上算

图片表格转 Excel

按 Ctrl+V 粘贴一张表格截图,或者拖一张照片进来。行、列、合并单元格都在本机识别,直接导出 Excel——图片不会发到任何服务器。

表格提取工作台

— 第一次使用要下载约 131 MB 的模型,之后从浏览器缓存里读,不再下载。

图片

Ctrl+V

粘贴一张表格截图

也可以把图片拖到这里

表格

ABCDEF
1
2
3
4
5
6

识别结果会出现在这里,合并单元格保持合并。

黄底的格子是没读准的。导出前可以直接点格子改字,改过的内容会带进所有导出文件。

三步:截图 → 核对 → 导出

  1. 粘贴或拖入表格。截图效果最好。Windows 按 Win+Shift+S、Mac 按 ⌘+Shift+Control+4、微信 / QQ 截图也行,截完直接在本页按 Ctrl+V。
  2. 看一眼黄底格子。每个格子的文字都带识别置信度,低于 85% 的会标黄,点进去就能改。图上的蓝框、橙框、紫框分别是识别到的行、列和合并单元格,哪里错了一眼能看出原因。
  3. 导出。.xlsx 保留合并单元格、表头加粗,1,152、13.1% 这类数字存成真正的数值,可以直接求和;CSV 和复制出来的内容保持识别到的原文。

哪些表格识别得好,哪些会出错

以下是本页自带模型在我们测试集上的实测结果(Apple M2 Max;WebGPU 每张约 0.4 秒;CPU 路径是单线程 WebAssembly,每张约 3.7 秒):

效果好

  • 网页表格、Excel、报表的截图——14 行 × 5 列、没有边框线的财务表,70 个格子全对。
  • 带合并单元格的多层表头(跨列、跨行)——示例表里 4 个合并格全部找到。
  • 嵌在文章里的表格:上面的标题和说明段、下面的脚注会被排除在表格之外。
  • 手机斜拍、有点糊的打印表格:44 格对了 40 格(把 Cherry 读成了 Chemy),所以才有黄底提示。

容易出错

  • 斜着拍的密集大表:一张老式公交时刻表照片,二十多行只认出 9 行。
  • 纸张弯曲、透视严重的照片——先用文档照片展平拉正再来。
  • 手写字、印章、打勾的复选框:文字识别模型是按印刷体训练的。
  • 只是排成两栏的正文,并不是真表格。只要文字的话,用图片转文字能保留段落。

原理:微软的 Table Transformer v1.1(MIT 许可)负责找表格、行、列、表头和合并单元格;百度飞桨 PP-OCRv5(Apache-2.0)负责找出并读出每一行文字;最后按每行文字的中心点落在哪个「行 × 列」里,把它放进对应的格子。三个模型都通过 ONNX Runtime Web 在当前标签页里运行。

常见问题

图片会上传到服务器吗?

不会。图片在浏览器里解码,三个模型在当前标签页里运行(有 WebGPU 用显卡,没有就用 CPU 上的 WebAssembly),Excel 文件也是本机的 JavaScript 生成的。唯一的下载是模型文件本身,而且只下一次。第一张表跑完之后断网,在同一个标签页里还能继续转换。

合并单元格能保留吗?

能,前提是结构模型把它检测出来了。Table Transformer 会标出跨行 / 跨列的单元格,凡是中心点落在里面的「行 × 列」位置都会合并。导出的 .xlsx 里是真正的合并区域;CSV 格式本身不支持合并,文字放在左上角那一格,其余留空。

手写的表格能识别吗?

基本不行。手画表格的行和列往往还能找出来,但文字识别用的 PP-OCRv5 mobile 是按印刷体和屏幕字体训练的,手写内容会读成乱码或空白。它擅长的是打印件、电子表格和各种截图。

为什么有的字跑到了别的格子里?

绝大多数是因为图片歪了或字太小。每行文字是按中心点归到格子里的,一张很宽的表只要歪几度,右边的字就可能掉进下一行。建议正对着截图、在图上拖框只框住表格,并保证最小的字至少有 10 个像素高。拍纸质表格的话,先展平再识别。

能一次转多张图或者整个 PDF 吗?

免费版不行:一次一张图、一张表(图里有好几张表时取最大的那张,想要别的就拖框选中它)。批量图片、PDF 页面、一页多表会放在 Pro 版里。如果你手上其实是一整个文件夹的发票、合同(带文字层的 PDF、邮件),我们的 Mac 应用 AIFormFerry 可以按你指定的字段,每份文档汇成表里的一行。

和 iLovePDF、Nanonets、Excel 的「从图片插入数据」有什么不同?

这些服务都要把图片传到服务器上识别(Excel 的「从图片」还要 Microsoft 365 订阅)。本页整个过程都在你的电脑上完成,不限次数、不用注册,还会把检测到的行列画在图上,哪一格错了能看出为什么。代价是:服务器上的模型更大,对乱七八糟的照片更宽容。

图片、格子里的文字和导出文件都不会离开这个标签页。模型由浏览器缓存,第二次打开大约一秒就能开始。