截图转表格 · 在你自己的电脑上算
图片表格转 Excel
按 Ctrl+V 粘贴一张表格截图,或者拖一张照片进来。行、列、合并单元格都在本机识别,直接导出 Excel——图片不会发到任何服务器。
表格提取工作台
图片
Ctrl+V
粘贴一张表格截图
也可以把图片拖到这里
在图上拖一个框,就只识别框里的部分。
表格
| A | B | C | D | E | F | |
|---|---|---|---|---|---|---|
| 1 | ||||||
| 2 | ||||||
| 3 | ||||||
| 4 | ||||||
| 5 | ||||||
| 6 |
识别结果会出现在这里,合并单元格保持合并。
黄底的格子是没读准的。导出前可以直接点格子改字,改过的内容会带进所有导出文件。
三步:截图 → 核对 → 导出
- 粘贴或拖入表格。截图效果最好。Windows 按 Win+Shift+S、Mac 按 ⌘+Shift+Control+4、微信 / QQ 截图也行,截完直接在本页按 Ctrl+V。
- 看一眼黄底格子。每个格子的文字都带识别置信度,低于 85% 的会标黄,点进去就能改。图上的蓝框、橙框、紫框分别是识别到的行、列和合并单元格,哪里错了一眼能看出原因。
- 导出。.xlsx 保留合并单元格、表头加粗,1,152、13.1% 这类数字存成真正的数值,可以直接求和;CSV 和复制出来的内容保持识别到的原文。
哪些表格识别得好,哪些会出错
以下是本页自带模型在我们测试集上的实测结果(Apple M2 Max;WebGPU 每张约 0.4 秒;CPU 路径是单线程 WebAssembly,每张约 3.7 秒):
效果好
- 网页表格、Excel、报表的截图——14 行 × 5 列、没有边框线的财务表,70 个格子全对。
- 带合并单元格的多层表头(跨列、跨行)——示例表里 4 个合并格全部找到。
- 嵌在文章里的表格:上面的标题和说明段、下面的脚注会被排除在表格之外。
- 手机斜拍、有点糊的打印表格:44 格对了 40 格(把 Cherry 读成了 Chemy),所以才有黄底提示。
原理:微软的 Table Transformer v1.1(MIT 许可)负责找表格、行、列、表头和合并单元格;百度飞桨 PP-OCRv5(Apache-2.0)负责找出并读出每一行文字;最后按每行文字的中心点落在哪个「行 × 列」里,把它放进对应的格子。三个模型都通过 ONNX Runtime Web 在当前标签页里运行。
常见问题
图片会上传到服务器吗?
不会。图片在浏览器里解码,三个模型在当前标签页里运行(有 WebGPU 用显卡,没有就用 CPU 上的 WebAssembly),Excel 文件也是本机的 JavaScript 生成的。唯一的下载是模型文件本身,而且只下一次。第一张表跑完之后断网,在同一个标签页里还能继续转换。
合并单元格能保留吗?
能,前提是结构模型把它检测出来了。Table Transformer 会标出跨行 / 跨列的单元格,凡是中心点落在里面的「行 × 列」位置都会合并。导出的 .xlsx 里是真正的合并区域;CSV 格式本身不支持合并,文字放在左上角那一格,其余留空。
手写的表格能识别吗?
基本不行。手画表格的行和列往往还能找出来,但文字识别用的 PP-OCRv5 mobile 是按印刷体和屏幕字体训练的,手写内容会读成乱码或空白。它擅长的是打印件、电子表格和各种截图。
为什么有的字跑到了别的格子里?
绝大多数是因为图片歪了或字太小。每行文字是按中心点归到格子里的,一张很宽的表只要歪几度,右边的字就可能掉进下一行。建议正对着截图、在图上拖框只框住表格,并保证最小的字至少有 10 个像素高。拍纸质表格的话,先展平再识别。
能一次转多张图或者整个 PDF 吗?
免费版不行:一次一张图、一张表(图里有好几张表时取最大的那张,想要别的就拖框选中它)。批量图片、PDF 页面、一页多表会放在 Pro 版里。如果你手上其实是一整个文件夹的发票、合同(带文字层的 PDF、邮件),我们的 Mac 应用 AIFormFerry 可以按你指定的字段,每份文档汇成表里的一行。
和 iLovePDF、Nanonets、Excel 的「从图片插入数据」有什么不同?
这些服务都要把图片传到服务器上识别(Excel 的「从图片」还要 Microsoft 365 订阅)。本页整个过程都在你的电脑上完成,不限次数、不用注册,还会把检测到的行列画在图上,哪一格错了能看出为什么。代价是:服务器上的模型更大,对乱七八糟的照片更宽容。
图片、格子里的文字和导出文件都不会离开这个标签页。模型由浏览器缓存,第二次打开大约一秒就能开始。