从 PDF 提取结构化数据

定义一次字段,将规则应用于多个 PDF,并导出 CSV、Excel 或 JSON。所有处理均在本地完成。

  1. 1PDF
  2. 2示例
  3. 3字段
  4. 4应用
  5. 5检查
  6. 6导出

🔒 PDF 永远不会离开您的设备,处理在浏览器本地完成。

设置

文字识别仅用于没有可选文本的页面。处理在本设备上完成。

将一个或多个 PDF 拖到此处PDF · 每批最多可包含 200 个 PDF。

添加 PDF 以开始提取结构化数据。

使用方法

使用方法

  1. 1

    选择 PDF

    从设备添加一个或多个 PDF,也可以直接选择整个文件夹。不会上传任何内容。

  2. 2

    设定字段

    UseTool 会根据第一个文档提出字段建议。你可以调整,或按锚点、区域、模式添加自己的规则。

  3. 3

    核对并导出

    逐个文件核对识别到的值,修正偏差,然后导出为 CSV、Excel 或 JSON。

这个工具做什么

输入什么
每批最多可包含 200 个 PDF。
输出什么
输出 CSV · XLSX · JSON。
质量会怎样
只读取你的文件,不做修改。原件保持原样。
边界在哪里
受密码保护的文件无法打开。 超大文件受设备内存限制,而不是服务器配额。
提取 PDF 数据
文字识别仅用于没有可选文本的页面。处理在本设备上完成。

支持的格式

PDF → CSVXLSXJSON

值得了解

常见问题

可以对多个 PDF 使用相同的提取规则吗?

可以。先在一个有代表性的 PDF 上定义字段,再在本地将规则应用到整个批次。导出前可检查缺失或不明确的值。

扫描版 PDF 也能用吗?

可以。如果某页没有可选中的文字,UseTool 可以在浏览器本地运行文字识别,在“设置”中开启。PDF 和识别出的文字都留在你的设备上。识别比读取已有文字层慢得多。

文字还能被搜索吗?

是的。PDF 不会被改动:提取器只做读取。原始文件保持不变,提取到的值会导出为 CSV、Excel 或 JSON。

手机上能用吗?

可以,Android 和 iPhone 都行——工作由浏览器完成,无需安装。大批量处理和本地文字识别需要内存和算力,任务很大时用电脑更合适。

这里能用哪些文件?

每批最多可包含 200 个 PDF。

我会得到什么?

输出 CSV · XLSX · JSON。

文件会损失质量吗?

只读取你的文件,不做修改。原件保持原样。

什么情况下不行?

受密码保护的文件无法打开。 超大文件受设备内存限制,而不是服务器配额。

能打开带密码的 PDF 吗?

不能。浏览器无法读取被密码锁定的 PDF,工具会直接说明,而不是生成一个空文档。请先在创建该文件的程序里取消保护。

从设计上保护隐私

你的文件留在你的设备上

PDF 永远不会离开您的设备,处理在浏览器本地完成。

其他工具

现成方案

适用于此文件类型的流程