版面 XML
版面 XML 记录 PDF 暴露出来的文本层。页面保留尺寸,每个文本片段保留位置、大小和字体信息。它适合搜索、视觉核对、后续提取规则以及需要把内容关联到页面位置的集成。
// PDF → XML
使用此 PDF 转 XML 工具,将文档文本层变为可读结构,或恢复 PDF 内已有的嵌入 XML。读取在浏览器完成,不使用 AI、OCR,也不会把文档上传到转换服务器。
PDF 最大 20 MB、60 页。文件保留在浏览器中。
版面 XML 示例 · 页面、行、坐标和文字均明确保留。
// 了解输出结果
PDF 和 XML 解决不同的问题。PDF 固定展示效果,XML 则为系统、脚本和技术读者组织信息。转换不会猜测原始数据库或重建源文档。此工具会清晰区分从 PDF 中提取的版面 XML 与原本就附在 PDF 内的 XML。
版面 XML 记录 PDF 暴露出来的文本层。页面保留尺寸,每个文本片段保留位置、大小和字体信息。它适合搜索、视觉核对、后续提取规则以及需要把内容关联到页面位置的集成。
有些 PDF 将 XML 作为内部附件。下载该附件比从页面推断业务字段更可靠。工具会按声明的编码预览附件,并按原始字节下载,不会重新编码为 UTF-8。
// 实际用途
当下一步需要文本、位置或附带数据文件时使用此工具。它提供可验证的处理基础,而不是替代业务数据模式。
集成团队可将输出作为中间步骤,再用自己的规则或 XSLT 映射到目标系统。这样能区分页面上的可见文字和已被验证的字段。
对于报告、收据、合同和对账单,版面 XML 可在自动化前定位标题、总额、日期和引用。可在同一流程中将文本片段与源 PDF 预览逐一比较。
将版面 XML 与 PDF 一同保存,用于索引和审计。页码和坐标能让后续搜索定位到文字出现的位置,但这并不表示 PDF 已成为可直接使用的数据库。
当 PDF 含有 XML 时,目标从提取版面变为恢复已有附件。转换器会检测 XML 附件,让用户选择其一,并保留原始下载字节。
// 使用步骤
流程将一个决定说清楚:有嵌入 XML 时优先使用它,否则使用版面 XML。界面总会标明即将下载的输出类型。
选择或拖入 PDF。工具会在读取前检查扩展名、文件签名、大小和页数。此版本不提供输入密码的界面,因此不会打开受密码保护的 PDF。
将 XML 与 PDF 预览进行比较。摘要会显示页数、文本片段和附件。嵌入 XML 会作为单独选项出现;没有附件时,界面会将下载标注为提取的版面 XML。
PDF 中含有原始文件时选择嵌入 XML;需要文字和页面几何信息时选择版面 XML。请保留能够识别来源的文件名,并在编辑器、XML 验证器或集成流程中验证结果。
// 技术解读
根元素标识模式和坐标原点。每个 page 包含宽度和高度。line 会组合相邻文本片段,span 保存文字与 x、y、width、height、font。这会保留空间上下文,但不证明视觉行属于某个表格或业务字段。自动化决策前,请为具体文档定义规则并验证真实样本。
// 明确限制
此版本读取 PDF 已有的文本层。仅由图片组成的扫描件可能没有文本片段。流程不包含 OCR 或 AI 分类,因此不会虚构缺失字符。自由排版的文档也可能存在与视觉顺序不同的读取顺序。请使用预览并验证重要文档。
// 可验证的隐私
提取在此浏览器中运行。PDF 不会发送到转换路由、保存到历史记录或获得公开下载链接。预览使用临时浏览器地址,在更换文件或离开页面时被丢弃。提取流程不会执行 PDF 链接、脚本、操作或注释。
0 字节发送到服务器
直接说明如何选择正确输出及理解其限制。