调整下载方式与工具使用偏好。
适用于单个 PDF 或图片文件,不包含 ZIP 下载。
下载文件数量超过此值时,打包为 ZIP。
对此问题感到抱歉!
如果你仍然遇到问题,不要犹豫,向我们寻求帮助。你可以在我们的GitHub页面上提交工单,或者通过Discord与我们联系:
免费免登录 · 单文件最多 50MB · 同一网络一次处理一个任务。转换文件会上传至服务器,完成后清理。使用与隐私说明
请先选择需要处理的文件。
将PDF转换为XML格式。
将 PDF 导出为转换引擎支持的 XML 文档表示。结果用于进一步解析与处理,不保证符合你业务系统的专用 XML 模板。
输入应为完整、可打开的 PDF。扫描图与文字型 PDF 的结构差异很大,需要提取正文时可先确认有可用文字层。
XML 只是结构化标记文件,不自动等同于发票、报表或其他行业规定的数据结构。先确认目标系统需要的字段和格式。
上传 PDF 后执行转换,下载生成的 XML 或转换结果。不同源文档的结构会影响输出节点和内容组织方式。
用文本编辑器或 XML 工具检查编码、节点层级与正文。浏览器显示原始标记并不代表文件错误,不要当作 PDF 阅读器文件打开。
重点检查中文、数字、表格顺序与特殊符号。页面外观信息不一定能转成准确的业务字段,需要与原 PDF 对照。
若要导入其他系统,应根据目标规范编写字段映射和校验。保留原始 PDF 与导出 XML,方便定位遗漏内容或解析差异。
TXT 主要提供可读字符,XML 会使用标记组织转换结果。但这种结构不一定就是你业务所需的数据模型,仍可能需要额外解析。
不能据此保证。此工具做通用格式转换,不提供特定行业字段模板、校验规则或业务认证;应使用对应系统规定的生成流程。
不同转换器采用的 XML 表示和结构可能不同。请按实际输出建立解析逻辑,不要假定不同软件的节点名称与组织方式一致。
扫描 PDF 可能没有文字层,转换无法凭空得到可编辑正文。先 OCR,再检查识别质量;仍不保证自动识别复杂表格的语义。
XML 是否能被某软件正确理解取决于它遵循的具体结构。请先用 XML 查看工具确认内容,再决定是否需要转换或字段映射。
先确认源 PDF 能打开、无密码且没有结构损坏,再尝试小型文字 PDF。若所有文件均失败,应检查部署的文档转换引擎及其输出支持。
此服务使用LibreOffice进行文件转换。