调整下载方式与工具使用偏好。
适用于单个 PDF 或图片文件,不包含 ZIP 下载。
下载文件数量超过此值时,打包为 ZIP。
对此问题感到抱歉!
如果你仍然遇到问题,不要犹豫,向我们寻求帮助。你可以在我们的GitHub页面上提交工单,或者通过Discord与我们联系:
免费免登录 · 单文件最多 50MB · 同一网络一次处理一个任务。转换文件会上传至服务器,完成后清理。使用与隐私说明
请先选择需要处理的文件。
将PDF转换为文本或RTF格式。
从 PDF 导出 TXT 或 RTF。TXT 适合获得不带版式的正文,RTF 可尝试保留部分文本格式;扫描内容需要先识别。
在阅读器中尝试选择和复制正文。纯扫描件与图片化文字无法通过普通提取变成文本,应先使用 OCR 并检查识别效果。
TXT 输出纯文字,不包含原图片、页面背景、字体大小和排版。适合检索、摘录、后续清洗和导入其他文字处理流程。
RTF 会尝试保留可表示的格式,但不能保证原 PDF 的复杂版面完全一致。多栏、表格和特殊对象应在目标编辑器中逐项检查。
PDF 中的文字存储顺序可能与视觉排版不同。多栏、侧注、页眉页脚可能穿插进入结果,提取后应重新检查段落顺序。
页面上原有的页码、页眉和水印文字可能一起被提取。这些属于文档内容,工具不会按你的业务含义自动删除。
用支持所需编码的文本编辑器打开结果,检查中文、标点、数字及换行。重要引用应回到原 PDF 核对,不把自动提取当作已校对文本。
源文档可能只有扫描图片,或文字被转为图形。先尝试 OCR;也可在原 PDF 中验证能否复制出正常文字,帮助判断是否存在可用文字层。
TXT 只保存文字,不保留图片和原始表格版式。需要表格数据可尝试 PDF 转 CSV,需要更接近页面外观可尝试 Word 或 RTF。
多栏与绝对定位文字的内部顺序未必等于视觉阅读顺序。提取后需要根据原文调整,复杂版面可以按页或按章节先拆分再处理。
TXT 只保留字符和换行,兼容性较强;RTF 能保存一定文本格式,但格式恢复依赖源 PDF。选择应由后续编辑需求决定。
当前没有按语义清理这些内容的选项。它们可能被当作普通文字一起导出,需要在文本编辑器或后续清洗流程中处理。
不一定,也可能是 PDF 内部字体编码或文字映射异常。先比较从原件复制的文字是否也乱码,再排查输出编码或考虑 OCR 重新识别。
此服务使用LibreOffice进行文件转换。