免费免登录 · 单文件最多 50MB · 同一网络一次处理一个任务。转换文件会上传至服务器,完成后清理。使用与隐私说明

OCR / Cleanup scans

Cleanup scans and detects text from images within a PDF and re-adds it as text.

Additional Settings

使用规则

识别扫描 PDF 中的文字,生成可搜索的文字层,并可额外导出文本。识别质量取决于语言选择、原图清晰度和版面。

先上传 PDF,再选择文档实际使用的语言,至少选一种。列表里是本站已经安装的语言;中英文混排就按需要一起选择,不用把所有语言都勾上。

忽略已有文本模式跳过已经含文字的页面;普通模式遇到已有文字可能报错;强制模式会重新 OCR 全部页面,并改变原有文字内容的处理方式。

纠偏用于改善倾斜扫描;清理用于减少噪点影响,最终清理还会改变输出外观。先在副本中测试,避免浅色印章或细线受到影响。

勾选生成文本文件时,结果会包含 OCR 文本与 PDF,通常打包交付。文本文件不等同于保留原始表格、字体与段落的可编辑文档。

渲染方式按文档语言和兼容性需要选择,HOCR 选项标明适用拉丁字母。移除图像会丢失图像内容,仅在确实需要纯文字结果时考虑。

用搜索和复制验证文字层,重点检查姓名、金额、日期、编号及相似字符。识别不是人工校对,低清、手写和复杂表格的结果更需检查。

常见问题

低分辨率、模糊、倾斜、噪点和语言选择都会影响识别。优先改善扫描源,选择正确语言,再尝试纠偏或清理并比较结果。

如果只想处理没有文字的页面,选忽略已有文本;想重做整个文档文字识别时才考虑强制模式,并注意它可能改变现有文字和外观。

页面语言来自当前环境已安装的 OCR 语言数据。需要额外语言时应补齐部署依赖,勾选近似语言不能保证正确识别。

它会移除输出中的图像,可能使扫描底图、照片或印章消失。只有明确需要纯文字处理结果时再用,重要原貌应另存保留。

启用附加文本输出后,需要同时交付 PDF 和文本文件,所以会打包。解压后分别查看文档外观与识别出的文字。

本工具主要添加文字层或导出识别文本,不保证恢复原始编辑结构。可继续转换 Word,但段落、表格和公式仍需要人工整理。

This service uses OCRmyPDF and Tesseract for OCR.

Please read this documentation on how to use this for other languages and/or use not in docker

https://github.com/Stirling-Tools/Stirling-PDF/blob/main/HowToUseOCR.md