返回博客

如何 OCR 翻译扫描版 PDF:完整操作指南

如何 OCR 翻译扫描版 PDF:完整操作指南

打开一份 PDF,想选中其中一句话,却发现整页像一张图片:无法复制,也搜索不到明明写在页面上的文字。这通常说明文件是扫描版或图片型 PDF。

这类文档需要先经过 OCR,也就是光学字符识别。OCR 从页面图片中找出文字,翻译服务再处理识别结果,最后由 PDF 工具把译文放回相应的版面位置。下面以 Mac 版 Doco Translate 为例,介绍完整操作流程。

快速了解

  • 用途: 先用 OCR 识别扫描版或图片型 PDF 中的文字,再翻译识别结果。
  • 原因: 扫描件把页面保存成图片,普通 PDF 翻译工具无法像读取数字版 PDF 那样直接提取文字。
  • 方法: 在 Doco Translate 中手动选择原文语言和目标语言,打开扫描件,等待 OCR 和翻译完成,对照检查后导出译文 PDF 或双语 PDF。
  • 结果: 得到一份保留原页面关系、方便核对的译文;导出的 PDF 包含可选择文字,但 OCR 和版面仍需人工检查。

如何判断 PDF 是否需要 OCR

普通数字版 PDF 通常包含真正的文字对象,因此可以选中句子、搜索关键词,也能把段落复制到其他应用。扫描版 PDF 则不同:即使文件扩展名同样是 .pdf,里面的每一页也可能只是一张纸质文档的照片。

可以用下面几个方法判断:

  • 拖动鼠标尝试选择一句话。如果只能选中整张页面图片,或者完全没有反应,通常需要 OCR。
  • 搜索页面上清楚可见的词。如果找不到,PDF 可能没有保存文字信息。
  • 放大查看字形。字母边缘明显出现像素时,看到的很可能是图片,而不是渲染出来的文字。
  • 多检查几页。有些 PDF 是混合文件,封面是数字版,后面的正文却是扫描图片。

OCR 连接了页面图片和翻译服务。它先检测文字区域并识别字符,再把识别出的文字交给翻译服务。两个步骤彼此独立,所以 OCR 如果把 I 认成 1,错误也会进入后续译文,除非在检查时修正。

使用 OCR 翻译扫描版 PDF

1. 尽量使用清晰的扫描件

页面清晰、端正、亮度均匀且对比度足够时,OCR 的识别效果最好。如果纸质原件还在,重新扫描一张模糊或倾斜的页面,往往比事后逐处改错更省时间。

导入前可以先旋转方向错误的页面,并检查页边文字是否被裁掉。大面积阴影、背面透字、水印、手写批注和装饰字体都会增加识别难度。

对比褶皱的扫描版 PDF 与 OCR 处理后的清晰页面

2. 手动选择原文语言

首先从 Mac App Store 下载 Doco Translate。安装完成后打开应用,在文件选择区上方设置扫描件使用的语言、目标语言和翻译服务。

处理扫描件时,尤其是画质一般的文件,不建议把原文语言留在“自动检测”。扫描页面没有数字版 PDF 中可靠的文字元数据,提前指定语言可以帮助 OCR 判断字符。如果文档以法语为主,只夹杂少量英文术语,就选择法语作为原文语言,再单独检查那些英文词。

只想快速翻译时,可以使用“自动选择”,由 Doco 选择当前可用的基础翻译服务。也可以改用 Apple 翻译或已经配置的 AI 服务。翻译服务决定识别出来的文字如何翻译,但无法自动修复 OCR 已经认错的字符。

运行 OCR 前在 Doco Translate 中手动选择原文语言

3. 打开扫描版 PDF

把导入类型保持为“本地”,点击“打开文件”,然后选择 PDF。Doco Translate 会进入翻译界面并开始处理文档。

检测到扫描文档后,Doco 可能会提示确认原文语言。这是 OCR 设置的一部分,不只是普通的翻译偏好。确认语言后再继续识别。

处理过程包括页面解析、OCR 文字识别、调用所选服务翻译文字,以及显示译文。翻译会逐页出现,前面的页面完成后就能开始检查,不必一直等到整份文件处理完。

通过 Mac 文件选择器在 Doco Translate 中打开扫描版 PDF

4. 对照原文检查 OCR 译文

Doco Translate 默认使用双语视图,左侧显示原始扫描页,右侧显示译文页。两边会同步滚动和缩放;鼠标指向一侧的对象时,另一侧对应对象也会高亮。看到可疑译文时,可以马上回到扫描原文核对。

以下内容一旦识别错误,影响通常比较大:

  • 人名、公司名和地名
  • 日期、小数点、百分比、货币金额和编号
  • 表头,以及必须留在正确行列中的数值
  • 缩写、产品代码、引用和专业术语
  • 外形相近的字符,例如 0O1I,以及不同标点符号

遇到多栏页面,要确认段落顺序是否正确。表格中的重要数字应逐项对照原文,不要只看译文是否通顺。混合多种语言的页面也需要多检查,因为一次 OCR 语言设置不一定适合页面上的每个短语。

在 Doco Translate 中并排检查扫描原文与 OCR 译文

5. 修正文字和版面问题

译文段落需要调整时,在右侧译文区域选中它。可以直接修改文字,也可以换一个翻译服务,只重新翻译当前段落。译文变长、原来的文本框放不下时,还可以移动文本框或调整大小。

OCR、翻译和版面重建处理的是不同问题。句子翻译正确,可能仍会超出原来的文本框;位置看起来合适的段落,也可能藏着识别错误。检查时要同时看文字和页面。

Doco Translate 会尽量保留图片、表格、分栏和页面中的对应关系,但没有任何 OCR PDF 翻译工具能保证每份扫描件都完全一致。译文长度、密集排版、破损页面和复杂图形都可能需要手动处理。

6. 导出译文 PDF 或双语 PDF

页面检查完成后,点击右上角的“导出”,格式选择“PDF”,再选择需要的模式:

  • 仅译文只导出翻译后的页面。
  • 双语同时导出原文和译文,按照一页原文、一页译文的方式交替排列。

选择文件名和保存位置,等待导出完成。导出的 PDF 包含可选择、可编辑的文字,并不是只有页面图片。PDF 导出属于 Pro 功能。

如果只是自己阅读,留在 Doco 的双语视图中可能已经够用。需要交给其他人核对时,双语 PDF 会更方便。

把 OCR 翻译结果导出为译文 PDF 或双语 PDF

如何提高 OCR 翻译质量

第一次识别的错误较多时,应该从前面的处理步骤开始排查,而不是只更换翻译服务。

  1. 改善原始图片。 重新扫描或替换模糊、倾斜、裁切不完整、颜色过浅或压缩严重的页面。
  2. 确认原文语言。 语言选择不对,字符在进入翻译阶段之前就可能被认错。
  3. 先改识别错误。 优先核对人名、数字、日期和专业术语,再调整句子是否流畅。
  4. 单独检查复杂区域。 表格、脚注、印章、手写内容和图片中的文字更容易出错。
  5. 保留原始文件。 译文 PDF 应作为衍生文件保存。法律、医疗、财务、安全或出版材料尤其需要留好原件。

重要文档可以用 OCR 和机器翻译完成初步处理,但正式使用前仍应由具备相关知识的人复核。

隐私说明:本地解析 PDF 不等于离线翻译

Doco Translate 会在设备上解析 PDF,翻译阶段是否联网则取决于所选服务。

使用 Google 翻译、Microsoft Translator 或云端 AI 服务时,翻译所需的文字会发送给对应服务商,并受其条款和隐私政策约束。需要完全本地的流程,可以使用已经下载语言包的 Apple 翻译,或者通过 Ollama、LM Studio、oMLX 连接本地模型。

扫描件如果包含机密或受监管信息,应先确认所在组织的规定,再选择云端翻译服务。

常见问题

PDF 中的文字无法选中,还能翻译吗?

可以。这正是 OCR 要解决的问题。OCR 先识别页面上可见的字符,随后翻译识别结果,并把译文显示在可阅读的文档页面中。

为什么扫描件要手动选择原文语言?

扫描页面缺少可靠的文字元数据。指定原文语言能为字符识别提供更明确的信息,通常可以减少提取错误。

模糊或倾斜的扫描件能识别吗?

可能识别出一部分,但效果会受到清晰度、角度、对比度、分辨率、字体和页面破损的影响。能重新扫描时,先把页面放正并提高画质通常最有效。

译文 PDF 会保留表格、图片和分栏吗?

Doco Translate 会按照原页面结构重建译文,并尽量保持这些内容之间的关系。复杂版面和较长译文仍可能需要人工检查或调整。

可以完全离线翻译扫描版 PDF 吗?

可以,但文档处理和翻译服务都必须在本地运行。在 Doco Translate 中,可以使用已经下载语言包的 Apple 翻译,或者选择 Ollama、LM Studio、oMLX 等本地模型方案。云端翻译服务会把翻译所需的文字发送给服务商。

能把图片型 PDF 导出成可搜索的文字吗?

可以。Doco Translate 导出的译文 PDF 包含可选择、可编辑的文字,也可以导出双语 PDF,方便与扫描原文对照。

把图片型 PDF 变成可核对的译文

扫描版 PDF 并不是不能翻译,只是要先多做一步文字识别。尽量使用清晰的扫描件,指定原文语言,对照原始页面检查重点内容,确认无误后再导出。

下载 Doco Translate,用 OCR 识别扫描版 PDF,在同一个界面中翻译并对照检查页面。

免費開始翻譯

下載Doco Translate,立即開始文件翻譯之旅。

Download on the App Store需要macOS 15、iOS 18 或更高版本