[{"data":1,"prerenderedAt":430},["ShallowReactive",2],{"blog-post-zh-translate-scanned-pdf-with-ocr":3},{"id":4,"title":5,"body":6,"category":418,"coverImage":419,"date":420,"description":421,"extension":422,"meta":423,"navigation":424,"path":425,"seo":426,"slug":427,"stem":428,"__hash__":429},"blog_zh/zh/blog/translate-scanned-pdf-with-ocr.md","如何 OCR 翻译扫描版 PDF：完整操作指南",{"type":7,"value":8,"toc":392},"minimark",[9,13,24,62,66,74,77,91,102,106,111,114,117,128,132,139,142,145,154,158,161,164,167,176,180,183,186,216,219,228,232,235,238,241,245,248,262,265,268,277,281,284,317,320,324,327,330,333,336,340,343,347,350,354,357,361,364,368,371,375,378,382,385],[10,11,12],"p",{},"打开一份 PDF，想选中其中一句话，却发现整页像一张图片：无法复制，也搜索不到明明写在页面上的文字。这通常说明文件是扫描版或图片型 PDF。",[10,14,15,16,23],{},"这类文档需要先经过 OCR，也就是光学字符识别。OCR 从页面图片中找出文字，翻译服务再处理识别结果，最后由 PDF 工具把译文放回相应的版面位置。下面以 Mac 版 ",[17,18,22],"a",{"href":19,"rel":20},"https://apps.apple.com/cn/app/id6758205667",[21],"nofollow","Doco Translate"," 为例，介绍完整操作流程。",[25,26,29,33],"div",{"className":27},[28],"tldr-block",[30,31,32],"h2",{"id":32},"快速了解",[34,35,36,44,50,56],"ul",{},[37,38,39,43],"li",{},[40,41,42],"strong",{},"用途："," 先用 OCR 识别扫描版或图片型 PDF 中的文字，再翻译识别结果。",[37,45,46,49],{},[40,47,48],{},"原因："," 扫描件把页面保存成图片，普通 PDF 翻译工具无法像读取数字版 PDF 那样直接提取文字。",[37,51,52,55],{},[40,53,54],{},"方法："," 在 Doco Translate 中手动选择原文语言和目标语言，打开扫描件，等待 OCR 和翻译完成，对照检查后导出译文 PDF 或双语 PDF。",[37,57,58,61],{},[40,59,60],{},"结果："," 得到一份保留原页面关系、方便核对的译文；导出的 PDF 包含可选择文字，但 OCR 和版面仍需人工检查。",[30,63,65],{"id":64},"如何判断-pdf-是否需要-ocr","如何判断 PDF 是否需要 OCR",[10,67,68,69,73],{},"普通数字版 PDF 通常包含真正的文字对象，因此可以选中句子、搜索关键词，也能把段落复制到其他应用。扫描版 PDF 则不同：即使文件扩展名同样是 ",[70,71,72],"code",{},".pdf","，里面的每一页也可能只是一张纸质文档的照片。",[10,75,76],{},"可以用下面几个方法判断：",[34,78,79,82,85,88],{},[37,80,81],{},"拖动鼠标尝试选择一句话。如果只能选中整张页面图片，或者完全没有反应，通常需要 OCR。",[37,83,84],{},"搜索页面上清楚可见的词。如果找不到，PDF 可能没有保存文字信息。",[37,86,87],{},"放大查看字形。字母边缘明显出现像素时，看到的很可能是图片，而不是渲染出来的文字。",[37,89,90],{},"多检查几页。有些 PDF 是混合文件，封面是数字版，后面的正文却是扫描图片。",[10,92,93,94,97,98,101],{},"OCR 连接了页面图片和翻译服务。它先检测文字区域并识别字符，再把识别出的文字交给翻译服务。两个步骤彼此独立，所以 OCR 如果把 ",[70,95,96],{},"I"," 认成 ",[70,99,100],{},"1","，错误也会进入后续译文，除非在检查时修正。",[30,103,105],{"id":104},"使用-ocr-翻译扫描版-pdf","使用 OCR 翻译扫描版 PDF",[107,108,110],"h3",{"id":109},"_1-尽量使用清晰的扫描件","1. 尽量使用清晰的扫描件",[10,112,113],{},"页面清晰、端正、亮度均匀且对比度足够时，OCR 的识别效果最好。如果纸质原件还在，重新扫描一张模糊或倾斜的页面，往往比事后逐处改错更省时间。",[10,115,116],{},"导入前可以先旋转方向错误的页面，并检查页边文字是否被裁掉。大面积阴影、背面透字、水印、手写批注和装饰字体都会增加识别难度。",[25,118,121],{"className":119},[120],"feature-image",[10,122,123],{},[124,125],"img",{"alt":126,"src":127},"对比褶皱的扫描版 PDF 与 OCR 处理后的清晰页面","/images/blog/translate-scanned-pdf-with-ocr/scanned-pdf-before-after.jpg",[107,129,131],{"id":130},"_2-手动选择原文语言","2. 手动选择原文语言",[10,133,134,135,138],{},"首先从 Mac App Store 下载 ",[17,136,22],{"href":19,"rel":137},[21],"。安装完成后打开应用，在文件选择区上方设置扫描件使用的语言、目标语言和翻译服务。",[10,140,141],{},"处理扫描件时，尤其是画质一般的文件，不建议把原文语言留在“自动检测”。扫描页面没有数字版 PDF 中可靠的文字元数据，提前指定语言可以帮助 OCR 判断字符。如果文档以法语为主，只夹杂少量英文术语，就选择法语作为原文语言，再单独检查那些英文词。",[10,143,144],{},"只想快速翻译时，可以使用“自动选择”，由 Doco 选择当前可用的基础翻译服务。也可以改用 Apple 翻译或已经配置的 AI 服务。翻译服务决定识别出来的文字如何翻译，但无法自动修复 OCR 已经认错的字符。",[25,146,148],{"className":147},[120],[10,149,150],{},[124,151],{"alt":152,"src":153},"运行 OCR 前在 Doco Translate 中手动选择原文语言","/images/blog/translate-scanned-pdf-with-ocr/select-source-language-for-ocr.jpg",[107,155,157],{"id":156},"_3-打开扫描版-pdf","3. 打开扫描版 PDF",[10,159,160],{},"把导入类型保持为“本地”，点击“打开文件”，然后选择 PDF。Doco Translate 会进入翻译界面并开始处理文档。",[10,162,163],{},"检测到扫描文档后，Doco 可能会提示确认原文语言。这是 OCR 设置的一部分，不只是普通的翻译偏好。确认语言后再继续识别。",[10,165,166],{},"处理过程包括页面解析、OCR 文字识别、调用所选服务翻译文字，以及显示译文。翻译会逐页出现，前面的页面完成后就能开始检查，不必一直等到整份文件处理完。",[25,168,170],{"className":169},[120],[10,171,172],{},[124,173],{"alt":174,"src":175},"通过 Mac 文件选择器在 Doco Translate 中打开扫描版 PDF","/images/blog/translate-scanned-pdf-with-ocr/open-scanned-pdf.jpg",[107,177,179],{"id":178},"_4-对照原文检查-ocr-译文","4. 对照原文检查 OCR 译文",[10,181,182],{},"Doco Translate 默认使用双语视图，左侧显示原始扫描页，右侧显示译文页。两边会同步滚动和缩放；鼠标指向一侧的对象时，另一侧对应对象也会高亮。看到可疑译文时，可以马上回到扫描原文核对。",[10,184,185],{},"以下内容一旦识别错误，影响通常比较大：",[34,187,188,191,194,197,200],{},[37,189,190],{},"人名、公司名和地名",[37,192,193],{},"日期、小数点、百分比、货币金额和编号",[37,195,196],{},"表头，以及必须留在正确行列中的数值",[37,198,199],{},"缩写、产品代码、引用和专业术语",[37,201,202,203,206,207,210,211,206,213,215],{},"外形相近的字符，例如 ",[70,204,205],{},"0"," 与 ",[70,208,209],{},"O","、",[70,212,100],{},[70,214,96],{},"，以及不同标点符号",[10,217,218],{},"遇到多栏页面，要确认段落顺序是否正确。表格中的重要数字应逐项对照原文，不要只看译文是否通顺。混合多种语言的页面也需要多检查，因为一次 OCR 语言设置不一定适合页面上的每个短语。",[25,220,222],{"className":221},[120],[10,223,224],{},[124,225],{"alt":226,"src":227},"在 Doco Translate 中并排检查扫描原文与 OCR 译文","/images/blog/translate-scanned-pdf-with-ocr/review-ocr-translation-side-by-side.jpg",[107,229,231],{"id":230},"_5-修正文字和版面问题","5. 修正文字和版面问题",[10,233,234],{},"译文段落需要调整时，在右侧译文区域选中它。可以直接修改文字，也可以换一个翻译服务，只重新翻译当前段落。译文变长、原来的文本框放不下时，还可以移动文本框或调整大小。",[10,236,237],{},"OCR、翻译和版面重建处理的是不同问题。句子翻译正确，可能仍会超出原来的文本框；位置看起来合适的段落，也可能藏着识别错误。检查时要同时看文字和页面。",[10,239,240],{},"Doco Translate 会尽量保留图片、表格、分栏和页面中的对应关系，但没有任何 OCR PDF 翻译工具能保证每份扫描件都完全一致。译文长度、密集排版、破损页面和复杂图形都可能需要手动处理。",[107,242,244],{"id":243},"_6-导出译文-pdf-或双语-pdf","6. 导出译文 PDF 或双语 PDF",[10,246,247],{},"页面检查完成后，点击右上角的“导出”，格式选择“PDF”，再选择需要的模式：",[34,249,250,256],{},[37,251,252,255],{},[40,253,254],{},"仅译文","只导出翻译后的页面。",[37,257,258,261],{},[40,259,260],{},"双语","同时导出原文和译文，按照一页原文、一页译文的方式交替排列。",[10,263,264],{},"选择文件名和保存位置，等待导出完成。导出的 PDF 包含可选择、可编辑的文字，并不是只有页面图片。PDF 导出属于 Pro 功能。",[10,266,267],{},"如果只是自己阅读，留在 Doco 的双语视图中可能已经够用。需要交给其他人核对时，双语 PDF 会更方便。",[25,269,271],{"className":270},[120],[10,272,273],{},[124,274],{"alt":275,"src":276},"把 OCR 翻译结果导出为译文 PDF 或双语 PDF","/images/blog/translate-scanned-pdf-with-ocr/export-translated-or-bilingual-pdf.jpg",[30,278,280],{"id":279},"如何提高-ocr-翻译质量","如何提高 OCR 翻译质量",[10,282,283],{},"第一次识别的错误较多时，应该从前面的处理步骤开始排查，而不是只更换翻译服务。",[285,286,287,293,299,305,311],"ol",{},[37,288,289,292],{},[40,290,291],{},"改善原始图片。"," 重新扫描或替换模糊、倾斜、裁切不完整、颜色过浅或压缩严重的页面。",[37,294,295,298],{},[40,296,297],{},"确认原文语言。"," 语言选择不对，字符在进入翻译阶段之前就可能被认错。",[37,300,301,304],{},[40,302,303],{},"先改识别错误。"," 优先核对人名、数字、日期和专业术语，再调整句子是否流畅。",[37,306,307,310],{},[40,308,309],{},"单独检查复杂区域。"," 表格、脚注、印章、手写内容和图片中的文字更容易出错。",[37,312,313,316],{},[40,314,315],{},"保留原始文件。"," 译文 PDF 应作为衍生文件保存。法律、医疗、财务、安全或出版材料尤其需要留好原件。",[10,318,319],{},"重要文档可以用 OCR 和机器翻译完成初步处理，但正式使用前仍应由具备相关知识的人复核。",[30,321,323],{"id":322},"隐私说明本地解析-pdf-不等于离线翻译","隐私说明：本地解析 PDF 不等于离线翻译",[10,325,326],{},"Doco Translate 会在设备上解析 PDF，翻译阶段是否联网则取决于所选服务。",[10,328,329],{},"使用 Google 翻译、Microsoft Translator 或云端 AI 服务时，翻译所需的文字会发送给对应服务商，并受其条款和隐私政策约束。需要完全本地的流程，可以使用已经下载语言包的 Apple 翻译，或者通过 Ollama、LM Studio、oMLX 连接本地模型。",[10,331,332],{},"扫描件如果包含机密或受监管信息，应先确认所在组织的规定，再选择云端翻译服务。",[30,334,335],{"id":335},"常见问题",[107,337,339],{"id":338},"pdf-中的文字无法选中还能翻译吗","PDF 中的文字无法选中，还能翻译吗？",[10,341,342],{},"可以。这正是 OCR 要解决的问题。OCR 先识别页面上可见的字符，随后翻译识别结果，并把译文显示在可阅读的文档页面中。",[107,344,346],{"id":345},"为什么扫描件要手动选择原文语言","为什么扫描件要手动选择原文语言？",[10,348,349],{},"扫描页面缺少可靠的文字元数据。指定原文语言能为字符识别提供更明确的信息，通常可以减少提取错误。",[107,351,353],{"id":352},"模糊或倾斜的扫描件能识别吗","模糊或倾斜的扫描件能识别吗？",[10,355,356],{},"可能识别出一部分，但效果会受到清晰度、角度、对比度、分辨率、字体和页面破损的影响。能重新扫描时，先把页面放正并提高画质通常最有效。",[107,358,360],{"id":359},"译文-pdf-会保留表格图片和分栏吗","译文 PDF 会保留表格、图片和分栏吗？",[10,362,363],{},"Doco Translate 会按照原页面结构重建译文，并尽量保持这些内容之间的关系。复杂版面和较长译文仍可能需要人工检查或调整。",[107,365,367],{"id":366},"可以完全离线翻译扫描版-pdf-吗","可以完全离线翻译扫描版 PDF 吗？",[10,369,370],{},"可以，但文档处理和翻译服务都必须在本地运行。在 Doco Translate 中，可以使用已经下载语言包的 Apple 翻译，或者选择 Ollama、LM Studio、oMLX 等本地模型方案。云端翻译服务会把翻译所需的文字发送给服务商。",[107,372,374],{"id":373},"能把图片型-pdf-导出成可搜索的文字吗","能把图片型 PDF 导出成可搜索的文字吗？",[10,376,377],{},"可以。Doco Translate 导出的译文 PDF 包含可选择、可编辑的文字，也可以导出双语 PDF，方便与扫描原文对照。",[30,379,381],{"id":380},"把图片型-pdf-变成可核对的译文","把图片型 PDF 变成可核对的译文",[10,383,384],{},"扫描版 PDF 并不是不能翻译，只是要先多做一步文字识别。尽量使用清晰的扫描件，指定原文语言，对照原始页面检查重点内容，确认无误后再导出。",[10,386,387,391],{},[17,388,390],{"href":19,"rel":389},[21],"下载 Doco Translate","，用 OCR 识别扫描版 PDF，在同一个界面中翻译并对照检查页面。",{"title":393,"searchDepth":394,"depth":394,"links":395},"",2,[396,397,398,407,408,409,417],{"id":32,"depth":394,"text":32},{"id":64,"depth":394,"text":65},{"id":104,"depth":394,"text":105,"children":399},[400,402,403,404,405,406],{"id":109,"depth":401,"text":110},3,{"id":130,"depth":401,"text":131},{"id":156,"depth":401,"text":157},{"id":178,"depth":401,"text":179},{"id":230,"depth":401,"text":231},{"id":243,"depth":401,"text":244},{"id":279,"depth":394,"text":280},{"id":322,"depth":394,"text":323},{"id":335,"depth":394,"text":335,"children":410},[411,412,413,414,415,416],{"id":338,"depth":401,"text":339},{"id":345,"depth":401,"text":346},{"id":352,"depth":401,"text":353},{"id":359,"depth":401,"text":360},{"id":366,"depth":401,"text":367},{"id":373,"depth":401,"text":374},{"id":380,"depth":394,"text":381},"使用教程","/images/blog/translate-scanned-pdf-with-ocr/cover.jpg","2026-08-19","了解如何用 OCR 翻译扫描版和图片型 PDF，改善文字识别效果，并尽量保留表格、图片、分栏和原始页面结构。","md",{},true,"/zh/blog/translate-scanned-pdf-with-ocr",{"title":5,"description":421},"translate-scanned-pdf-with-ocr","zh/blog/translate-scanned-pdf-with-ocr","rIW26QipYRrtdH8uOUsJBjVZSUDKZS9wmBsqNBF0kko",1787207634957]