扫描版 PDF 翻译效果不好,很多时候不是翻译模型本身的问题,而是 OCR 一开始就没有识别准。
如果原图模糊、页面歪斜、字太小、表格线断裂,后面的翻译和排版都会被影响。尤其是论文、说明书、合同、外贸报价单这类正式文档,翻译前先把扫描件质量看一遍,通常比直接整份上传更稳。
先判断它是不是扫描版 PDF
第一步,不是马上翻译,而是先判断文件类型。
你可以打开 PDF 试一下:
- 文字能不能逐字选中。
- 复制出来是不是正常文字。
- 放大到 200% 后文字边缘是否清晰。
- 页面是不是整张图片。
- 表格线、图注和页脚是不是和正文混在一起。
如果只能选中整页图片,或者复制出来是乱码,那它本质上就是图片型 PDF,需要先走 OCR。可以先看 扫描版PDF翻译OCR流程,理解 OCR、翻译和排版之间的关系。
1. 清晰度不够,先换更清楚的文件
OCR 最怕的是低清晰度。
常见问题包括:
- 手机拍照发虚。
- 扫描分辨率太低。
- 页面被压缩过很多次。
- 文字边缘有明显锯齿。
- 纸张阴影压住了正文。
如果原始文件不清楚,翻译工具只能在错误文字上继续翻译。此时与其反复重试,不如先找更清晰的原文件,或者重新扫描一版。
2. 页面歪斜会影响阅读顺序
扫描件只要稍微歪一点,OCR 就可能把段落、表格和页眉页脚读错。
特别是双栏论文、说明书步骤页、参数表和合同条款页,页面倾斜后会更容易出现:
- 段落顺序错乱。
- 两栏文字串在一起。
- 表格行列对不齐。
- 页眉页脚混进正文。
- 图片说明跑到错误位置。
如果文件是拍照得到的,建议先裁正、拉平、去掉多余背景,再上传测试。
3. 页边和黑边不要留太多
很多扫描件四周会有黑边、桌面背景、手指、装订孔或阴影。人眼看着不影响阅读,但 OCR 会把这些杂讯当成页面内容的一部分。
翻译前最好先检查:
- 页面四周是否有大面积黑边。
- 是否有水印、印章或批注遮住正文。
- 是否有装订边压住文字。
- 是否有扫描阴影影响小字。
这些内容越少,OCR 越容易把重点放在正文、表格和图注上。
4. 表格密集页面要单独试看
扫描版 PDF 里,表格是最容易出问题的部分。
如果表格线很浅、单元格合并很多、小数点和单位很多,OCR 可能识别出文字,但不一定能识别出正确结构。翻译后常见问题是金额错位、型号错位、单位跑到下一列。
所以如果文件里有报价单、参数表、设备清单、实验数据表,不建议只拿纯正文页测试。应该选一页表格密集页,先用 文档翻译先免费试看第一页 判断真实效果。
5. 小字号和脚注要重点看
正式文档里,小字号经常藏着重要信息,比如:
- 合同脚注。
- 表格备注。
- 产品警示语。
- 论文图注。
- 参数单位。
- 免责声明。
这些内容如果 OCR 漏掉,正文看起来没问题,实际交付时还是会出错。试翻译第一页时,不要只看标题和大段正文,也要放大检查小字有没有漏识别。
6. 不要直接用整份文件赌结果
扫描版 PDF 最稳的处理方式,是先用最复杂的一页试。
这页最好包含:
- 小字号。
- 表格。
- 图注。
- 页眉页脚。
- 双栏或多栏。
- 扫描阴影。
如果这一页 OCR、翻译和排版都还能接受,再继续处理整份文件。否则建议先换更清晰的源文件,或者降低排版保留预期。
什么时候可以继续整份翻译
可以用下面这个标准判断:
- 正文大部分能识别准确。
- 段落顺序没有明显错乱。
- 表格里的数字、单位、型号没有大面积错位。
- 图注和图片还能对应。
- 导出的结果适合继续阅读或人工校对。
如果你的目标是正式交付,还可以继续看 PDF翻译后怎么检查质量。如果你更关心成本,可以看 扫描版PDF翻译怎么估价 和 翻译排版大师定价页。
小结
扫描版 PDF 翻译前,提高 OCR 识别率的关键不是换很多工具,而是先把文件质量看清楚。
优先检查清晰度、倾斜、页边、表格线、小字号和页面结构。再选最复杂的一页免费试看,确认 OCR、翻译和基础排版都能接受后,再继续整份处理。这样比直接上传整份文件更稳,也更容易控制返工成本。