做双语教材、涉外课件、进口设备说明书的技术同事,绕不开一个问题:怎么把一份带公式、表格、插图的 PDF,翻成西/法/德等小语种,还尽量保住原版式?这篇从工程角度拆开讲——难点在哪、流程怎么搭、边界怎么划。
先划清边界:本文不提供、也不虚构任何翻译 API/SDK。在线翻译工具本质是「你上传文件、服务端用翻译引擎处理、下载结果」的网页操作;本地要批量、要进流水线,可以把它和脚本组合起来用。两者定位不同,下文会区分。
一、教材课件翻译的三道坎
| 坎 | 表现 | 根因 |
|---|---|---|
| 版式乱 | 公式下标飞、表格跨页断、章节编号错位 | 普通翻译只抽文字,丢掉结构树 |
| 多语言 | 西/法/德小语种资料难找工具 | 很多工具只做好英语 |
| 批量 | 几十份课件逐份手点效率低 | 缺自动化入口 |
好工具的核心能力是按结构翻译:先解析标题层级、表格单元格、图片锚点、多栏分栏,只对文字节点翻译,位置信息原样写回。这样公式、表格、插图、章节编号能对得上。
二、实测一组(源:一份 40 页双语数学讲义,含公式与 12 张表格)
| 方案 | 目标语言 | 结果 | 观感 |
|---|---|---|---|
| 原片 | 中文 | 基准 | 基准 |
| 在线翻译(目标 英语) | 英 | 版式基本保留 | 公式编号对应、表格对齐 |
| 在线翻译(目标 法语) | 法 | 版式基本保留 | 小语种可用 |
| 普通复制粘贴翻译 | 英 | 纯文字流 | 表格全散、需重排 |
结论:保住版式不是为了好看,是为了「翻译完能直接用」。以 PDFTranslator 为例,它保留原始布局、表格、图片、字体、标题层级和多栏排版,翻译后即可使用;支持 100+ 语言(含西/法/德),源语言自动检测。
三、批量工作流(文件不出机器,先筛选再翻)
批量场景先用脚本扫一遍,挑出超限/非文本型文件,再决定怎么翻:
# 需本地安装 pdfinfo(poppler)做文本型判断forfininbox/*.pdf;dopages=$(pdfinfo"$f"|awk-F': ''/Pages/{print $2}')text=$(pdffonts"$f"2>/dev/null|tail-n+3|wc-l)echo"$f|${pages}页 | 嵌入字体数=${text}(0 多为扫描件)"done输出一目了然:哪些超 20MB 要拆、哪些是扫描件要先 OCR、哪些直接翻。注意:扫描判断在本地完成,文件不上传;真正翻译按渠道选在线工具。
四、边界与隐私(重点提醒)
以浏览器端工具 PDFTranslator 为例,如实列能力与限制:
- 单文件最大20MB,每月1000 页免费额度,月初重置;
- 完全免费,无需注册、无信用卡、无隐藏费用;
- 仅支持文本型 PDF,不支持扫描件/图片型 PDF;
- 有上下文准确率 99%+ 的宣传口径,但不承诺 100% 完美翻译;
- 上传 SSL 加密,翻译完成24 小时内自动删除,无需注册即不收集个人信息;
- 不替代人工翻译:学术、法律、技术术语等内容建议人工复核。
隐私侧同样分两层说:平台做到「加密 + 限时删除 + 免注册」,但这不豁免你的判断——涉密教材、未授权资料不该进任何在线工具;重要原片自己留一份备份。
五、碎碎念
日常「要发给别人 / 要做双语课件」的场景,在线按版式翻译最省事,不用自己重排;真正批量、进流水线的,把「扫描判断 + 拆分 + 翻译 + 合并」用脚本串起来更稳。把「判断」(能不能翻、翻多大)和「执行」(怎么翻)分开,效率差很多。