ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

论文解读:mBART-large-50-many-to-many-mmt 背后的可扩展多语言预训练与微调方法

论文解读:mBART-large-50-many-to-many-mmt 背后的可扩展多语言预训练与微调方法 论文解读mBART-large-50-many-to-many-mmt 背后的可扩展多语言预训练与微调方法【免费下载链接】mbart-large-50-many-to-many-mmt项目地址: https://ai.gitcode.com/hf_mirrors/facebook/mbart-large-50-many-to-many-mmtmBART-large-50-many-to-many-mmt 是 Facebook AI 基于 mBART-large-50 多语言预训练模型微调而来的多语言机器翻译模型支持 50 种语言之间的任意两两直接互译其背后对应论文《Multilingual Translation with Extensible Multilingual Pretraining and Finetuning》Tang 等2020arXiv: 2008.00401。本文用通俗的方式解读这篇论文的核心思想——可扩展多语言预训练 多对多微调方法并结合本仓库中的配置文件带你快速看懂并上手这个模型。一、论文要解决什么问题 要做多语言翻译传统思路是每两个语言训练一个模型。但 50 种语言两两组合会产生2450 个翻译对数据稀缺、训练成本极高根本不可行。当时主流有两种折中方案各有硬伤方案做法缺点枢纽翻译Pivoting所有翻译都先过英文中转A→英→B多跳误差累积以英语为中心冷门语言对质量差按语言对分别训练每个有数据的语言对各建一个模型数据稀缺的语言对覆盖不全模型数量爆炸这篇论文给出的答案是只用一个模型直接完成 50 种语言中任意一对的翻译many-to-many简称 m2m并且以后想加新语言时不需要从头重新训练extensible可扩展。二、核心方法三阶段训练流程 ️整个方法可以概括为一条流水线多语言去噪预训练 → 机器翻译微调 → 多对多翻译微调。第一阶段50 语言去噪预训练沿用 BART/mBART 的去噪自编码目标把文本中的随机片段遮住让模型根据上下文重建。训练数据是覆盖 50 种语言、总量超过 220GB 的混合语料。这一步产出的就是底层的 mBART-large-50 多语言语言模型它读懂了 50 种语言但还不会翻译。第二阶段多语言机器翻译微调在 mBART-large-50 基础上用 50 种语言与英文之间的平行语料做翻译微调让模型学会翻译这一任务本身。第三阶段多对多翻译微调关键创新把所有可用语言对的平行语料不再局限于英文对混合在一起做最终微调并引入语言标签language tag机制——这是整个方法最核心的设计源语言作为前缀写进输入例如hi_IN印地语目标语言强制模型生成的第一个 token 就是目标语言标签例如fr_XX法语同一个模型仅仅换掉这两个标签就能在印地语→法语和阿拉伯语→英语之间自由切换。翻译能力从此与具体语言对解耦真正做到一个模型50×49 个方向。三、关键设计语言标签如何锁定翻译方向 ️仓库里的special_tokens_map.json可以看到每个语言都有一个专属特殊 tokenhi_IN、ar_AR、zh_CN等共 50 个tokenizer_config.json中language_codes标记为ML50即这套 50 语言编码表。调用时的分工非常清晰源语言通过分词器的src_lang属性设置写入输入前缀目标语言通过生成参数forced_bos_token_id传入把第一个生成 token 强制锁定为目标语言标签这也解释了为什么模型词表达到 250,054 那么大——多语言 SentencePiece BPE 词表对应文件sentencepiece.bpe.model需要同时切分 50 种语言的文本其中还包含大量阿拉伯文、泰文、缅甸文等复杂书写系统。四、模型架构与关键参数速览 从config.json可以读出模型的全部身份信息参数取值含义架构MBartForConditionalGenerationTransformer 编码器-解码器d_model1024隐层维度编码器 / 解码器层数12 / 12共 24 层注意力头数16多头注意力配置FFN 维度4096前馈网络宽度vocab_size250,05450 语言多语言词表最大位置编码1024支持的最长序列generation_config.json则给出了默认推理设置束搜索beam search宽度 5、最大生成长度 200、提前停止early_stopping开启。也就是说默认就按稳妥出译文的参数跑新手无需调参即可使用。五、快速上手5 步调用 mBART 多语言翻译模型 安装依赖pip install transformers加载模型通过模型库名称facebook/mbart-large-50-many-to-many-mmt一行代码加载本仓库即为该模型的完整权重文件设置源语言tokenizer.src_lang hi_IN锁定目标语言forced_bos_token_idtokenizer.lang_code_to_id[fr_XX]生成并解码调用model.generate后解码输出README.md中给出了完整示例把印地语新闻标题翻译成法语from transformers import MBartForConditionalGeneration, MBart50TokenizerFast model MBartForConditionalGeneration.from_pretrained(facebook/mbart-large-50-many-to-many-mmt) tokenizer MBart50TokenizerFast.from_pretrained(facebook/mbart-large-50-many-to-many-mmt) tokenizer.src_lang hi_IN # 源语言印地语 inputs tokenizer(article_hi, return_tensorspt) outputs model.generate( **inputs, forced_bos_token_idtokenizer.lang_code_to_id[fr_XX] # 目标语言法语 ) print(tokenizer.batch_decode(outputs, skip_special_tokensTrue)) # Le chef de lONU affirme quil ny a pas de solution militaire dans la Syrie.把hi_IN换成ar_AR、fr_XX换成en_XX同样的代码就完成了阿拉伯语到英语的翻译——换标签不换模型这正是 m2m 的精髓。六、模型仓库文件清单 本仓库就是一个开箱即用的模型包各文件分工如下README.md模型介绍、50 语言清单、用法示例config.json模型架构参数上文已解读generation_config.json默认生成参数tokenizer_config.json分词器配置与语言编码表special_tokens_map.json特殊 token 映射含 50 个语言标签sentencepiece.bpe.modelSentencePiece 多语言 BPE 词表model.safetensors、pytorch_model.binPyTorch 权重tf_model.h5TensorFlow 权重flax_model.msgpackFlaxJAX权重rust_model.otRust 推理引擎权重同一套模型权重提供 PyTorch / TensorFlow / Flax / Rust 四种运行时格式说明该模型已被多家框架官方适配工程生态相当成熟。七、实验效果与论文意义 翻译质量在 WMT 系列多语言翻译评测中m2m 直接翻译在绝大多数语言对上优于英文枢纽基线质量更稳定且不再受是否绕道英文的限制。可扩展性在 50 种语言基础上继续加入新语言做增量预训练 多对多微调新语言即可达到接近全量训练的质量而原有语言的性能基本不下降。这对低资源语言尤其友好——不必推倒重来。方法影响语言标签 强制首 token的设计后来成为多语言翻译模型的通用范式同实验室后续的 m2m-100 等模型沿用了这一思路论文也因此成为多语言 NMT 方向被广泛引用的工作。八、适用场景与局限 ⚖️适合用它多语言内容互译、跨语言检索/摘要的预处理、快速搭建多语言翻译原型、支持小语种如僧伽罗语、斯瓦希里语、缅甸语的场景。需要注意模型约 6.7 亿参数单份权重文件以 GB 计批量推理建议搭配 GPU最大序列长度 1024超长文档需分段处理对英、德、法等高资源语言对专用翻译模型仍可能更优m2m 的优势在于一个模型通吃的覆盖面九、总结mBART-large-50-many-to-many-mmt 背后论文的贡献可以浓缩为一句话用50 语言去噪预训练打基础 语言标签锁定方向 全语言对混合数据微调三步走把 2450 个翻译对压缩进一个可扩展的模型里。语言标签机制既简单又有效是理解现代多语言翻译模型的关键一步。想要复现或二次开发本仓库中的config.json、special_tokens_map.json与多框架权重文件已经提供了全部所需。论文引用Yuqing Tang, Chau Tran, Xian Li, Peng-Jen Chen, Naman Goyal, Vishrav Chaudhary, Jiatao Gu, Angela Fan.Multilingual Translation with Extensible Multilingual Pretraining and Finetuning, 2020, arXiv: 2008.00401.【免费下载链接】mbart-large-50-many-to-many-mmt项目地址: https://ai.gitcode.com/hf_mirrors/facebook/mbart-large-50-many-to-many-mmt创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表