在这里插入图片描述

📖标题:Omnilingual MT: Machine Translation for 1,600 Languages
🌐来源:arXiv, 2603.16309v2

🌟摘要

NLLB(No Language Left Behind)技术的进步已经证明,高质量的机器翻译(MT)可以扩展到200种语言。后来,大型语言模型(LLM)被用于MT,提高了质量,但不一定扩大了语言覆盖范围。目前的系统仍然受到有限的覆盖范围和持续的生成瓶颈的限制:虽然跨语言迁移使模型能够以某种方式理解许多支持不足的语言,但它们通常不能可靠地生成它们,使世界上大多数7,000种语言,特别是濒危和边缘化的语言,在现代机器翻译的范围之外。早期的极端扩展探索提供了有希望的概念证明,但没有产生持续的解决方案。我们提出了全语言机器翻译(OMT),第一个支持1,600多种语言的机器翻译系统。这一规模是通过全面的数据战略实现的,该战略将大型公共多语言语料库与新创建的数据集集成在一起,包括手动策划的MeDLEY双文本,合成回译和挖掘,大大扩展了长尾语言,域和寄存器的覆盖范围。为了确保可靠和广泛的评估,我们将标准指标与一套评估工件相结合:BLASER 3质量评估模型(无参考),OmniTOX毒性分类器,BOUQuET数据集(一个新创建的,迄今为止最大的多语言评估集合,从零开始构建,并手动扩展到广泛的语言家族),Met-BOUQuET数据集(规模上的忠实多语言质量评估)。我们探索了两种专门用于机器翻译的LLM的方法:作为仅解码器模型(OMT-LLaMA)或作为编码器-解码器架构中的模块OMT-NLLB模型。前者是建立在LLaMA 3上的模型,具有多语言持续预训练和检索增强翻译以适应推理时间;后者是建立在多语言对齐空间之上的模型(OmniSONAR,本身也基于LLaMA 3),并引入了一种可以利用非并行数据的训练方法,使我们能够将仅解码器的连续预训练数据纳入编码器-解码器架构的训练中。值得注意的是,我们所有的1B到8B参数模型都匹配或超过70 B LLM基线的MT性能,显示出明显的专业化优势,并在低计算环境下实现强大的翻译质量。此外,我们对英语到1,600个翻译的评估进一步表明,虽然基线模型可以解释支持不足的语言,但它们通常无法以有意义的保真度生成它们; OMT-LLaMA模型大大扩展了连贯生成可行的语言集。此外,OMT模型在跨语言迁移方面有所改进,接近于解决MT中1,600个评估的难题的“理解”部分。除了强大的开箱即用性能之外,我们发现微调和检索当目标数据或领域知识可用时,增强生成提供了额外的途径来提高给定语言子集的质量。我们的排行榜和主要的人工创建的评估数据集(BOUQuET和Met-BOUQuET)正在朝着全语言和免费提供的方向动态发展。

🛎️文章简介

🔸研究问题:如何解决当前机器翻译系统在长尾语言上存在的生成瓶颈,将高质量翻译覆盖范围从 200 种语言扩展至全球 1600 多种语言?
🔸主要贡献:论文提出了首个支持超过 1600 种语言的全语机器翻译系统 OMT,通过创新数据策略和专用模型架构,在低算力下实现了超越通用大模型的翻译质量。

📝重点思路

🔸实施综合数据战略,整合大规模公共语料与新建数据集,包括人工 curated 的 MeDLEy 种子数据、合成回译数据及双语挖掘数据,填补长尾语言空白。
🔸探索两种 LLM 专用化路径:一是基于 LLaMA3 的纯解码器模型 OMT-LLaMA,采用多语言持续预训练和检索增强翻译;二是基于 OmniSONAR 对齐空间的编码器 - 解码器模型 OMT-NLLB,利用非平行数据训练。
🔸扩展词表至 256K 并优化分词器,显著提升对稀有脚本和低资源语言的表征能力,降低令牌冗余度。
🔸构建全方位评估体系,推出无参考质量估计模型 BLASER 3、毒性分类器 OmniTOX 以及大规模人工评估数据集 BOUQuET 和 Met-BOUQuET。

🔎分析总结

🔸实验显示,10 亿至 80 亿参数的专用 OMT 模型在翻译性能上匹配或超越了 700 亿参数的通用 LLM 基线,证明了专用化优于单纯扩大规模。
🔸评估表明,虽然基线模型能理解部分低资源语言,但往往无法可靠生成,而 OMT 模型显著扩大了可实现连贯生成的语言集合。
🔸引入合成回译数据和自动编码目标有效提升了低资源语言的解码器鲁棒性,特别是在平行语料稀缺的场景下。
🔸检索增强生成(RAG)技术能在推理阶段利用领域知识进一步提升特定语言子集的翻译质量,且无需重新训练模型。

💡个人观点

论文打破了“理解”与“生成”在低资源语言上的不对称性,以往模型虽能通过跨语言迁移“读懂”生僻语言,却难以“写出”通顺译文。

🧩附录

在这里插入图片描述

Logo

AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。

更多推荐