Multiple-Translation Arabic (MTA) Part 1数据集介绍,官网编号LDC2003T18
·
Multiple-Translation Arabic (MTA) Part 1(LDC2003T18)是 LDC 发布的阿拉伯语 - 英语翻译评测基准数据集,核心用于机器翻译多参考评估、翻译质量评测算法研发与模型调优,适配统计与神经机器翻译的性能验证场景。以下是详细介绍:
核心定位与背景
- 聚焦阿拉伯语(现代标准阿拉伯语 MSA)到英语的机器翻译评测,提供多参考译文与人工评分基准,支撑翻译流畅度(Fluency)和充分性(Adequacy)的人工与自动评估,适配 TIDES 项目的翻译评测需求Linguistic Data Consortium。
- 由 LDC 于 2003 年发布,为早期统计机器翻译时代的评测提供标准数据,至今仍是阿拉伯语翻译评估领域的经典基准之一。
数据规模与构成
| 项目 | 详情 |
|---|---|
| 核心语料 | 100 篇阿拉伯语新闻故事(含 1,043 个翻译单元 / 段落),源自新闻专线,覆盖政治、经济、文化等主流新闻领域 |
| 译文类型 | 每段落配 4 组独立人工参考译文 + 3 组系统译文,人工译文由专业译者完成,系统译文为同期主流机器翻译系统输出 |
| 标注信息 | 按 TIDES 标准标注每段译文的流畅度与充分性评分,含标注者 ID、评分细则、元数据标签等 |
| 语言规范 | 阿拉伯语为无变音符号(unvocalized)的 MSA,英语为标准书面语,符合新闻文本的正式表达习惯 |
技术规格
- 标注格式:UTF-8 编码,XML 格式存储,包含原文、参考译文、系统译文、人工评分与元数据(来源、标注时间、标注者)等结构化信息,便于程序解析与批量处理。
- 评分体系:采用 TIDES 5 级评分制,流畅度与充分性分别评分,标注一致性经多轮校验,可靠性高,适配翻译质量的量化评估Linguistic Data Consortium。
- 数据划分:无官方固定训练 / 开发 / 测试集划分,用户可按翻译单元或文档自主切分,适配不同评测场景。
- 交付形式:压缩包,包含文本文件、标注文件、数据说明文档,适配主流 NLP 数据处理流程。
核心用途与价值
- 机器翻译评估:用于 BLEU、METEOR、TER 等自动评估指标的有效性验证,对比人工评估与自动评估结果,优化指标设计。
- 翻译模型调优:以多参考译文为标准,指导模型迭代,提升阿拉伯语 - 英语翻译的流畅度与充分性。
- 评测算法研发:支撑多参考翻译评估算法创新,适配不同翻译模型的性能对比需求。
- 翻译教学研究:用于翻译质量分析,辅助阿拉伯语 - 英语翻译教学与翻译理论研究。
AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。
更多推荐



所有评论(0)