Korean-English Treebank Annotations数据集介绍,官网编号LDC2002T26
·
Korean-English Treebank Annotations(韩英树库标注数据集)是面向韩英双语的句法树库资源,以词法、句法与语义标注为核心,支撑句法分析、机器翻译、跨语言 NLP 模型开发与评测,主流包括 Penn Korean Treebank(PKT)、KAIST Treebank 及 UD Korean Treebank 等衍生标注集,以下从核心定位、典型版本、标注体系、获取与应用等方面详细介绍。
一、核心定位与背景
- 定义:以韩英平行或单语文本为基础,经人工 / 半自动标注形成的多层级句法树库,涵盖词素切分、词性标注(POS)、短语结构( constituency)或依存结构(dependency)标注,适配跨语言句法迁移与双语对齐研究。
- 背景:源于 2000 年后韩英 NLP 基础设施建设需求,弥补韩语句法资源匮乏,推动形态丰富语言的句法分析与跨语言模型优化,适配军事、新闻等领域应用。
二、典型代表与核心参数
| 名称 | 发布方 | 规模 | 标注类型 | 语种 | 领域 | 用途 |
|---|---|---|---|---|---|---|
| Penn Korean Treebank(PKT) | 宾夕法尼亚大学 | 15K 句(新闻);5.4 万词(军事) | 词素 + 短语结构 + 空范畴 | 韩语 | 新闻 / 军事 | 句法分析基准、空范畴研究 |
| KAIST Treebank | KAIST | 27K + 句,35 万词 | 短语结构→依存转换 | 韩语 | 新闻 / 通用 | UD 转换、句法分析评测 |
| UD Korean Treebank | Emory 等高校 | 38K + 依存树,50 万 + 词 | 通用依存(UD) | 韩语 | 通用 | 跨语言句法解析、UD 系统适配 |
| 韩英平行树库(如 KU Parallel Treebank) | 韩国高校 | 数千句对 | 双语句法对齐 + POS | 韩英 | 通用 | 双语句法迁移、翻译模型调优 |
1. Penn Korean Treebank(PKT)
- 核心特点:首个大规模人工标注韩语树库,含词素切分、短语结构与空范畴标注,支持非投射依存生成,适配形态丰富语言的句法研究。
- 版本:2002 版含 5.4 万词军事文本,2006 版扩展至 15K 新闻句,标注指南明确空范畴与短语结构规则。
2. KAIST Treebank
- 核心特点:早期韩语短语结构树库,后经转换为 UD 依存结构,成为 UD Korean Treebank 核心数据源,支撑 SPMRL 2013 句法解析评测。
- 规模:27,363 句、350,090 词,聚焦新闻领域,适配形态丰富语言的句法分析模型训练。
3. UD Korean Treebank
- 核心特点:基于 KAIST、PKT 与 Google Treebank 转换生成,遵循 UD 2.0 标准,统一 POS 与依存关系标注,支持跨语言句法对比与模型迁移。
- 规模:38K + 依存树,覆盖 50 万 + 词,含 Google Treebank(6K 句)、KAIST(27K 句)、PKT(5K 句)三部分。
三、标注体系与层级
- 词法层
- 词素切分:适配韩语黏着语特点,拆分词干与词缀(如格助词、时制后缀)。
- POS 标注:采用 Sejong 标签集(XPOS)与通用 POS 标签(UPOS),兼顾语言特异性与跨语言兼容性。
- 句法层
- 短语结构:标注 NP、VP、PP 等短语节点,明确句子成分层级与支配关系。
- 依存结构:遵循 UD 标准,标注主谓、动宾、定语等依存关系,适配跨语言句法解析。
- 语义 / 特殊层
- 空范畴标注(PKT 独有):标记隐含主语、宾语等,提升句法完整性。
- 双语对齐:部分平行树库含韩英句子 / 短语级对齐,支撑跨语言句法迁移。
AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。
更多推荐



所有评论(0)