1999 年发布的葡萄牙语新闻专线文本数据集,全称为 Portuguese Newswire Text,与之前提到的博阿齐奇大学 2016 年版是两个不同的资源,前者为 LDC 官方发布的早期葡语新闻语料,后者是后续开源的更大规模数据集。以下是其详细介绍:

核心基础信息

项目 内容
发布机构 美国语言数据联盟(LDC)
发布时间 1999 年
语言 欧洲葡萄牙语为主,包含少量巴西葡萄牙语新闻文本
数据规模 约 500 万字,涵盖数千篇新闻稿,具体篇数因统计口径略有差异
数据格式 纯文本格式,附带基本元数据(如发布时间、来源等)
获取方式 需通过 LDC 官网订阅或购买,非开源,仅限授权用户使用
数据来源 主要来自葡萄牙卢萨通讯社(Lusa)、巴西国家通讯社(Agência Brasil)等主流新闻机构,内容覆盖政治、经济、社会、文化等多个领域

数据内容与特点

  • 文本类型:以新闻专线稿件为主,包含完整的标题、导语、正文等结构,语言风格正式、严谨,符合新闻文体规范,适合用于葡语书面语相关的 NLP 研究。
  • 元数据信息:每条文本记录包含发布时间、新闻机构名称、主题分类等基础元数据,便于数据筛选和任务适配。
  • 无标注属性:原始数据为无标注纯文本,无词性标注、命名实体标注等结构化信息,若用于特定任务需自行标注或借助工具处理。

预处理与使用要点

  • 预处理需求:相比 HTML 格式数据集,LDC99T40 预处理相对简单,主要包括文本编码统一、特殊字符清理、分句分词、去除冗余空行等步骤,可使用 Python 的 nltk、spaCy 等库完成。
  • 适配任务:适合文本分类、语言模型预训练、机器翻译(葡英 / 英葡)、命名实体识别等基础 NLP 任务,尤其适合欧洲葡萄牙语相关的模型训练和评估。
Logo

AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。

更多推荐