2001 NIST Speaker Recognition Evaluation Corpus(LDC 目录编号 LDC2002S34)是 NIST 主导、LDC 发布的经典说话人识别评测基准数据集,核心用于会话式电话语音(CTS)场景的说话人检测与验证任务,为早期说话人识别系统提供统一评测标准与训练 / 测试数据划分,是 GMM - UBM 等经典模型的核心评测资源。

基础信息

项目 详情
资源名称 2001 NIST Speaker Recognition Evaluation Corpus(SRE 2001)
发布机构 NIST、Linguistic Data Consortium(LDC)
发布时间 2002 年
LDC 编号 LDC2002S34
语言 英语
数据类型 会话式电话语音(固定电话 + 蜂窝电话)、标注元数据、评测控制文件
数据规模 含 174 个目标说话人,训练集平均每人 2 分钟语音,测试集平均每条测试片段 30 秒;含 2,038 个目标测试与 20,380 个冒名测试样本
数据格式 音频为 SPHERE 格式(16kHz,16 位单声道);标注含说话人 ID、性别、会话侧标识、评测控制文件等
获取方式 LDC 订阅获取,遵循 NIST 与 LDC 数据使用协议,仅限科研与非商业用途

核心数据构成与标注体系

  • 数据来源:核心数据源自 Switchboard - I(SWBD - I)会话式电话语料库,新增蜂窝电话语音数据,覆盖固定电话与移动电话两种信道,提升信道鲁棒性评测能力。
  • 数据划分
    1. 注册集:每个目标说话人提供 2 分钟语音,用于训练说话人模型。
    2. 测试集:包含目标测试(同一说话人)与冒名测试(不同说话人),平均每条测试片段 30 秒,用于系统性能评估。
    3. 扩展数据集:基于 Switchboard - I 扩展,用于额外系统开发与对比实验。
  • 标注内容
    1. 说话人标注:含说话人 ID、性别,通过会话侧标识(如 “1234A”)关联说话人与对应语音片段。
    2. 评测控制文件:定义模型训练与测试流程,明确目标 / 冒名测试对,规范评测标准。
    3. 元数据:标注语音信道类型(固定 / 蜂窝)、会话 ID 等,支撑信道适配研究。

评测任务与核心流程

  • 核心任务:单说话人检测(speaker detection),即给定注册语音与测试语音,判断测试语音是否来自目标说话人,输出二分类决策与似然得分。
  • 评测流程
    1. 用注册集训练说话人模型(如 GMM - UBM)。
    2. 对测试集样本进行目标 / 冒名分类,计算等错误率(EER)等指标。
    3. 基于评测控制文件统一评估标准,确保不同系统间结果可比。

主要用途

  1. 说话人识别模型训练:用于 GMM - UBM、i - vector 等经典模型的训练与参数调优,适配会话式电话语音场景。
  2. 系统性能基准评测:作为统一评测数据集,评估不同说话人识别系统的检测精度与信道鲁棒性。
  3. 信道适配研究:对比固定电话与蜂窝电话语音差异,支撑信道补偿算法(如 CMS、VTS)开发。
  4. 说话人识别算法对比:为不同算法(如基于频谱、韵律、声门特征的方法)提供公平对比平台。
Logo

AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。

更多推荐