01、📊 国内开源语音数据集
目前最大的多语种语音生成数据集
涵盖脱口秀、访谈、辩论、体育解说等多种场景
提供 Emilia-pipe 预处理流水线
首个 「唇读信息 + 幻灯片语义信息」 结合的中文数据集
包含唇读视频 (720P) + 幻灯片视频 (1080P)
覆盖 9 大热门领域
泰语: 10,000 小时
印尼语: 6,000 小时
越南语: 6,000 小时
涵盖 19 个主题领域
提供自动化构建流程
模型性能达到商业服务水平
覆盖 10 个领域: 讲故事、娱乐、戏剧、文化、vlog、评论、教育、播客、新闻等
多维标注: ASR 转录、文本置信度、说话人身份、年龄、性别、语音质量评分、字符级时间戳
质量分级: 强标签 (confidence>0.9)、中等标签 (0.8-0.9)、弱标签 (0.6-0.8)
专门筛选 12,000 小时高质量语音用于 TTS (DNSMOS>2.5 且 SNR>25dB)
提供 WS Yue-Eval 评测基准
支持中英混杂 (code-switching) 场景
WSC-Eval-ASR: 人工标注集,评测不同场景声学条件下的 ASR 性能
WSC-Eval-TTS: 简单和困难子集,用于标准测试与泛化能力测试
基于该数据集训练的模型性能超越 SOTA 系统
与商业系统相媲美
推动川渝方言语音技术发展
1200 万语音 - 文本对齐样本
建立语音表示与文本语义空间对齐
1350 万多任务指令样本
涵盖 20 项任务,支持三种交互模式
15,044 个测试样本
标准化评估协议
完整状态: 580 小时
不完整状态: 532 小时
回应状态: 10 小时
等待状态: 23 小时
02、🌍 国际开源语音数据集
78% 的语言字符错误率低于 10%
95% 有 10 小时以上训练数据的语言达到实用标准
36% 低资源语言(<10 小时数据)也达到实用水平
少样本学习:仅需几段音频 + 文本即可扩展新语言
理论扩展能力:可扩展到 5400 + 种语言
模型规模:3 亿参数(轻量级)到 70 亿参数(高精度)
从 80.8GB 增长到 86.53GB
语言覆盖从 100 + 扩展到 137 种
参与人数增长 7,000+
专注高带宽语音合成
详细元数据标注
支持零样本 TTS 训练
语音障碍
神经系统疾病(帕金森、ALS、中风)
心境障碍(抑郁症、焦虑症)
呼吸系统疾病
03、📈 数据集统计分析
超大规模(10k 小时 +): Emilia(101k)、WenetSpeech-Yue(21.8k)、GigaSpeech 2(30k)、WenetSpeech-Chuan(10k)
中等规模(100-1000 小时): Chinese-LiPS(100)、Easy-Turn(1100)
小规模(10-100 小时): ChildMandarin(41)、SeniorTalk(55)、CS-Dialogue(104)
单语言: 中文、英语、波兰语、越南语等
多语言: Meta Omnilingual(1600+)、Common Voice(137)、Emilia(6)
方言: 粤语 (WenetSpeech-Yue)、川渝方言 (WenetSpeech-Chuan)
语音识别: 最多,包含多个大规模数据集
语音合成: 注重情感表达和多风格
医疗健康: 新兴重要领域
情感分析: 多语言覆盖
多模态: 结合视觉信息
方言保护: 粤语、川渝方言等
04、🎯 使用建议
规模突破: 10 万小时级数据集成为现实
质量提升: 多模态、精细化标注成为趋势
语言覆盖: 从主流语言扩展到 1600 + 种语言
方言保护: 粤语、川渝方言等地方语言得到重视
领域深化: 医疗、教育、娱乐等垂直领域快速发展
技术创新: 自动化构建、合成数据等新技术应用
