我的资源
共 246 个数据集
The AMI Corpus
语音识别会议场景
The AMI Corpus

AMI 会议会议记录包含 100 小时的会议录音

0 下载 · 0 赞获取 →
LibriTTS corpus
语音合成语音识别
LibriTTS corpus

LibriTTS 是一种多语言英语语种,以 24kHz 采样率阅读英语语音约 585 小时,由 Heiga Zen 在 Google 语音和 Google 大脑团队成员的协助下编写。

0 下载 · 0 赞获取 →
CSTR VCTK
Speech Recognition
CSTR VCTK

这个数据集包括109个以英语为母语、带有不同口音的英语使用者说出的语音数据。每位发言者宣读约400句词句,其中大部分来自报纸,加上rainbow passage和旨在识别说话者口音的引语段落。

0 下载 · 0 赞获取 →
 AISHELL-DMASH
多设备近场
AISHELL-DMASH

AISHELL-DMASH 中文普通话麦克风阵列家居场景语音数据库

0 下载 · 0 赞获取 →
GiantMIDI-Piano
歌曲合成
GiantMIDI-Piano

包括来自 2,784 位作曲家 10,854 首作品的 MIDI 文件,总时长为 1,237 小时

0 下载 · 0 赞获取 →
Free ST American English Corpu
Speech Recognition
Free ST American English Corpu

包含十个发言者的话语,每个说话者有350个左右的词句

0 下载 · 0 赞获取 →
CCPE数据集
文本数据集
CCPE数据集

该数据集中有超过 500 个电影偏好对话,表达了 10,000 多个偏好。

9 下载 · 0 赞获取 →
Google AudioSet
音频信号
Google AudioSet

2128维的特征,采样率为1Hz,也就是把音频按秒提取为128维特征。

0 下载 · 0 赞获取 →
TED-LIUM 3
语音识别英文演讲
TED-LIUM 3

。包含2351条录音与对齐脚本,452小时的音频,159848条发音词典

0 下载 · 0 赞获取 →
TED-LIUM 2
语音识别英文演讲
TED-LIUM 2

包含1495个录音和音频会议、159848条发音词典和部分WMT12公开的语料库以及这些录音的文字转录

0 下载 · 0 赞获取 →
TED-LIUM
英文演讲语音识别
TED-LIUM

时长:118小时

0 下载 · 0 赞获取 →
CHIME
语音识别语音分离
CHIME

真实录音由 4 个speaker在 4 个嘈杂位置的近 9000 个录音构成

1 下载 · 0 赞获取 →