由CMU渡部晋治的音频和语音实验室(CMU WAVlab)联合Meta、上海交通大学和中国人民大学的lab举办的Interspeech2024 语音离散表征挑战赛(Interspeech2024 Speech Processing Using Discrete Speech Unit Challenge)正式开启。主要关注离散语音表征在ASR、TTS和SVS任务上的应用以及相关的topic,欢迎大家投稿报名!

  赛事官网:https://www.wavlab.org/activities/2024/Interspeech2024-Discrete-Speech-Unit-Challenge/


比赛简述 
在语音任务中,我们通常采用原始波形或者基于这些模型的频谱特征作为模型的输入。尽管频谱语音特征的使用依然普遍,近年来基于神经网络的深度特征也逐渐流行起来。
其中语音离散表征,因为其在实际使用中的高效性、易用性、以及可以与大语言模型等其他模态相结合的特点,在很多语音的任务(如,语音识别、语音合成等)都有着很重要的应用。
考虑到相关的研究热点和相关离散表征研究的空白,本次Interspeech2024语音离散表征挑战赛联合卡内基梅隆大学、Meta、上海交通大学和中国人民大学的学者,引入了语音的三个经典任务来邀请相关学者一同研究如何设计和提取更好的语音离散表征。

赛道任务详情 
本次主要采用的三个任务是语音识别(ASR),语音合成(TTS)以及歌声合成(SVS)。
参赛者需要在指定的三个任务中选择一个或多个任务参加。每个任务都需要采用语音离散表征作为关键模块(即语音识别需要使用离散语音表征作为输入、语音合成和歌唱合成需要先将文本或乐谱转换为离散表征后再进行合成)。

对于离散表征的提取,本次比赛允许使用任何数据(但不可以包含参赛任务中的测试集)和预训练模型;但对于具体的识别和合成系统,我们只允许用比赛指定的数据集训练。为了帮助参赛者,我们在语音框架ESPnet中提供了对应的基线系统和工具包。


其他关于语音、音频离散表征的研究 

本次挑战赛同时也是Interspeech2024的special issue,也会接受除了挑战赛系统介绍之外的研究论文(具体论文要求和Interspeech2024 论文一致)。论文的主题可以是下面任何关于语音、音频离散表征的研究:

  • 离散语音、音频或音乐表征学习
  • 离散表征在语音、音频下游任务(如ASR、TTS等)中的使用
  • 离散语音、音频表征的评测
  • 高效离散语音、音频表征
  • 离散语音、音频的可解释性
  • 其他基于离散语音、音频表征的新型应用


重要时间和日期 
2024. 02. 20开始接受参赛者提交的结果
2024. 03. 02

论文摘要提交截止日期(和Interspeech2024一致)

2024. 03. 09

论文修改截止日期(和Interspeech2024一致)

2024. 03. 09

之后,我们仍然欢迎后续参赛者提交系统参与评估

我们诚挚欢迎对语音离散表征感兴趣的学界和工业界的研究同行一同参与本次挑战赛或提交相关的研究论文。

更多详细信息请访问赛事官网:https://www.wavlab.org/activities/2024/Interspeech2024-Discrete-Speech-Unit-Challenge/


挑战赛组织者 
  • 常烜恺(CMU)

  • 史嘉彤(CMU)

  • Shinji Watanabe(CMU)

  • Yossi Adi (HUJI、Meta)

  • 陈谐(SJTU)

  • 金琴(RUC)