自监督学习一直是语音研究中的重要课题之一。通过利用大规模无标签数据,自监督学习可以获取编码重要语音特征的语音表征,并在语音识别、说话人识别、情感识别等多种语音任务中取得卓越效果。为了针对不同种类和场景下的语音自监督模型,SUPERB排行榜应运而生,并成为最受欢迎的语音排行榜之一。超过60个国内外语音研究机构和组织已将其作为自监督模型评测的标准。

尽管SUPERB覆盖了大量语音任务,但由于数据和应用场景的限制,其主要关注英文语音处理。然而,近期越来越多的研究者开始探索自监督学习在不同语言或多语言场景下的应用。为了满足这一需求,我们的SUPERB团队推出了ML-SUPERB挑战赛,专注于多语言场景。


挑战赛涵盖以下三个方向
ML-SUPERB方向:延续传统,我们将提供一个专注于多语言场景的排行榜,用于评估参赛者提交的自监督语音模型。
  1. 新语言方向:为了推动多语言研究的广泛发展,我们特别增设了新语言赛道,鼓励参赛者提交不同语言(方言)的数据。这些数据将作为ML-SUPERB挑战赛的隐藏测试集,并可以选择继续成为后续版本ML-SUPERB公开测试集的一部分。

  2. 自主研究方向:除了上述挑战赛之外,我们也欢迎相关的自主研究方向使用ML-SUPERB的数据和框架作为研究工具。


挑战赛时间线

  • 2023.5.12 挑战赛正式开启

  • 2023.5.19 排行榜上线并开始接受参赛系统

  • 2023.6.26 新语言方向提交截止

  • 2023.7.07 论文、模型提交截止

  • 2023.7.10 论文更新截止


相关资源


请访问我们的官方网站获取更多详细信息和时间线:https://multilingual.superbbenchmark.org