清华语音与音频技术实验室(THUsatlab)参与主办的长短视频多语种多模态识别挑战赛开赛啦。
近年来,随着短视频、直播等应用的迅速崛起,带来了长短视频、直播音视频等新兴互联网媒介的百花齐放。各类创作模式层出不穷、创作门槛日趋平民化,导致各类长短音视频、直播流中声学场景更加复杂多变,多语种、多方言问题日益突出。围绕各类长短音视频的语音识别和内容理解任务一直以来都备受工业界关注,如何对各类视频内容进行准确转写和内容理解,成为了字幕内容创作、兴趣内容推荐、数字媒介归档等下游应用中不可或缺的利器。
因此,由腾讯科技、数据堂、清华大学、西北工业大学、中国计算机学会联合主办长短视频多语种多模态识别挑战赛,围绕时下在工业界最为关注的三类媒体形式——长视频、短视频、直播场景进行。

本次比赛由易到难设置3个任务,Task1将关注模型场景失配下长短视频及直播中汉语关键词的检测问题;Task2则扩展到Task1的多语种和多方言关键词场景;Task3则关注音视频多模态文字内容识别。从而共同打造SOTA的长、短视频、直播场景的字幕语音内容识别多模态工业级解决方案。Task1比赛结果和排名将在NCMMSC2021会议上公布。
受限赛道:只允许使用官方提供的1505小时普通话朗读数据及各50小时的长短视频、直播数据作为有监督语音训练数据,外部数据可使用开源发布的预训练模型及开源语言模型、网络爬取的文本等。可使用外部数据进行扩充和预训练,但不得使用外部数据的标注脚本。非受限赛道:参赛队伍可使用可公开获取的标注数据、任意无标注数据进一步提升系统性能,但需要在最终提交系统里说明里提供数据来源(如可使用http://www.openslr.org/中的开源数据并标明数据来源)。
参赛日程

竞赛指导委员会

请访问竞赛官网: datatang.com/VMR了解详细