
由中国科学技术大学杜俊副教授,佐治亚理工学院的李锦辉教授以及恩纳科雷大学的Sabato Marco Siniscalchi教授联合举办的闲聊场景下的中文唇读比赛(ChatCLR)已经开放注册。我们的挑战赛聚焦于真实的家居闲聊场景,包含了词级别和句子级别的唇读任务:
ChatCLR挑战赛作为国际多媒体与博览会议(ICME 2024)的Grand Challenge之一,诚邀来自工业界与学术界的队伍报名参赛。联系方式:mispchallenge@gmail.com
背景
在日常交流中,人们通过听觉线索(如声音)和视觉线索(如唇部动作)获取信息,以助于理解言语内容。然而,在恶劣的声学环境中,音频信号可能会被噪音淹没,影响理解。唇读技术通过分析唇部运动来推测发音内容,这一新兴而具有挑战性的领域位于计算机视觉和自然语言处理的交汇点,对各种领域的应用起着关键作用。然而,目前的唇读研究主要集中在英文数据集上,中文唇读的研究需求亟待解决。由于汉字数量的庞大以及汉字发音与唇部运动之间的映射关系复杂,中文唇读是个极具挑战性的任务。此外,中文唇读挑战赛和大规模中文唇读数据集的稀缺,进一步限制了该领域的研究。现有的中文唇读数据集主要源于专业的播音员或精心准备的视频内容,呈现出更倾向于表演型的风格,而非自然放松状态下的口语对话,这在实际应用中存在局限性。我们的比赛将发布真实家庭闲聊场景中录制的视频,每个场景中有2-6个说话人以放松自然的方式进行对话。我们的挑战赛包含了语音唤醒和目标说话人唇读两项任务。语音唤醒任务旨在实现在闲聊时唤醒智能家居设备的目标。目标说话人唇读要求参赛者针对特定说话人微调模型,以识别连续的口语化对话内容。我们诚挚欢迎来自学术界和工业界的研究人员参与我们的任务,以推动利用视频信息进行语音处理的研究。目前,比赛注册已经开放,优胜者将有机会在ICME 2024会议上发表挑战论文。根据论文质量,我们将有机会推荐这些文章纳入IEEE Transactions on Multimedia (TMM)的专题特刊进一步评审,详情参阅https://2024.ieeeicme.org/grand-challenge-proposals/。
重要日期 (AOE时间)
注册
请参赛者在如下网址进行注册,并注意注册时使用学校或公司的机构邮箱,主办方将在注册后3个工作日内与您进行联系,并提供数据集的下载链接。