
MCSD数据集来源于现实世界的真实对话场景,包含数据安全过滤后近十万通用户与运营商客服间的咨询类对话日志,是迄今为止首个十万量级面向任务的多领域公开人人对话数据集,为促进对话大模型、口语化人人对话系统、数据驱动的体系化对话分析等研究目标提供有力的数据支撑。
助力人机对话模型及研究范式突破
目前的人工智能技术过度依赖有监督学习和高成本人工标注,泛化性不足,领域知识难以有效利用。各类半监督和强化方法,包括预训练 (pre-training)、自训练 (self-training)、自监督 (self-supervised)、弱监督 (weakly-supervised)、零样本/少样本迁移学习 (transfer learning for zero-shot or few-shots)、隐变量建模 (latent-variable modeling)、领域自适应 (domain adaptation)、数据增强 (data augmentation)、强化学习 (reinforcement learning) 等,孕育着重要的技术发展趋势。本次公开的MCSD数据集不仅服务于竞赛任务,更有助于人机对话模型的创新及研究范式的突破。
双赛道竞赛任务面向实际需求
本挑战赛聚焦半监督和强化对话系统,不仅关注任务相关知识的抽取——对话数据的信息抽取;还关注对话系统本身的构建——客服场景任务型对话系统的构建。
挑战赛具体分为两条赛道:
赛道一(Track 1)
基于对话数据的信息抽取
此赛道包括实体抽取和槽值填充。在真实客服对话中实体以不同的表示形式被提及,如何准确提取实体,是建立对话系统知识库的重要步骤;进一步需要通过槽值填充,提取实体在语义槽位的槽值。
赛道二(Track 2)
任务型对话系统构建
此赛道要求构建一个客服场景的任务型对话系统,进行基于测试语料的离线客观评估和人工交互式评估。
赛事奖励规则
本次竞赛提供约 10,000 通标注语料和 90,000 通未标注语料,以及一个Track 1基线系统。
参赛队伍可以选择单独参加Track 1,依据信息抽取性能进行得分排名。
参赛队伍选择参加Track 2,这时可以选用组委会提供的Track 1基线系统或者使用自己开发的Track 1系统,形成的知识库可用于Track 2任务。依据对话系统客观评估和人工评估的综合性能进行得分排名。
冠军:20,000现金奖励,颁发荣誉证书 亚军:15,000现金奖励,颁发荣誉证书 季军:10,000现金奖励,颁发荣誉证书
2022 赛事时间节点

参赛方式
登录挑战赛官网: http://seretod.org/Challenge.html 下载并填写报名表。将填写完毕的报名表发送到指定邮箱,seretod2022@gmail.com,报名截止日期为2022年5月31日; 组委会将对参赛队伍的资质进行审核,通过审核的团队将签署挑战赛数据使用协议,并有资格参加挑战; 训练数据将于6月公布,数据下载方式将提供给通过审核的个人或团队。
SereTOD挑战赛组委会
欧智坚 清华大学 冯俊兰 中国移动 李涓子 清华大学 李亚坤 清华大学 刘一红 清华大学 彭一皓 清华大学 黄一毅 中国移动 赵江江 中国移动

更多信息,敬请扫码关注
EMNLP 2022 SereTOD Workshop官网
http://seretod.org
