活动与赛事

声纹识别研究与应用学术研讨会

声纹识别研究与应用学术研讨会

声纹识别研究与应用学术研讨会

多技能人工智能通过多模态感知技术来描述越来越复杂的现象和动态,从反映相关性的多场景数据中推理其中的因果关系,协同多技能来解决真实场景下的复杂问题,并且与组织管理方法进行融合决策,让多技能的防疫系统变得更加安全可靠。声智科技团队相信多模态的感知技术可以将解决方案的价值最大化释放,团队研发的Azero人工智能基础开发框架从声音、文字、图像、手势等单模态向多模态智能发展,即通过对听觉、视觉,甚至未来对嗅觉、味觉等难以量化的信号开展多个模态的融合分析,并在智慧健康、智慧城市和智慧生活领域开启崭新的落地实践。 本次沙龙将带大家走进Azero人工智能基础开发框架,一起探索背后的技术和多场景应用实践。

随着智能化产品深入生产生活,智能对话应用需求爆发,业界近年提出“对话即服务”、“对话即平台”等概念,国内外智能对话问答相关厂商相继推出智能对话平台类产品,产业各界也在此类产品投入越来越多的关注,本次沙龙请到国内智能对话平台领域专家,围绕技术、应用、产业的现状及未来发展趋势进行分享。

由中国科学技术大学杜俊教授,佐治亚理工学院的李锦辉教授、西北工业大学的陈景东教授、卡内基梅隆大学的Shinji Watanabe教授、西西里中部自由大学的Siniscalchi Sabato Marco教授以及代尔夫特理工大学的Odette Scharenborg教授联合举办的基于多模态信息的语音处理(MISP)国际挑战赛已经开放注册,今年关注的是家居电视场景下的多人中文聊天场景,包括音视频唤醒和音视频语音识别两个任务。MISP评测也已被接收为ICASSP 2022 Signal Processing Grand Challenge,参加两个任务排名前列的团队有机会将自己的技术方案写成论文被ICASSP 2022会议接收。欢迎大家报名参加!

语音识别技术已广泛应用于日常生活当中,然而其在口音或方言上的性能或体验仍不尽如人意。本次报告对近几年口音与方言语音识别上的研究进展进行了快速的回顾,并进一步介绍了口音或方言语音识别相关的数据、基准和竞赛,以及一些可行的研究方向。 10月30日19:00-21:30,汤志远老师将为大家分享《口音与方言语音识别研究进展》。

“天马杯全球高校科技创新大赛”(以下简称大赛),是由马上消费金融股份有限公司主办的高校级别的科技主题杯赛。在新时代国家信息化发展“数字中国”大战略背景下,2021届大赛主题为“敢为所AI,无惧未来”,围绕人工智能核心技术助力实体经济建设的宗旨,依托马上消费强大的科技实力与丰富的行业数据,吸引高校人才共同发现、创造具体落地场景的技术方案。以赛引才、以赛促研、以赛兴业,通过大赛的举办为优秀的高校人才提供企业就业机会,为广大高校学子的创业、创新提供观点与思路的交流,引导更多青年人才在乡村振兴赋能、数字中国建设等方面进行有价值的探索。

由深圳市科学技术协会和哈尔滨工业大学(深圳)共同主办,深圳市人工智能学会承办,深圳市人工智能学会自然语言处理专委会协办的自然语言处理青年精英论坛将于2021年10月13日13:30-16:45在深圳市西丽大学城哈工大校区信息楼203会议室举办。

由CCF语音对话与听觉专委会 、中国人工智能产业发展联盟(AIIA)评估组 、腾讯会议天籁实验室、语音之家(北京)科技有限公司、北京希尔贝壳科技有限公司共同主办的【语音之家】AI产业沙龙-腾讯会议背后的语音技术,将于2021年10月12号 20:00通过语音之家微信视频号直播。


为进一步促进AI在金融科技行业的整体发展,9月1日,由浙江核新同花顺网络信息股份有限公司主办,浙江大学人工智能研究所指导的同花顺“9-10双月算法挑战赛”(以下简称9-10双月赛)报名活动正式开启!

The Computer Composition Identification Challenge, initiated by the Conference on Sound and Music Technology (CSMT), is succeeding the CSMT Data Challenge, 2020. This new challenge is dedicated to finding improved music generation models and objective evaluation models for a number of specified music styles.

近年来,AI智能语音应用在58同城广泛落地,从2018年开始,58同城AI Lab先后研发了语音对话机器人、语音内容分析平台,在销售、客服、产品、运营场景广泛使用,打造了多款AI应用,如销售智能外呼助手、呼叫中心语音质检系统、招聘面试机器人等。其中,语音对话机器人、语音内容分析平台底层依赖语音识别技术,初期由第三方语音厂商提供服务,但在2020年7月,58自主研发的语音识别引擎正式上线,替换了第三方语音厂商。当前已接入了数十个不同业务场景,日均转写语音量达数万小时。 本次沙龙将分享58同城AI Lab自研语音识别引擎的历程,包括数据、算法和工程架构,以及在58同城本地服务(黄页)业务中落地的一款智能语音应用——销售智能外呼助手。

LiveVideoStackCon音视频技术大会是多媒体技术领域的盛会,大会聚焦在音频、视频、图像等技术的最新探索与应用实践,覆盖教育、娱乐、医疗、安防、交通、制造、旅游、电商、金融、社交、游戏、智能设备、IC等行业领域,嘉宾将面向3年以上工作经验的音视频工程师、多媒体工程师、图像算法工程师、技术负责人以及高端行业用户、产品与项目负责人等分享技术创新与最佳实践。

语音增强是提高语音质量、消除背景噪音和提取干净原始语音的技术方法,主流算法包括Filtering Techniques、Spectral Restoration、Speech-Model-Based等算法。该技术广泛应用在会议系统、移动电话、助听器、VoIP等场景。在日常生活中语音通信的质量往往受到周围环境噪音的影响,使用语音增强技术可以降低噪声的干扰,但如何保证语音的可懂度是该技术在产业应用的难点。噪音围绕在生活的每个角落,更好的技术让我们更好的倾听。

如今,对话式AI成为人工智能热门方向,它在商业上的应用规模不断增长,也是人工智能研究者重要研究领域。IDC数据显示,中国对话式AI市场规模预计在2023年达到约18.6亿美元,2019-2023年的年均复合增长率(CAGR)为34.0%。 对话式AI是指能够进行人类对话,捕捉对话语境并做出智能化响应的智能语音助手。对话式AI是基于模型认知,突破聊天机器人单一的问答方式,可破译复杂场景,理解人类情感。它能够基于NLP功能与人进行个性化对话,根据对人类情感的理解采取相应行动。 对话式AI要想精准领会意图,做出瞬间响应,做到和人自然对话,离不开大量结构化训练数据的支撑。挑战赛主办方将联合企业、机构和高校等,共同探索对话式AI创新发展。

近年来,随着短视频、直播等应用的迅速崛起,带来了长短视频、直播音视频等新兴互联网媒介的百花齐放。各类创作模式层出不穷、创作门槛日趋平民化,导致各类长短音视频、直播流中声学场景更加复杂多变,多语种、多方言问题日益突出。围绕各类长短音视频的语音识别和内容理解任务一直以来都备受工业界关注,如何对各类视频内容进行准确转写和内容理解,成为了字幕内容创作、兴趣内容推荐、数字媒介归档等下游应用中不可或缺的利器。 因此,由腾讯科技、数据堂、清华大学、西北工业大学、中国计算机学会联合主办长短视频多语种多模态识别挑战赛,围绕时下在工业界最为关注的三类媒体形式——长视频、短视频、直播场景进行。

本届竞赛新增以真实场景音频作为测试集的任务赛道和混合13种语言的“多语种语音识别”任务赛道。 在语种识别的开放赛道,测试集由17种语言覆盖视频会议、日常对话等10余个场景的真实环境音频和开源数据集两部分组成,这意味着本届OLR胜出队伍的模型将更贴近真实使用场景,环境鲁棒性更强,提前为模型吹响了实战的号角,以加速其适应真实世界交互的过程。 此次的多语种语音识别任务赛道突破了历届OLR仅识别语种的任务限制,参赛队伍的模型需要识别出多语种混合测试集的语音内容。这样的设置不仅出于实际应用需求的考虑,也为低资源数据识别训练提供了新的解题思路。据悉,工业级语音识别系统通常需要上万甚至十万小时以上规模的标注数据,才能在特定场景达到90%以上的识别率,而诸如小语种等低资源数据获取难、标注难、评估难,已经成为了世界性难题。多语种语音识别,可通过对大语种模型的迁移学习或多语种共享特征学习弥补对低资源数据的依赖。

语音合成(Speech Synthesis)技术已经被广泛应用在智能客服、新闻播报、有声阅读等业务场景。实现从文本到语音(Text To Speech)的转化,解决了人机语音交互的闭环,多语言多情感的实现赋能了机器的发声。所熟知的微软小冰、小爱同学、小度音箱等已经陪伴在我们生活当中,成为了人类的助手。但是在TTS的高拟真度、声音多样性、情绪控制等还存在一些问题需要解决,人类的对话不仅是一个发声而是有思想、有情感、有内容的更深入表达。TTS技术未来如何发展,值得我们思考与期待。

“十四五”规划中指出,以人工智能为代表的新一代信息技术,逐渐成为我国推动经济高质量发展、建设创新型国家的重要技术保障和核心驱动力。为了进一步支撑国家人工智能相关决策和部署,推动人工智能产业的交流与合作,中国信息通信研究院云计算与大数据研究所将于2021年7月15日召开“2021年可信AI成果发布会”。

