本期开源发布为 [罗振宇跨年演讲] 场景,测试集ID: SPEECHIO_ASR_ZH00004 获取方式: 平台:Linux / MacOS Step 1 获取 leaderboard 代码仓库: 初次获取: git clone http…
声浪
情绪是社交互动中的重要一环。它影响着人们的行为方式,塑造人际关系。语言尤为如此,只需要几句话,我们就能够表达各种微妙而复杂的情绪。因此,研究界的一个长期目标是让机器能够理解上下文和情绪,这反过来又有助于研发各种应用(包括有同理心的聊天机器人…
美团语音交互部 语音交互部负责集团语音和智能交互技术及产品研发,面向美团业务和生态伙伴,提供对语音和口语数据的大规模处理及智能响应能力。团队以建设业界一流的语音交互技术为基础,一方面支持集团业务场景中的技术需求,创造显著业务价值;另一方面为…
为进一步方便大家使用 WeNet 进行学术研究,近日,WeNet 在原有 LibriSpeech 和 GigaSpeech 两个主流英文数据集的基础上,新增如下四个英文数据集的支持: chime4 switchboard tedlium3…
语音转语音翻译 (S2ST) 是打破世界各地人与人之间语言障碍的关键。自动 S2ST 系统通常由语音识别、机器翻译和语音合成子系统级联组成。然而,此类级联系统可能会面临较长的延迟、信息(尤其是副语言和非语言信息)丢失,以及各子系统之间的错误…
荔枝集团 荔枝(原荔枝FM)打造了一个集声音社交、播客内容、音频社区为一体的全球化音频生态系统,致力于通过其产品组合用声音将人们联系在一起。荔枝旗下包括TIYA 在内的全球化声音社交平台,致力于满足用户的实时在线社交需求;荔枝同时打造了一个…
岗位职责: 1. 负责语音识别/合成方向的技术预研和研发工作,包括但不限于语音前端处理,声学模型,语言模型的建立和调优,ASR在线解码系统,语音合成系统。 2. 负责语音识别/合成方向前沿问题的探索与研究,结合实际应用场景,实现可商用落地且…
本周,WeNet 新增首个日语数据集 csj 的支持。该工作由吴先超博士贡献,以下是更新的具体内容。 吴先超,博士毕业于东京大学。目前就职于 NVIDIA Japan,任深度学习资深架构师,负责 Finance + NVIDIA AI、Ge…
Authors of papers in the journals of the IEEE Signal Processing Society will have the opportunity to present their work…
近期,新加坡国立大学Human Language Technology (HLT) 实验室提出神经网络自动配音模型VisualTTS: TTS with Accurate Lip-Speech Synchronization for Aut…
