面向听觉智能与物理AI的
人机交互开发者社区

发现模型、参与赛事、分享实践、连接同行,共创数据、模型与评测驱动的人机交互生态。

50k+
注册开发者
5.8k+
技术文章
268+
开源数据集
300+
技术课程

最新声浪

查看全部 →
EMNLP 2026|Qwen Audio 团队入选论文分享
原创20 days ago
EMNLP 2026|Qwen Audio 团队入选论文分享

近日,EMNLP 2026正式公布录用结果,本期分享阿里 Token Foundry Qwen Audio 团队中稿的 3 篇论文,涵盖视频到音频生成、大语言模型推理增强、神经编解码语音合成三大前沿方向。 本次入选的 3 篇论文分别围绕跨模…

37 0 0
网易有道开源流式ASR模型 R2T2,要做语音Agent 的 infra
原创22 days ago
网易有道开源流式ASR模型 R2T2,要做语音Agent 的 infra

做过实时语音识别的人,大概率都见过这样一种场景: 你刚说完半句话,屏幕上的字幕已经出来了,但再多说几个字,前面的内容突然被改掉。字幕一会儿增加、一会儿回滚,甚至整句话重新刷新。如果只是看字幕,这可能只是“有点闪”。但当ASR的输出开始直接连…

45 0 0
语音与音频学术速递[9.18]
原创22 days ago
语音与音频学术速递[9.18]

今日论文合集:CS.SD语音与音频 | 共 7 篇。 本文经arXiv每日学术速递授权转载,微信公众号:arXiv_Daily [机构]信息由AI分析生成,可能存在错误,仅供参考,以论文实际显示为准 快速导航 1. 语音识别与关键词检测 1…

13 0 0
技术解读|Qwen Audio Agent 系列:座舱语音助手新范式
转载23 days ago
技术解读|Qwen Audio Agent 系列:座舱语音助手新范式

一边聊天,一边办事。 从办公协作,走进智能座舱。 在上一篇《qwen-audio-agent架构解析》中,我们主要围绕办公场景介绍了框架。这一次,我们把它带进智能汽车座舱。 我们做了一套可运行的智能座舱示例:接入车控、音乐、导航与天气,让用…

33 0 0
语音与音频学术速递[9.17]
原创23 days ago
语音与音频学术速递[9.17]

今日论文合集:CS.SD语音与音频 | 共 12 篇。 本文经arXiv每日学术速递授权转载,微信公众号:arXiv_Daily [机构]信息由AI分析生成,可能存在错误,仅供参考,以论文实际显示为准 快速导航 1. 语音识别与关键词检测…

14 0 0

为语音开发者而生