面向听觉智能与物理AI的
人机交互开发者社区

发现模型、参与赛事、分享实践、连接同行,共创数据、模型与评测驱动的人机交互生态。

50k+
注册开发者
5.8k+
技术文章
268+
开源数据集
300+
技术课程

最新声浪

查看全部 →
Cactus Compute 开源 16.9MB 语音识别模型 Whistle
原创a day ago
Cactus Compute 开源 16.9MB 语音识别模型 Whistle

Cactus Compute 发布开源语音识别模型 Whistle,面向手机、可穿戴设备、机器人、汽车和微控制器等端侧设备。 模型文件仅 16.9MB,直接在 CPU 上运行,并与其端侧工具调用模型 Needle 共用同一套 C++ 推理引…

15 0 0
语音与音频学术速递[10.9]
原创a day ago
语音与音频学术速递[10.9]

今日论文合集:CS.SD语音与音频 共 15 篇,本文展示前 8 篇 本文经arXiv每日学术速递授权转载,微信公众号:arXiv_Daily [机构]信息由AI分析生成,可能存在错误,仅供参考,以论文实际显示为准 快速导航 1. 语音合成…

20 0 0
AudioEdit:深入探索基础模型时代的音频编辑
原创2 days ago
AudioEdit:深入探索基础模型时代的音频编辑

把录音里说错的一个词改过来,让一句话的语气更轻松,或者去掉背景中的狗叫声,同时保留原本的人声和环境声——这些看似简单的要求,正是音频编辑需要解决的问题。 随着音频生成模型的发展,用文字描述一段声音并让模型生成出来,已经有了不少可行方案。但面…

13 0 0
语音与音频学术速递[10.8]
原创2 days ago
语音与音频学术速递[10.8]

今日论文合集:CS.SD语音与音频 共 14 篇,本文展示前 8 篇 本文经arXiv每日学术速递授权转载,微信公众号:arXiv_Daily [机构]信息由AI分析生成,可能存在错误,仅供参考,以论文实际显示为准 快速导航 1. 语音识别…

16 0 0
语音与音频学术速递[10.7]
原创3 days ago
语音与音频学术速递[10.7]

今日论文合集:CS.SD语音与音频 共 18 篇,本文展示前 8 篇 本文经arXiv每日学术速递授权转载,微信公众号:arXiv_Daily [机构]信息由AI分析生成,可能存在错误,仅供参考,以论文实际显示为准 快速导航 1. 语音识别…

12 0 0
VoxMem:音频大模型能跨会话记住说话人、语气和环境声吗?
原创4 days ago
VoxMem:音频大模型能跨会话记住说话人、语气和环境声吗?

语音助手正在从“一问一答”走向跨越多次会话的长期交互。用户上周提过的计划、某位家庭成员说过的话、某次对话时的语气,都可能在之后被问起。但语音里的信息远不止文字:谁说的、怎么说的、背景里有什么声音,都只存在于音频信号里,一旦转成文字就丢失了。…

17 0 0
EvoAudio:让音频大模型在“听力训练”中自进化
原创5 days ago
EvoAudio:让音频大模型在“听力训练”中自进化

同一句话播放两遍,内容一模一样,只是第二遍音调更高,让它挑出音调更高的那一遍。能把语音转写准确的模型,未必答得好这样的题。类似的问题还有:一段对话里有几位说话人?一段音乐的节奏有没有加快?这些任务都在提醒我们:知道“说了什么”,不等于听懂声…

15 0 0
语音与音频学术速递[10.5]
原创5 days ago
语音与音频学术速递[10.5]

今日论文合集:CS.SD语音与音频 | 共 12 篇。 本文经arXiv每日学术速递授权转载,微信公众号:arXiv_Daily [机构]信息由AI分析生成,可能存在错误,仅供参考,以论文实际显示为准 快速导航 1. 语音合成与声音生成 1…

9 0 0

为语音开发者而生