基于查询的通用声音分离(USS)技术旨在通过文本、音频等多模态提示从混合信号中分离出目标声音。这项技术能够应用于沉浸式音频渲染、智能音频编辑和辅助听力设备等应用,实现对复杂声学环境中任意声源的精准提取。 尽管近年来方法架构不断演进,现有基于…
声浪
音乐结构分析(MSA)作为能够识别音乐作品中具有功能性意义的段落(如前奏、主歌、副歌)并精准检测其边界的关键技术,正在成为音乐理解和可控音乐生成的重要基础。然而,现有的MSA方法通常会因训练数据的限制、标注不一致、依赖复杂预处理流程等原因而…
题目:MDPE: A Multimodal Deception Dataset with Personality and Emotional Characteristics 作者:蔡聪,梁山,柳雪飞,朱康,温正棋,陶建华,解衡,崔济舟,马一…
这可不是什么未来科技的遥远设想,而是Tesla车主 Kim 与其车载 AI Grok 之间的一次真实互动。在即将开始线上会议前,仅凭一句指令,Grok 就能理解用户意图、规划充电路径、选择充电设施,并自主执行整个补能过程。这种跨越“人—车—…
内蒙古大学S2LAB刘瑞教授联合美国约翰霍普金斯大学、美国卡耐基梅隆大学、香港中文大学(深圳)等单位推出了首个面向情感一致性建模的多情感语音编辑数据集——ECD-TSE。该数据集大约90小时,涉及到5种情感,涵盖11个主题内容,总计84,0…
AI眼镜的爆发与挑战 AI眼镜正从科技概念迅速走向大众消费市场,其作为穿戴式智能设备的独特优势,使其有望成为每个独立个体的私人助理,重塑人机交互的入口。近期,随着AI大模型与增强现实技术的深度融合,智能眼镜市场迎来了新的发展机遇。Meta与…
去年 12 月,生成式 AI 公司 Petuum 以及穆罕默德·本·扎耶德人工智能大学(MBZUAI)共同推出了一个用于创建开源大型语言模型的项目 LLM360,旨在提高开源代码的透明度,公开整个 LLM 训练过程、代码、数据和最佳实践,以…
神经信息处理系统大会(Conference on Neural Information Processing Systems,NeurIPS)是中国计算机学会(CCF)推荐的人工智能领域 A 类学术会议,其 H5 指数高达 337,在 Go…
为了进一步丰富开源语音语料库,促进语音语言处理技术的发展,Magic Data联合中科院声学研究所、上海交通大学和西北工业大学,在Magichub开源社区正式开源180小时中文对话式语音数据集MagicData-RAMC。MagicData…
