近期,厦门大学、联合浙江大学、香港中文大学(深圳)的研究员发表了一篇题为“WavBench: Benchmarking Reasoning, Colloquialism, and Paralinguistics for End-to-End…
声浪
在大语言模型(LLM)的演进中,文本分词器(Tokenizer)作为离散接口,为模型的压缩、理解、生成与上下文学习奠定了基石。然而,在音频领域,如何构建一个简单、同构且具备强大扩展潜力(Scalable)的离散接口,依然是通往“原生音频大模…
今天,豆包大模型正式进入2.0阶段。 随着Agent时代到来,大模型将在现实世界发挥更大作用。豆包2.0(Doubao-Seed-2.0)围绕大规模生产环境下的使用需求做了系统性优化,依托高效推理、多模态理解与复杂指令执行能力,更好地完成真…
2月10日,由上海创智学院孵化的模思智能及OpenMOSS团队正式发布并开源了MOSS-TTS Family。模型发布后,壁仞科技(06082.HK)旗舰产品壁砺™ 166M率先完成其中语音生成基座MOSS-TTS模型的高性能推理部署。作为…
为促进语音技术的多元化与包容性发展,推动人工智能真正惠及每一位用户,希尔贝壳秉持“技术向善”的理念,联合西北工业大学、中国科学技术大学、南开大学、昆山杜克大学、新加坡南洋理工大学、佐治亚理工学院、StammerTalk、WeNet等顶尖学术…
过去一年,生成式人工智能在音乐行业的应用正不断创造新体验,但歌唱语音合成领域(SVS,Singing Voice Synthesis)整体进展相对缓慢。 为拓展这一领域,近日,Soul App AI 团队(Soul AI Lab)与吉利汽车…
AudioCC交我学 作为学术研究者与实践者的连接点,我们致力于打造一个专注于语音技术的学术交流平台——「AudioCC交我学」专栏。在这里,我们将以简洁、专业的视角,解读听觉认知与计算声学领域的前沿论文,分享技术创新与应用实践的最新动态。…
基于查询的通用声音分离(USS)技术旨在通过文本、音频等多模态提示从混合信号中分离出目标声音。这项技术能够应用于沉浸式音频渲染、智能音频编辑和辅助听力设备等应用,实现对复杂声学环境中任意声源的精准提取。 尽管近年来方法架构不断演进,现有基于…
AI 音频初创公司ElevenLabs在 D 轮融资中筹集了 5 亿美元。 据报道,此轮融资使这家初创公司的估值达到 110 亿美元,比一年前的估值增长了三倍多。 本轮融资由红杉资本领投,其合伙人安德鲁·里德(Andrew Reed)加入…
