一首歌从"灵感"到"成品",往往要经历词曲创作、编曲配器、人声录制、混音母带等多个环节。如果有一天,一个 AI 系统能够从一段文字描述出发,直接输出包含人声演唱、完整伴奏和段落结构的歌曲——甚至还能翻唱已有作品——这会对音乐创作意味着什么?…
声浪
两周前 OpenAI 上线GPT-Live,社交媒体上的形容词高度趋同:"像人"、"有温度"、"跟朋友聊天一样"。往前推两个月,Thinking Machines Lab 放出第一批 Interaction Models;同期 xAI 的g…
来源:机器之心 刚刚,腾讯混元正式发布新一代语音识别模型 Hy ASR 3.0 preview。基于最新一代大语言模型 Hy3 的语言理解能力,Hy ASR 3.0 preview 融合高精度语音识别与深度语义理解能力,在通用识别、上下文感…
以下文章来源:电影声音网 欧盟《人工智能法案》透明度要求已于2026年8月2日生效。 如果你正在使用人工智能对面向欧盟受众的作品进行音频、对话或视频的编辑、修改或生成,那么无论你身处何地,本周末生效的披露规则都将适用。以下是摘要。 01、欧…
AudioCC交我学 今天我们来聊一聊,自动语音识别 (Automatic Speech Recognition, ASR) 中的强化学习是怎么做的? 近年来,大语言模型的快速发展,使得"预训练—监督微调—强化学习"逐渐成为构建智能系统的主…
零样本语音转换旨在保留语音语言内容的同时,将源说话人音色迁移至任意未见过的目标说话人。随着实时通信、直播互动、在线会议、游戏语音等应用场景的发展,语音转换系统对低延迟、轻量化和高保真流式推理能力提出了更高要求。此前提出的 MeanVC 通过…
通义千问团队今日正式发布 Qwen 3.8-Max,参数规模达 2.4 万亿(活跃参数 95B),成为 Qwen 家族迄今最强的模型,模型权重将于下周开源。这是 Qwen 首次对 Max 级别模型开放权重。 千问AI平台:https://w…
以下文章来源于乐百一家 论文题目:A Survey of Full-Duplex Spoken Dialogue Systems: Architectural Hierarchy, Interaction Ontology, and Dec…
