来源丨魔搭社区 通义万相开源 Wan-Dancer,一款音乐驱动的人像舞蹈视频生成模型。输入一张人物照片和一段音乐,即可自动生成节奏精准、动作流畅、风格鲜明的高质量舞蹈视频。首次突破分钟级时序瓶颈,支持15秒到3分钟的超长连贯输出,覆盖中国…
声浪
通义开源 Wan-Dancer,从音乐直接生成1分钟+高画质同步舞蹈视频
18 0 0
Interspeech2026 | MSU-Bench:多说话人对话理解评测基准
近年来,音频语言模型(Audio Language Model, ALMs)推动语音理解从传统单任务系统走向统一的音频到文本生成范式。在这一框架下,说话人验证、语音识别、说话人识别与时间戳标注等任务都可以被重新组织为可交互、可解释的生成式任…
16 0 0
【论文导读】CCF语音对话与听觉专委会论文导读(2026年第10期)
本期分享国防科技大学与湖南师范大学近期发表在IEEE Transactions on Neural Networks and Learning Systems的一篇语音人脸多模态学习的综述文章。 【论文标题】A Survey on Huma…
14 0 0
音频理解大模型四年进展:从 Whisper 到 Qwen3.5-Omni
以下文章来源于433的3号同学,作者贾彦 一、结论先行 过去四年,音频智能的核心范式发生了五次迁移: 先形成可复用的两类听觉前端。Whisper 提供稳健的语音语义表征,解决“说了什么”;CLAP 提供通用声音—文本对齐,解决“这是什么声音…
47 0 0
GPT-Live——语音智能体的技术路线和架构
以下文章来源于AI语音AI思考 今天 OpenAI 发布了 GPT-Live,展示了令人惊艳的实时语音交互能力。4月份,在豆包发布全双工语音对话模型时,我也曾写过一篇文章,探讨了端到端全双工语音交互背后的技术门槛,以及如何构建一个真正的语音…
34 0 0
FlowTTS-GRPO:让语音合成模型学会“说得准、说得像、说得好”
近年来,语音合成模型的能力提升很快。只给一小段参考音频,模型就可以模仿目标说话人的音色,读出一段新的文本。但真正把语音克隆系统用起来时会发现,模型不能只"能发声"——它需要同时做到三件事:读对文字、像目标说话人,并且声音自然、清晰、稳定。…
20 0 0
北京芯智睿声招聘语音算法工程师(弱语音 / 个性化识别方向)
一 岗位信息 岗位职责: 1. 病理 / 弱语音场景 ASR 效果迭代优化 2. 单用户个性化语音模型训练、自适应调优 3. 搭建数据清洗、标注、训练集全流程闭环 4. 设计对照实验、基线方案、评测体系驱动算法收敛 5. 联动部署、固件、测…
429 0 0
