
最新声浪
查看全部 →从搜索到聊天:AI时代重新审视语音交互这件事
以下文章来源于AI语音AI思考 如果看过我最早的文章,你可能记得我曾说过:限制语音交互发展的主要因素通常并非技术,而是场景。例如,在办公室等公开场合,人们通常不会选择与机器进行语音对话,也不会频繁使用语音输入;而在车内、家中等相对私密的环境…
49 0 0
NTU、NUS、上海AI Lab联合开源 Mega-ASR:刷新真实世界高噪语音识别纪录,复杂环境相对 SOTA 降 WER 超 30%,消费级显卡可跑
以下文章来源于一杯阔乐聊ai 面向“全场景复杂环境”:Mega-ASR 引入双粒度强化学习,领跑现有开源语音识别方案 资源导航 论文链接:https://arxiv.org/abs/2605.19833 项目主页:https://xzf-t…
39 0 0
ICML 2026 | 仅凭“声音气质”即可瓦解大模型安全防线
以下文章来源于SV4Good AI Lab 近来,大型音频语言模型(Large Audio Language Model,LALM)的蓬勃发展使得声音这一人类最为自然的交流媒介被越来越多地用于与大模型的交互之中。然而,新的音频模态的引入也自…
38 0 0
【交我学-33】从"对口型"到"数字人" 音频驱动虚拟人合成技术全景解析
AudioCC交我学 作为学术研究者与实践者的连接点,我们致力于打造一个专注于语音技术的学术交流平台——「AudioCC交我学」专栏。在这里,我们将以简洁、专业的视角,解读听觉认知与计算声学领域的前沿论文,分享技术创新与应用实践的最新动态。…
48 0 0
通义发布Qwen3.5-LiveTranslate ,支持 60 种语言,开口即同传!
跨境直播卡顿、跨国会议延迟、AI配音“机器感”太重……实时同传一直卡在“延迟、语种、音色”三大痛点。 Qwen3.5-LiveTranslate-Flash给出了解决方案:支持60种语言的音频输入和文字输出,29种语言的音频输出,端到端字均…
50 0 0
通义发布 Qwen3.7-Max,重新定义 AI Agent 基座
来源丨通义实验室 刚刚,通义发布了 Qwen3.7-Max ——面向智能体时代的新一代旗舰模型,即将通过 API 提供服务。Qwen3.7-Max 致力于成为全能的智能体基座——无论是编写和调试代码、自动化办公流程,还是在跨越数百乃至数千步…
77 0 0
