语音之家
首页声浪活动AI科普学堂SOTA分享热聘会员服务
登录 注册

声浪

写文章
不用出声也能聊天?苹果公开一项无声语音识别专利
语音小管家语音小管家
转载2 months ago
不用出声也能聊天?苹果公开一项无声语音识别专利

地铁里、会议室中、医院病房内——很多场合我们都需要“说点什么”,却又不便发出声音。 苹果公司近日公开了一项专利申请(WO2026159706A1),提出一种默声语音检测方案:用户在不发声的情况下靠面部肌肉运动“默念”,设备读取面颊皮肤微动后…

语音识别
171 0 0
语音与音频学术速递[8.10]
每日语音速递每日语音速递
原创2 months ago
语音与音频学术速递[8.10]

今日论文合集:CS.SD语音与音频 | 共 6 篇。 本文经arXiv每日学术速递授权转载微信公众号:arXiv_Daily [机构]信息由AI分析生成,可能存在错误,仅供参考,以论文实际显示为准 1. MMAG: A Multi-Cont…

语音合成语音识别
156 0 0
Fun-ASR 如何用强化学习教会语音识别听懂中英混搭
语音小管家语音小管家
转载2 months ago
Fun-ASR 如何用强化学习教会语音识别听懂中英混搭

说话时不自觉地在中文里夹几句英文——"这个 project 的 deadline 快到了""帮我订一个 meeting room 讨论一下"——这种语言现象叫做"语码转换"(Code-Switching)。在全球化语境下,它已经成为日常交流…

语音识别
152 0 0
SALMONN-2:让大模型不只"听见",更真正"听懂"声音
语音小管家语音小管家
原创2 months ago
SALMONN-2:让大模型不只"听见",更真正"听懂"声音

论文标题:SALMONN-2: Advancing General-Purpose Hearing Abilities with Self-Supervised Representations 作者:Xiaoyu Yang\*, Xuena…

语音识别
122 0 0
语音与音频学术速递[8.6]
每日语音速递每日语音速递
原创2 months ago
语音与音频学术速递[8.6]

语音合成语音识别
108 0 0
ECoM-Reasoning:让端到端的语音大模型学会轻量级推理
语音小管家语音小管家
转载2 months ago
ECoM-Reasoning:让端到端的语音大模型学会轻量级推理

以 GPT-4o、Moshi、GLM-4-Voice、Qwen-Omni 为代表的端到端语音大模型(SLM)正在推动人机交互迈向“开口即对话”的新阶段。然而,在需要精确、结构化推理的场景下——尤其是口语数学问答——语音大模型的表现仍显著落后…

语音大模型
104 0 0
面向低信噪比水声信号增强:中科大等团队提出CUMA-Net全复值多维注意力网络
语音小管家语音小管家
转载2 months ago
面向低信噪比水声信号增强:中科大等团队提出CUMA-Net全复值多维注意力网络

近日,中国科学技术大学联合科大讯飞研究院团队在期刊IEEE Open Journal of Signal Processing上发表一项成果,针对被动声呐在信噪比低至-15 dB至-5 dB的极低条件下船舶辐射信号提取困难的问题,提出全复值…

信号增强
84 0 0
字节发布音视频全双工大模型:SeedRealtime
语音小管家语音小管家
原创2 months ago
字节发布音视频全双工大模型:SeedRealtime

8月5日,字节发布原生音视频全双工大模型 SeedRealtime。 项目主页:https://seed.bytedance.com/seedrealtime 体验入口:将豆包 App 更新至最新版本,在对话框内选择“打电话”,进入视频通话…

语音合成
79 0 0
FFmpeg 9.0 发布,代号“Lei”,以此纪念中国开发者雷霄骅
语音小管家语音小管家
原创2 months ago
FFmpeg 9.0 发布,代号“Lei”,以此纪念中国开发者雷霄骅

2026年8月4日,全球知名开源多媒体框架FFmpeg正式发布了9.0版本。 这次发布,除了例行的性能跃升、新编解码器支持与硬件加速优化之外,最令中国音视频开发者动容的,是写在发布日志最前方的版本代号:“Lei”。 这个名字,来自中国音视频…

资讯
48 0 0
语音与音频学术速递[8.5]
每日语音速递每日语音速递
原创2 months ago
语音与音频学术速递[8.5]

语音合成语音识别
52 0 0
‹1…910111213…479›

热门主题

1资讯
2SpeechIO
3WeNet
4Kaldi
5AudioCC
6算法
7开源
8数据
9学术
10内推招聘

热文排行

1英伟达CPU问世:ARM架构,对比x86实现十倍性能提升2微软拟斥资 160 亿美元收购全球最大语音识别公司 Nuance3ImageNet验证集6%的标签都是错的,MIT:十大常用数据集没那么靠谱4WeNet更新:支持 CTC alignment52021全国声学大会语言声学分论坛报告—第三代语音识别技术初探6详解 WebRTC 高音质低延时的背后 — AGC(自动增益控制)7TIOBE 场景测试:经济 金融 货币8语音信号处理论文优选:Handling Background Noise in Neural Speech Generation9TIOBE 场景测试:汽车之家 汽车评测10推出 Lyra:用于语音压缩的新型极低比特率编解码器

活跃用户榜

语音小管家
语音小管家
已发表 2999 篇
每日语音速递
每日语音速递
已发表 991 篇
西工大音频语音与语言处理研究组
西工大音频语音与语言处理研究组
已发表 106 篇
SpeechIO
SpeechIO
已发表 82 篇
低调奋进
低调奋进
已发表 57 篇
机器之心
机器之心
已发表 45 篇
新智元
新智元
已发表 39 篇
阿里语音AI
阿里语音AI
已发表 33 篇
新一代Kaldi
新一代Kaldi
已发表 31 篇
THUHCSI人机语音交互实验室
THUHCSI人机语音交互实验室
已发表 29 篇

语音之家 SpeechHome

汇聚产学研各界开发者,覆盖语音识别、音频合成、声纹识别、视听多模态、物理 AI、具身听觉、人机交互等方向。

友情链接

中国计算机学会中国人工智能产业发展联盟中国人工智能学会魔搭社区希尔贝壳开源中国思否稀土掘金RTE开发者社区CSDNAI光影社 WeNetopenslrMongoDB中文社区

资源

声浪 活动 AI科普 分享 热聘 会员服务

关于

服务条款 隐私协议 合作伙伴

© 2026 语音之家 SpeechHome.com|京ICP备17027745号-4|京公网安备11010802032971号