语音之家
首页声浪活动AI科普学堂SOTA分享热聘会员服务
登录 注册

声浪

写文章
语音/音频处理学术速递[6.4]
每日语音速递每日语音速递
原创4 months ago
语音/音频处理学术速递[6.4]

语音合成语音识别
23 0 0
SoulX-Transcriber:Soul App与西工大开源端到端多人对话转录模型
语音小管家语音小管家
原创4 months ago
SoulX-Transcriber:Soul App与西工大开源端到端多人对话转录模型

近日,Soul AI Lab与西北工业大学音频语音与语言处理研究组、Moonstep AI,开源了端到端多人对话转录模型SoulX-Transcriber。 作为一款面向长音频、多说话人场景设计的语音理解模型,SoulX-Transcrib…

语音合成
27 1 0
ElevenLabs发布Music V2:AI音乐迈入可编辑创作阶段
语音小管家语音小管家
转载4 months ago
ElevenLabs发布Music V2:AI音乐迈入可编辑创作阶段

来源丨AI音频时代、Renee 创业随笔 近日,ElevenLabs 发布了新一代音乐模型 Music v2,目前已经可以在 ElevenMusic 和 ElevenCreative 中使用。 Stable Audio 3.0刚刚升级后(S…

语音合成
19 0 0
ICME 2026|语音对话系统中的语义打断检测:基准测试、指标和模型
语音小管家语音小管家
转载4 months ago
ICME 2026|语音对话系统中的语义打断检测:基准测试、指标和模型

在自然的人机对话中,“系统能否被打断”以及“何时应停止发言并转而倾听用户”是决定交互自然性的关键问题。理想的语音对话系统(Spoken Dialogue System, SDS)不应只是机械地遵循“你一句、我一句”的轮替模式,而应像人与人交…

语音识别
24 0 0
语音/音频处理学术速递[6.3]
每日语音速递每日语音速递
原创4 months ago
语音/音频处理学术速递[6.3]

语音合成语音识别
13 0 0
AI 制造 AI:全球首个完全由 AI 编写的生产级训练框架 ForgeTrain 发布并开源
语音小管家语音小管家
转载4 months ago
AI 制造 AI:全球首个完全由 AI 编写的生产级训练框架 ForgeTrain 发布并开源

近日,清华大学自然语言处理与社会人文计算实验室与面壁智能、OpenBMB 开源社区正式发布ForgeTrain——全球首个完全由 AI 编写、零人类代码介入的生产级大模型训练框架。 它不是一个实验原型,而是一套可以直接投入生产、创造价值的“…

26 0 0
高德语音用20万小时数据做出来的开源TTS,说话人相似度拿了第一 ,支持11种情感+14类方言
语音小管家语音小管家
转载4 months ago
高德语音用20万小时数据做出来的开源TTS,说话人相似度拿了第一 ,支持11种情感+14类方言

论文链接:https://arxiv.org/abs/2605.27258 项目主页:https://amapvoice.github.io/PilotTTS/ GitHub Repo:https://github

语音合成
35 0 0
语音/音频处理学术速递[6.1]
语音小管家语音小管家
原创4 months ago
语音/音频处理学术速递[6.1]

语音合成语音识别
24 0 0
Dasheng AudioGen:语音、音乐、音效一次生成,让 AI 成为“声音导演”
语音小管家语音小管家
原创4 months ago
Dasheng AudioGen:语音、音乐、音效一次生成,让 AI 成为“声音导演”

上海交通大学 X-LANCE 实验室与小米联合发布的 Dasheng AudioGen,不再独立建模语音、音乐、音效生成任务,而是让 AI 像“声音导演”一样理解真实世界音频中多种声音的复杂关系,并端到端生成自然、协调的混合音频场景。 在线…

语音合成
24 0 0
2B 以下全球最优、开放数据集……MiniCPM5-1B 正式发布并开源!
语音小管家语音小管家
转载4 months ago
2B 以下全球最优、开放数据集……MiniCPM5-1B 正式发布并开源!

来源丨清华大学自然语言处理与社会人文计算实验室 昨日,清华大学自然语言处理与社会人文计算实验室与面壁智能、OpenBMB 开源社区正式发布并开源最新一代端侧文本基座大模型——MiniCPM5-1B。 MiniCPM5-1B 再次刷新模型的智…

开放数据集
45 0 0
‹1…1920212223…314›

热门主题

1资讯
2SpeechIO
3WeNet
4Kaldi
5AudioCC
6算法
7开源
8数据
9学术
10内推招聘

热文排行

1英伟达CPU问世:ARM架构,对比x86实现十倍性能提升2微软拟斥资 160 亿美元收购全球最大语音识别公司 Nuance3ImageNet验证集6%的标签都是错的,MIT:十大常用数据集没那么靠谱4WeNet更新:支持 CTC alignment52021全国声学大会语言声学分论坛报告—第三代语音识别技术初探6详解 WebRTC 高音质低延时的背后 — AGC(自动增益控制)7TIOBE 场景测试:汽车之家 汽车评测8TIOBE 场景测试:经济 金融 货币9语音信号处理论文优选:Handling Background Noise in Neural Speech Generation10推出 Lyra:用于语音压缩的新型极低比特率编解码器

活跃用户榜

语音小管家
语音小管家
已发表 3000 篇
每日语音速递
每日语音速递
已发表 991 篇
西工大音频语音与语言处理研究组
西工大音频语音与语言处理研究组
已发表 106 篇
SpeechIO
SpeechIO
已发表 82 篇
低调奋进
低调奋进
已发表 57 篇
机器之心
机器之心
已发表 45 篇
新智元
新智元
已发表 39 篇
阿里语音AI
阿里语音AI
已发表 33 篇
新一代Kaldi
新一代Kaldi
已发表 31 篇
THUHCSI人机语音交互实验室
THUHCSI人机语音交互实验室
已发表 29 篇

语音之家 SpeechHome

汇聚产学研各界开发者,覆盖语音识别、音频合成、声纹识别、视听多模态、物理 AI、具身听觉、人机交互等方向。

友情链接

中国计算机学会中国人工智能产业发展联盟中国人工智能学会魔搭社区希尔贝壳开源中国思否稀土掘金RTE开发者社区CSDNAI光影社 WeNetopenslrMongoDB中文社区

资源

声浪 活动 AI科普 分享 热聘 会员服务

关于

服务条款 隐私协议 合作伙伴

© 2026 语音之家 SpeechHome.com|京ICP备17027745号-4|京公网安备11010802032971号