论文题目:《Train Short, Infer Long: Speech-LLM Enables Zero-Shot Streamable Joint ASR And Diarization On Long Audio》 arXiv链接:…
声浪
JEDIS-LLM — 短音频训练、长音频流式推理解决说话人日志问题
18 0 0
S2SND:支持在线/离线统一推理的高精度说话人日志新框架 —— 武汉大学/昆山杜克大学团队成果发表于 IEEE T-ASLP
论文题目:Sequence-to-Sequence Neural Diarization with Automatic Speaker Detection and Representation 作者列表:Ming Cheng(程铭), Yu…
17 0 0
MIMO-TSVAD:支持模态缺失的音视频说话人日志新框架 —— 武汉大学/昆山杜克大学团队成果发表于 IEEE T-ASLP
论文题目:Multi-Input Multi-Output Target-Speaker Voice Activity Detection For Unified, Flexible, and Robust Audio-Visual Spe…
14 0 0
IEEE T-ASLP | 基于特定人跟踪的在线说话人日志研究
近期,昆山杜克大学在语音旗舰期刊IEEE/ACM Transactions on Audio, Speech and Language Processing (TASLP) 上发表了一篇题为“Online Neural Speaker Di…
11 0 0
开源更新丨通义3D-Speaker多说话人日志功能
说话人日志任务(Speaker Diarization)是指将音频划分为属于不同说话人的多个段落。其目标是确定音频中有多少个不同的说话人,并且识别出每个说话人在音频中的开始时间和结束时间。 3D-Speaker开源工具针对该功能进行了更新升…
11 0 0
IEEE T-ASLP|基于注意力-编码器-解码器的端到端说话人日志系统
近期,上海交通大学听觉认知与计算声学实验室的论文“Attention-based Encoder-Decoder End-to-End Neural Diarization with Embedding Enhancer”被语音领域顶级期刊…
21 0 0
Speaker Diarization 中的无监督聚类算法
以下文章来源于阿里语音AI,作者郑斯奇 说话人日志(Speaker Diarization,SD)系统的目标是解决“谁在什么时间说话”的说话人识别问题,是一种可以广泛应用于客服、会议等多轮对话场景的语音技术。无监督聚类一直是 Speaker…
61 0 0
