ASRU 2025|基于大语言模型的 ASR 高效扩展方法
语音识别(ASR)作为高效转录语音的技术,在当今社会中扮演着越来越重要的角色。借助大语言模型的语音识别(LLM-ASR)性能出色,但通常会产生高昂的计算成本。探索LLM-ASR的高效训练策略以及扩展方法具有重要意义,以便获得给定计算成本(F…
15 0 0
语音识别(ASR)作为高效转录语音的技术,在当今社会中扮演着越来越重要的角色。借助大语言模型的语音识别(LLM-ASR)性能出色,但通常会产生高昂的计算成本。探索LLM-ASR的高效训练策略以及扩展方法具有重要意义,以便获得给定计算成本(F…
作为语音相关研究领域的旗舰国际会议,ASRU2025(IEEE Workshop on Automatic Speech Recognition and Understanding)将于12月6-10日在夏威夷檀香山举办。IEEE ASRU…
论文题目:《SpeakerLM: End-to-End Versatile Speaker Diarization and Recognition with Multimodal Large Language Models》 论文地址:ht…
大家好,欢迎来到「AudioCC交我学」专栏! 作为学术研究者与实践者的连接点,我们致力于打造一个专注于语音技术的学术交流平台——「AudioCC交我学」专栏。在这里,我们将以简洁、专业的视角,解读听觉认知与计算声学领域的前沿论文,分享技术…
随着以智能助手为代表的人机语音对话系统和会议转录与纪要等应用的爆发,对话语音识别(Conversational ASR) 技术变得愈发重要。对话语音(Conversational Speech)具有高度的上下文(Context)相关性,而擅…