ChatGPT、DeepSeek等语言模型具备「深度推理」(Reasoning)能力,这类模型会在回答问题前先进行一段较长的推论过程,使回答的品质大幅提升。

不过,这种「等使用者说完话才开始思考」的方式,虽然在纯文字的使用场景能够被接受,却不太适用于需要即时反应的语音互动场景。

现在,台大李宏毅教授团队与微软研究人员合作开发出SHANKS,让口语语言模型(即输入语音、输出语音的大型语言模型, Spoken Language model)能「边听使用者说话进行深度推理」。


论文地址:https://arxiv.org/abs/2510.06917

项目主页与demo:https://d223302.github.io/SHANKS/index_zh.html

⏩作者团队来自

工业界:微软

学术界:台湾大学李宏毅团队

⏩SHANKS的贡献


  • SHANKS将使用者的流式语音输入进行分段推理,根据现有的使用者语音思考或产生动作,使得模型能够聆听使用者说话,一边进行无声的深度思考。

  • 实验显示SHANKS可以在使用者说错话时,更准确的打断使用者并提出纠正与澄。

  • SHANKS可以用来在使用者说话时,同时调用工具。当使用者的输入需要调用工具才能回覆时,现存模型需要等到使用者说完话才会开始进行工具调用,然而,我们观察到有些工具其实在使用者话说到一半时就能调用了。我们使用SHANKS在使用者说话时调用工具,能够大幅降低回覆的延迟。