本文介绍清华大学语音与音频技术实验室(SATLab) ICASSP 2024录用论文Whisper-Based Transfer Learning for Alzheimer Disease Classification: Leveraging Speech Segments with Full Transcripts as Prompts。这篇文章的研究基于大规模语音识别模型Whisper,利用自发语音进行迁移学习来做阿尔兹海默症(AD)检测任务,并通过将语音的完整转录本作为prompt,显著提升了模型性能。

论文链接:https://ieeexplore.ieee.org/document/10448004


阿尔兹海默症检测

阿尔茨海默症(AD)是一种起病隐匿的神经退行性疾病。随着老年人口的大幅增长,阿尔茨海默病患者的人数也在迅速增加,全球患者人数已达到约5500万。临床研究表明,早期治疗可以延缓阿尔茨海默症恶化。因此,利用成本低廉、操作便捷的方式进行大规模阿尔兹海默症筛查至关重要。

最近,人们对基于语音的阿尔茨海默症检测方法进行了广泛研究,为其大规模筛查奠定了基础。在本文中,我们尝试使用语音识别模型 Whisper和迁移学习来进行阿尔茨海默症分类,并将整个转录本作为提示(FTP),使模型能够获得全局语义信息。实验结果证明了基于 Whisper 的迁移学习方法的可行性和FTP的有效性。


实验方法

Whisper是基于Transformer架构的多语言语音识别模型。在训练和解码过程中,Whisper 要求将音频填充或修剪为 30 秒的片段。对于长音频转录,它提供了分段后利用前文进行连续转录的接口。不过,在对Whisper进行迁移学习的微调时,音频片段仍有不能超过 30 秒的限制。在本文使用的音频检测阿尔兹海默症数据集ADReSSo中,大部分音频长度都超过30秒。因此,需要进行预处理,将音频分割成更小的片段。我们利用原始的Whisper-large模型来转录长音频,利用时间戳进行分割与合并,确保合并后的片段尽可能长,且不超过 30 秒。




在训练过程中,提示部分应作为预测的参考信息而非目标。因此,在解码器输入和目标中,从<|startofprev|>开始的提示信息部分是保持不变。模型可以根据输入直接输出相同的内容,直到遇到<|startoftranscript|>,这时才开始预测后续内容。在本实验中,音频转录自Whisper-large原始模型的长音频转录接口。在对测试样本进行解码时,不仅需要提供prefix,还需要提供全文作为prompt。这样可以确保模型在生成输出时参考完整的文本信息。本文将这种使用整个转录本作为提示的方法称为Whisper-TL-FTP。通过这种迁移学习的方式,Whisper被改装成类似指令输入的大模型形式,prefix类似于instruction,表明需要做的任务;这里的prompt类似于文本input,提供全局文本信息;output展示分类结果。


实验结果

本研究使用的数据集来自 ADReSSo 挑战赛,包括参与者描述波士顿失语症诊断考试 Cookie Theft 图片的语音记录。考虑到数据集规模有限,使用不同的随机种子可能会导致不同的结果。为了提高可靠性,我们使用不同的随机种子进行了10次实验。对于每个测试样本,我们将所有投票汇总,得出最终预测结果。实际上,在选择合适的随机数种子的情况下,我们的方法单个模型的准确率比我们报告的投票结果还会高1%以上。


上表总结了在ADReSSo 测试集上我们的方法与其他相关方法的结果。在没有 ASR 转录本的情况下,Whisper-TL 方法的准确率达到了77.46%,超过了从无监督预训练模型中提取额外音频表征的方法。在使用 ASR 转录本的方法中,Whisper-TL-FTP方法的准确率达到84.51%,也明显优于多种级联系统。Whisper-TL-FTP方法有效地利用了音频和语义两个层面的信息,而无需增加任何额外的层或模型。当使用来自Whisper的相同转录本时,它以5.3%的相对优势超过了微调预训练的语言模型RoBERTa,这证明了Whisper-TL-FTP方法的有效性。此外,我们还与添加停顿信息的方法进行了比较。添加停顿信息的方法是将音频的停顿特征编码到文本中,让下游语言模型学习特定的语音特征,从而达到更好的效果。与这种方法不同的是,我们的Whisper-TL-FTP在一个模型中同时学习语音和文本信息,同样能够提取有用的判断依据,取得了更好的效果。


上表列出了在 ADReSSo 测试集上使用迁移学习和不同大小的 Whisper 模型(base,small,medium,large)得出的汇总结果。从表中可以看出,在使用base模型时,采用FTP的性能略有下降。但是,对于small及更大规模的模型,使用FTP会显著提高性能,相对提高幅度约为9%到12%。这表明,在具有更多参数的Whisper模型的迁移学习中,使用 FTP 可以让模型有效地从提示文本中学习,从而帮助阿尔茨海默症的检测。另一方面,当模型参数较少时,可能无法有效利用提示文本信息,从而导致性能下降。在比较不同规模模型的整体迁移学习效果时,medium规模的模型在准确率和F1分数方面取得了最好的结果。这表明,在数据量有限的情况下,适当的参数量能使模型更好地利用音频信息和提示文本,而不会导致明显的过拟合。


总结

在本文中,我们利用大规模语音识别模型Whisper探索了在阿尔茨海默症检测任务中的迁移学习方法。与其他方法不同,基于Whisper的迁移学习无需任何额外的层或模型即可实现。我们提出了一种名为Whisper-TL的方法,并将其进一步改进,将完整转录本作为提示,称为Whisper-TL-FTP。在ADReSSo数据集上,Whisper-TL的准确率达到了77.46%,而 Whisper-TL-FTP 的准确率达到了84.51%,超过了多种级联系统。此外,在多个规模的模型上使用FTP,相对准确率提高了9%-12%,证明了所提方法的有效性。我们希望通过这种方法,为开发有效的阿尔茨海默症筛查方法提供有价值的见解。

作者简介