在即将举行的 ICASSP 2026 中,墨尔本大学 HEART AI LAB 共有五篇论文被正式录用,系统展示了在 Test-Time 自适应与增强策略以及多模态健康智能方向上的最新研究进展。
研究方向概览:Test-Time 自适应与增强 | 多模态健康智能
本次入选的五篇论文主要围绕两个核心研究方向展开:
🔹方向一:Test-Time 自适应与推理增强
从test-time adaptation(TTA)与test-time scaling(TTS)出发,系统探索在不依赖额外标注数据的前提下,提升模型(尤其是语音与音频大模型)在下游任务中的推理能力、稳健性与泛化性能。
🔹方向二:多模态大模型在健康场景中的真实有效性研究
聚焦真实世界健康数据中普遍存在的挑战,包括ICU 场景下的非规则时间序列数据,以及语音大模型生成的情绪感知标签在多模态建模中的可靠性与适用边界。
Test-Time Adaptation for Speech Emotion Recognition
作者:Jiaheng Dong, Hong Jia, Ting Dang
简介:语音情感识别(Speech Emotion Recognition, SER)在真实应用中长期受限于分布偏移问题,例如说话人个体差异、表演式与自然情感之间的差异,以及跨数据集采集条件不一致等。尽管已有大量域自适应与微调方法被提出,但它们通常依赖源域数据或目标域标注,在隐私受限或真实部署场景中难以适用。Test-Time Adaptation(TTA)作为一种仅利用无标注目标数据、在推理阶段进行自适应的方法,为SER提供了潜在解决方案。然而,现有TTA方法主要针对图像分类与语音识别设计,其在SER场景下的有效性尚未被系统研究。
为此,本文首次对11 种主流 TTA 方法在SER任务上的表现进行了系统评测,覆盖三类具有代表性的分布偏移场景:同语料个性化适配、表演情感到自然情感迁移,以及跨语料泛化。实验结果表明:1)无反向传播(backpropagation-free)TTA 方法整体最具潜力,在多数任务上优于熵最小化与伪标签方法;2)基于熵最小化和伪标签的TTA方法在SER中普遍失效,其核心假设“情感标签具有唯一且高置信度的真值”与情感表达的内在模糊性不相容;3)不存在在所有任务上均占优的单一TTA方法,其效果高度依赖于分布偏移的类型与强度;4)TTA在跨语料等中到强分布偏移场景下收益最为显著,而在表演到自然情感迁移等复杂非一致偏移中提升有限。本文为SER场景下TTA方法的适用边界提供了首个系统性实证分析,并为后续设计更鲁棒的情感自适应方法奠定了实验基础。
AdaNODEs: Test Time Adaptation for Time Series Forecasting Using Neural ODEs
作者:Ting Dang, Soumyajit Chatterjee, Hong Jia, Yu Wu, Flora Salim, Fahim Kawsar
Test-time Scaling for Auditory Cognition in Audio Language Models
作者:Ting Dang, Yan Gao, Hong Jia
简介:近年来,大型音频语言模型(Audio Language Models, ALMs)在语音识别与语音合成任务上取得了令人瞩目的进展。然而,当面对更贴近真实世界的听觉认知挑战(例如嘈杂环境),这些模型是否具备像人类一样的听觉推理与理解能力,仍然缺乏系统研究。人类可以在复杂声学场景中灵活地关注、推理并理解不同声音来源,但当前我们尚不清楚ALMs是如何处理多样化的认知声学场景的,也不清楚其推理能力在多大程度上影响了对声学场景的理解。与此同时,尽管test-time scaling(TTS)等推理增强技术已在文本大模型中展现出显著效果,但在音频领域仍面临数据集不足、听觉推理评测受限等挑战。为此,我们构建了一个专门面向听觉认知推理的音频数据集,并系统评测了五种主流ALMs在多类听觉认知任务中的表现,同时探索了TTS策略在复杂听觉场景中的应用潜力。实验结果表明,现有ALMs在高难度听觉认知任务上仍存在明显局限,但在推理阶段引入TTS方法,能够显著提升模型在复杂声学场景下的听觉推理能力。本研究为理解和提升音频大模型的听觉认知与推理能力提供了新的数据、评测基准与方法视角。
Scaling Ambiguity: Augmenting Human Annotation in Speech Emotion Recognition with Audio-Language Models
作者:Wenda Zhang, Hongyu Jin, Siyi Wang, Zhiqiang Wei, Ting Dang
简介:情感具有天然的歧义性(ambiguity)和主观差异,难以用单一标签准确刻画。然而,现有语音情感识别研究大多依赖少量人工标注,难以可靠建模真实的情感分布(emotion distribution probability),从而限制了模型对情感歧义的理解。针对这一问题,本文提出利用音频-语言模型(Audio-Language Models)生成高质量的合成情感标注,与人工标注相结合,构建更可靠的情感分布表示。引入合成感知代理(Synthetic Perceptual Proxies)让模型从不同“感知视角”模拟多名标注者,并提出 DiME-Aug 分布感知数据增强策略,以缓解标注稀缺和情感类别不平衡问题。实验结果表明,在低到中等歧义的真实语音场景中,合成标注能够有效补充人工标注,显著提升情感分布建模的可靠性;而在高度歧义的情感场景下,人工标注仍然不可或缺。这项工作首次系统性地验证了:音频-语言大模型在情感标注与歧义建模中的可扩展潜力,为低成本、大规模情感建模提供了新思路,并对情感对话系统、心理健康分析和人机交互等应用具有重要意义,同时也指出了在高度歧义情感场景下仍需更精细生成策略的未来研究方向。
Rethinking Large Language Models for Irregular Time Series Classification in Critical Care
作者:Feixiang Zheng, Yu Wu, Cecilia Mascolo, Ting Dang
