在即将举行的 ICASSP 2026 中,墨尔本大学 HEART AI LAB 共有五篇论文被正式录用,系统展示了在 Test-Time 自适应与增强策略以及多模态健康智能方向上的最新研究进展。


研究方向概览:Test-Time 自适应与增强 | 多模态健康智能

本次入选的五篇论文主要围绕两个核心研究方向展开:

🔹方向一:Test-Time 自适应与推理增强

从test-time adaptation(TTA)与test-time scaling(TTS)出发,系统探索在不依赖额外标注数据的前提下,提升模型(尤其是语音与音频大模型)在下游任务中的推理能力、稳健性与泛化性能。

🔹方向二:多模态大模型在健康场景中的真实有效性研究

聚焦真实世界健康数据中普遍存在的挑战,包括ICU 场景下的非规则时间序列数据,以及语音大模型生成的情绪感知标签在多模态建模中的可靠性与适用边界。


Test-Time Adaptation for Speech Emotion Recognition

作者:Jiaheng Dong, Hong Jia, Ting Dang

简介:语音情感识别(Speech Emotion Recognition, SER)在真实应用中长期受限于分布偏移问题,例如说话人个体差异、表演式与自然情感之间的差异,以及跨数据集采集条件不一致等。尽管已有大量域自适应与微调方法被提出,但它们通常依赖源域数据或目标域标注,在隐私受限或真实部署场景中难以适用。Test-Time Adaptation(TTA)作为一种仅利用无标注目标数据、在推理阶段进行自适应的方法,为SER提供了潜在解决方案。然而,现有TTA方法主要针对图像分类与语音识别设计,其在SER场景下的有效性尚未被系统研究。

为此,本文首次对11 种主流 TTA 方法在SER任务上的表现进行了系统评测,覆盖三类具有代表性的分布偏移场景:同语料个性化适配、表演情感到自然情感迁移,以及跨语料泛化。实验结果表明:1)无反向传播(backpropagation-free)TTA 方法整体最具潜力,在多数任务上优于熵最小化与伪标签方法;2)基于熵最小化和伪标签的TTA方法在SER中普遍失效,其核心假设“情感标签具有唯一且高置信度的真值”与情感表达的内在模糊性不相容;3)不存在在所有任务上均占优的单一TTA方法,其效果高度依赖于分布偏移的类型与强度;4)TTA在跨语料等中到强分布偏移场景下收益最为显著,而在表演到自然情感迁移等复杂非一致偏移中提升有限。本文为SER场景下TTA方法的适用边界提供了首个系统性实证分析,并为后续设计更鲁棒的情感自适应方法奠定了实验基础。


AdaNODEs: Test Time Adaptation for Time Series Forecasting Using Neural ODEs

作者:Ting Dang, Soumyajit Chatterjee, Hong Jia, Yu Wu, Flora Salim, Fahim Kawsar

简介:Test-Time Adaptation(TTA)作为一种无需标注即可将预训练模型适配到新数据分布的有效方法,近年来受到广泛关注。然而,现有大多数TTA方法主要针对独立同分布数据设计,往往忽略了时间序列数据所固有的时序依赖特性,也很少直接面向时间序列预测任务。本文提出了一种全新的source-free TTA方法AdaNODEs,专为时间序列预测场景设计。我们引入Neural Ordinary Differential Equations(NODEs),构建了一种能够刻画时间序列分布漂移特性的自适应框架,从而更好地应对真实世界中常见的动态变化数据。同时,我们创新性地设计了一种适用于预测任务的TTA损失函数,弥补了现有方法在该问题设置下的不足。AdaNODEs仅需更新少量模型参数,在保持较低内存开销的同时,能够有效捕捉时间序列中的时间依赖关系。大量在一维和高维时间序列数据上的实验结果表明,AdaNODEs相较于当前最优方法分别取得了5.88%和28.4%的相对性能提升,尤其在高强度分布偏移场景下展现出更强的鲁棒性。


Test-time Scaling for Auditory Cognition in Audio Language Models

作者:Ting Dang, Yan Gao, Hong Jia

简介:近年来,大型音频语言模型(Audio Language Models, ALMs)在语音识别与语音合成任务上取得了令人瞩目的进展。然而,当面对更贴近真实世界的听觉认知挑战(例如嘈杂环境),这些模型是否具备像人类一样的听觉推理与理解能力,仍然缺乏系统研究。人类可以在复杂声学场景中灵活地关注、推理并理解不同声音来源,但当前我们尚不清楚ALMs是如何处理多样化的认知声学场景的,也不清楚其推理能力在多大程度上影响了对声学场景的理解。与此同时,尽管test-time scaling(TTS)等推理增强技术已在文本大模型中展现出显著效果,但在音频领域仍面临数据集不足、听觉推理评测受限等挑战。为此,我们构建了一个专门面向听觉认知推理的音频数据集,并系统评测了五种主流ALMs在多类听觉认知任务中的表现,同时探索了TTS策略在复杂听觉场景中的应用潜力。实验结果表明,现有ALMs在高难度听觉认知任务上仍存在明显局限,但在推理阶段引入TTS方法,能够显著提升模型在复杂声学场景下的听觉推理能力。本研究为理解和提升音频大模型的听觉认知与推理能力提供了新的数据、评测基准与方法视角。


Scaling Ambiguity: Augmenting Human Annotation in Speech Emotion Recognition with Audio-Language Models

作者:Wenda Zhang, Hongyu Jin, Siyi Wang, Zhiqiang Wei, Ting Dang

简介:情感具有天然的歧义性(ambiguity)和主观差异,难以用单一标签准确刻画。然而,现有语音情感识别研究大多依赖少量人工标注,难以可靠建模真实的情感分布(emotion distribution probability),从而限制了模型对情感歧义的理解。针对这一问题,本文提出利用音频-语言模型(Audio-Language Models)生成高质量的合成情感标注,与人工标注相结合,构建更可靠的情感分布表示。引入合成感知代理(Synthetic Perceptual Proxies)让模型从不同“感知视角”模拟多名标注者,并提出 DiME-Aug 分布感知数据增强策略,以缓解标注稀缺和情感类别不平衡问题。实验结果表明,在低到中等歧义的真实语音场景中,合成标注能够有效补充人工标注,显著提升情感分布建模的可靠性;而在高度歧义的情感场景下,人工标注仍然不可或缺。这项工作首次系统性地验证了:音频-语言大模型在情感标注与歧义建模中的可扩展潜力,为低成本、大规模情感建模提供了新思路,并对情感对话系统、心理健康分析和人机交互等应用具有重要意义,同时也指出了在高度歧义情感场景下仍需更精细生成策略的未来研究方向。


Rethinking Large Language Models for Irregular Time Series Classification in Critical Care

作者:Feixiang Zheng, Yu Wu, Cecilia Mascolo, Ting Dang

简介:不规则时间序列(Irregular Time Series)指的是观测时间点不均匀、不同变量采样频率不一致、且伴随大量缺失的时间序列数据,这在ICU场景中普遍存在.虽然近年“LLM+时间序列建模”在规则采样数据(Regular Time Series)上表现亮眼, 但其在不规则 ICU 数据上的有效性仍缺乏验证。为此,我们提出对“LLM用于非规则时间序列”进行系统性再思考:围绕LLM时间序列框架中两个关键模块(时间序列编码器与多模态对齐策略)构建统一实验平台,在多个不规则时间序列分类任务上对多种SOTA LLM模型,自监督模型以及针对不规则性设计的监督模型进行可控对比,从而回答: 1)现有“LLM+时间序列建模”不能很好地泛化到高缺失率的ICU数据上. 2) 编码器设计比对齐策略更关键: 显式建模不规则性的编码器带来显著提升,而对齐策略的增益相对有限. 3)尽管通过改进编码器取得了性能提升(最高4%),但LLM也引入了训练时间的成倍增加(最少约10倍),从权衡收益与成本角度看,LLM的引入并非总是必要的。4)在少样本任务上的表现不如针对不规则性设计的监督模型。