中国人民大学高瓴人工智能学院 GeWu 实验室提出了一种动态视音场景下的空间 - 时序问答模型,让 AI 能像人一样观看和聆听乐器演奏,并对给定的视音问题做出跨模态时空推理。论文已被 CVPR2022 接收并选为 Oral Presentation。

论文地址:
https://gewu-lab.github.io/MUSIC-AVQA/static/files/MUSIC-AVQA.pdf
项目地址:
https://gewu-lab.github.io/MUSIC-AVQA/



首先,声音及其视觉源的位置反映了视听模态之间的空间关联,这有助于将复杂的场景分解为具体的视听关联。因此该研究提出了一个基于注意力机制的声源定位的空间模块来模拟这种跨模态的关联。
其次,由于视听场景随时间动态变化,因此捕捉和突出与问题密切相关的关键时间戳至关重要。因此,该研究提出了使用问题特征作为查询的时间基础模块来聚焦关键时间片段,以有效地编码问题感知音频和视觉的嵌入。
最后,融合上述空间感知和时间感知的视听特征,得到问答的联合表示,以预测视频关联问题的答案。




