2022年8月12日,由语音之家打造的AI语音技术相关的前沿论文成果分享平台—SH SSS(SH Symposium Series on Speech)第一期成功举办。本期是由覃晓逸进行论文解读:《跨年龄声纹识别:学习年龄不变的说话人特征》。
下面是本次论文解读的回顾:
VIDEO POSTER

题 目 Tittle:Cross-Age Speaker Verification: Learning Age-Invariant Speaker Embeddings
期 刊 Journal & Comments:InterSpeech2022
作 者 Authors:覃晓逸,李娜,翁超,苏丹,李明
论文地址 Url:https://arxiv.org/abs/2207.05929
论文代码 Code:https://github.com/qinxiaoyi/Cross-Age_Speaker_Verification
Methods & Data analysis
收集VoxCeleb1&2所有视频数据的人脸图片 采用Dex估计所有人脸的年龄 给音频打上年龄标签(通过平均人脸年龄值) 选择年龄跨度大的音频构造正样本对,选择同国籍和同性别的音频构造负样本对



是从输入音频
中提取的
维向量,是身份和年龄信息的总和:
和
分别表示说话人特征向量中的身份成分和年龄成分。然后,我们设计了一个与年龄相关的提取器模块(ARE),该模块使用注意机制从高维特征映射图
中提取与年龄相关的信息。在
经过ARE模块后,我们得到了维的年龄相关向量,其公式如下:

和
表示池化层和全连接层。通过
从
将年龄相关成分从说话人特征向量中剥离。其中
由年龄分类器进行有监督年龄组学习,以控制
含有年龄信息。这里我们采用注意力统计池化层(Attentive Statistical Pooling)来实现高维特征图中的年龄相关信息捕捉,从而获得固定长度的年龄信息表征向量
。
来引导
表示身份信息。随着时间的推移,说话人的音色会发生很大的变化,跨年龄说话人识别的本质问题是说话人的老化会导致类内方差的增加。因此,我们采用ArcFace作为身份损失函数来减少类内距离。
来监督与年龄相关的表征向量学习。然而,在常用的说话人年龄估计方法中,我们不使用年龄回归学习方法或具体年龄分类作为输出标签。这是由于人的音色不会在几年内发生明显变化,如果强行采用年龄分类和年龄回归任务作为损失函数,会误导年龄分类器从而使系统性能反而变差。因此,我们采用了年龄组分类法,将年龄分为7组:0-20,21-30、31-40、41-50、51-60、61-70和70-100。
朝着年龄不变的方向学习,在
上本方法通过增加一个带有梯度反转层(GRL)[18]的年龄分类器,以进一步减少解耦后特征向量中的年龄信息。
和
分别是身份和年龄分类任务的输出标签。
表示交叉熵损失,
和
是平衡不同损失函数的标量。Results



Conclusion & Discussion
本篇文章采用人脸年龄估计的方法挖掘跨年龄声纹识别场景数据并提出跨年龄声纹识别的的新基准Vox-CA。Vox-CA上的结果表明年龄不匹配带来的影响和跨年龄场景的测试难度。另外本篇文章还提出一种年龄解耦的对抗学习方法来学习年龄不变的说话人表征以降低年龄跨度带来的不利影响。但是跨年龄声纹识别依旧是一个非常具有挑战性的任务,需要进一步的探索和研究。
References
