本文来源丨Amphion
当语音大模型(SLM)从“个人设备”走向“智能家居/车载/公共服务”等多人共享场景时,新的风险出现了:模型可能将用户A的私密日程、隐私信息,误传给用户B。简单来说,语音助手需要明确 “哪些话能说、该对谁说”,团队称它为交互隐私(interactional privacy)。基于此,团队提出并发布VoxPrivacy:首个面向语音大模型的交互隐私评测基准,以系统化方式衡量模型在共享环境中是否能“说对话、也守规矩”。
✅「可量化、可复现的语音评测」让语音大模型“懂规矩”
VoxPrivacy的核心贡献是把“共享场景里哪些信息能说、该对谁说”这件事,做成了一套可量化、可复现的语音评测。不仅看模型会不会聊天,更看它能不能在多人、多轮、跨时间的对话里识别说话人、理解语境、做出正确隐私保护的决策。

✅基准与数据:
团队设计了三层难度任务(直接保密指令→ 说话人验证保密 → 无指令的主动隐私保护),覆盖“被要求保密”到“主动判断什么是隐私”的完整能力链路;并构建了7107 条、超过 32 小时的中英双语音频,另含18 位志愿者录制的真实语音验证集,确保评测更贴近真实使用场景。

✅评测与诊断:


💡 VoxPrivacy 让“共享语音助手的交互隐私”第一次有了统一标尺,能测出问题、解释问题、更提供了明确的改进路径:团队同步开放 4000小时数据集,助力开发者通过微调优化模型隐私边界能力。
