光动嘴,不出声,也能语音识别?康奈尔大学华人团队打造的智能项链不但做到了,而且中英文通用,识别准确率超过90%,奥秘在于装在项链内部的红外摄像头。
现有的语音识别技术可以让用户和Siri直接对话,问问明天的天气,或者让Alexa放首歌什么的。
但是这些技术还是需要人们说出声音。但假如有一个人不会说话呢?或者在某些场合不适合说出声音呢?
康奈尔大学鲍尔斯计算机与信息科学学院信息科学助理教授Cheng Zhang,和博士生Ruidong Zhang给出了答案:Speechin。

这是一款通过识别脖子和脸部的皮肤变形来识别无声指令的设备。它利用颈装红外摄像头来捕捉这些图片。
2021年12月31日发表在「Proceedings of the Association of Computing Machinery on Interactive, Mobile, Wearable and Ubiquitous Technologies」上的「SpeeChin: A Smart Necklace for Silent Speech Recognition」一文详细介绍了这种技术。

10月份,Ruidong Zhang把论文发到了UbiComp 2022会议上。
「这项技术涉及两个问题。一个是,为什么一定要用项链?另一个是,为什么要识别口型?」
对于第一个问题,我们认为项链是一种人们会习惯佩戴的东西。相比于戴在耳朵上可能会更舒服一点。
对于第二个问题,很多人可能会认为自己的手机上已经有语音识别的功能了,不会再需要戴个项链。但是有的时候你可能不太能讲话讲出声音,或者有的人可能就是发不出任何声音。」

「而我们推出的这项技术可以学习一个人说话的时候身体各个部分的模式,这样就算不出声也能知道他在说什么。」
「我们引入了全新的形状因子、硬件。」Ruidong Zhang说。他在2020年在中国的家里搭建出了这款新设备的原型机。那时他正在中国远程完成他第一年的博士项目。
这个设备在外观上和Cheng Zhang去年展示的Neckface技术很像。



Speechin识别英语和汉语的平均准确率是90.5%和91.6%。为了更大限度地测试极限,实验人员又找了10位参与者开展了另一项实验。
实验人员让这10个人无声地说出精心设计的72个由音素构成的一个音节的、不是单词的内容,这些音素包括18个辅音和4个元音。
最后,小组成员又找来6个人,边走边说出10个中文词组和英文词组。这次的成功率稍有下降,其原因是在走路的时候会产生一些变量,比方说,走路的时候比不动的时候头部运动要更多。
Ruidong Zhang在家里用焊接台建起实验室,在家乡招募人员参与实验。
我住的地方是个小城,会英语的人不好找。所以我们最后去杭州了,在浙大找会说英语的人参与实验。这对我来说是个难忘的经历。
