来源丨SmellLikeAISpirit
人机交互(HMI)正在经历一场根本性的架构变革,从依赖云端的僵化命令结构,转向流暢、具备情境感知和空间智能的对话模式。
音频前端(AFE)技术,特别是从传统以硬件为中心的波束成形向软件定义的空间听觉AI的迁移,正处于这场变革的最前沿。
分析的核心是关键创新者Kardome,其“空间听觉”和“认知AI”技术栈正在重新定义消费电子、汽车座舱和下一代机器人的能力。
与依赖自由场假设和庞大硬件阵列的传统声学回声消除(AEC)和波束成形不同,空间听觉AI利用多路径混响作为“空间指纹”,仅需最少的硬件即可实现精确的声源分离和定位。

我们将探讨这些技术在实体AI代理中的集成,以LG CLOiD家用机器人和SK Intellix的NAMUHX健康机器人为例。
分析延迟在“系统1”(反射式)与“系统2”(推理式)AI架构中的关键作用,并指出,为了实现自然对话所需的低于200毫秒的轮话门槛,必须转向边缘原生处理。

⏩音频前端的演进:从硬件阵列到空间AI
任何语音用户界面(VUI)的效能都决定性地受限于其接收信号的质量。几十年来,在嘈杂环境中捕捉语音的行业标准一直是波束成形。然而,空间听觉AI的出现代表了技术轨迹的非连续性飞跃,从基于物理的硬件约束转向基于深度学习的软件推理。
1.1 传统波束成形的局限性
传统波束成形技术通过创建指向特定声源的“敏感波束”来衰减离轴信号,但在汽车座舱和客厅等动态、真实的现实世界环境中面临固有的物理和计算限制。
对自由场假设的依赖:传统算法(如延迟和求和,DS;最小方差无失真响应,MVDR)假设声音直接从声源传播到传感器,没有反射。在封闭空间中,声音反射产生的混响会干扰到达方向(DOA)估计算法,导致信号质量下降。
对硬件几何的重度依赖:为了获得高指向性,尤其是在语音能量显著的低频段,波束成形需要大孔径(麦克风之间的物理距离)或大量的麦克风元件。这带来了巨大的工业设计限制和成本负担,例如,高端会议室麦克风Shure MXA920使用了超过100个MEMS元件。
泄漏与音染问题:在“鸡尾酒会”等高度混响或弥散噪声场中,波束成形经常遭受空间泄漏,即离轴噪声“泄漏”到目标波束中。处理过程还可能引入频谱音染,扭曲目标语音的频率响应,使其听起来不自然或像机器人。

1.2 空间听觉AI:软件定义范式
以Kardome为代表的空间听觉AI从根本上颠覆了这个问题。它不将混响视为需要抑制的噪声,而是利用声源独特的反射模式作为“空间指纹”来对其进行定位和分离。这种方法通常被称为“点成形”(spot-forming)或基于位置的声音聚类,采用深度神经网络(DNNs)来解码三维声学场景。

通过分析直达声和早期反射,系统可以区分特定坐标的说话者和另一位置的噪声源,即使它们在角度上非常接近。这是从到达方向(DOA)到真正声源定位(Source Localization)的深刻转变。这种软件定义的方法将音频性能与硬件复杂性解耦,使单个紧凑的麦克风阵列能够执行以往需要分布式麦克风或巨大天花板阵列才能完成的任务。

1.3 盲源分离 (BSS) 的作用
盲源分离(BSS)是现代空间听觉的算法支柱。传统的BSS依赖于独立成分分析(ICA)等统计方法,但在真实声学环境中常常失效,因为混响会引入信号间的统计依赖性。
现代空间听觉AI采用基于深度学习的BSS,利用时频掩蔽技术,由神经网络预测每个时频单元的“掩码”,根据从麦克风对中提取的空间特征将其分配给特定的说话者。
Kardome的实现方式能够实时、低延迟地分离重叠语音,这是传统波束成形几乎无法完成的任务,对于用户在设备播放音频时进行打断(“barge-in”)的功能至关重要。

2. Kardome 技术栈深度解析
Kardome将自己定位为平台提供商,提供从信号采集到语义理解的完整解决方案。其架构分为两个主要层:空间听觉AI(感知)和认知AI(理解),并由MyWord等个性化工具支持。
2.1 空间听觉AI:感知层
Kardome技术的基础是实时绘制声学环境地图,这不仅仅是噪声抑制,而是场景分析。
SoundMap与点成形:核心引擎SoundMap能够检测语音和声音在3D空间中的来源。与引导“锥形”监听区域的波束成形不同,SoundMap在目标说话者周围创建一个虚拟的“气泡”或点。这实现了“音频变焦”功能,系统可以仅从期望区域(如驾驶员座位)捕获语音,同时完全静音其他区域的乘客或收音机噪声。
盲源分离 (BSS):该技术利用先进的BSS技术来分解混合的音频流。在一个三人同时说话的场景中,系统可以输出三个独立的音轨,每个音轨只包含单个人的语音。
硬件无关部署:一个关键的竞争优势是它能够在标准MEMS麦克风上运行,无需复杂的阵列几何。无论是电视边框上的线性阵列还是机器人头上的圆形阵列,该软件都能适应硬件配置,从而显著降低OEM的物料清单(BOM)成本。
2.2 认知AI:理解层
认知AI负责解释经过空间听觉处理后的清晰信号。Kardome引入了一种混合架构,在“边缘”(设备端)处理数据,以解决基于云的LLM固有的延迟和隐私问题。
系统1 vs. 系统2架构:借鉴卡尼曼的心理学框架,Kardome将处理分为两个系统。
系统1(反射层)在设备本地使用小型语言模型(SLM)处理即时、低延迟的交互(如“停止”、“开灯”),确保约80%的交互响应时间低于200毫秒。
系统2(推理层)仅在需要深度知识检索的复杂查询时才调用基于云的大型语言模型(LLM)。
情境感知:认知AI将空间数据与语义数据融合。它知道谁在说话(通过VoiceID)以及他们在哪。这使得情境感知逻辑成为可能,例如,机器人知道“到这儿来”意味着“导航到客厅沙发”,因为声音来自那里。
意图识别:系统能够区分直接命令和环境对话,减少错误唤醒,改善对话流畅度。
3. 应用前沿:机器人、汽车与企业
3.1 机器人技术:实体AI的先锋
机器人行业是先进空间音频技术最积极的采用者。CES 2026展示了LG和SK Intellix在该领域的领先部署。
LG CLOiD: LG的“零劳动家庭”愿景下的仿人机器人。在厨房、客厅等充满噪声的动态家庭环境中,CLOiD利用Kardome的技术栈来定位用户、过滤自身运行的噪音,并理解多步骤命令。其“情感智能”依赖于VoiceID来个性化响应。空间听觉还能引导机器人的视觉注意力,增强视觉-语言-行动(VLA)模型的效率。
SK Intellix NAMUHX: 这款“健康机器人”面临着移动带来的独特挑战——自身噪声和不断变化的声学环境。SK Intellix明确指出,“仅靠传统的波束成形,开发一个能在360度移动中理解用户的机器人将非常困难”。NAMUHX利用Kardome的高保真声源分离技术分析声学标记(音调、节奏的细微变化)以检测压力、疲劳等情绪状态,从而提供主动的健康建议。
3.2 汽车驾驶舱革命:多区域智能
汽车座舱是语音技术面临的最具挑战性的声学环境之一。
多区域交互的必要性:Kardome Automotive利用单个头顶麦克风阵列创建多达六个独立的监听区(驾驶员、乘客、后排左侧等)。这实现了“以座位为中心”的体验,每位乘客都可以通过语音控制自己的媒体或空调,而不会相互干扰。系统支持多说话者分离,允许驾驶员打电话的同时,后排乘客与信息娱乐系统互动。
法规驱动:Euro NCAP 2026:欧洲新车评估规程(Euro NCAP)的2026年协议惩罚对触摸屏的过度依赖,并鼓励使用强大的驾驶员监控和直观界面。可靠的语音控制被视为一个重要的安全层。Kardome的技术经证实,在高速(120公里/小时)下能将识别率提高多达248%,直接解决了可靠性问题。

硬件整合与成本降低:Kardome的软件允许单个中央阵列覆盖整个座舱,取代了传统系统中需要在每个座位附近分布麦克风的方案。这显著减少了布线、麦克风模块和ADC端口,从而节约了成本并减轻了重量。

3.3 企业会议室:软件定义的颠覆
长期以来,会议室市场一直由Shure、Sennheiser和Cisco等公司昂贵的专有硬件解决方案主导。空间听觉软件的兴起对这种硬件优先的商业模式构成了颠覆性威胁。
挑战昂贵硬件:如果软件能够使用一个简单的8麦克风圆形阵列解析3D空间位置并分离说话者,那么价值4000多美元的天花板麦克风阵列的价值主张就会减弱。
实现会议公平性:现代混合会议的目标是“会议公平性”,即为远程参与者提供会议室中每个人的独立音频流。通过BSS软件,可以实现对重叠说话者的流畅、动态分离。
软件定义会议室:在会议室的PC或专用边缘设备上运行先进的空间听觉算法,可以取代专门的DSP硬件。这使得远程参与者可以选择性地听取特定发言人,或者自动生成能准确区分说话者的转录文本。
4. 延迟、边缘计算与“系统1”架构
贯穿机器人、汽车和企业音频的统一主题是低延迟的绝对必要性。超过300毫秒的响应延迟会打破人类对话的自然流程。
云处理的瓶颈:传统的语音AI架构依赖于云端往返,通常需要1.5到3秒的时间,这在许多场景中是不可接受的。
混合边缘架构的重要性:Kardome的“系统1/系统2”架构模仿人类认知来解决这个问题。
系统1(反射-边缘):完全在本地NPU/DSP上运行,处理源分离、定位、身份验证和简单意图(“静音”、“音量调高”),延迟低于200毫秒。
系统2(推理-云/混合):仅为复杂请求激活。即使在这种情况下,本地系统也会通过“让我查一下…”等反馈来维持对话,从而掩盖云端处理的延迟。
硬件赋能:AI NPU的兴起:这种软件架构需要强大的芯片支持。Synaptics Astra SL2610等处理器集成了专门用于始终在线音频和视觉处理的NPU,使复杂的BSS算法能够高效运行,而无需唤醒耗电的主应用核心。

5. 竞争格局分析
市场正在分化为两种解决“鸡尾酒会问题”的截然不同的方法。
硬件纯粹主义者:Soundskrit:该公司从传感器层面进行创新,其SKR0400/0600麦克风在硬件级别具有固有的方向性(偶极子模式),能在信号进入电子处理前就抑制噪声。这种方法对于无法运行繁重神经网络的超低功耗应用非常有价值。
软件架构师:Kardome:Kardome代表软件优先的方法。他们假设使用普通硬件,并利用AI来克服物理限制。软件可以无限扩展,并通过OTA更新在现有设备上改进算法,为OEM提供了更大的灵活性。
混合型巨头:Cerence:Cerence仍然是汽车领域的主导者,提供从信号增强到云内容的全面解决方案。他们的挑战在于敏捷性,但其庞大的数据集和根深蒂固的OEM关系使其成为强大的现有参与者。Kardome的技术栈通常可以与Cerence的对话代理互补。
⏩结论:空间智能时代
语音AI正在从一个命令界面演变为一个空间智能传感器。
CES 2026上展示的技术表明,机器要真正融入我们的物理空间,就必须像我们一样去听。它必须理解来自不同位置的声音有不同的含义,并能以低于200毫秒的延迟进行响应,从而实现真正的对话而非交易。
Kardome的“空间听觉”技术栈是实现这一未来的关键推动者。通过将高保真音频捕捉与昂贵的硬件阵列解耦,并将智能转移到边缘,它正在普及设备理解人类互动中“谁”、“在哪”和“说什么”的能力。
对于OEM:差异化竞争的战场已转向软件。投资于灵活的、由NPU加速的音频技术栈,比投资于固定的硬件阵列具有更好的长期价值和功能迭代速度。
对于企业:专用硬件DSP的时代屈指可数。在通用计算设备上运行的基于软件的声源分离将日益蚕食高端音视频市场。
对于机器人:空间音频现已成为安全和导航的必要条件,而不仅仅是一个UI功能。

随着我们迈向2026年,“音质”的定义将发生改变。它将不再是发烧友意义上的“保真度”,而是AI意义上的“可懂度”和“情境准确性”。在这个新时代,听得最好的设备将是理解得最透彻的设备。
