在AI语音正火热的当下,ElevenLabs的联合创始人兼CEOMati Staniszewski却抛出一个冷静的判断——他认为,AI模型最终会被“商品化”。
他在周二的TechCrunch Disrupt 2025大会上说,公司现在仍在专注于模型研发,但从长远看,这项技术不会一直是竞争壁垒。
对于一家目前专注于自研模型的公司而言,这番表态颇具启示意义。
斯坦尼斯泽夫斯基坦言,尽管在短期内自研模型仍是核心优势,但长期来看,不同模型之间的性能差异将逐渐缩小,尤其在主流语言和通用音色上。AI语音能力将如同电力一样,成为随处可得的基础设施。
⏩短期靠模型:为何仍要重投入?
面对“既然模型终将同质化,为何还要重投入研发”的质疑,斯坦尼斯泽夫斯基给出了直截了当的回答:“今天,模型仍是最大的技术壁垒。如果AI语音听起来不自然、不流畅,用户体验就无从谈起。”
他认为,当前阶段,自主建模是解决语音真实感、自然度等关键问题的唯一途径。ElevenLabs过去在模型架构上的突破——如情感表达、多语言韵律建模——正是其目前领先的关键。
⏩长期看应用:价值重心正在转移
斯坦尼斯泽夫斯基并不认为模型商品化意味着行业衰退,而是价值重心从底层技术向应用创新转移。
他解释说:“未来,企业会根据具体场景选择不同模型——客服用一个,游戏配音用另一个,教育讲解再用一个。可靠性、可扩展性和场景适配性,比单纯的‘音质最好’更重要。”

⏩多模态融合:下一波浪潮已可见
展望未来1-2年,斯坦尼斯泽夫斯基预测,单一模态的语音模型将加速向多模态融合演进。
“你将同时生成音频与视频,或在对话中实时联动大语言模型与语音引擎。”他以Google最新发布的Veo 3视频生成模型为例,说明跨模态协同正成为技术新前沿。


⏩新商业模式:从工具到生产力

⏩战略调整:ElevenLabs的双轮驱动

⏩未来展望:声音基础设施

