据最新报道,成立仅四年的 AI 语音技术公司 ElevenLabs 目前估值已达 220 亿美元。该公司构建了人工智能的“语音层”,其核心模型能将文本转化为高度拟人的语音。

ElevenLabs 的技术已深入大众生活,尽管用户往往未察觉。例如,美国克拉纳(Klarna)公司利用该技术为 3500 万用户提供一线电话支持;德意志电信、思科、Adobe 以及越来越多的政府机构也是其企业客户。此外,该平台还服务于创作者群体,用于制作有声书、配音及音乐等内容。
尽管面临 Decagon 等对话式 AI 平台的竞争,投资者对 ElevenLabs 的前景依然看好。为了深入了解这家独角兽企业的战略与现状,媒体采访了 ElevenLabs 联合创始人兼首席执行官 Mati Staniszewski。
音频模型尚未商品化,图灵测试仍是目标
针对此前关于“音频模型将在几年内成为商品”的预测,Staniszewski 认为这一观点需要重新评估。他指出,仅在模型层面实现高质量输出仍需大量工作,目前该领域的价值依然巨大。虽然长期来看(三至五年后)模型间的差异可能会缩小,但 ElevenLabs 的目标是率先通过“交谈式人工智能图灵测试”。他强调,这需要结合逻辑智能与情感智能,使 AI 能够理解对方情绪并调整语速或表达方式,而这一能力目前尚未完全实现。
营收结构与企业占比
在业务构成方面,ElevenLabs 目前的年化经常性收入(ARR)达到 6 亿美元。其中,企业级客户占据了相当比例,剩余约 45% 的收入来自中小企业、开发者、构建者及创作者。
随着 Anthropic 等前沿实验室从模型公司向平台及应用方向演进,AI 行业的边界日益模糊。Staniszewski 观察到,过去清晰的“模型”与“应用”界限正在消失,这种融合趋势预计将持续下去。
开源与闭源模型的选择策略
对于客户在 ElevenLabs 平台上选择“推理层”时面临的开源与前沿模型抉择,Staniszewski 表示这并非二元对立。如果知识库定义良好,许多开源模型足以胜任。然而,在金融服务等高合规要求场景下,涉及交易信息或还款细节时,容错率极低,此时具备认证优势的前沿模型仍占据主导地位。
针对部分开源模型源自中国,而美国政府及欧洲政府作为客户的情况,Staniszewski 解释称,部署方案因案例而异。以波兰政府的医疗保健项目为例,旨在解决公共卫生系统中 18% 患者爽约的问题,系统通过自动拨打提醒电话来提升就诊率。在此类部署中,模型可以是开源、封闭或客户自行微调的版本,关键在于数据存储的安全整合及符合当地法规的要求。
AI 披露义务与社会接受度
关于企业是否应告知客户正在与 AI 而非人类交谈,Staniszewski 持肯定态度。他认为现阶段人们尚不适应,且普遍反感被欺骗,因此透明披露至关重要。但他预测,五年后当每个人都有自己的 AI 代理代表其工作时,社会观念将发生转变。届时,若人工客服等待时间长达 30 分钟,绝大多数用户会主动选择体验更佳的 AI 代理。
毛利率策略:市场份额优先
在被问及毛利率时,Staniszewski 给出了较为模糊的回答。他表示,公司通过智能微调和约束模型来优化成本,但如果这意味着能向客户让利并扩大市场份额,他不介意毛利率受到挤压。在他看来,证明产品价值并与客户建立信任比短期利润率更为重要。
数据训练与合成内容
ElevenLabs 拥有数百万小时的客户服务通话数据。Staniszewski 澄清,训练的核心并非单纯的数据量,而是数据标注的质量。公司拥有成千上万的内部人员及聘请的语音教练,专门负责注释数据,包括识别口音等细微特征,以确保模型不仅知道“说什么”,还能准确呈现“怎么说”。在某些合作项目中,双方会共同创建满足特定需求的定制模型。
IPO 计划与安全立场
对于市场传闻中提到的 2028 年 IPO 计划,Staniszewski 未予证实,仅表示公司致力于建立经得起时间考验的企业,并为未来几年做准备,具体上市时间取决于市场时机。
谈及 AI 安全与伦理,他主张行业应共同努力寻找合适的节奏,并在部署技术时采取适当预防措施。针对外界对类似“拥抱脸”(HugFace)等 AI 失控风险的担忧,Staniszewski 强调,ElevenLabs 不部署具有自我复制或递归智能功能的组件,其技术架构不允许代理创造更多代理。所有客户均需通过 KYC(了解你的客户)验证,公司已针对网络安全风险采取了严格的预防措施。





