ElevenLabs发布v4与v4 Turbo语音模型,支持超90种语言

ElevenLabs发布v4与v4 Turbo语音模型。新版支持超90种语言,10秒即可克隆声音,并优化延迟以适配语音代理场景。

ElevenLabs 于周一正式发布两款全新语音模型:ElevenLabs v4 与 v4 Turbo。新版本在表达控制能力、语音代理延迟优化以及多语言支持方面均有显著提升,目前支持的语言数量已超过 90 种。

10秒音频即可完成声音克隆

早在今年早些时候于华沙举办的一场活动中,ElevenLabs 便曾预告了新一代模型的动向。此次推出的 v4 系列采用了全新的底层架构,旨在实现更精细的声音控制与更快的声音克隆速度。据官方介绍,借助 v4 模型,用户仅需提供 10 秒音频即可完成声音克隆。

在创意表现层面,新模型在处理长文本时能更好地保持语音身份的一致性,并具备上下文记忆功能,能够根据朗读内容动态调整表达方式。继 v3 版本引入用于定义表达的内联标签后,v4 进一步扩展了这一功能,允许用户叠加多个标签,并确保模型严格遵循标签序列进行生成。

语言覆盖范围方面,ElevenLabs 将支持语言数从上一版本的 70 种扩充至 90 种以上。该公司指出,日语、巴西葡萄牙语、普通话及广东话的语音质量提升最为显著。

过去一年内,ElevenLabs 的企业级呼叫业务迅速扩张,来自大型企业的营收占比已超过 55%。针对这一市场需求,新模型特别优化了延迟性能,使其更适配语音代理场景。此外,v4 具备流式处理能力,可在大型语言模型(LLM)开始生成回答的同时启动音频合成。该模型还能有效处理对抗性输入,并在问题解决过程中展现出更强的适应性与升级能力。

当前语音 AI 赛道竞争日趋激烈,Cartesia、Deepgram、Fish Audio、Boson 和 WellSaid Labs 等初创公司纷纷推出具备高表现力的语音模型,Google 与 OpenAI 等大型科技企业也在持续迭代其语音技术。

资本运作方面,ElevenLabs 今年早些时候完成了由红杉资本领投的 5 亿美元融资。市场传闻称,后续融资轮次或将使公司估值达到 220 亿美元。数据显示,公司年收入已从年初的 3.3 亿美元增长至 6.6 亿美元。与此同时,ElevenLabs 正在印度、欧洲和巴西等多个市场积极招聘,员工总数已突破 800 人。

联合创始人兼首席执行官 Mati Staniszewski 在接受 TechCrunch 采访时表示,公司计划在未来几年内启动 IPO,但尚未承诺具体时间表。

评论 0

0/500

评论需审核后展示,请文明发言

💬
还没有评论,来说两句

相关阅读