Google DeepMind发布Gemini 3.8 Flash TTS系列模型

Google DeepMind发布Gemini 3.8 Flash TTS系列模型。新模型支持自然语言控制声音生成与精细调节,具备内置水印等安全机制,适用于有声书、播客及实时语音代理等场景。

Google DeepMind 近日发布了 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS。官方称这两款模型为迄今最具表现力的音频生成模型,支持在 Google AI Studio、Gemini API、Gemini Enterprise、Gemini Notebook 以及 Google Vids 中生成自定义角色声音及直接场景对话。

支持自然语言控制声音创建

核心功能与技术特性

  • 自然语言控制:用户可通过简单的自然语言提示创建全新声音或复制现有声音,无需复杂的技术参数调整。
  • 精细化调节:支持对节奏、情绪以及真实交谈中的细微声音特征进行控制。
  • 应用场景:适用于制作高质量有声书、播客内容或构建实时语音代理。
  • 安全机制:内置水印等安全工具,旨在确保生成音频的可追溯性与负责任使用。

该系列工具允许用户从头开始定制逼真的语音输出,涵盖从口音到情感表达的多种维度,使其在听觉上接近真人说话的效果。


作者信息:

利兰德·雷希斯(Leland Reisch)
集团产品经理

艾伦·科恩(Alan Cohen)
代表 Gemini 音频团队的科学研究主任

评论 0

0/500

评论需审核后展示,请文明发言

💬
还没有评论,来说两句

相关阅读