Google DeepMind 近日发布了 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS。官方称这两款模型为迄今最具表现力的音频生成模型,支持在 Google AI Studio、Gemini API、Gemini Enterprise、Gemini Notebook 以及 Google Vids 中生成自定义角色声音及直接场景对话。

核心功能与技术特性
- 自然语言控制:用户可通过简单的自然语言提示创建全新声音或复制现有声音,无需复杂的技术参数调整。
- 精细化调节:支持对节奏、情绪以及真实交谈中的细微声音特征进行控制。
- 应用场景:适用于制作高质量有声书、播客内容或构建实时语音代理。
- 安全机制:内置水印等安全工具,旨在确保生成音频的可追溯性与负责任使用。
该系列工具允许用户从头开始定制逼真的语音输出,涵盖从口音到情感表达的多种维度,使其在听觉上接近真人说话的效果。
作者信息:
利兰德·雷希斯(Leland Reisch)
集团产品经理
艾伦·科恩(Alan Cohen)
代表 Gemini 音频团队的科学研究主任





