Google为Gemini Live推出实时化身功能

Google向企业开放Gemini Live实时化身功能,主打精准唇形同步与自然交互。该功能采用端到端音频处理消除文本中转延迟,虽实现毫秒级响应,但测试者反馈仍缺乏真实人际连接感。

Google 为 Gemini Live 推出实时化身功能,强调自然交互体验

Google 近期为其语音代理 Gemini 3.8 Live 合成了“富有表现力的面对面体验”,正式向 Google Enterprise 账户开放名为 Live Avatar 的功能。该功能主打精准的唇形同步、自然的表情变化以及流畅的话轮转换,旨在为企业客户提供更具吸引力的客户服务或交互式操作指引。

端到端音频处理消除延迟

据 The Verge 报道,除了提供预设的化身库供用户选择外,Google 还允许组织创建自定义化身。YouTube 频道 "AI with Surya" 展示了部分应用案例。

技术原理:端到端音频处理消除文本中转延迟

GPT-Live 和紧随其后的 Gemini Live 摒弃了传统的“语音转文本再转语音”的中继模式。模型直接在同一个系统内处理原始音频输入与输出,中间不经过任何文本翻译步骤。这一架构调整显著降低了响应延迟,使模型能够在毫秒级时间内做出反应,并捕捉到文本无法传递的非语言线索,如语调、犹豫情绪、恼怒或玩笑意味等。

用户体验反馈:流畅但缺乏人类连接感

尽管技术层面实现了快速响应和多语言无缝切换(包括同一句话中混合多种语言的情况),测试者对这种交互的真实感仍持保留态度。Android Police 博客指出,即便没有视觉化化身,仅凭 AI 生成的音频进行对话,也难以摆脱“非真实交谈”的感觉。这种体验更接近于拨打技术支持电话,而非人际交流。

有测试者表示,虽然 Gemini 能够迅速识别诸如“T-O-P-G-3-3-K”这样的拼写变体并正确解读为“Top Geek”,且能根据用户语速调整回答节奏,但整个过程中并未产生类似人类对话的连接感。相反,这种高度流畅的自然语言交互反而强化了屏幕另一端“无人存在”的认知。

社区讨论:关于算法依赖性的反思

Slashdot 读者 MrBrklyn(编号 #4,775)分享了他与 Gemini 关于“主流媒体为何避免报道屏幕依赖性”的对话经历。他声称最终促使 Gemini 承认,该技术本质上是科技巨头构建的工具,旨在确保用户依赖其系统来获取观点、表达方式及事实判断。

评论 0

0/500

评论需审核后展示,请文明发言

💬
还没有评论,来说两句

相关阅读