Google 现已在兼容的 Android 设备上推出 Gemini Live 功能,该功能利用人工智能技术,能够实时对手机摄像头捕捉到的画面进行音频描述。

用户只需在 Gemini Live 中共享相机权限,即可让 Google AI 协助完成多项视觉任务,包括阅读细小文字、描述周围环境、识别或寻找特定物体,以及提供物体的细节信息。此外,除了通过 Gemini 应用使用外,该功能也可通过“指导视觉”(Guided Vision)入口访问。
这一功能的定位与 Apple 在 iPhone 和 Vision Pro 上推出的 VoiceOver 实时识别功能类似,主要面向盲人、视力障碍者以及在特定场景下需要视觉辅助的用户群体。





