
谷歌Gemini Live新增视觉功能:支持实时语音读细字与环境识别
谷歌在兼容的Android设备上的Gemini Live中正式推出Guided Vision功能。该功能利用AI技术,通过在Gemini Live中共享手机摄像头,对镜头对准的任何物体提供实时语音描述。用户可以借助该功能轻松读取细小文字、感知周围环境,以及寻找或识别身边的物体,进一步拓展了实时多模态AI的实用场景。
核心要点
- 功能正式上线:谷歌今日在兼容的Android设备上的Gemini Live中推出全新Guided Vision功能。
- 实时语音描述:用户通过在Gemini Live中共享手机摄像头,AI即可对镜头所指向的任何内容提供实时语音描述。
- 核心应用场景:支持帮助用户读取细小文字(fine print)、描述周边环境,以及寻找和识别周围的物体。
详细分析
摄像头实时共享与多模态AI感知
根据外媒报道,谷歌正式在兼容的Android设备上的Gemini Live中推出了名为Guided Vision的全新功能。该功能的核心交互机制依托于摄像头画面的实时共享:用户在使用Gemini Live的过程中开启摄像头权限并对准目标,系统中的AI便能够实时捕捉并理解视觉画面,将其转化为连续的即时语音描述。这种将视觉输入与音频输出无缝融合的机制,让移动端AI助手具备了直接“观看”和“解说”现实世界的能力。
聚焦日常实用需求:读细字与环境识别
在具体使用场景方面,Guided Vision主要针对日常生活中的视觉感知痛点提供了针对性支持。原始报道指出,该功能可以协助用户读取难以辨识的细小文字,有效解决标签、说明书或合同中微缩字体不易阅读的难题;同时,它还能对用户所处的周围环境进行即时描述,并在视野范围内寻找或识别特定物体,为用户在多样化场景下提供即时的视觉辅助与信息反馈。
行业影响
Guided Vision在Gemini Live中的落地,体现了多模态大模型从“静态图文问答”向“实时流式视觉交互”演进的行业趋势。通过将实时摄像头视频流与即时语音交互结合,AI助手不再局限于处理用户手动拍摄的照片,而是能够以连续低延迟的方式感知动态物理环境。这不仅为阅读障碍和视觉辅助等无障碍应用场景提供了更具实用价值的解决方案,也标志着移动端AI助手的竞争正进一步深化到实时多模态环境理解的核心领域。
常见问题
什么是Guided Vision功能?
Guided Vision是谷歌在Gemini Live中推出的一项新功能。用户通过在Gemini Live中共享手机摄像头,AI能够对镜头指向的任何内容提供实时语音描述。
Guided Vision主要可以用来做什么?
根据官方发布的内容,该功能主要用于帮助用户读取细小文字、描述周围环境,以及寻找或识别身边的具体物体。
哪些设备可以使用该功能?
该功能目前已在兼容的Android设备上的Gemini Live中正式上线推出。

