← 返回 Blog

Gemini Live 大升级:能记住你说过的话、能联动 40 款 App,语音助手第一次有了"记忆"

2026年6月,谷歌通过支持页面的静默更新,终于为Gemini Live补上了这一块短板。据9to5Google观察,该功能目前以灰度方式向美国英语用户推送,安卓端"个人智能"设置页面中Live语音模式的记忆功能仍标注为"即将上线",表明分批推送仍在进行中。

GeminiGemini Live

语音助手首次拥有"长期记忆"能力

Gemini Live此前存在一个棘手短板:用户滔滔不绝和它聊上十分钟,下次重新打开对话,它仿佛清空了所有记忆,对过往交流一无所知。

文字版Gemini早在一年多前就上线记忆功能,但承载谷歌重大期待的语音模式——也就是"实时对话"形态,始终困在"每次对话都是初次交流"的局限里。用户告知它不吃辣,下次让它推荐餐厅,它依旧会推荐四川火锅。

2026年6月,谷歌通过支持页面的静默更新,终于为Gemini Live补上了这一块短板。据9to5Google观察,该功能目前以灰度方式向美国英语用户推送,安卓端"个人智能"设置页面中Live语音模式的记忆功能仍标注为"即将上线",表明分批推送仍在进行中。

记忆:语音助手从"工具"走向"伙伴"的分水岭

首先厘清本次更新的核心本质。如今Gemini Live能够调取过往对话留存的记忆,以及部分关联应用中的信息。具体来说,它可以安全记住用户在不同对话间隙提到的关键信息:饮食偏好、家人重要日期、兴趣爱好等等。

这不等同于单纯"扩大上下文窗口"。上下文窗口只是单次对话内的临时存储,一旦关闭会话,信息就全部清零。而记忆具备跨会话、持久留存的特性。用户今天和它说"女儿9月1日开学",下周再提出"帮我整理开学清单",无需重复补充背景信息。

有人将这场转变概括为:从"事务型助手"进化为"陪伴型助手"。这种说法虽带有营销色彩,但方向准确。过去的语音助手遵循"一问一答"模式,每一轮对话都是独立的单次事务交互。现在它持续积累关于用户的信息,对话拥有了延续性

💡 记忆功能的上线,标志着语音助手第一次拥有"长期记忆"——记住的不只是上一句话的内容,而是用户的身份、用户关心的事、用户曾经说过的想法。

联动40余款应用:从"单纯对话"走向"执行事务"

记忆只是完整拼图的一半,另一半依托互联应用(Connected Apps)体系拓展能力边界。

谷歌在2026年I/O开发者大会上推出神经表达架构改版,Gemini Live可接入的应用名单大幅扩充。据谷歌官方披露,Gemini已能跨越40余款主流应用自动执行操作,原生应用包含谷歌智能家居、航班、酒店、Workspace办公套件、购物服务、公用服务、YouTube、YouTube音乐以及图像生成工具,第三方平台支持Spotify等。在官方演示中,用户讨论晚餐时系统可以提示预约餐厅,在美国本土Gemini还能在后台购买商品、自动预约车辆或代打商家电话。

这意味着什么?用户在Gemini Live中说"帮我预订下周飞往纽约的航班",它可以直接调用航班应用查询票务;说出"播放我收藏的歌单",无需手动跳转打开软件。语音对话不再是孤立的聊天窗口,而是能够打通手机内各类应用的交互入口。

谷歌仍在持续拓展这套生态。权限、地区、设备和应用版本,都可能影响实际体验;涉及付款、账号和隐私的操作,也需要清楚的确认环节。但方向已经明确:从"告诉人怎么做"转向"替用户把其中几步直接完成"。

容易被忽视的细节:语音端与文字端能力终于对齐

本次更新还有一处不显眼但意义重大的调整:Gemini Live实现了和文字对话版本的功能对等。

此前,文字版Gemini拥有记忆、个人智能、互联应用能力,语音端Gemini Live却全部缺失。由此形成一种割裂感:同一个AI,打字交流时十分智能,切换语音对话却显得生硬迟钝。如今这道鸿沟被填平。在语音模式下,Gemini可以调取历史对话、读取关联应用数据,结合用户在谷歌平台的行为记录(搜索、YouTube、Workspace等)给出个性化回复。

谷歌还在2026开发者大会上推出一项优化:将Gemini Live直接整合进通用聊天界面,用户能够在简短文字提问与自由语音对话之间无缝切换。打字中途,如果觉得开口沟通更便捷,点击麦克风即可继续交流,上下文不会中断。

记忆功能的隐私问题:谷歌的处理方案

每当谈及"AI记住你的信息",隐私都是绕不开的议题。

谷歌的方案是:记忆功能沿用与文字聊天完全一致的权限和隐私设置。用户可以在Gemini应用的「设置→个人智能→记忆」中自主管理。如果不希望Gemini留存特定信息,可以关闭功能,或是单独删除某条记忆。在个人智能设置页面,Live语音模式的记忆功能标注为"即将上线"(尽管部分用户已经提前生效),说明该功能仍处于分批次灰度推送阶段。

记忆,首次赋予语音助手"厚重感"

早期语音助手如同一块白板,对话结束一切归零。无法持续积累信息,也难以依托对用户的了解给出愈发精准的回答。

而这正是Gemini Live本次更新所改变的局面。语音助手第一次拥有"长期记忆"——记住的不只是上一句话的内容,而是用户的身份、用户关心的事、用户曾经说过的想法。

当AI能够跨会话记住用户的饮食偏好、家人日程、兴趣爱好,并且在对话过程中直接调动手机内40余款应用协助处理事务时,它就不再只是一个问答工具。它开始转变为拥有记忆的对话伙伴、可以落地执行任务的智能助手。

值得关注的是,这类"记忆+多应用调用+多智能体编排"的工作流,对后端模型调用的稳定性、并发能力与成本控制提出了更高要求。无论是前端的交互流畅度,还是后端的智能体编排,都需要稳定、合规、可负担的模型接入能力作为支撑。

在这方面,UseAIAPI提供了一条清晰的路径:平台一站式聚合Gemini(含3.6 Flash、3.5 Flash、3.1 Pro等最新模型)、Claude、ChatGPT、DeepSeek等全球主流大模型的最新版本,无需为每个大模型分别注册海外账号、配置支付方式,一套API Key即可打通全球主流模型。

更为实在的是其成本优势——平台优惠折扣最低可达官方价格的50%。对于企业用户,UseAIAPI还支持企业级定制化部署,可根据业务需求灵活配置并发、配额与路由策略,结合Batch 5折机制与缓存机制,将长上下文、高并发、持续运行的智能体工作流的单位成本压到更低。平台通过海外合规节点接入官方API,提供企业级SLA保障,规避地区可用性门槛与数据中心IP风控风险。

📌 对于需要长期、大规模调用全球主流大模型的团队而言,Gemini Live"记忆+执行"架构的启示在于:当AI真正走入千行百业,让每一次调用都稳定、合规、可负担,将成为决定产品能走多远的关键变量之一。

语音正在从一种"输入方式"升级为整套交互体系的核心,而记忆,正是这场升级里最关键的一块拼图。键盘不会消失,但键盘不再是人机交互的默认选项;正如触摸屏没有消灭键盘,只是把键盘回归到它最擅长的专业场景。语音正在复刻同样的变化——而支撑这场变化的,除了算法与产品,还有一套"无忧接入、按需扩展"的模型接入基础设施。