← 返回 Blog

63%的人不再打字!Gemini 10亿用户背后的语音革命:日均1.5亿张AI图片诞生

2026年8月11日,谷歌CEO桑达尔·皮查伊在X平台宣布:Gemini独立应用月活跃用户突破10亿,成为谷歌史上增长最快的产品,也是谷歌第14款迈入"十亿用户俱乐部"的旗舰服务。

GeminiGemini独立应用月活跃用户突破10亿

打字?太慢了

2026年8月11日,谷歌CEO桑达尔·皮查伊在X平台宣布:Gemini独立应用月活跃用户突破10亿,成为谷歌史上增长最快的产品,也是谷歌第14款迈入"十亿用户俱乐部"的旗舰服务。

10亿这个数字本身已经极具冲击力——15个月前,这一数字为4亿;2025年10月为6.5亿;2026年2月为7.5亿;6月Google I/O大会达到9亿;7月财报电话会议升至9.5亿;直至8月正式突破10亿。从4亿到10亿仅用约15个月,最后5000万增量耗时不足三周。

但真正值得关注的,是10亿用户背后暗藏的另外两组关键数据:63%的用户通过语音和Gemini交互Gemini每日生成图像数量超1.5亿张

10亿用户只是最终结果;63%与1.5亿,才是解开这一轮增长底层驱动力的钥匙。

📌 需要厘清的口径:10亿月活仅统计Gemini独立应用的用户规模,未计入通过谷歌搜索、Workspace、安卓系统内置入口等生态渠道接入的用户。谷歌搜索内嵌的AI功能月活同样突破10亿,但该统计口径与本次数据相互独立。

打字效率太低,语音交互成为主流

63%意味着什么?

代表在Gemini十亿月活用户里,超过6.3亿人优先选择开口说话,而非手动打字。语音不再是可供选用的附加功能,已然成为主流交互方式。谷歌在官方博客中进一步明确:包括更多"纯语音"用户在内,语音正在改变日常交互形态。

谷歌披露的细分数据更具代表性——忙碌家长使用语音处理日常任务的概率比其他用户高出43%。这组数据极具说服力:一手抱孩子、一手拿手机时,根本腾不出手打字,语音沟通成为唯一可行选择。

纯语音交互用户的占比仍在持续攀升。这群人并非偶尔使用语音指令,而是几乎完全放弃打字输入。

这不只是一次功能升级,更是交互范式的底层更迭。持续四十年、由键盘与触屏主导的输入模式,正被麦克风悄然改写。Gemini并非首款支持语音的AI助手,却是第一个让语音成为主流交互形式的AI助手。

日均1.5亿张图像,一场视觉创作革命

日均1.5亿张图像是什么概念?

这意味着全年产出超547亿张AI生成图像。谷歌表示,中小企业是图像生成功能的核心使用者,依靠它制作营销物料、配图、短视频与音频素材——一家咖啡店店主无需精通设计、熟练使用Photoshop,只需要对Gemini说出需求,源源不断的创意图像就此诞生。

另一项数据更加关键:五分之一(20%)的Gemini Live交互,早已突破纯语音模式。用户开始借助实时摄像头取景、屏幕共享解决现实问题。手工爱好者、学生是主力人群:修理物件时拍照让AI识别,写作业时共享屏幕获取AI指导。

Gemini正在从对话工具,进化为视觉驱动的多模态智能体。

语音作为输入方式,图像作为输出载体,摄像头充当感知传感器——三种模态在同一个应用内形成完整闭环。而学生的使用习惯同样印证了这一点:38%的学习相关请求包含附件,学生将作业、讲义、试卷拍照或上传PDF,让AI基于真实学习材料提供辅助。

跨40款应用的自动执行能力

多模态交互的尽头,是"代用户执行任务"。

谷歌披露:Gemini在安卓端能够跨40余款主流应用自动执行操作——从呼叫网约车到预订餐厅均可一键完成。这意味着AI不再只是"回答问题",而是能够"完成事务"。

与此同时,Gemini在苹果生态同样站稳脚跟:iOS平台活跃用户突破1亿,macOS重度用户的提问频率约为其他端的2倍。

打字,正在退居次要备选方案

把Gemini放置在更大行业视角观察,趋势清晰可见:人机交互正迎来第三次重大变革

  • 第一次:从命令行转向图形界面

  • 第二次:键鼠交互转向触屏操作

  • 第三次:触屏交互迈向语音+视觉融合交互

键盘时代的输入线性、精准,但是节奏缓慢;触屏时代操作直观、支持多点触控,依旧依赖手指操作;语音视觉时代的交互更加自然——人们不用专门学习操作逻辑,说话、观察事物都是人类与生俱来的本能。

Gemini的数据印证了这一点:当AI拥有足够理解力、响应速度与上下文感知能力,用户会自发选择最低成本的交互方式

63%用户选用语音,不是追求新鲜感,而是语音比打字更加便捷;每日生成1.5亿张图像,不是流于花哨,而是图像传递信息远比文字直观;跨40余款应用自动执行任务,不是炫技,而是用户需要AI真正"把事办成"。

比起"十亿用户",更值得深思的方向

十亿用户是重要里程碑。而63%语音占比、1.5亿张日生成图、20%的Gemini Live涉及摄像头或屏幕共享,如同指南针,指明AI助手未来的演化方向。

未来的AI助手,绝不只是能够听懂对话的聊天机器人,而是集听觉、视觉、内容生成、任务执行为一体的多模态智能体。

你开口诉说,它能够理解;你展示实物,它能够识别;你需要配图,它即时生成;你下达事务指令,它自动完成。

打字正在从默认输入方式,退居次要备选方案。​ 当AI充分理解自然语言、高效生成视觉素材、稳定完成跨应用任务,键盘将不再是必备交互工具。

63%的用户已经率先拥抱新交互模式。剩下37%的使用者,或许只是还不习惯开口交流——而谷歌表示,未来几周内将推出支持60余种地区方言的更新,进一步降低"开口"的门槛。

💡 多模态时代的算力经济账

当Gemini证明"语音+视觉+图像生成+跨应用执行"的多模态交互能够撬动10亿用户,AI能力真正进入人类自然交互的主航道,企业面临的算力调用挑战也愈发现实——如何以合规、稳定、高性价比的方式接入全球主流大模型,成为比"选用哪家模型"更关键的课题。

UseAIAPI作为全球主流AI大模型聚合服务平台,一站式接入Gemini(含3.6 Flash、3.5 Flash、3.1 Pro等最新模型)、Claude、ChatGPT、DeepSeek等全球主流大模型的最新版本,并支持企业级定制化部署服务,让开发者无需多头对接即可调用全球前沿模型。

在成本层面,平台折扣最低可达官方价格的50%。企业级定制方案还可结合业务需求灵活配置并发、配额与路由策略,将长上下文、高并发、持续运行的智能体工作流的单位成本压到更低,让高强度内容生成、自动化智能体、大规模代码重构等重消耗场景不再为调用消耗而担忧。

通过海外合规节点接入官方API,UseAIAPI提供企业级SLA保障,规避地区可用性门槛与数据中心IP风控风险。在多模态交互全面爆发的当下,选择具备稳定资质、价格友好、服务完善的一站式接入平台,是企业把控算力成本、提升产品竞争力的关键一环。

当63%的用户放弃打字、每天1.5亿张AI图像诞生、Gemini Live的摄像头和屏幕共享成为五分之一交互的标配,一个信号已经十分明确:

AI助手的核心竞争力,不再是谁"能聊天",而是谁能够听、能够看、能够生成、能够执行。

打字太慢,不仅仅是一句用户体验的吐槽,而是整个行业交互范式迁移的缩影。而对于需要在这场多模态浪潮中持续调用全球大模型的企业与开发者而言,以更优成本、更合规的方式驾驭AI能力,比追逐单一功能迭代本身更具现实意义