
63%不是偏好,而是主动选择
2026年8月11日,桑达尔·皮查伊在社交平台X宣布:Gemini应用月活跃用户突破10亿。这是谷歌旗下第14款十亿级用户产品,同时也是增长速度最快的一款,仅用半年时间,用户规模就从7.5亿增长至10亿。
但真正值得深入解读的是另一组数据:63%的用户直接通过语音和Gemini沟通,"纯语音交互"用户的占比仍在持续攀升。
这绝非一笔可以简单掠过的数据,它标志着AI交互入口正在发生结构性重构。
语音不只是一项功能,而是默认交互方式
首先厘清63%这一数据的内涵。谷歌对10亿月活跃用户的统计标准十分严苛:特指主动打开Gemini独立应用、或是访问网页端并产生交互行为的用户。仅在Gmail、云存储内被动调用Gemini功能,不纳入统计范围。在iOS平台,已有超过1亿用户主动下载安装Gemini客户端。
在这批活跃用户当中,63%的人选择开口对话,而非打字输入。
作为参照,谷歌还披露了一组极具参考价值的数据:需要处理日常琐事的家长,使用语音完成任务的概率高出43%。五分之一的Gemini实时语音交互,已经突破纯语音沟通范畴——用户开始共享实时相机画面与屏幕内容。平台每日生成图像超1.5亿张;38%的学生发起提问时附带文件附件;Gemini可跨越40余款主流应用执行自动化操作。
语音并非文字的替代品,它打开了文字交互无法触及的边界。
变革为何恰逢此刻到来?
语音AI的爆发并非突如其来。过去一年,相关技术底层完成质的飞跃。
3月,谷歌推出Gemini 3.1 Flash Live,将实时语音交互延迟压缩至毫秒级别。Gemini Live API支持30种高清人声、覆盖24门语言。依托全双工架构,AI能够一边收听、一边应答,告别"听完再回应"的传统模式;
6月,Gemini 3.5实时语音翻译上线,支持70余种语言的流式语音同传,不再"等用户说完整段话再翻译",而是边收听、边输出译文,同时保留说话人原本的语调;
7月,OpenAI推出GPT Live全双工语音模型,实现AI同步收听与发言。
一系列技术进展指向同一个趋势:语音正在从"辅助输入手段"升级为计算设备的主流交互通道。
早期语音助手的运行逻辑是"语音转文字→运算处理→文字转语音",三次格式转换带来延迟、表达生硬、上下文断裂等诸多弊病。新一代模型直接处理语音数据流,将延迟从数秒缩短至毫秒级,一问一答的指令交互,转变为流畅的实时对话。
不过技术仅仅是必要条件,真正让语音跨过普及门槛的,是场景需求的匹配。
交互入口,就是竞争主战场
Gemini达成十亿用户规模,绝不只是"对话窗口"层面的胜利。谷歌将Gemini嵌入安卓锁屏、Gboard输入法、谷歌搜索框、Workspace侧边栏、Pixel相机快捷键。用户不必主动打开App,系统级入口已经把AI送到用户手边。
语音在这套全域分发网络中承担着怎样的作用?它解决了"双手、视线被占用"的痛点。开车设置导航、烹饪时查阅菜谱、哄孩子的同时回复消息……在这类场景下,键盘束手束脚、屏幕难以操作,唯独语音可以顺畅使用。
键盘输入要求紧盯屏幕、双手就位;语音交互不存在这类约束。当AI承载的任务,从"下达精准指令"转向"传递主观意图",语音与生俱来的自然沟通优势被无限放大。
"语音将淘汰键盘"是伪命题
"语音正在消灭键盘"的说法博人眼球,却并不准确。
同一批数据里还有一条关键信息:macOS平台资深用户调用指令的频次,是其他平台的两倍。键盘并没有走向消亡,反而在专业场景下变得更加高效。
更贴切的表述是:语音与键盘正在形成分层分工。语音负责任务发起、流程调度、轻松闲聊;键盘与屏幕继续承担精细文本编辑、复杂程序编写、结构化内容创作。二者不存在互相取代的竞争关系,而是各司其职的协作关系。
63%语音交互占比、每日1.5亿张图像生成,共同印证同一个规律:当AI足够智能、响应足够迅速、交互足够自然时,人类会本能选择消耗最低的交互方式。开口说话远比敲击键盘省力,这是根植于人本身的客观规律。此前语音难以大范围普及,根源在于技术短板:延迟过高、语义理解能力不足、难以连贯记忆上下文。如今这些阻碍正被逐一消除。
十亿用户之后的行业变局:模型接入成为新基础设施
谷歌追平ChatGPT,实现十亿月活跃用户。但相比这个数字,63%背后传递的信号更具价值。
当63%的用户选择开口和AI对话,而非打字,意味着语音已经跨越"能用"与"好用"之间的临界点。跨过这道门槛,并不依靠单一功能更新,而是全双工架构、毫秒级低延迟、30种高清音色、24种语言实时翻译、相机共享、画面感知等多项技术拼图全部落地共同促成。
💡 值得关注的是,语音交互爆发式增长的背后,是模型调用频次、并发规模、多模态数据处理量的指数级攀升。无论是前端的交互流畅度,还是后端的智能体编排,都需要稳定、合规、可负担的模型接入能力作为支撑。
在这方面,UseAIAPI提供了一条清晰的路径:平台一站式聚合Gemini(含3.6 Flash、3.5 Flash、3.1 Pro等最新模型)、Claude、ChatGPT、DeepSeek等全球主流大模型的最新版本,无需为每个大模型分别注册海外账号、配置支付方式,一套API Key即可打通全球主流模型。
更为实在的是其成本优势——平台优惠折扣最低可达官方价格的50%。对于企业用户,UseAIAPI还支持企业级定制化部署,可根据业务需求灵活配置并发、配额与路由策略,结合Batch 5折机制与缓存机制,将长上下文、高并发、持续运行的智能体工作流的单位成本压到更低。平台通过海外合规节点接入官方API,提供企业级SLA保障,规避地区可用性门槛与数据中心IP风控风险。
键盘不会消失,但键盘不再是人机交互的默认选项。
正如触摸屏没有消灭键盘,只是把键盘回归到它最擅长的专业领域。语音正在复刻同样的变化:打字将从通用交互方式,转变为面向专业工作的专属工具。
而63%,正是这条变革的分水岭。自这一刻起,AI助手的交互入口格局彻底改写。
📌 对于需要长期、大规模调用全球主流大模型的团队而言,Gemini 63%语音交互占比的背后,是一个更朴素的真理:当AI真正走入千行百业,让每一次调用都稳定、合规、可负担,将成为决定产品能走多远的关键变量之一——这正是UseAIAPI所致力于解决的问题。