← 返回 Blog

"跑测试的同时把需求文档摘出来":ChatGPT 桌面语音的多 Agent 并行实战

7月23日,OpenAI将ChatGPT语音能力接入桌面客户端的办公(Work)与代码(Codex)场景,覆盖macOS与Windows系统,从Plus订阅版到企业版全部开放使用。据相关报道,当天起在macOS和Windows上全球分批推送,Android即将跟上,iOS则通过Remote配对远程接入。 但本次升级的核心关键词并非"语音",而是并行处理。

OpenAIChatGPTChatGPT语音能力

一句话下达指令,多个智能体在后台分头执行任务

7月23日,OpenAI将ChatGPT语音能力接入桌面客户端的办公(Work)与代码(Codex)场景,覆盖macOS与Windows系统,从Plus订阅版到企业版全部开放使用。据相关报道,当天起在macOS和Windows上全球分批推送,Android即将跟上,iOS则通过Remote配对远程接入。

但本次升级的核心关键词并非"语音",而是并行处理

在Work和Codex里,用户张嘴就能启动一个任务、问它跑到哪了、看某个智能体现在什么状态,还能在同一段对话里同时协调好几个Agent,让它们各干各的。正如相关报道所描述的:"任务在后台跑着,你随时插一句让它换方向;它卡住了或干完了,会主动开口,或在屏幕上给你提个醒。"

这才是多智能体并行运行的真实形态:并非多个智能体排队等候你逐一下达命令,而是你只需要一句话,各个智能体便各司其职。

一边运行测试,一边整理文档:并行能力如何落地

我们拆解一个典型开发场景加以说明。

你正在开发功能分支,持续半小时的持续集成(CI)测试迟迟没有结果;与此同时,产品经理在工作群催促更新需求文档。传统操作方式只能等待测试结束,再切换窗口撰写文档,之后切回页面查看测试结果。

如今操作方式截然不同。你对ChatGPT说:"运行测试的同时整理需求文档。"代码智能体负责监控测试进程,办公智能体翻阅代码仓库内历史PR描述与设计文档,还有一个智能体同步搭建文档框架。多个智能体分头工作,你可以继续处理手头事务。

测试完成后,代码智能体会主动推送结果;文档整理完毕,办公智能体直接向你发送文稿。你无需在多个窗口来回切换,也不用刻意记住"各个任务分别推进到哪一步"。在同一会话中,随时可以查询进度、调整方向,还能让某个智能体直接复用另一智能体的输出成果。

更重要的是,整套调度流程仅依靠自然语言完成。不需要撰写复杂提示词,无需在命令行输入指令,仅仅口述需求即可。正如相关报道所述,用户甚至可以"趁你泡咖啡或者忙别的",这些活在后台自己就跑完了——调用已有的项目上下文,连上文档、日历、联系人和通讯记录,把一件做了一半的事收尾。

多智能体并行,不是同时打开多个聊天窗口分头对话,而是依托同一个会话、依靠语音,调度多个智能体在后台同步运转。

全双工交互:随时打断指令,不再排队等待响应

支撑整套能力落地的底层基石,是7月8日正式推出的GPT-Live全双工语音模型。

传统语音交互属于半双工模式:按住录音、松手发送,AI完成回复之后,你才能继续发言。如同对讲机,一方说完,另一方才能开口。GPT-Live采用全双工架构,能够同时处理输入和输出音频流,并且每秒做出几十次判断,不用等你说完就能回应。你能够随时插话修改需求,模型立刻终止当前输出,同步更新整套任务逻辑。它会像活人一样在你说的中间"嗯""明白了",对话体验更接近真人交流。

这套架构是实现语音调度多智能体的关键。倘若语音依旧是轮流对话模式,你必须等待AI完整输出一轮内容,才能继续下发新指令,调度效率甚至比不上键盘打字。依托全双工交互,你可以在智能体执行任务期间,持续下达新指令、修正偏差、调整目标。

更进一步来看,GPT-Live基于的是一个双层架构:前台是一个轻量低延迟的语音模型,负责实时对话、轮次管理、打断响应;后台由GPT-5.5负责复杂推理、网页搜索、Agent任务。这被称为"委派推理"(Delegated Reasoning)——当你问一个需要深度思考的问题,GPT-Live会把任务异步委派给后台的GPT-5.5,然后自己继续跟你聊,等结果出来了再汇报。OpenAI将对话延迟和推理深度彻底解耦:你不需要等大模型想完才能继续说话。

从跑分来看,这个委派架构成效显著,语音模式终于不再是"降级版聊天":GPQA(专家级科学推理)从此前高级语音模式的45.3%跳到84.2%;BrowseComp(Agent网页搜索能力)从0.7%飙到75.2%。

你甚至能够在智能体后台工作时继续和它交流。这不只是单纯的"多任务"噱头,而是两条交互流同步运行:一边是你持续发言沟通,另一边是智能体执行任务,互不干扰。

Mac用户专属杀手锏:Appshots窗口捕捉

Windows与Mac系统均可使用GPT语音,但Mac用户拥有一项独家王牌功能:Appshots窗口捕捉。

简单来说,Appshots支持ChatGPT直接读取前端活动窗口内容。结合电脑操作能力与本地文件访问权限,模型能够同时读懂屏幕视觉信息与本地代码仓库。

这意味着无需将报错信息复制粘贴进对话框。对着屏幕口述问题,AI同步读取画面,完整理解故障场景。移动端永远无法实现该功能——手机不存在"当前活动窗口"这一概念。桌面设备是唯一能让AI同时读取代码、终端、浏览器页面,并理清各类信息关联的载体。

多智能体并行的真正价值

OpenAI在官方声明中提出愿景:"未来用户只需口头阐述需求,ChatGPT就能依托想法并行推进多项任务。"

关键词是多任务并行。单纯把打字换成说话,仅仅属于输入方式迭代。GPT-Live想要重塑的交互范式是:AI可以在后台同步运行多项任务,与此同时,你能够无延迟持续和它沟通交流。

目前,ChatGPT Work与Codex的采用率正飞速攀升——OpenAI于7月21日宣布,Codex和ChatGPT Work的合并周活跃用户数已突破1000万,较本月早些时候几乎翻倍。这批AI智能体早已投入常态化运转,你只需要告知目标——单一会话,调度一众智能体分头作业,各项任务同步推进、互不等待。

当"动口指挥多智能体"成为常态,企业如何接住这波智能红利

GPT-Live与ChatGPT Work/Codex的进化揭示了一个朴素而深刻的趋势:AI的价值不再只是"更会聊天",而是能够自主调用工具、跨应用协同、把自然语言转化为真实世界的动作。无论是个人用户想要的"动口办事",还是企业想要的"Agent自动执行跨系统任务",背后依赖的,都是稳定、丰富、高性价比的大模型调用能力。

然而现实落地中,企业往往面临多重门槛:

  • 模型碎片化:GPT、Claude、Gemini、DeepSeek各有擅长,分别对接意味着重复开发、运维成本高企;

  • 智能体高频调用的成本压力:Agent化场景意味着高频次、长上下文、多轮调用,按官方原价计费,账单将呈指数级膨胀——这正是联想集团高级副总裁戴炜所言"养得起AI,用不起AI"的企业普遍困境;

  • 跨境调用与合规:跨国企业往往需要在不同的AI模型之间切换以降低成本并提升性能,同时还要满足GDPR、CCPA等多种监管标准,跨境数据传输和隐私保护成为巨大挑战。

这正是UseAIAPI所致力于解决的问题。作为全球大模型统一接入平台,UseAIAPI为企业与开发者提供以下核心权益:

  • 全生态模型一站式接入:单一接口无缝调用GPT、Claude、Gemini、DeepSeek等全球主流大模型的最新版本,覆盖对话、推理、多模态、嵌入等全场景,官方能力实时同步,业务始终站在技术前沿。

  • 企业级定制化服务:提供适配不同业务规模的企业级定制方案,全程护航技术对接、合规部署与运维保障,助力客户快速完成场景落地,让前沿智能真正融入核心业务系统,像管控水电一样精细化管理AI消耗。

  • 成本优势显著,缓解高强度消耗压力:平台专属优惠折扣最低可达官方定价的50%。对于高并发调用、高强度内容生成、长上下文Agent开发等重度使用场景,这一权益能够有效缓解成本压力,让预算管控精准高效,让企业真正"养得起、用得起"AI。

  • 稳定可靠的接入体验:依托全球化的服务架构,保障业务高峰期依旧流畅稳定,让开发者无需为基础设施分心,专注于产品与业务创新。

从GPT-Live在桌面端"动口指挥多智能体分头干活",到UseAIAPI在企业服务端提供稳定、低成本、全模型覆盖的接入底座,AI正在从"会对话的工具"进化为"会办事的伙伴"。而当前沿智能真正成为可调用、可负担、可落地的基础设施,这场范式变革的红利,才能惠及每一位开发者和每一家企业。

UseAIAPI,让澎湃智能触手可及。