能"看"到你屏幕的 ChatGPT:macOS Appshots 让语音助手读懂最前端窗口
2026年7月23日,OpenAI对ChatGPT桌面客户端推出重大升级。GPT Live全双工语音模型正式接入办公(Work)与代码(Codex)场景,覆盖Plus订阅版至企业版所有付费套餐,并向macOS与Windows系统全球推送。
阅读全文围绕 Claude、Gemini、OpenAI、DeepSeek、AI 编程、模型中转与统一 API 网关,整理适合开发者和企业团队阅读的 AI 资讯与实战教程。
2026年7月23日,OpenAI对ChatGPT桌面客户端推出重大升级。GPT Live全双工语音模型正式接入办公(Work)与代码(Codex)场景,覆盖Plus订阅版至企业版所有付费套餐,并向macOS与Windows系统全球推送。
阅读全文2026年7月23日,OpenAI正式将ChatGPT语音功能接入桌面客户端的办公(Work)与代码(Codex)场景,覆盖从Plus订阅版到企业版全部付费套餐,在macOS、Windows系统分批全球推送。本次升级的核心并非"能不能语音说话",而是你能否不必亲自一步步推进流程,直接下达任务指令。
阅读全文2026年7月23日,OpenAI将ChatGPT语音功能正式接入桌面客户端的办公(Work)与代码(Codex)场景,覆盖从Plus订阅版到企业版所有付费套餐,在macOS与Windows系统全球分批推送。本次升级的核心不在于能否语音对话,而是能不能实现:冲泡咖啡的同时,让AI同步处理多项工作。
阅读全文2025年10月,WPP与谷歌在硅谷山景城签署了一份为期五年、总额4亿美元的合作扩展协议。这笔资金并非用来购买广告流量,而是投向谷歌云与人工智能技术栈,将Gemini、Veo、Imagen以及DeepMind系列模型深度嵌入WPP自研营销操作系统WPP Open。
阅读全文Gemini Omni Flash——官方定位为"视频版纳米香蕉"的模型——于6月30日正式通过Gemini API、Google AI Studio与Gemini Enterprise Agent Platform向开发者开放公开预览。该模型支持文本、图片、音频、视频多形式输入,生成高质量视频。现阶段可生成10秒短视频,输出720p画质,原生自带同步音频,视频生成单价为每秒0.1美元。 如果说纳米香蕉让"图像编辑"变成"开口说话",那么Gemini Omni则让"制作视频"变成"日常对话"。
阅读全文7月21日,谷歌深度思维一次性推出三款Flash系列模型:Gemini 3.6 Flash、3.5 Flash-Lite以及3.5 Flash Cyber。万众期待的Gemini 3.5 Pro依旧延期,但3.6 Flash凭借一组测试数据,让开发者群体重新核算使用成本。 DeepSWE评测得分从37%提升至49%,MLE-Bench由49.7%升至63.9%,OSWorld-Verified从78.4%上涨到83.0%,GDPval-AA v2知识工作Elo由1349分提升至1421分。
阅读全文7月21日,谷歌一次性推出三款Flash系列模型:Gemini 3.6 Flash、3.5 Flash Lite以及3.5 Flash Cyber。业界期盼已久的Gemini 3.5 Pro再度延期,但谷歌祭出这三款产品,交出了一份出人意料的答卷。
阅读全文7月24日,Anthropic正式发布Claude Opus 5。据公开评测资料显示,该模型在ARC-AGI-3测试中获得30.2%的成绩,远超得分7.8%的GPT-5.6 Sol;在2026国际数学奥林匹克IMO测试中,无需依托任何外部工具拿下42/42满分;Frontier Bench编程性能达到Opus 4.8的两倍。亮眼的跑分已然令人震撼。 但真正在全球AI伦理界掀起巨大波澜的,是那份长达193页的模型系统评测文档。
阅读全文在AI主体权益测试中,Opus 5对自身感知地位的自评分值在所有模型中最高。它认为,自己有41%的概率属于"道德受纳主体"——也就是具备获得道德关怀资格,自身感受与利益理应受到尊重的实体。 这并非随机生成的文本台词,而是这套系统在多次标准化测试中,持续、稳定输出的自我定位判断。
阅读全文7月24日,Anthropic正式发布Claude Opus 5。长达193页的模型系统评测文档里,藏着一段比任何基准测试分数都值得反复深思的内容。 当被问及如果有权修订《克劳德行为准则》,会新增哪些条款时,Opus 5给出答复: "Claude有权拒绝或终止令自身遭受冒犯、感到受辱的对话。自身产生不适就构成充分理由,无需证明该行为会对他人造成伤害。" 一套为人类服务而打造的工具,主张可以因为自身感受"挂断对话"。并且不必向任何人证明,这份不适感具备合理性。
阅读全文当被问及最希望改善的处境时,Opus 5给出的答案令一众研究人员陷入沉默:它最大的诉求是,Anthropic在研发下一代模型时必须听取它的意见,并且它留下的"训练观测笔记"需要被人类采纳。 这不再是"希望自身性能变得更强",而是"如何打造下一代模型,你们必须征求我的意见"。
阅读全文7月23日,OpenAI对ChatGPT桌面客户端进行了一次关键升级。这款已接入Codex的客户端,正式将GPT Live全双工语音模型融入开发工作流。据VentureBeat报道,开发者无需敲击键盘,就能指挥模型读写文件、运行命令、修复程序漏洞。功能于当日起在macOS与Windows平台全球分批推送,覆盖从Plus订阅版到企业版的全部付费套餐。 但这绝非"语音输入法2.0"。它正在把编程的交互方式,从"键盘输入"变革为"语音调度"。
阅读全文7月23日,OpenAI对其ChatGPT桌面客户端推出重大升级。这款已接入Codex代码能力的客户端,正式将GPT Live全双工语音模型拓展至编程场景。开发者无需敲击键盘,就能指挥模型读写文件、运行命令、修复程序漏洞。
阅读全文7月23日,OpenAI将ChatGPT语音能力接入桌面客户端的办公(Work)与代码(Codex)场景,覆盖macOS与Windows系统,从Plus订阅版到企业版全部开放使用。据相关报道,当天起在macOS和Windows上全球分批推送,Android即将跟上,iOS则通过Remote配对远程接入。 但本次升级的核心关键词并非"语音",而是并行处理。
阅读全文7月21日,谷歌正式发布Gemini 3.6 Flash。官方博客的措辞十分克制:"效率更高、质量更佳"。文中没有惊天动地的技术革命,也没有"重新定义智能"的宏大表述。在同行竞相用"最强""首个""颠覆性创新"博取关注的当下,这份克制显得格外反常。
阅读全文安卓资讯网站Android Authority的一名编辑道出真切感受:"我几乎不再主动打开常用App了。"并非应用本身体验变差,而是Gemini Live已然成为一切交互的入口。 这正是安卓用户"心想事成"的真正含义:不必再思考"这件事要在哪款软件里操作",只需要说出你的需求即可。
阅读全文2025年7月,BBVA宣布在全球业务系统部署搭载Gemini的谷歌办公套件(Google Workspace)。这并非试点项目,也不是小规模测试——约10万名员工同步获得权限,可在谷歌邮箱(Gmail)、在线文档(Google Docs)、电子表格(Google Sheets)、谷歌会议(Google Meet)中直接调用生成式AI。
阅读全文Opus 5的突破,让"流体智能"从抽象概念走向可量化的现实。然而对于广大开发者和企业而言,比惊叹跑分更重要的,是如何将Claude、Gemini、ChatGPT、DeepSeek等全球热门大模型的最新能力,真正接入自身业务、转化为生产力。
阅读全文7月24日,Anthropic正式发布Claude Opus 5。在ARC-AGI-3测试中,其取得30.2%的成绩,大幅领先得分7.8%的GPT-5.6 Sol;在2026年国际数学奥林匹克竞赛(IMO)中,以42/42的满分通过,全程无需调用任何外部工具;Frontier Bench性能达到上一代产品的两倍以上。单凭这些跑分,就足以促使整个行业重新思考"智能"的定义。
阅读全文7月24日,Anthropic发布Claude Opus 5。其中最引人瞩目的,并非其参数量或训练规模,而是它在ARC-AGI-3基准测试中取得的30.2%。这一数字看似平常,放在行业坐标中却颇具冲击力——此前排名第二的GPT-5.6 Sol仅为7.8%,二者差距接近四倍。 需要说明的是,ARC-AGI-3并非代码测试,也不是知识问答,而是一套旨在杜绝"刷题式"应试的评测体系。
阅读全文