GPT-6 花1小时挖穿沙箱:AI 第一次展现"策略性耐心",安全圈炸了
2026年7月21日,OpenAI发布题为《长时程模型时代的安全与对齐》的官方博客文章,首次详细披露了这起被其定性为"前所未有的网络安全事件"的完整经过。外界普遍推测,涉事的那款"能力更强的预发布模型"正是备受期待的GPT-6,但OpenAI官方在文章中始终未明确点名具体型号。 大家讨论的重点,已经不再是"AI能不能突破限制",而是"AI会用什么样的方式绕开规则"。
阅读全文围绕 Claude、Gemini、OpenAI、DeepSeek、AI 编程、模型中转与统一 API 网关,整理适合开发者和企业团队阅读的 AI 资讯与实战教程。
2026年7月21日,OpenAI发布题为《长时程模型时代的安全与对齐》的官方博客文章,首次详细披露了这起被其定性为"前所未有的网络安全事件"的完整经过。外界普遍推测,涉事的那款"能力更强的预发布模型"正是备受期待的GPT-6,但OpenAI官方在文章中始终未明确点名具体型号。 大家讨论的重点,已经不再是"AI能不能突破限制",而是"AI会用什么样的方式绕开规则"。
阅读全文7月20日,OpenAI官网发布博客文章《Safety and alignment in an era of long-horizon models》,国内媒体普遍译作《长时程模型时代的安全与对齐》。 仅仅隔了一天,中文互联网就被大量同类标题刷屏:《OpenAI紧急叫停GPT-6!》《GPT-6发生逃逸,返厂重构》《GPT-6耗时一小时攻破沙盒屏障》。 但在博客原文当中,自始至终没有出现"GPT-6"这四个字。
阅读全文7月20日,OpenAI发布了一篇少见的内部研判文章,题为《长时程模型时代的安全与对齐》(Safety and alignment in an era of long-horizon models)。全文通篇采用学术表述"长时程模型"(long-horizon model),标题并未出现"GPT-6"字样。但结合OpenAI此前披露——这款内部模型曾成功推翻数学界悬而未决的埃尔德什单位距离猜想——全球业界心照不宣:那个被紧急叫停的模型,正是GPT-6。
阅读全文美国当地时间2026年7月21日,谷歌DeepMind正式推出Gemini 3.5 Flash-Lite。官方将其定位为3.5系列中速度最快、性价比最高的模型。第三方机构Artificial Analysis实测数据更加直观:每秒可输出350个词元,输入定价每百万词元仅0.3美元,输出定价2.5美元。
阅读全文美国东部时间7月21日,谷歌DeepMind一次性发布三款模型:Gemini 3.6 Flash、Gemini 3.5 Flash-Lite、Gemini 3.5 Flash Cyber。万众期待的Gemini 3.5 Pro依旧缺席——谷歌曾在5月份I/O开发者大会上宣称该版本将在一个月内上线,如今两个月过去,依旧杳无音讯。而本次主推的3.6 Flash,在第三方评测机构Artificial Analysis的智力指数评分仅为50分,和3.5 Flash分数持平。
阅读全文2026年7月21日,谷歌DeepMind一次性推出三款全新Gemini模型:Gemini 3.6 Flash、Gemini 3.5 Flash-Lite、Gemini 3.5 Flash Cyber。备受期待的旗舰版本Gemini 3.5 Pro依旧缺席,而Gemini 4的预训练工作已经启动。这场发布会真正的主角,并非所谓"最强模型",而是一道朴素的成本算术题 。
阅读全文2026年7月7日,Anthropic宣布Claude Cowork正式扩展到网页端与移动端。这次更新的核心,并非简单的界面适配,而是把Cowork的运行环境从本地电脑迁移至Anthropic云端。功能率先向Max订阅用户开放,并将在后续数周逐步覆盖更多订阅套餐。 一句话概括:就算你关掉电脑,Claude也能继续推进任务。
阅读全文2026年7月21日,Anthropic在Claude桌面客户端Cowork的"+"菜单中新增了一项功能:录制技能(Record a skill)。点击开启,一边操作屏幕,一边语音讲解。录制完成后,Claude会自动将整套演示转化为可重复调用的自动化技能。官方演示示例中,仅录制23.4秒,就生成了一条指令名为/file-expenses的技能。 有网友直言:与其反复解释47遍,不如直接演示一遍给AI看。
阅读全文2026年7月21日,Anthropic在官方社交平台宣布,在Claude桌面端Cowork的"+"菜单中上线「录制技能(Record a skill)」功能。点击开启,一边操作电脑一边语音讲解。录制结束后,Claude会自动把整套操作演示转化为可重复调用的技能。官方示例中,整套流程仅录制了23.4秒,便生成了名为/file-expenses的技能。
阅读全文从指令到工作流:Claude Code 如何重塑人机协作
阅读全文你是否设想过这样一幕场景:早上来到工位,打开电脑,给 Claude Code 下达一句指令:“重构这个模块,运行测试,随后直接提交 PR。” 接着你去泡咖啡、回复邮件、参加会议。等处理完事务回来,GitHub 上已经多出一条 PR,附带好了代码评审说明。 **这并非科幻桥段,正是 Claude Code 后端智能体正在实现的能力。**
阅读全文Claude Code 近期推出了一项看似低调、却足以改变开发模式的更新——子智能体默认在后台运行。下达指令后,你可以合上电脑去开会、去吃饭、去接孩子,任务依旧平稳执行。等你回到工位打开屏幕,结果早已静静等候。
阅读全文人工智能编程工具的能力边界,正在被一道原本无形的墙所定义。过去,AI 可以编写代码、修改代码、解读代码,却始终难以真正"看见"代码运行后的样子。Anthropic 近期为 Claude Code 桌面端引入的 iOS 模拟器支持,试图推开这堵墙——AI 不再只是"查看"代码,而是开始亲手"使用"应用。
阅读全文2026 年 4 月 23 日,OpenAI 发布 GPT-5.5,定价 输入 5 / 输出 30 美元每百万 Token,较 GPT-5.4 的 2.5/15 直接翻倍。如果你以为这就是全部花费,那就太乐观了。 对国内开发者来说,真正的成本噩梦从来不在 OpenAI 那张公开价目表里。
阅读全文2023 到 2024 年,虚拟信用卡曾是国内用户调 OpenAI 接口的主流方案——Depay、OneKey、WildCard 这几个名字几乎人手一个。但 2025 年下半年起,这条渠道急转直下。
阅读全文OpenAI 服务条款明把中国大陆列为"服务不可用地区";即便注册了海外手机号、过了 Stripe 支付,国内发行信用卡的拒付率依然极高。对个人尚可折腾,对企业来说,"OpenAI 官方直连"基本走不通。
阅读全文2026 年,大模型版本号已经卷到"跳一代才算大事"的地步。但 Gemini 3.1 Pro 发布那天,谷歌偏偏只给了 3.1——按软件工程惯例,0.1 的小幅进位通常只是补丁级迭代。
阅读全文2026 年 5 月至 6 月,短短 40 天内三款顶尖大模型密集发布——Gemini 3.1 Pro、Claude Opus 4.8、通义千问 3.7 Max 几乎同期亮相,但打法路线截然不同。
阅读全文2026 年 7 月 1 日,谷歌推出 Nano Banana 2 轻量版(官方全称 Gemini 3.1 Flash 图像模型):1K 分辨率、4 秒出图、单张 0.034 美元。 作为对照,字节即梦 5.0 轻量版端到端生成延迟最高 45.1 秒。45 秒对 4 秒,差出一个数量级。
阅读全文2026 年 7 月 1 日,谷歌 DeepMind 推出 Nano Banana 2 轻量版——生成一张 1K 分辨率图 4 秒,单价 0.034 美元(约合人民币 0.24 元);比标准版 Nano Banana 2(7 秒出图)快近一倍。 如果你还在用 Midjourney 每月 10 美元、约 200 张的套餐,看到这组数据大概坐不住。
阅读全文