被 Fable 5 在 HLE 甩开一倍,Gemini 3.5 Pro 重训数学推理,7/17 能不能追回来?
重训数学能力的Gemini 3.5 Pro,能否扭转HLE评测仅为Fable 5六成的劣势
阅读全文围绕 Claude、Gemini、OpenAI、DeepSeek、AI 编程、模型中转与统一 API 网关,整理适合开发者和企业团队阅读的 AI 资讯与实战教程。
重训数学能力的Gemini 3.5 Pro,能否扭转HLE评测仅为Fable 5六成的劣势
阅读全文Gemini 3.5 Pro推出名为Deep Think(深度思考)的推理模式——重点在于,它是一种可选模式,而非默认运行状态,仅面向Google AI Ultra订阅套餐开放(月费250美元),需用户手动开启。
阅读全文万众期待的Gemini 3.5 Pro终于要正式落地。两个月前谷歌在I/O开发者大会上原定6月发布该模型,却遭遇延期;延期期间,多名核心AI研究员接连离职。如今官方确认上线日期定为7月17日,但这次发布背后藏着一道更难解的题:Gemini 3.5 Pro能否抗衡已抢占先机的Fable 5?答案远比想象中复杂。
阅读全文2026年7月7日,Anthropic公布的一组数据,令不少人意外的同时,也把一个隐藏事实摆上台面。占比最高的板块达33.4%,归类为"业务流程与运营工作"——具体用途包括汇总零散业务更新形成报告、制作新员工入职清单、搭建对账表格。紧随其后的是内容创作与文案撰写,占16.4%。 换句话说,财务、人力、行政、运营岗位的职员,才是Claude Cowork的核心重度用户。
阅读全文半年前Claude Cowork刚推出时,我曾试着在地铁上用电脑给Claude派任务。结果电脑一休眠,任务直接卡在半路;等回到家点亮屏幕,程序停在原地,仿佛无事发生,只等着我手动继续。那一刻我意识到一个尴尬的现实:所谓"远程指令",本质上要求人不能离设备太远。 2026年7月7日,Anthropic一举解决了这个痛点——Claude Cowork正式上线网页端与移动端。这不只是能用手机查看进度那么简单,所有任务改在Anthropic云端运行,无论电脑是否开机、人是否坐在工位,都不影响推进。
阅读全文2026年7月7日,Anthropic针对这一痛点推出了一套新的解决方案——Claude Cowork正式从桌面端拓展至网页端与移动端。
阅读全文两周前还能完整拆推导过程,两周后关键中间步骤直接省了——这不是主观感受,是 CSDN 博主晓峰3693 在 6 月 9 日那份实测报告里锤出来的。 温度是固定 0.3、所有任务重复跑三次取平均、对照基准是本地存档的历史记录——不靠记忆,靠数据。结果出来有点细思极恐。
阅读全文Polymarket 预测市场上,GPT-5.6 于 7 月 7 日 发布的 probability 已推到 64%。发布日本身不算稀奇,稀奇的是窗口选择——7 月 7 日恰好撞上 Claude Fable 5 专属配额方案到期的空档。OpenAI 把新品卡在对手资源轮换的间隙,与其说是常规迭代,不如说时机选得耐人寻味。
阅读全文GPT-5.5 这轮翻车,不是偶发小故障,是被 GitHub #30364 里 39 万条响应级 token 记录 钉出来的系统性问题。516——这个不起眼的数字,成了这款旗舰模型眼下最扎眼的软肋。
阅读全文聊到 OpenAI 的模型,业内一直有个惯性认知:新版本一定比旧版强。直到开发者 Dre Dyson(德雷·戴森)放出一组对照数据,把这层假设撕开了一道口子。
阅读全文一张极简等距读卡器 SVG 对比图,让 Gemini 3.5 Pro 这几天在开发者圈刷了屏。读卡器这种测试里,3.5 Pro 那版圆角、磁条莫尔纹、触控状态层全齐,Claude Fable 5 High 翻车——开发者圈于是冒出个带调侃的词 "mogging"(社区用语,大致指"单项体感压制"),形容这轮前端线上的差距。 但就此认为谷歌已经"全面反超 Anthropic",恐怕是被那张图带偏了。
阅读全文一张等距读卡器 SVG 对比图,让 Gemini 3.5 Pro 在前端圈刷足了存在感——配色、留白、层级、磁条莫尔纹、触控态,压过 Claude Fable 5 High。开发者圈于是冒出个带调侃的词 "mogging"(社区用语,大致指"单项体感压制"),形容这轮前端线上的差距。 但就此认为谷歌已经"全面反超",就片面了。
阅读全文前端圈有项常年反复的"考古式改造"——把 React 类组件批量重写成 Hooks。听着不算复杂,做起来全是坑:翻上百个文件梳生命周期逻辑,把 componentDidMount拆成 useEffect,this.state拆出多个 useState,依赖数组不能漏,闭包陷阱要避开。每改一个组件,还得把它关联的子组件、工具函数、类型定义一并喂给 AI——受限于上下文装不下整库,只能拆、只能猜、只能反复核对,折腾完往往比手写还累。 而泄露版 Gemini 3.5 Pro 带来的变化,不止"UI 图画得更好看"那层。200 万 token 上下文 + Deep Think 推理层,正在把前端重构从"碎片分段投喂"推到"整库一次性载入"。
阅读全文聊 Gemini 3.5 Pro 的前端能力,开发者圈眼下最热的还是那张等距读卡器 SVG 对比图——Gemini 3.5 Pro vs Claude Fable 5 High,圆角、磁条莫尔纹、触控态,Fable 5 翻车,3.5 Pro 压过去。"mogging"这个词这轮被用顺了。 但这场讨论里,有个更值得拆的底牌被谈得少了——200 万 token 上下文窗口。在前端重构这条线上,它才是让"多轮拉锯"变成"一气呵成"的那个变量。
阅读全文一次版本更新同时碰三个长期痛点,这种事在 Claude Code 近期节奏里不算多见。v2.1.202 共 18 项改动,其中三项修复分别对准三类被折磨已久的用户:多 worktree 并行开发的、习惯用 /rename给会话打标签的、还有被 Ctrl+R 反向搜索闪退坑过的。三处看着不相关,指向却一致——Claude Code 正从"能用"往"靠谱"挪。
阅读全文用 Claude Code 跑大型项目,最让人挠头的瞬间是什么? 不是它写不出代码,是你为并行开发新建了十几个 git worktree,切回目录准备恢复会话——进度条开始转圈,终端像冻住,风扇狂响,短则一两分钟,长则三五分钟,只能干等。这种"等工具缓过来"的煎熬,是高频用多 worktree 的开发者近几个月反复撞上的日常。
阅读全文Claude Code 面向企业落地一直有个尴尬:代码生成能力再强,一过企业网关、网络稍抖就断连,那它在生产环境里终究只能算"玩具"。金融、医疗这类行业的研发团队,没法接受一款时不时掉线的 AI 助手——哪怕它写得再好。 v2.1.202 补了两处看着不起眼、但对企业用户很要紧的优化:mTLS 证书轮换时的偶发断连修掉了,网络中断的容错能力也补上了。
阅读全文mTLS 证书自动轮换,看上去是安全部门管的底层基建,和 AI 编程助手搭不上边。但在企业级开发环境里,Claude Code 没法独立跑——它得经企业代理、对接内部代码仓库、往内部网关上报遥测,缺了 mTLS 支持,内网根本进不去。 也正因如此,v2.1.202 更新日志里那句看似冷门的修复项——"修复重新加载配置、客户端证书就地轮换时偶发 mTLS 握手失败问题"——让身处严苛合规环境的企业开发者松了口气。
阅读全文聊到 AI 模型"降智",过去听过太多玄学解读——网络波动、上下文太长、触发了什么隐藏阈值。但这一轮不太一样:OpenAI 把"罪证"白纸黑字写在了帮助中心里。你以为是程序 bug,人家定义成产品机制。
阅读全文网友 Lisa Algeb 最近撞上一件闹心的事:她每月花 200 美元订阅的 GPT-5.5 Pro,连续用一两个小时后会突然"降智"——请求秒回,输出质量断崖下跌,可界面上仍挂着"GPT-5.5 深度思考模式"的标签。 思考标识还在原地,思考能力却像被抽走了。这不是段子,是 2026 年 5 月末 OpenAI 开发者社区炸开的那轮"假深度思考"风波的缩影。
阅读全文