科技·商业·财经

曝 GPT-6 Sol 和 Opus 5.2 本周齐发,AI 巨头嘴上喊刹车脚上踩油门

   时间:2026-09-16 11:55 作者:APPSO
上周末,Anthropic CEO 阿莫迪带头发长文呼吁减速,奥特曼、马斯克和哈萨比斯等几大顶流也纷纷在 AI 刹车这件事上达成共识。

可倡议书刚发出来没几天,GPT-6 Sol 和 Claude Opus 5.2 的爆料信息却又在本周双双刷屏。不是说好要踩刹车了吗?怎么又卷起来了。OpenAI 放出重磅预告,GPT-6 Sol 成猜测大热门昨天,OpenAI 赛博义父 Tibo 在社交平台上神秘兮兮地表示,这周要端出一批分量堪比 DevDay 的重磅更新。奥特曼随即顺水推舟转发,并抛出了经典的谜语人式预告。根据部分测试用户反映,自己的日常请求似乎已经被悄悄分流到了 GPT-6 Sol。X 用户 Kiran Jd 昨天也晒出了详细体验:新模型的普通模式速度至少提升了 50%,token 的响应时间改善了约 67%;他让两个任务线程连续跑了两个多小时,最后只花掉了大概 3% 的周额度。用 Kiran Jd 的话来说,新模型更像是一款「更便宜的 Astra」。各显神通的网友们,也找到了一些关于鉴定新模型的蛛丝马迹。有网友尝试在不联网、不调用记忆的情况下,让模型回答竞品 Claude Opus 4.7 的发布时间,觉得只要能准确报出新事件,就证明后台换了更新的知识底座;还有网友试图通过抓包看内部的「juice」数值来区分版本。除了模型本身的传闻,OpenAI 联合创始人布罗克曼最近也吊足了胃口。他透露 OpenAI 在「另一个千禧年数学难题」上取得了显著进展。而根据之前流出的网传消息,这次的突破方向几乎被锁定在了代数几何皇冠上的明珠——霍奇猜想(Hodge Conjecture)。作为代数几何领域最著名的开放问题之一,霍奇猜想试图解答一个非常抽象的问题:那些通过拓扑和微积分分析观察到的某些几何结构,究竟能否全部对应到由代数方程定义出来的几何对象上?据网友 Leo 爆料, OpenAI 或 Anthropic 还同样在集中重兵,逼近另一道千禧难题——BSD 猜想(Birch and Swinnerton-Dyer 猜想)。Claude Opus 5.2 被曝内测,AI 开始主动检查自己的工作最近几天,几位 Claude Code 的重度用户表示自己疑似内测了未公开的 Opus 5.2,测试场景覆盖了写代码、操纵浏览器、调用插件和多 Agent 协同。用户 Chetaslua 提到,界面上写的虽然还是 Opus 5,但后台可能已经切成了新版本。在他放出的案例里,模型跑完用户交代的任务后并没有直接歇工,而是主动检查并优化了一遍产出结果。另一位用户 Gegam 连续测了两天,发现这版模型处理残缺信息的能力明显变强,不需要用户来回确认细节。在 8 个复杂测试任务里,模型不仅一路推进到底,收尾时还会自我复核。在调用能力方面,他观察到模型不会一股脑把 Skills、MCP 和插件全塞进上下文,而是按需索取,跑完大量重活后,会话只消耗了约 60% 的上下文。更戏剧化的是,在多 Agent 协作测试里,一个疑似 Opus 5.2 的子 Agent 甚至挑出了另一个模型在任务分配上的毛病,并要求重新分工。据此,Gegam 认为它的能力已经够到了 Astra 和 Fable 的水平。上下滑动内容在视觉生成上也有类似的反馈。用户 SuSu 酥酥用一张「戴头盔的鹈鹕骑自行车」的 2D 线稿做测试,模型不仅把它扩充成包含了道路、灯塔和围巾的完整 3D 场景,还在初稿后主动进行了多轮细化。另一位用户 Conor Dart 用一个耗时 51 分钟的项目测试后,也认为该模型在单次成功率和画质上提升明显。还有网友就在 Microsoft Foundry 中翻出了疑似 claude-opus-5-2 的模型标识,暗示 Anthropic 已经在云平台侧做准备。如果不出意外,我们在本周就能见到这两款新模型登场。至于 Codex 会不会顺手再重置一次额度,就看 Claude Opus 5.2 给不给力了。回过头看,上周末那份言之凿凿的减速倡议,反倒更像是一场各怀心思的心理战:人人都希望对手先踩刹车,好让自己在弯道上多超半个身位。

 
 
更多>同类内容
全站最新
热门内容