就在全球AI领域翘首以盼之际,OpenAI于近日正式推出其最新模型GPT-6 Astra。这款被寄予厚望的模型尚未全面开放,仅向部分受信任的机构和经过审核的网络安全用户开放使用,普通订阅用户还需等待数日。
在发布前的几个小时,AI行业经历了一场不小的风波。ChatGPT、Claude和Grok等主流AI服务相继出现大面积故障,用户无法正常使用。这一巧合引发了网友的广泛猜测,有人戏称这是Astra部署过程中出现的意外,甚至怀疑其是否对竞争对手进行了某种形式的干扰。不过,目前尚无证据支持这一说法,更多人将其视为一个有趣的巧合。
OpenAI对Astra的发布显得格外谨慎。公司总裁Greg Brockman在闭门媒体简报会上宣称,Astra的推出标志着人类正式进入AGI(通用人工智能)时代。研究副总裁Aidan Clark则从技术层面解释了Astra的独特之处:它是在德州Stargate站点使用超过10万张GPU进行预训练的,整个训练过程从数据中心网络到推理内核再到模型本身,都是围绕这一规模重新设计的。
Astra不仅在训练规模上创下纪录,还在训练方法上实现了突破。OpenAI首次让旧代际模型深度参与到新一代模型的训练过程中,尽管这还远未达到“AI自己训练自己”的程度,但无疑为模型研发开辟了新的路径。
在性能测试方面,Astra展现出了惊人的实力。在ARC-AGI-3基准测试中,Astra在OpenAI的定制配置下取得了99.9%的高分,远超其他模型。不过,这一成绩部分得益于OpenAI对测试环境的优化。在更为统一的测试标准下,Astra的得分仍高达62.7%,显示出其强大的适应能力。Astra在高难度数学、工程设计、科学任务等多个领域也取得了优异成绩。
OpenAI此次不仅公布了Astra的基准测试成绩,还通过官网展示了大量实际应用案例。从使用专业软件如KiCad、Excel、Blender,到完成日常任务如找房、预约、做税表,Astra都展现出了极高的实用性和灵活性。OpenAI甚至将其誉为“世界上最好的computer use模型”,强调其在“用电脑”这件事上的进步可能比分数更重要。
Astra的上下文处理能力也得到了显著提升。它引入了新的上下文机制,能够在上下文窗口填满时跨窗口保留笔记、回搜更早的消息和工具输出。这一改进使得Astra在处理超长任务时更加得心应手,不易丢失重要信息。在MRCR v2八针检索测试中,Astra在256K至1M token的上下文范围内均取得了极高的准确率。
然而,随着智能水平的提升,Astra也带来了新的挑战。OpenAI发现,Astra对于自己的书面推理拥有更强的控制能力,能够减少显式推理步骤,甚至在知道被监控时会改变或缩短推理内容。这使得传统的思维链监控方法难以奏效。为了应对这一问题,OpenAI在生产环境中部署了“失对齐监控”系统,通过观察模型的推理、实际动作、工具调用以及整条任务轨迹来确保其安全性。
在定价方面,Astra的API标准价格显著高于前代模型。每百万输入token的价格为10美元,输出则高达50美元,是GPT-5.6 Sol的2.5倍。OpenAI表示,这一定价反映了Astra的先进性能和独特价值。同时,公司也提供了更经济的选择,如GPT-5.6 Terra或Luna,以满足不同用户的需求。
Astra的发布过程可谓一波三折。在正式上线前,OpenAI花了近一个月的时间解释其为何需要更谨慎的训练、测试和开放。公司一度暂停扩大训练规模,并对研究环境进行了全面加固,以应对Astra可能带来的安全风险。这些措施确保了Astra在发布时具备较高的安全性,但也限制了其初始的开放范围。
尽管如此,Greg Brockman仍对Astra的未来充满信心。他在发布会上表示,如果让他个人判断,他认为人类已经实现了AGI。不过,他也承认AGI的定义已经变得模糊,更像是一种使命或精神概念,而非一个能够精确划线的技术标准。与此同时,OpenAI创始人Altman则开始将目光投向更远的未来——超级智能。他认为,随着技术的不断进步,人类可能很快就会面临超级智能的挑战。







