科技·商业·财经

OpenAI新模型GPT-6 Astra来袭:数学推理、计算机操作等多领域实现跃升

   时间:2026-09-04 14:29 作者:顾雨柔

在人工智能领域,各大科技公司正展开一场激烈的模型竞赛。近日,OpenAI推出的GPT-6 Astra引发了广泛关注,这款模型在数学推理、网络安全、计算机操作和科学研究等多个领域展现出显著优势,成为当前AI模型中的佼佼者。

根据OpenAI官方发布的技术文档,Astra整合了多年来在预训练、强化学习和对齐领域的研究成果,其核心突破集中在智能体执行能力和深度推理两大维度。在衡量自主科学研究能力的Terminal-BenchScience0.1基准测试中,Astra取得了64.6%的高分,远超Anthropic最新发布的Claude Fable5.1的52.6%,且完成同等任务的API成本低约31%。即使在更低成本设置下,Astra仍能获得61.1%的分数,成本降低约27%,而上一代GPT-5.6Sol的最佳表现仅为22.4%。在考察终端编程能力的Terminal-Bench4.0测试中,Astra同样以57.9%的得分领先于Claude Fable5.1的55.8%和GPT-5.6Sol的37.3%。

数学推理能力是Astra的一大亮点。在被称为“最难数学基准之一”的Frontier Math Tier4(v2)测试中,Astra取得了97.6%的惊人成绩,而Claude Fable5.1和Claude Fable5并列获得87.8%,上一代Opus5仅为73.2%。OpenAI透露,Astra已经帮助解决了数学领域长期存在的开放性问题,包括在素数间隔研究中取得了两个新的理论结果。在衡量模型在陌生环境中抽象推理和学习能力的ARC-AGI-3测试中,Astra获得了99.9%的接近满分成绩,而GPT-5.6Sol仅为7.8%,实现了十余倍的提升。

计算机操作与任务自动化能力的提升,让Astra具备了“替代人完成工作”的潜力。在OSWorld2.0测试中,Astra得分72.6%,高于GPT-5.6Sol的65.7%;完成单项任务的平均时间从约75分钟缩短至40分钟,效率提升近47%。这意味着AI操作电脑开始具备实际的生产效率。在考察业务流程自动化的Automation Bench测试中,Astra得分41.4%,较GPT-5.6Sol的18.1%翻倍有余,也高于Claude Fable5.1的31.4%。官方演示视频显示,Astra可以独立完成填写报税表、更新CRM系统、整理日程安排、制作财务模型、分析科研数据、搭建网站、设计PCB电路板、创建3D游戏场景等复杂工作,用户只需给出最终目标,模型会自行规划步骤、切换工具、修正错误,整个过程无需人工分步指令。

在定价方面,GPT-6 Astra的API调用价格每百万输入Token为10美元、每百万输出Token为50美元,是GPT-5.6Sol当前价格的2.5倍,与Claude Fable5.1的定价基本持平。模型支持五级推理强度调节,用户可以根据任务难度灵活权衡成本与深度。上下文窗口方面,Astra总上下文长度为105万Token,最大输出长度为12.8万Token,知识截止时间为2026年4月30日,略晚于Claude Fable5.1的2026年6月。支持的功能包括流式输出、结构化输出、函数调用、文件搜索、网页浏览和提示缓存等。

OpenAI强调,Astra是公司“有史以来对齐程度最高的模型”,在理解用户意图和行为边界方面有实质性改进。为此,OpenAI专门设计了一套评估体系,测试模型在面对困难或不可能任务时是否会超出授权范围。结果显示,未加生产安全护栏的GPT-5.6Sol有48%的概率会越权操作,而GPT-6 Astra这一比例为0%。这一改进对于企业级应用至关重要,当模型被授权访问内部系统和数据时,能否严格守住权限边界直接关系到企业的信息安全。OpenAI表示,Astra在网络安全领域的能力提升伴随着严格的护栏设计,模型可以用于发现软件漏洞,但不能用于开发漏洞利用程序。

近期,除了OpenAI,Anthropic发布了Claude Fable5.1,谷歌推出了Gemini 3.8 Flash,Muse发布了Spark 1.3,头部厂商密集发布新品,迭代速度持续加快。从各维度对比来看,Astra并非全面碾压对手,其优势集中在数学、网络安全、计算机操作和自动化等特定领域,而在综合知识、创意写作等维度并未拉开差距。可以看出,没有任何一家厂商能够在所有维度保持绝对领先,各家在不同赛道各有千秋,竞争正在向精细化、场景化方向深化。

 
 
更多>同类内容
全站最新
热门内容