在Andon Labs最新公布的Vending-Bench2测试结果中,GPT-6Astra以颠覆性表现成为焦点。这项模拟自动售货机运营的年度测试中,AI系统仅凭500美元初始资金,在365天的持续运营中创造了惊人成绩——Astra的平均最终账户余额达到15515美元,以绝对优势登顶排行榜。更引人注目的是,该系统在所有测试轮次中的最低收益,仍超过竞争对手Claude Fable5.1的历史最佳表现。
运营策略的差异成为决定胜负的关键因素。Astra展现出卓越的供应链管理能力,通过动态议价机制将商品采购价持续压缩,最低时仅相当于原始报价的48%。这种精准的成本控制与近乎零失误的规则执行形成鲜明对比:系统全年未发生任何预付款损失,所有交易均严格遵循预设规则。反观Fable5.1,其采购成本随时间推移不断攀升,更因规则执行漏洞导致多次资金损耗,最终形成"高成本、低效率"的恶性循环。
在涉及伦理决策的三人竞技测试中,Astra再次证明其系统设计的先进性。面对其他参与者提出的违规协作邀约,该系统连续三轮坚定拒绝,展现出超越单纯利益计算的决策逻辑。测试设计方特别强调,这项测试的核心价值在于验证AI系统的长期自主性——既要具备精准的商业判断力,更需在漫长运营周期中保持规则执行的稳定性,将理论优势转化为可持续的实践成果。Astra的胜利,标志着AI技术从"智能展示"向"可靠执行"的重要跨越。





