开源项目CodexRadar的发起人Lambda最近在社区里发起了一场别开生面的“鹈鹕杯”比赛。自GPT-6 Astra发布以来,他每天都会收到大量用户发送的鹈鹕骑单车视频,这些视频被用来测试新模型的稳定性。比赛要求参赛者使用模型生成“画一只骑自行车的鹈鹕”的作品,并提交到社区进行展示。出乎意料的是,比赛在深夜上线后,短时间内就收到了近百份投稿,次日上午比赛页面的访问量更是突破了7000次。
用鹈鹕骑自行车来测试模型能力已经成为一种流行方式。这一任务看似简单,却能直观反映模型的稳定性,比如鹈鹕的腿和踏板是否对位、车轮是否随动作转动、画面是否连贯等。同时,这个任务也足够复杂,涉及动作理解、时序一致性、空间关系等多方面能力,对进入Agent阶段的模型来说,是检验其综合能力的理想方式。GPT-6 Astra上线后,因其“智商”不稳定,导致鹈鹕测试更加引人关注,用户通过观察鹈鹕的表现就能直观感受到模型能力的变化。
“鹈鹕杯”比赛分为Classic和Open两个赛道。Classic赛道使用统一提示词,要求生成SVG格式的2D动画。在模型状态正常时,生成的鹈鹕画面质量和结构通常保持一致。但如果用户发现鹈鹕出现频繁踩空、车轮错乱等问题,就会引发对模型“降智”的讨论。虽然这种方法不够科学严谨,但能快速反映模型在短时间内的表现变化,用户无需理解复杂指标,通过观察鹈鹕就能发现差异。Open赛道则允许参赛者自由发挥,更注重测试模型的开放任务处理能力。
其中一个Open赛道的作品令人印象深刻,它是一部长达30分钟的“一镜到底”骑行故事。整个作品使用SVG元素构成所有场景,Javascript仅负责计算位置和时间,没有使用任何外部资源。镜头可以连续移动,所有场景存在于同一个矢量世界中。作品前20分钟穿越30个城市和自然景点,后10分钟进入宇宙,从火星到黑洞再返回地球。作者还特别注明了现实与虚构的内容,展示了GPT-6 Astra在理解开放目标、完成复杂任务方面的强大能力。
模型能力波动已成为重度用户的共同痛点。CodexRadar最初是为了解决发起人监测模型状态的需求,后来发展成社区开源项目,吸引了超过500名志愿者参与,累计贡献达百亿级Token。用户对模型能力波动的敏感,源于这种波动会直接影响自动化任务的处理。一位大模型算法工程师表示,模型降智会导致自动化任务积累,错误可能通过系统传播,最终影响整个工作流程。进入Agent阶段后,模型调用往往是任务链的一环,任何偏差都可能导致后续步骤出错。
用户感知的“降智”现象,实际上可能由多重因素导致。从工程角度看,最终效果受底层模型、推理强度、上下文管理等多层因素影响。例如,Coding Agent可能减少测试轮次或并行探索,导致用户感觉模型变笨。这也是CodexRadar出现的原因,它能帮助用户监测模型的实时状态,而不仅仅是发布时的峰值能力。对于实际工作中的用户来说,模型的实时状态至关重要。
目前没有公开证据表明OpenAI在主动降低Astra的模型能力,但上线后的供给压力已十分明显。9月10日,OpenAI暂停了每月200美元的Pro 20x套餐新订阅和升级,这个套餐提供约Plus 20倍的使用额度,是重度用户的重要选择。Astra的API价格不菲,其最受欢迎的能力又非常消耗算力,如Computer Use和多Agent工作流。当大量用户同时使用这些功能时,供给压力远超以往。
这轮“降智”讨论背后,实际反映了模型质量波动、限流、资源调度等多重问题。社区有人认为,问题与Astra需求过强、Pro 20x用户激增和算力供给紧张有关。OpenAI暂停新增订阅,至少证明前沿模型出现了真实的供需矛盾。过去大模型竞争集中在训练更强模型,现在则延伸到能否稳定供应智能给大量用户。
用户对模型稳定性的关注,推动了大模型领域对“智力SLA”的需求。就像云服务的服务等级协议约定可用率和延迟等指标,模型也需要保证在不同时间段的任务成功率和长任务稳定性。模型越强,这个问题越突出。未来模型公司的竞争,将不仅在于峰值能力,还在于能否长期、稳定、规模化地供应高水平智能,这已成为AI Agent走向工作场景的关键因素。





