新一代开源旗舰模型Step5Preview近日由阶跃公司正式全量发布,其核心定位是成为真实世界中Agentic任务的主力解决方案。该模型直面AI领域长期存在的“能力-效率-成本”三角困境,通过架构创新实现帕累托边界突破——在保持6000亿参数总规模的同时,每次推理仅激活270亿参数,配合原生支持的百万级token上下文窗口,成功在性能与资源消耗间取得平衡。据Artificial Analysis最新评测显示,该模型在Intelligence Index基准测试中取得44分,跻身全球开源模型前三,单任务成本仅为Claude Opus5的八分之一。
在技术架构层面,稀疏MoE(专家混合)设计成为关键突破口。这种动态参数激活机制使模型能够根据任务需求智能调配计算资源,在处理文本与视觉双模态输入时展现显著优势。阶跃团队自建的StepCodeBench编程基准测试显示,该模型在覆盖33种编程语言的553个真实代码仓库场景中,成功实现跨领域代码生成、调试与优化,其稳定性与任务完成率达到行业领先水平。一个典型案例中,模型通过解析ESP32开发文档,自主完成蓝牙键盘的硬件改造与软件适配,整个过程持续三小时,涉及串口通信、摄像头调用、错误诊断等复杂操作。
长周期任务处理能力验证了模型的工程化潜力。在持续24小时的MLA GPU内核优化实验中,Step5Preview通过自主代码迭代与性能测试,将峰值算力从初始版本提升至508TFLOPS,超越Claude Opus5的493TFLOPS纪录。另一项模型后训练实验中,该模型在相同时间内将Qwen3-30B-A3B基础模型在AIME24数学基准上的准确率从53.3%提升至60%,且标注数据消耗量显著低于对比模型。这些测试均采用单张H100显卡完成,凸显其资源利用效率。
跨模态交互能力拓展了应用边界。在前端开发场景中,模型不仅能生成交互式网页代码,还可调用Blender创建3D资产并通过Three.js实现动态渲染。历史文献数字化项目则展示其信息抽取与产品化能力——通过解析1922年《广九铁路旅行指南》,模型自动构建出包含费用计算、路线模拟的交互式应用,使百年前的交通数据重获新生。金融领域专项测试进一步证实其综合实力,在覆盖公司估值、深度研究等场景的FinStepBench评测中,模型在220道专业题目上达到专家级表现,外部FrontierFinance基准测试结果同样领先同类开源模型。
阶跃公司透露,完整模型权重将于10月15日对外开放,开发者可基于该架构构建各类智能体应用。从Step3.5Flash到Step5Preview的技术演进路线显示,该公司正探索超越传统Scaling Law的新路径——通过架构优化而非单纯堆砌算力,实现AI模型在真实业务场景中的高效落地。这种发展策略已获得市场初步验证,其前代模型在代码生成、多模态理解等领域的表现,为本次技术突破奠定了基础。






