科技·商业·财经

小米MiMo-V2.6强化学习训练大揭秘:挑战规模边界,押注Agent时代

   时间:2026-09-17 14:30 作者:沈瑾瑜

小米MiMo团队负责人罗福莉在社交平台宣布,团队正在推进的MiMo-V2.6模型已进入强化学习训练关键阶段。此次训练聚焦于突破传统强化学习的规模限制,通过扩大计算资源、训练环境复杂度及奖励评估机制三个维度,探索模型在复杂任务场景中的能力边界。据透露,团队将在未来数周内逐步公开技术细节,同时首次对外展示实时训练监控面板。

训练页面数据显示,MiMo-V2.6包含Pro和Flash两个版本,当前分别处于第12步和第17步训练阶段。Pro版本累计消耗251亿Token,训练成本约80.6万美元;Flash版本则消耗405亿Token,成本约35.4万美元。两个版本总成本已超116万美元,平均每小时计算成本达20.72万元人民币。尽管成本高昂,但团队强调此次公开的核心在于展示模型能力提升过程,而非单纯聚焦资源投入。

在计算规模扩展方面,团队将单个训练步的Token量提升至20亿级别,采用1568个提示词与16次并行推演的异步训练模式。这种设计使模型在面对任务时能同时生成多种解决方案,通过奖励反馈筛选最优路径。例如在编程任务中,模型可自主尝试不同算法,根据执行效率优化代码结构。罗福莉指出,这种大规模探索能力对Agent模型至关重要,尤其在需要多步骤决策的复杂场景中,模型需通过持续试错形成有效策略。

训练环境复杂度提升体现在多任务混合训练机制上。监控面板显示,当前训练任务覆盖视觉处理、代码生成、通用推理及对话交互四大领域,涉及GTA5游戏画面解析、代码库修改等20余种数据集。这种设计迫使模型在不同场景间快速切换,例如在完成视觉识别后立即转向代码调试任务。团队认为,单一能力优化已无法满足Agent时代需求,模型需具备跨领域任务处理能力才能适应真实应用场景。

奖励评估机制的革新是本次训练的另一重点。团队引入智能体组内贡献归因系统,结合测试用例与评分细则构建精细化反馈机制。在复杂任务中,模型需完成信息检索、方案制定、工具调用等多步骤操作,评估系统会针对每个环节的贡献度分配奖励值。数据显示,Pro版本的平均奖励值已从0.55提升至0.582,Flash版本从0.52升至0.570,表明模型的任务执行策略正在持续优化。

训练面板还透露了模型能力演进的关键指标。在软件工程能力测试中,Pro版本DeepSWE基准得分达63.72,Flash版本为60.77,显示模型在代码理解与复杂开发任务处理方面取得进展。更引人注目的是上下文记忆能力的突破,Pro版本平均上下文长度已接近10万Token,这意味着模型可持续追踪长达数万字的操作记录、工具反馈及任务状态,为完成跨时段复杂任务奠定基础。

此次公开训练过程在行业引发关注。与传统大模型发布时仅展示最终成绩不同,小米选择将训练细节透明化,包括实时计算成本、任务组成变化及能力提升曲线。目前两个版本的训练仍在持续,外界可通过监控面板观察计算投入与能力提升的关联性,以及环境复杂度对模型适应能力的影响。这种开放姿态或为AI研发领域提供新的观察视角,关于强化学习规模边界的探讨也将随着训练进展获得更多实证依据。

 
 
更多>同类内容
全站最新
热门内容