科技·商业·财经

每小时3万美元“烧”向何方?罗福莉直播揭秘小米MiMo训练投入与回报

   时间:2026-09-17 14:31 作者:顾青青

小米近期在人工智能领域迈出重要一步,其研发团队公开了最新大模型MiMo-V2.6的训练细节,引发行业高度关注。项目负责人罗福莉通过社交媒体平台,首次向外界展示了这款模型在强化学习扩展性上的突破性尝试,同时公开了训练过程中的实时数据看板,涵盖训练步数、Token消耗、任务通过率等核心指标。

据公开信息显示,此次训练采用双模型并行策略,MiMo-V2.6-Pro与MiMo-V2.6-Flash同步推进。训练系统每步处理约20亿Token,通过1568个提示词与每个提示16次尝试的配置,实现全异步训练模式。这种设计使得单批次训练可生成25088条轨迹数据,但同时也对系统稳定性提出极高要求——团队需持续监控环境运行数量、基础设施故障导致的样本损失,以及样本生成与模型版本更新的同步性。

技术架构层面,研发团队重点优化了三个方向:计算规模、任务环境适配和评分器效率。混合滑动窗口注意力机制的应用,在提升长上下文推理能力的同时,兼顾了现有硬件基础设施的兼容性。多token预测技术则通过减少GPU等待时间,显著提高了强化学习效率。后训练阶段采用的多教师在线策略蒸馏方法,成功将不同领域模型的能力整合到单一模型中。

训练成本数据首次公开引发讨论。按官方设定的费用速率计算,双模型训练每小时消耗约3.08万美元,累计展示费用已达115万美元。不过该数字仅包含直接计算成本,未涵盖硬件折旧、能源消耗及人力投入等隐性支出。研发团队坦言,实际训练中存在大量无效样本生成——当环境启动失败或评分标准存在漏洞时,算力投入可能无法转化为有效学习成果。

实时数据看板揭示了训练过程的波动性。在DeepSWE v1.1代码评测中,Flash模型成绩从初始的48.67分逐步提升至第12步的60.77分,但期间出现明显起伏,第11步曾骤降至54.13分。Pro模型虽保持更高得分区间,同样经历多次分数回落。这种非线性增长特征,反映出大规模强化学习训练中投入与产出并非简单正相关。

行业专家指出,小米此次公开训练细节具有双重意义。技术层面,全流程数据透明化展示了多任务强化学习的复杂性,特别是任务执行框架与计算资源的协同优化挑战。商业层面,Pro与Flash模型的差异化训练策略,暗示了未来产品矩阵的分层布局——前者追求极致性能,后者侧重成本控制,这种路线选择或将影响后续API定价策略。

研发团队特别强调系统稳定性的关键作用。公开记录显示,Pro模型训练曾因单个节点的显存问题导致整体重启,这类基础设施故障直接造成样本损失。环境运行数量与任务通过率的动态变化,进一步证明大规模训练既是算法挑战,也是工程难题。如何平衡计算规模扩张与系统可靠性,将成为团队下一阶段的研究重点。

随着训练持续推进,行业观察者开始关注模型能力的实际转化效率。当前公布的数据仅反映训练阶段表现,最终商业价值需通过模型上线后的任务完成质量来验证。特别是在代码生成、工具调用等复杂场景中,模型能否在控制成本的同时保持稳定性,将决定这项技术投入能否转化为市场竞争力。

 
 
更多>同类内容
全站最新
热门内容