人工智能领域再掀波澜,小米旗下MiMo大模型团队负责人罗福莉通过社交平台X向公众展示了最新一代大模型的训练进程。这位曾任职于DeepSeek的95后科学家,在沉寂半年后以直播形式揭开小米大模型研发的神秘面纱,标志着其正式回归技术竞争的核心赛道。
实时训练界面显示,当前主推的MiMo-V2.6版本正进行大规模智能体强化学习实验。研发团队在三个关键维度实现突破:通过完全异步模式将单步计算资源消耗提升至20亿token量级,具体包含1568个提示与16次rollout的组合运算;在测试框架层面构建多任务代理系统,实现单次运行中多个评估体系的同步运作;评估机制引入组内信用分配算法,结合实际测试用例与标准化奖励模型优化训练效果。相关技术细节预计在未来数周内逐步开源。
高昂的研发成本折射出头部企业间的算力军备竞赛。训练平台同时运行两个并行版本:Pro版累计训练43小时耗资89万美元,Flash版训练38小时花费39.7万美元,整体成本突破128万美元。按当前进度推算,每小时训练支出超过3万美元,这一数据直观展现了千亿参数模型在强化学习阶段对计算资源的极致需求。
团队技术积淀可追溯至今年3月,当时小米创始人雷军曾在社交媒体披露,其万亿参数模型MiMo-V2-Pro在全球权威评测Artificial Analysis中位列综合排名第八、品牌排名第五,超越xAI的Grok模型。该成果为后续技术迭代奠定基础,研发团队持续保持每月数次的版本更新频率。
作为项目核心成员,罗福莉的学术履历与产业经验备受关注。这位北京师范大学计算机本科、北京大学计算语言学硕士,曾主导阿里巴巴多语言预训练模型VECO开发,推动AliceMind项目开源。2022年转战量化投资领域后,参与构建DeepSeek-V2等核心模型,直至去年11月正式加盟小米,负责通用人工智能(AGI)从语言理解到物理世界交互的跨越式研发。其技术路径选择与团队构建思路,持续引发业界对AI落地场景的深度思考。






