月之暗面近日宣布,正式开放其最新研发的Kimi K3大模型权重及相关技术资源,并同步开源三项支撑模型训练的核心基础设施技术。这一举措旨在推动前沿人工智能技术的普及应用,为全球开发者提供更高效的模型开发工具链。

作为当前月之暗面最强大的语言模型,Kimi K3采用混合专家架构(MoE),参数规模达2.8万亿,较前代Kimi K2.5扩大近3倍。该模型突破性地整合原生视觉理解能力,支持长达100万token的上下文窗口处理。在算力优化方面,研发团队通过创新算法将规模化效率提升2.5倍,这意味着在相同算力条件下可产出更高质量的智能输出。
技术实现层面,Kimi K3采用多重创新架构:在注意力机制方面,通过3:1比例混合KDA与Gated MLA实现高效长文本建模;视觉编码器MoonViT-V2采用next-token prediction训练方式,在保持SigLIP基线效果的同时优化训练稳定性;Stable LatentMoE架构则通过动态路由机制,从896个专家模块中智能激活16个进行计算,配合SiTU-GLU与Quantile Balancing技术确保训练稳定性。后训练阶段在通用推理、智能体和编程三大领域构建百万级token的强化学习环境,并通过近20个专业评测集进行全面验证。
同步开源的三项基础设施技术构成模型训练的底层支撑:高性能通信库MoonEP专为超大规模MoE架构设计,可处理专家并行计算中的负载不均衡问题;FlashKDA作为Kimi Delta Attention的高性能算子,在英伟达H20芯片上实现1.72-2.22倍的预填充速度提升;与KVCache.ai联合开发的AgentEnv沙箱系统,通过强隔离环境支持大规模智能体训练,具备快速快照、任务分叉等分布式训练必需功能。
开发者现已可通过官方渠道获取Kimi K3模型权重及完整技术文档,相关代码库遵循开源协议开放。此次开源涵盖从模型架构到训练基础设施的全链路技术,为行业提供可复用的技术解决方案,特别适用于需要处理超长上下文或复杂多模态任务的场景。









