本周 DeepSeek 发布了 V4.1 Flash,这个大模型架构变化之大,完全可以称得上是 V5,但 DeepSeek 很低调地没有更换大版本号。Pro 系列的新品已确定为 V4.1 Pro,具体升级尚未公布;如果是 V4 到 V4.1 这样的提升幅度,V4.1 Pro 的性能上限也会很高,但考虑到此前 V4 Pro-0813 正式版不及预期,外界期待值不宜拉得太高。
DeepSeek Code 2.0 被指即将发布,主打电脑控制据爆料,后续还有一波大模型,名为 DeepSeek Code 2.0,即将在 9 月份发布,预计性能会击败 Mythos 5.1 和 GPT-6 Astra——这是当前最强大的两个前沿级大模型。
其他方面,DeepSeek Code 2.0 预计将继续保持开源开放,设计重点是 Computer Use,也就是电脑控制:让 AI 替代用户操作电脑完成大量工作,Astra 目前许多令人惊讶的表现正来自这一能力。
3 万亿参数,国内最强规模爆料称该模型拥有高达 3 万亿以上的参数量,显然这也是它提升性能的关键。作为对比,国内目前最强的是 K3 大模型的 2.8 万亿参数,千问 Qwen 3.8 Max 为 2.4 万亿参数,DeepSeek V4 Pro 为 1.6 万亿参数。
从 V4.1 Flash 换用新结构使参数量翻倍来看,Code 2.0 从当前 1.6 万亿提升到 3 万亿参数的可信度是有的——想与 Mythos 5.1 及 Astra 这样的大模型竞争,就需要这个级别的参数量,否则性能上限很难提升。
不过这一爆料的可信度尚难判断。DeepSeek 在 2023 至 2024 年曾推出过三款名字带 Code 的大模型,当时表现平平;这次若重推偏向代码 / 逻辑的 Code 大模型、作为旗舰级产品,也不失为一个方向,让 V4.1 Pro 及 Flash 面向通用 Agent 任务即可。






