DeepSeek-V4.1-Flash近日上线千问AI平台,API服务与Token Plan同步开放。开发者可通过标准API接入业务系统,也能在Qoder、千问APP、Codex等工具中直接调用Token Plan,用于代码、文档、视觉理解与智能体任务。
据平台公告,该模型为DeepSeek新一代轻量旗舰,总参数552B的MoE架构,采用Causal-Encoder-Decoder非对称结构,输入激活约8B、输出激活约16B;原生支持文本与图像理解,最长上下文100万token,平台最大输出约393K。官方称其在多项Agent与代码基准上较同系前代提升,并以更低激活参数换取高吞吐、低延迟。
成本侧是本次上架重点。新一代缓存压缩使KV Cache对HBM需求降至上一代1/4、对SSD存储需求降至1/8,长上下文与多轮工具调用更省资源。千问页面给出分时价:闲时输入1元/百万token、输出4元/百万token;忙时输入2元、输出8元。速率限制RPM15K、TPM1M,功能覆盖前缀补全、函数调用、缓存、结构化输出、批量任务与联网搜索。
部署方面,阿里云百炼联合vLLM开源社区完成适配,中国站、国际站均可调用,覆盖北京、新加坡及Global美国、德国、日本、香港等地域。百炼文档显示,该模型支持多轮对话、函数调用、联网搜索、上下文缓存与结构化输出,max_tokens上限约393216,适合企业把长文档解析、客服知识库、代码仓库问答和多模态审单等工作迁移到同一接口。
业内认为,V4.1-Flash把“大参数、小激活、强缓存”的组合放到千问生态,会降低长上下文Agent的试错成本;对中小团队而言,闲时低价加Token Plan订阅,可更灵活地做批量推理与原型验证。





