深度求索公司近日宣布,其最新研发的多模态模型DeepSeek-V4-Flash-Vision-Exp已在Hugging Face平台正式开源。该模型采用MIT License协议,允许开发者自由使用、修改和分发。此次开源内容涵盖模型文件、分词器、提示编码参考实现以及基于PyTorch的最小化推理实现,包含了视觉编码器、Aligner、DFlash注意力机制、MoE架构、Hyper-Connections和DSpark等核心组件。
作为DeepSeek V4系列的首个视觉模型,DeepSeek-V4-Flash-Vision-Exp原生支持图片输入功能,能够处理JPEG、PNG、GIF和WebP等多种常见图片格式。该模型不仅具备描述图片内容的能力,还能识别截图中的文字信息,并对各类图表进行专业分析。官方特别标注该版本为"Exp"实验性质,计划于2026年8月21日通过DeepSeek API平台向公众开放。
技术团队透露,新模型在保持与V4-Flash正式版相当的文本处理能力基础上,显著提升了多模态交互性能。在涉及视觉理解的Agent基准测试中,其表现较前代版本有大幅提升,多模态Agent能力已接近行业领先的Opus-4.8模型。这得益于其创新的混合专家架构(MoE)和超连接技术(Hyper-Connections),有效提升了模型对复杂场景的理解能力。
深度求索官方表示,该模型在各类Agent框架中展现出优秀的适配性,能够与多样化的工具链无缝集成,为开发者解锁更多实际应用场景。特别是在需要结合视觉与文本信息的任务中,如自动化报表生成、智能文档处理等领域,新模型表现出显著优势。目前开发团队正在持续优化模型性能,后续版本将进一步提升处理速度和准确性。
此次开源的代码库包含完整的推理实现示例,帮助开发者快速部署模型到本地环境。技术文档详细说明了各核心模块的工作原理和参数配置方法,为二次开发提供便利。随着多模态技术需求的增长,DeepSeek-V4-Flash-Vision-Exp的发布预计将推动AI在视觉-语言交互领域的应用创新。







