新浪AI前沿速递
2026-09-01 06:47来自 科技看点

DeepSeekV4多模态模型开源后如何下载使用?

  2026年8月31日,DeepSeek在Hugging Face正式开源了V4家族首款多模态模型DeepSeek-V4-Flash-Vision-Exp,采用MIT许可协议,模型权重与推理代码全部开放,标志着DeepSeek真正补齐了“视觉”这一关键拼图。

  一、这是怎样一款多模态模型

  定位与架构:DeepSeek-V4-Flash-Vision-Exp是V4家族首个实验性多模态模型,基于V4-Flash架构加入视觉模块并持续训练,解锁了视觉理解能力。总参数约305B,采用MoE架构,每token激活仅13B参数。

  能力表现:在ApexBench上得分36.5,比纯文本版Flash的26.2分大幅跃升;ZeroBench得分35.0,反超Opus-4.8的34分,多模态Agent能力已接近或超越国际顶尖闭源模型。

  文本能力保持:加入视觉模块并未牺牲原有优势,Terminal Bench 2.1达83.9,DeepSWE从54.4涨至59.3,纯文本推理、Agent与世界知识能力完整保留。

  二、开源内容与下载方式

  开源范围:不只开放模型权重,还包括Tokenizer、Prompt Encoding参考实现,以及覆盖视觉编码器、Aligner、DFlash Attention、MoE、Hyper-Connections、DSpark等核心模块的最小化PyTorch推理代码。

  下载渠道:模型已上架Hugging Face平台,搜索“deepseek-ai/DeepSeek-V4-Flash-Vision-Exp”即可找到。权重为safetensors格式,支持8-bit精度(FP8),方便直接下载部署。

  本地部署门槛:128G内存即可运行,对于有本地部署需求的开发者来说相对友好。官方同步适配了DeepSeek Harness智能体框架,实现从视觉输入到工具调用的全链路闭环。

  三、开源协议与使用要点

  MIT License:采用极其宽松的MIT协议,允许自由商用、修改和二次开发,无需担心授权壁垒。中小团队可直接下载到本地,用自己的数据微调,接入自有产品,不再受API调用额度限制。

  支持图片格式:该模型原生支持JPEG、PNG、GIF、WebP格式图片输入,能描述图片、识别截图文字、分析图表。图片最大token上限为384个,图片进入前会进行缩放处理。

  注意事项:官方明确标注为“Exp”实验版本。建议开发者部署后结合真实业务场景多做实测验证,尤其是复杂图文匹配与长时运行稳定性,确认符合需求后再用于线上业务。