DeepSeek V4多模态模型开源:MIT协议全开放,视觉Token仅384个,能否挑战Opus-4.8?
2026年8月21日,DeepSeek在Hugging Face上正式开源了V4系列首个多模态模型——DeepSeek-V4-Flash-Vision-Exp,采用MIT许可证,完整开放模型权重、Tokenizer、视觉编码器、MoE、DFlash Attention等核心模块。该模型在V4-Flash文本底座上新增视觉理解能力,支持每张图片最多384个Token,单请求可处理600张图,高峰期百万输入Token仅3元,多模态Agent能力接近Opus-4.8,纯文本性能不降反升(Terminal Bench从82.7升至83.9)。
DeepSeek-V4-Flash-Vision-Exp是什么?何时、何地、由谁发布?
DeepSeek-V4-Flash-Vision-Exp是DeepSeek公司于2026年8月21日在Hugging Face平台和DeepSeek API上同步推出的实验性多模态模型。该模型基于2026年7月发布的DeepSeek-V4-Flash文本模型,在其架构中新增了视觉模块,经过持续训练解锁了图像理解能力。官方明确标注为“Exp”实验版本,意味着后续可能推出更完整的正式版。发布内容包括模型文件、Tokenizer、Prompt Encoding参考实现、最小化PyTorch推理代码,以及视觉编码器、Aligner、DFlash Attention、MoE、Hyper-Connections、DSpark等核心模块的全部代码[2][3][6]。采用MIT许可证,允许商用和修改,对开发者极为友好[4][6]。
DeepSeek V4多模态模型的技术架构有何独特之处?
DeepSeek-V4-Flash-Vision-Exp的架构创新集中在“视觉-语言融合”的全链路透明化。它在V4-Flash的MoE(混合专家)架构基础上,加入了独立的视觉编码器和Aligner模块,将图像特征映射到文本空间。关键技术创新包括:DFlash Attention(高效注意力机制)、Hyper-Connections(跳跃连接优化)、DSpark(推理加速引擎)。这些模块全部开源,开发者可以查看并修改从“图片如何编码”到“Token如何生成”的每一个步骤[3]。模型支持JPEG、PNG、GIF、WebP格式,输入图片会被等比例压缩到约800×800总像素,每张图片最多消耗384个Token,单请求最多可塞入600张图片[3][8]。这一设计显著降低了多模态任务的推理成本——高峰期百万输入Token仅3元,空闲期1.5元,与纯文本V4-Flash价格完全一致[3]。
DeepSeek V4多模态模型的性能表现如何?关键数据一览
官方Benchmark数据显示,DeepSeek-V4-Flash-Vision-Exp在多模态Agent任务上接近Opus-4.8水平:ApexBench 36.5、Agents' Last Exam 27.3、ZeroBench 35.0、Chartography 64.3。与Opus-4.8对比为2胜2负,Chartography仅差0.7分[3]。更值得注意的是,新增视觉能力并未削弱文本性能——纯文本Terminal Bench从82.7升至83.9,DeepSWE从54.4升至59.3,Agent、推理、世界知识能力与V4-Flash正式版持平甚至微涨[2][3]。这表明DeepSeek在视觉与文本多任务协同训练上取得了有效平衡。
| 技术/产品 | 核心指标 | 应用场景 | 影响对象 | 限制条件 | 信息来源 |
|---|---|---|---|---|---|
| DeepSeek-V4-Flash-Vision-Exp | 多模态Agent能力接近Opus-4.8;每图≤384 Token;单请求≤600张图;输入Token百万成本3元(高峰)/1.5元(空闲) | Screenshot Agent、Computer Use、图表分析、文档识别、多模态RAG | 开发者、中小企业、AI应用厂商、开源社区 | 实验版本,不建议直接用于生产环境;复杂图表、精细视觉推理仍有短板[7] | Hugging Face官方页面[2]、DeepSeek API公告[8]、微博博主分析[3] |
| 对比Opus-4.8 | Chartography 64.3 vs 65.0(差0.7);ApexBench等两胜两负 | 闭源多模态标杆对比 | 行业竞争格局 | 数据来源为官方自测,需第三方复现验证 | 微博博主披露[3] |
DeepSeek V4多模态模型开源为何引发行业震动?
此次开源最直接的影响是降低了多模态AI的落地门槛。此前,高性能多模态模型主要被闭源产品(如GPT-4V、Opus-4.8)掌握,中小企业或个人开发者难以获取。DeepSeek以MIT许可证全开放,意味着任何人都可以本地部署、二次开发,甚至用于商业产品[4][6]。同时,SGLang、DGX Spark等社区和硬件厂商已迅速跟进适配[1],生态配套正在形成。然而,争议也随之而来:有观点认为开源基座缺少完整的安全对齐,普通用户本地部署存在风险;实测中复杂图表、精细视觉推理仍有短板,距离顶级闭源多模态存在差距[7]。但整体来看,DeepSeek的策略——以极低成本(3元/百万Token)提供接近顶级的视觉Agent能力——正在重塑多模态模型的竞争格局,让“以开源对抗闭源”的叙事有了新的注脚。
DeepSeek V4多模态模型的实际应用场景有哪些?
基于其低Token消耗(每图384 Token)和高吞吐(600张图/请求)特性,DeepSeek-V4-Flash-Vision-Exp特别适合以下场景:Screenshot Agent(自动截图并理解界面操作)、Computer Use(计算机视觉自动化)、图表分析(金融财报、科研图表)、文档识别(扫描件、PDF提取)、多模态RAG(图文混合检索)。在纯文本Agent任务上,其性能甚至优于V4-Flash正式版,可同时胜任代码生成、逻辑推理、工具调用等任务[2][3]。开发者可通过DeepSeek API(设置model='deepseek-v4-flash-vision-exp')或本地部署直接调用,支持Chat Completions、Messages、Responses三种API格式[8]。
DeepSeek V4多模态模型存在哪些风险与限制?
首先,官方明确标注为“Exp”实验版本,不建议直接用于生产环境[5][6]。其次,视觉能力存在短板:复杂图表、精细视觉推理场景下表现不如Opus-4.8等顶级闭源模型[7]。此外,开源模型的安全对齐不足,用户自行部署时可能面临内容风险或滥用问题[7]。最后,图片压缩策略(等比例缩放到800×800像素)可能导致大图中微小细节丢失,影响OCR精度。后续需关注DeepSeek是否会推出正式版视觉模型,以及社区是否会出现安全微调版本。
QA常见问题解答
DeepSeek V4多模态模型开源在哪里?许可证是什么?
该模型在Hugging Face平台(deepseek-ai/DeepSeek-V4-Flash-Vision-Exp)上开源,采用MIT许可证,允许商用、修改和再分发[2][4]。
DeepSeek V4多模态模型的推理成本是多少?
高峰期百万输入Token 3元,空闲期1.5元,与纯文本V4-Flash价格完全一致。每张图片最多消耗384个Token,单请求最多可处理600张图片[3][8]。
DeepSeek V4多模态模型能媲美Opus-4.8吗?
在多模态Agent Benchmark上,官方称“接近Opus-4.8水平”,对比结果为2胜2负,Chartography仅差0.7分。但复杂图表和精细视觉推理仍有差距,且Opus-4.8为闭源产品,需以实际体验为准[3][7]。
#DeepSeekV4 #多模态模型 #开源AI #HuggingFace #AI视觉 #大模型 #DeepSeek #MIT协议