DeepSeekV4多模态模型开源,免费商用颠覆AI生态
8月31日,DeepSeek在Hugging Face正式开源V4家族首款多模态模型DeepSeek-V4-Flash-Vision-Exp,采用MIT协议全面开放权重与核心代码,开发者可自由商用、修改与本地部署。
一、开源概况与模型定位
模型名称:DeepSeek-V4-Flash-Vision-Exp,是V4系列首款原生支持图片输入的视觉模型,支持JPEG、PNG、GIF、WebP格式,可在Chat Completions、Responses等多种API格式下调用。
开源协议:采用MIT License,允许商用、本地部署与二次开发,大幅降低开发者使用门槛。
核心定位:并非简单"看图聊天",而是面向多模态Agent场景,让智能体可直接读取网页截图、软件界面和图表并执行任务。
二、核心能力与性能表现
多模态Agent跃升:在需要视觉理解的Agent基准测试中大幅提升,ApexBench得分36.5,ZeroBench得分35.0,多模态Agent能力已接近或超越Opus-4.8。
纯文本能力持平:加入视觉模块未牺牲原有优势,Terminal Bench达83.9,DeepSWE达59.3,文本推理与Agent能力完整保留。
工程能力突出:图为生成商业PPT、前端Demo等场景提供视觉理解支撑,可输出带动态特效的完整页面。
三、开源内容与生态支持
全链路代码公开:不仅开放模型权重,还公开Tokenizer、Prompt Encoding参考实现及最小化PyTorch推理代码。
核心模块覆盖:开源内容涵盖视觉编码器、Aligner、DFlash Attention、MoE、Hyper-Connections与DSpark等底层核心模块。
生态快速跟进:SGLang等推理框架已开始适配支持,DGX Spark版本的部署方案也在同步更新中。