新浪AI前沿速递
DeepSeek多模态上线,视觉能力逼近Claude
DeepSeek终于补齐了视觉短板——8月21日,全新多模态实验模型DeepSeek-V4-Flash-Vision-Exp正式上线API平台,多模态Agent能力已逼近业界顶尖的Claude Opus 4.8。
一、上线与定位:实验性视觉模型正式开放
发布动态:8月21日,DeepSeek API平台上线多模态视觉理解模型DeepSeek-V4-Flash-Vision-Exp,通过设置
model=deepseek-v4-flash-vision-exp
即可调用。
产品定位:这是DeepSeek首个正式开放的多模态实验模型,旨在补齐纯文本之外的图像理解能力,面向开发者开放API服务。
生态同步:DeepSeek Harness 0.1.1版本已原生适配该模型,开发者可快速接入图文自动化流程。

二、核心能力:文本不缩水,视觉大跃升
文本能力持平:在Agent、推理、世界知识等纯文本任务上,该模型与7月31日发布的V4-Flash正式版完全持平,无能力妥协。
多模态跃升:在需要视觉理解的Agent基准测试中,相比V4-Flash实现大幅提升,多模态Agent能力已接近Opus-4.8水平。
实际表现:可完成图片描述、截图文字识别、图表分析、PPT生成、前端Demo编写等多模态任务。

三、性价比:沿用文本版定价,图片计费克制
价格不变:计费规则与V4-Flash文本版保持一致,未因多模态能力额外加价。
Token占用低:单张图片最高仅计费384 tokens,按文本版原价结算,开发者调用成本可控。
上传方式灵活:支持base64、URL及Files API三种图片传入方式,且Files API支持图片复用,免去重复上传。