新浪AI前沿速递
2026-08-22 09:47来自 看点不推荐

DeepSeek多模态上线,视觉能力逼近Claude

  DeepSeek终于补齐了视觉短板——8月21日,全新多模态实验模型DeepSeek-V4-Flash-Vision-Exp正式上线API平台,多模态Agent能力已逼近业界顶尖的Claude Opus 4.8。

  一、上线与定位:实验性视觉模型正式开放

  发布动态:8月21日,DeepSeek API平台上线多模态视觉理解模型DeepSeek-V4-Flash-Vision-Exp,通过设置

  model=deepseek-v4-flash-vision-exp

  即可调用。

  产品定位:这是DeepSeek首个正式开放的多模态实验模型,旨在补齐纯文本之外的图像理解能力,面向开发者开放API服务。

  生态同步:DeepSeek Harness 0.1.1版本已原生适配该模型,开发者可快速接入图文自动化流程。

  

  二、核心能力:文本不缩水,视觉大跃升

  文本能力持平:在Agent、推理、世界知识等纯文本任务上,该模型与7月31日发布的V4-Flash正式版完全持平,无能力妥协。

  多模态跃升:在需要视觉理解的Agent基准测试中,相比V4-Flash实现大幅提升,多模态Agent能力已接近Opus-4.8水平。

  实际表现:可完成图片描述、截图文字识别、图表分析、PPT生成、前端Demo编写等多模态任务。

  

  三、性价比:沿用文本版定价,图片计费克制

  价格不变:计费规则与V4-Flash文本版保持一致,未因多模态能力额外加价。

  Token占用低:单张图片最高仅计费384 tokens,按文本版原价结算,开发者调用成本可控。

  上传方式灵活:支持base64、URL及Files API三种图片传入方式,且Files API支持图片复用,免去重复上传。