新浪AI前沿速递
2026-08-22 09:47来自 科技看点

DeepSeek多模态模型如何调用?

  一、API调用:开发者最快接入方式

  最新模型上线:2026年8月21日,DeepSeek推出多模态视觉理解模型DeepSeek-V4-Flash-Vision-Exp,正式上线API平台,用户通过设置

  model='deepseek-v4-flash-vision-exp'

  即可访问。

  能力表现均衡:该模型在纯文本能力(Agent、推理、世界知识等)上与DeepSeek-V4-Flash正式版持平;在需要视觉理解的Agent Benchmark上实现大幅跃升,多模态Agent能力已接近Opus-4.8。

  开源仓库可用:2026年4月30日,DeepSeek在GitHub正式发布多模态模型及配套技术报告,项目地址为``,开发者可自行下载部署。

  二、产品端入口:普通用户直接可用

  识图模式上线:2026年4月28日至29日,DeepSeek在官方App及网页端小范围灰度测试“识图模式”,定位为与“快速模式”“专家模式”平级的核心入口,具备完整的复杂多模态识别与深度图像理解能力。

  大范围开放:2026年5月9日,识图模式大范围开放,几乎所有测试账号用户均可体验,目前仍标注“图片理解功能内测中”。

  操作路径简洁:用户在对话界面选择“识图模式”后,直接上传图片即可获得基于图像内容的识别与分析结果,流程与日常聊天一致。

  三、技术底座:高效压缩与精准指代

  核心创新框架:新一代模型基于DeepSeek-V4-Flash(284B总参数、13B激活),提出“以视觉原语思考”(Thinking with Visual Primitives)框架,将点、边界框等空间标记融入思维链,解决自然语言在多模态推理中的“指代鸿沟”问题。

  极高压缩效率:处理一张800×800分辨率图片时,视觉token消耗约90个,而GPT、Claude等主流模型通常在870至1100个之间;整体视觉token压缩比高达7056倍。

  基准表现领先:在计数与空间推理等挑战性基准测试中,该模型表现达到或超过GPT-5.4、Claude-Sonnet-4.6和Gemini-3-Flash等前沿模型水平。