新浪AI前沿速递
2026-08-22 09:47来自 科技看点

DeepSeek多模态模型对比Claude Opus 4.8差距多大?

  DeepSeek昨晚正式上线了首款多模态视觉模型DeepSeek-V4-Flash-Vision-Exp,官方基准测试显示其多模态Agent能力已接近Claude Opus 4.8,而价格却不到对手一半,被开发者称为“AI界的性价比屠夫”。

  一、能力对标:多项基准逼近Opus 4.8

  多模态Agent评测:DeepSeek官方公布的数据显示,V4-Flash-Vision-Exp在多模态Agent基准测试(如Terminal Bench 2.1、Chartography、ZeroBench等)上已接近Opus-4.8水平,相比纯文本版V4-Flash实现了大幅跃升。

  核心指标表现:Terminal Bench 2.1得分83.9,Chartography达64.3(p0.95),ZeroBench(Pass@5)为35.0,在需视觉理解的Agent任务中表现亮眼。

  纯文本能力持平:在Agent、推理、世界知识等纯文本能力方面,新模型与DeepSeek-V4-Flash正式版完全持平,未出现性能缩水。

  

  

  二、技术路径:从“看清”到“想清”

  视觉原语思考:DeepSeek早在2026年4月就发布了《用视觉原语思考》技术报告,将点、边界框等空间标记作为“思考的基本单元”融入思维链,解决了传统多模态模型在密集场景下的“指代鸿沟”问题。

  极高压缩效率:处理一张800×800图片仅需约90个视觉token,而Claude、Gemini等主流模型通常需要870-1100个,整体压缩比达7056倍,实现“花更少的成本干同样的活儿”。

  训练策略创新:采用“专家化SFT+专项RL+统一RFT”四段式流水线,在计数、空间推理、迷宫导航、路径追踪等拓扑推理任务上断层领先,迷宫导航得分66.9%远超GPT-5.4的50.6%。

  三、定价策略:性价比成为核心武器

  价格优势明显:V4-Flash-Vision-Exp定价与DeepSeek-V4-Flash保持一致,空闲时段输入(缓存命中)仅0.05元/百万tokens,输出4.5元/百万tokens,远低于Claude Opus 4.8同级别的千万级价格。

  开发者友好:兼容OpenAI与Anthropic格式接口,支持Tool Calls、Responses API,并同步上线免费Files API,图片上传一次即可重复引用,大幅降低多模态应用开发门槛。

  生态工具联动:DeepSeek Harness已第一时间支持该模型,并可将Claude Code与Codex作为子代理调用,方便开发者构建“看懂图片干活”的智能体。