森赛
26-08-21 17:53 微博认证:微博新知博主 科技博主 头条文章作者 微博原创视频博主

DeepSeek今天悄摸上线了V4-Flash-Vision-Exp多模态API,名字挂着实验版,容易被当成一次常规迭代,其实这波更新的分量比很多人想的重。

这次更新我第一眼注意到“视觉能力大幅提升”,后来看了下,真正的核心看点似乎在多模态Agent能力,就是放出的跑分已经摸到了Opus-4.8的水平。普通多模态模型的终点是看懂图、说得出内容就行了,而多模态Agent的起点是看完图直接把事办了。截一张后台界面它能顺着操作流程走,甩一张复杂图表它能直接拆解数据出结论,拍一张设备故障图它能一步步排查问题,是能直接嵌进工作流里干活的能力。

这是Flash产品线的视觉版本,Flash系列本来主打的就是低延迟、高性价比,走的是落地实用路线。现在它把多模态Agent能力拉到接近旗舰级的水准,等于给开发者开了条低成本通路,以前要做复杂的视觉Agent,只能咬牙上昂贵的旗舰大模型,现在用轻量模型的成本,就能摸到差不多的效果,对大量中小团队和垂直场景来说,实际价值比跑分榜单高得多。

目前还是在跑分阶段,实验版跑分归跑分,真实场景里的非标界面、模糊实拍、复杂工业图纸,还得等开发者实测踩坑。但行业风向已经很明确:多模态早就卷完了认不认得图这 part 了,接下来的主战场,是看完图能不能解决问题。期待后续!
#DeepSeekV4视觉模型上线#

发布于 广东