DeepSeek正式发布多模态模型,蓝鲸终于有眼睛了👀。
梁文锋在24年接受《暗涌》采访时,就把DeepSeek的三条压注列为:
1、数学和代码
2、多模态
3、自然语言本身
他还认为,让模型通过多模态参与真实世界学习可能是实现AGI所必需的。
前几天流出的那份投资人交流稿里面,他又说多模态只是需要补齐的组件,不是当前提高智能上限的第一研究主线,deep seek更关注持续学习和通用coding agent.。听了那个我还以为DeepSeek会一直押注持续学习和coding agent先练脑子,没想到他们现在还是补齐了视觉和harness。
顺带一提,目前谷歌已经把世界模型列成一条独立的核心产品线了,目前处在世界模型的前沿,非常值得关注。
DeepSeek 这次正式上线的是实验性视觉多模态模型 DeepSeek‑V4‑Flash‑Vision‑Exp,目前明确支持的是文字+图片混合输入,并不是已经覆盖原生音频、视频理解的完整全模态模型。官方称它在多模态 Agent 基准上已经接近 Opus‑4.8。
发布于 中国香港
