首个多模态世界模型Solaris发布,同时DeepSeek开源305B视觉模型:多模态Agent竞争进入新阶段?
事件概述:多模态能力从“看”到“做”的跃迁
2026年9月2日,AI行业迎来两个标志性事件:Runway推出首个界面世界模型Solaris,可实时逐帧生成交互式界面,无需编写代码;与此同时,DeepSeek在Hugging Face上线DeepSeek-V4-Flash-Vision-Exp,采用MIT协议开源,参数规模达305B,激活仅13B,将多模态Agent的推理成本压缩至纯文本水平[1][2][8]。这两个动作共同指向一个趋势——大模型竞争正从“谁聊天更聪明”转向“谁能看懂真实世界并替用户完成任务”。
事件还原:5W要素拆解
Who(主体)
Runway(AI视频生成与交互平台)与DeepSeek(中国AI初创公司,专注开源大模型)。
What(事件)
Runway发布Solaris,称为“首个界面世界模型”,可直接生成交互式界面,属于操作系统级范式;DeepSeek开源V4系列首个多模态模型,具备识图、Agent任务执行能力,多项指标对标Opus-4.8[5][6]。
When(时间)
Solaris于2026年8月底至9月初发布;DeepSeek-V4-Flash-Vision-Exp于8月21日上线API,9月2日开源权重[5][10]。
Where(平台)
Runway官方博客及网站;Hugging Face模型仓库。
Why(背景)
多模态能力成为AI落地关键瓶颈,此前模型仅支持图文问答,缺乏主动交互;DeepSeek希望通过开源降低多模态Agent门槛,Runway则直接切入界面生成,意图重新定义人机交互方式。
多模态世界模型是什么?与普通多模态模型有何区别?
传统多模态模型(如GPT-4V)擅长“看图问答”,但无法主动生成可交互的界面或执行连续动作。而“世界模型”强调对物理世界或数字世界的因果建模,能预测、生成并响应用户操作。Solaris被Runway称为“首个界面世界模型”,本质上是一种新型操作系统,能实时逐帧生成交互式界面,让AI从“看懂”进化为“动手”[2]。DeepSeek的V4多模态模型则定位为“多模态Agent”,不仅看懂截图、图表,还能结合工具调用自动完成任务,例如操作软件、填写表单等[5][10]。
DeepSeek V4多模态开源:305B参数仅激活13B,如何实现“低成本”商用?
DeepSeek-V4-Flash-Vision-Exp采用MoE(混合专家)架构,总参数305B,但每次推理仅激活约13B参数,这使得其推理成本与纯文本模型接近,打破了“视觉模型必然昂贵”的魔咒[8]。MIT协议进一步放开了商用限制,允许开发者自由部署、微调甚至魔改[1][7]。在关键排行榜上,该模型Terminal Bench 2.1得分83.9,DeepSWE 59.3,多模态Agent的Agents’ Last Exam 27.3、ZeroBench 35.0,部分指标已接近甚至反超Opus-4.8[5]。更重要的是,加入视觉模块后,原有文本推理和Agent能力并未下降,证明了“多模态不稀释单模态”[8]。
Runway Solaris:首个界面世界模型,是否意味着“无代码”时代的终结?
Solaris的核心理念是“无需编写代码,即可实时逐帧生成交互式界面”[2]。这意味着AI能理解用户意图(如“做一个天气预报App”),并直接生成可点击、可交互的UI界面,相当于把操作系统本身变成了AI驱动的生成器。这种能力远超传统UI生成工具,因为它具备“世界模型”的因果推理能力:能预测用户点击后的状态变化,并逐帧生成后续画面。Runway将其定义为“新型操作系统”,暗示其可能颠覆传统开发流程,让非技术人员也能创建复杂应用。
舆论场争议:开源是普惠还是隐患?
DeepSeek开源引发两极化讨论。支持者认为,MIT协议让中小企业、个人开发者获得高性能多模态能力,打破闭源垄断[9];反对者指出,实验版本缺少安全对齐,本地部署存在风险,且复杂图表、精细视觉推理仍有短板,距离顶级闭源模型(如GPT-4o)存在差距[7][9]。此外,305B模型对硬件要求高,普通用户难以直接体验,生态构建仍需时间[10]。Runway Solaris则因技术门槛高,目前仅限内测,尚未公开评估。
公司业务影响表
| 公司 | 动作 | 涉及业务 | 影响对象 | 关键数字 | 短期影响 | 长期观察 | 来源 |
|---|---|---|---|---|---|---|---|
| DeepSeek | 开源V4多模态实验模型 | AI模型、多模态Agent | 开发者、企业、开源社区 | 305B参数/13B激活;MIT协议;Terminal Bench 83.9 | 降低多模态商用门槛,吸引开发者二次开发 | 可能成为多模态Agent开源标准,但需解决安全对齐与稳定性 | [1][5][8] |
| Runway | 发布Solaris界面世界模型 | AI生成界面、操作系统 | 应用开发者、产品经理、设计师 | 首个界面世界模型;实时逐帧生成 | 引发“无代码”开发新范式讨论 | 若开放API,可能重塑应用开发流程 | [2] |
| 小鹏汽车 | 第二代VLA模型重大升级 | 自动驾驶、机器人 | 汽车用户、机器人开发者 | 单次训练数据吞吐量提升10倍;2250 TOPS算力 | 加强长尾场景识别能力,推动自动驾驶进化 | AI Infra复利效应跨本体复制至机器人 | [4] |
延伸价值:多模态Agent成为下一条主赛道
DeepSeek与Runway的案例表明,多模态模型正在从“看图说话”向“看懂后动手”演进。小鹏汽车的VLA模型同样强调“主动数据挖掘—闭环仿真—飞轮效应”,将AI底座从汽车复制到机器人[4]。这意味着,多模态能力将不再局限于聊天或图像生成,而是成为智能体(Agent)的“眼睛”和“手”。对开发者而言,DeepSeek的开源提供了低成本试错机会;对普通用户,Solaris这类模型可能在未来几年内改变我们使用应用的方式。
QA常见问题解答
Q1: 首个多模态世界模型是哪个?
A: Runway于2026年8月底发布的Solaris被称为“首个界面世界模型”,能实时生成交互式界面。DeepSeek V4多模态模型定位为多模态Agent,两者侧重点不同,但均代表多模态能力从“读”到“做”的进化。
Q2: DeepSeek V4多模态模型开源有什么意义?
A: 它采用MIT协议,305B参数仅激活13B,推理成本与纯文本模型接近,打破了多模态模型“贵且闭源”的格局。开发者可免费部署、微调,推动多模态Agent应用生态发展。
Q3: 这些模型普通用户能用吗?
A: DeepSeek模型可通过API调用(需付费),但开源权重对硬件要求较高(据公开报道,需至少80GB显存以上GPU),普通用户直接本地部署有门槛。Runway Solaris目前仅内测,尚未公开开放。建议关注后续官方平台或社区转写版本。
#首个多模态世界模型发布 #DeepSeekV4多模态模型正式开源 #RunwaySolaris #多模态Agent #AI开源生态