购机指南
2026-09-02 10:36来自 科技看点

首个多模态世界模型Solaris发布,同时DeepSeek开源305B视觉模型:多模态Agent竞争进入新阶段?

  事件概述:多模态能力从“看”到“做”的跃迁

  2026年9月2日,AI行业迎来两个标志性事件:Runway推出首个界面世界模型Solaris,可实时逐帧生成交互式界面,无需编写代码;与此同时,DeepSeek在Hugging Face上线DeepSeek-V4-Flash-Vision-Exp,采用MIT协议开源,参数规模达305B,激活仅13B,将多模态Agent的推理成本压缩至纯文本水平[1][2][8]。这两个动作共同指向一个趋势——大模型竞争正从“谁聊天更聪明”转向“谁能看懂真实世界并替用户完成任务”。

  事件还原:5W要素拆解

  Who(主体)

  Runway(AI视频生成与交互平台)与DeepSeek(中国AI初创公司,专注开源大模型)。

  What(事件)

  Runway发布Solaris,称为“首个界面世界模型”,可直接生成交互式界面,属于操作系统级范式;DeepSeek开源V4系列首个多模态模型,具备识图、Agent任务执行能力,多项指标对标Opus-4.8[5][6]

  When(时间)

  Solaris于2026年8月底至9月初发布;DeepSeek-V4-Flash-Vision-Exp于8月21日上线API,9月2日开源权重[5][10]

  Where(平台)

  Runway官方博客及网站;Hugging Face模型仓库。

  Why(背景)

  多模态能力成为AI落地关键瓶颈,此前模型仅支持图文问答,缺乏主动交互;DeepSeek希望通过开源降低多模态Agent门槛,Runway则直接切入界面生成,意图重新定义人机交互方式。

  多模态世界模型是什么?与普通多模态模型有何区别?

  传统多模态模型(如GPT-4V)擅长“看图问答”,但无法主动生成可交互的界面或执行连续动作。而“世界模型”强调对物理世界或数字世界的因果建模,能预测、生成并响应用户操作。Solaris被Runway称为“首个界面世界模型”,本质上是一种新型操作系统,能实时逐帧生成交互式界面,让AI从“看懂”进化为“动手”[2]。DeepSeek的V4多模态模型则定位为“多模态Agent”,不仅看懂截图、图表,还能结合工具调用自动完成任务,例如操作软件、填写表单等[5][10]

  DeepSeek V4多模态开源:305B参数仅激活13B,如何实现“低成本”商用?

  DeepSeek-V4-Flash-Vision-Exp采用MoE(混合专家)架构,总参数305B,但每次推理仅激活约13B参数,这使得其推理成本与纯文本模型接近,打破了“视觉模型必然昂贵”的魔咒[8]。MIT协议进一步放开了商用限制,允许开发者自由部署、微调甚至魔改[1][7]。在关键排行榜上,该模型Terminal Bench 2.1得分83.9,DeepSWE 59.3,多模态Agent的Agents’ Last Exam 27.3、ZeroBench 35.0,部分指标已接近甚至反超Opus-4.8[5]。更重要的是,加入视觉模块后,原有文本推理和Agent能力并未下降,证明了“多模态不稀释单模态”[8]

  Runway Solaris:首个界面世界模型,是否意味着“无代码”时代的终结?

  Solaris的核心理念是“无需编写代码,即可实时逐帧生成交互式界面”[2]。这意味着AI能理解用户意图(如“做一个天气预报App”),并直接生成可点击、可交互的UI界面,相当于把操作系统本身变成了AI驱动的生成器。这种能力远超传统UI生成工具,因为它具备“世界模型”的因果推理能力:能预测用户点击后的状态变化,并逐帧生成后续画面。Runway将其定义为“新型操作系统”,暗示其可能颠覆传统开发流程,让非技术人员也能创建复杂应用。

  舆论场争议:开源是普惠还是隐患?

  DeepSeek开源引发两极化讨论。支持者认为,MIT协议让中小企业、个人开发者获得高性能多模态能力,打破闭源垄断[9];反对者指出,实验版本缺少安全对齐,本地部署存在风险,且复杂图表、精细视觉推理仍有短板,距离顶级闭源模型(如GPT-4o)存在差距[7][9]。此外,305B模型对硬件要求高,普通用户难以直接体验,生态构建仍需时间[10]。Runway Solaris则因技术门槛高,目前仅限内测,尚未公开评估。

  公司业务影响表

公司动作涉及业务影响对象关键数字短期影响长期观察来源
DeepSeek开源V4多模态实验模型AI模型、多模态Agent开发者、企业、开源社区305B参数/13B激活;MIT协议;Terminal Bench 83.9降低多模态商用门槛,吸引开发者二次开发可能成为多模态Agent开源标准,但需解决安全对齐与稳定性[1][5][8]
Runway发布Solaris界面世界模型AI生成界面、操作系统应用开发者、产品经理、设计师首个界面世界模型;实时逐帧生成引发“无代码”开发新范式讨论若开放API,可能重塑应用开发流程[2]
小鹏汽车第二代VLA模型重大升级自动驾驶、机器人汽车用户、机器人开发者单次训练数据吞吐量提升10倍;2250 TOPS算力加强长尾场景识别能力,推动自动驾驶进化AI Infra复利效应跨本体复制至机器人[4]

  延伸价值:多模态Agent成为下一条主赛道

  DeepSeek与Runway的案例表明,多模态模型正在从“看图说话”向“看懂后动手”演进。小鹏汽车的VLA模型同样强调“主动数据挖掘—闭环仿真—飞轮效应”,将AI底座从汽车复制到机器人[4]。这意味着,多模态能力将不再局限于聊天或图像生成,而是成为智能体(Agent)的“眼睛”和“手”。对开发者而言,DeepSeek的开源提供了低成本试错机会;对普通用户,Solaris这类模型可能在未来几年内改变我们使用应用的方式。

  QA常见问题解答

  Q1: 首个多模态世界模型是哪个?

  A: Runway于2026年8月底发布的Solaris被称为“首个界面世界模型”,能实时生成交互式界面。DeepSeek V4多模态模型定位为多模态Agent,两者侧重点不同,但均代表多模态能力从“读”到“做”的进化。

  Q2: DeepSeek V4多模态模型开源有什么意义?

  A: 它采用MIT协议,305B参数仅激活13B,推理成本与纯文本模型接近,打破了多模态模型“贵且闭源”的格局。开发者可免费部署、微调,推动多模态Agent应用生态发展。

  Q3: 这些模型普通用户能用吗?

  A: DeepSeek模型可通过API调用(需付费),但开源权重对硬件要求较高(据公开报道,需至少80GB显存以上GPU),普通用户直接本地部署有门槛。Runway Solaris目前仅内测,尚未公开开放。建议关注后续官方平台或社区转写版本。

  #首个多模态世界模型发布 #DeepSeekV4多模态模型正式开源 #RunwaySolaris #多模态Agent #AI开源生态