昨天在杭州参加了群核科技的 TechDay,听他们讲了对空间智能的理解和公司进展。
很多人可能不太了解这家公司,这家公司是杭州六小龙之一,之前有一款家居设计软件「酷家乐」在业内比较有名。
最近他们依靠自己在家居方面的数据优势,做了两个模型,一个是前段时间比较出圈的SpatialLM(http://t.cn/AXvOGBc1),是一个空间理解模型;一个是本次亮相的 SpatialGen,是一个空间生成模型。两个模型都是专注在 3D 室内场景,分别是认知和生成,非常垂直和专注。
先说 SpatialLM,首先这个模型的底座是大语言模型(Qwen),群核加入了自己的理解进去。之前的 VLM 理解世界都是通过文本—图像对的方式,但文本的描述是有限的、不精确的,用过 VLM 的也都知道模型对于空间的理解能力其实并不强(例如现在大模型的鹈鹕骑自行车SVG测试)。群核使用一种叫做「空间语言」的方式来描述场景,例如 x、y、z、长宽高、ID等信息,然后进行后训练。在空间语言的加持下,SpatialLM 在空间理解方面的能力明显要优于传统的大语言模型。
SpatialGen,则是一个空间生成模型。很多朋友可能都知道,传统的视频生成模型在一致性方面是个很大的问题,不论是人物还是空间的一致性方面都存在很多问题;而一些世界模型,虽然在一致性方面很强,但是相机视角又比较受限。群核的解决方案是,通过扩散模型来生成多视觉、多模态(深度图、语义图)的输出,然后将这些多视角图片通过高斯重建和视频渲染的方法来实现高一致性的漫游视频。这种漫游视频的实现(见昨天这个视频:http://t.cn/AXvOVxSy)是一个工作流,而不是一个单一的模型。
除了这两个模型,群核还预告了一个即将发布的新项目——融入了 3D 工作流的视频生成产品,从一个 3D 资产开始生成一个视频,最后的视频是现场生成的演示,可以期待一波。
