苹果研发团队发布最新研究项目 HeadsUp (arXiv:2605.04035),重点展示了3D 人头重建技术从“单人建模”向“大模型预测”的范式转移,传统 3D 重建(如 NeRF 或原始 3DGS)需针对每个用户进行数分钟甚至数小时的“测试时优化”。而 HeadsUp 是一个前馈式(Feed-forward)模型,通过编码器-解码器架构,它能在亚秒级时间内从几张照片中直接“推断”出完整的 3D 高斯点分布,实现即看即得,HeadsUp 的核心创新在于“UV 参数化 3D 高斯表示法”。它将高斯点锚定在标准的 2D UV 模板上,实现了模型复杂度与输入分辨率的解耦。相比 Meta 的 Avat3r(需 80 万至 110 万个高斯点),HeadsUp 仅需 6.5 万个高斯点。在点数极低的情况下,HeadsUp 的 PSNR(信噪比)更高,发丝、睫毛及口腔细节的还原度远超同类 SOTA 模型。苹果动用了包含 10,000 多名受试者 的内部高精度数据集进行训练。研究证明了 3D 领域的“规模效应(Scaling Laws)”:随着训练数据量增加,模型对从未见过的陌生面孔具有极强的泛化能力,彻底解决了稀疏视图下边缘模糊和伪影的问题。有人说这是AVP下一代自影像的技术底层,个人感觉是其实应该目前在AVP中已经慢慢用上,甚至已经用上,从vision OS 1.0到现在,每次的系统更新都感觉Personal在不断的提升,确实采集与运算更快,也符合苹果的逻辑,自己测试完在公开。http://t.cn/AXJkMFGy http://t.cn/AXJkMFGL
发布于 广东
