AV2发布了1.0版本的技术规范和参考代码,而其中值得关注的是:原生多层编码与空间视频支持。目前Apple Vision Pro上的immersive video动不动就100M-150M码率,这对普通消费者日常使用的带宽压力比较大,大多数APP里的immersive video视频都是建议下载到本地观看。除了在压缩效率提升,降低码率以外,AV2与VVC都原生将多层和子图像概念写进了底层基础语法中。
VVC 是允许将一个超高分辨率的画面(例如 8K 的多视角拼合图)在底层划分为多个完全独立的“子图像”。VVC 的语法定义了极其复杂的 OLS (Output Layer Sets, OLS),允许在一个容器内打包深度图、透明度通道以及多达数十个视角,并提供明确的高层语法指令,告诉解码器如何将这些层重新映射到 3D 空间中。沉浸式视频的核心痛点是投影映射(球面到平面)和视口依赖(Viewport-dependent)。头显只能看到当前视野(约 90°-110°),如果强行解码完整的 8K/12K 全景画面,会导致算力崩溃。在这方面,VVC 拥有架构优势。沉浸式视频通常采用 ERP(等距柱状投影)或 CMP(立方体投影)。VVC 引入独立的子图像(Subpictures) 概念。它可以把一个 8K 的全景展开图在底层直接切分成多个方块。当用户戴着头显向左看时,VVC 解码器可以直接从比特流中只提取左边那几个 Subpicture 进行解码,其余部分完全不消耗算力。VVC 深度绑定了 MPEG-I OMAF (Omnidirectional Media Format) 标准。它的 SEI 消息中原生包含了基于区域的打包 (RWPK, Region-Wise Packing) 和球面旋转参数,可以直接告诉渲染引擎如何把这些 2D 像素完美贴合回 3D 空间球体上。
AV2虽然没有 VVC 的 Subpicture 那么激进。AV2 的核心创新在于 OPS (Operating Point Sequence)的重构,基于 Tile 解耦的流媒体 AR/VR 增强,在 AV2 的流中,多层(空间视角的左右眼、甚至多机位)被封装为不同的 Operating Points。AV2 在 OBU 层面赋予了客户端极大的自主权。如果头显设备检测到当前电量不足或网络降级,它可以通过读取 OPS OBU 的头部信息,在极低算力消耗下直接“丢弃”不必要的视角数据包,只解码当前视野的视频层。AV2 将空间可扩展性 (Spatial Scalability) 深度集成到了核心语法中。它处理多层视频时,不仅能做视角上的扩展(左眼/右眼),还能在同一个文件中无缝叠加分辨率和帧率的扩展。这为未来基于 Web 浏览器的轻量级 AR 播放(例如通过 FFmpeg 重新封装后在普通设备上按需调取)奠定了基础。AV2 依靠其强大的 OPS机制来处理沉浸式视频,服务器可以将全景视频的不同区域或不同视点定义为不同的操作点。头显客户端通过读取最前端的 OBU 序列头,可以在极低的延迟下,动态向服务器请求当前视野所需的 Tile 数据流,非常适合高并发的沉浸式流媒体分发。
从另一个角度来说,目前immersive的视频只能在Apple Vision Pro上看,普通平面设备无法做到正常图像分发,有了类似VVC和AV2分割多个子图像的能力,对于内容创作者来说,能多一份2D平面视频或3D视频形态的分发,也会更有多样传播性,减少臃肿的多版本。
可以预见的是,Apple Vision Pro后续硬件升级应该是会加入VVC编解码能力以及AV2解码能力,而其他品牌头显也会根据自身设备及系统选择适配的编码,在前期制作流程里,也是会慢慢加入VVC和AV2的编码能力。
发布于 广东
