爱可可-爱生活
26-06-21 05:28 微博认证:AI博主 2025微博新锐新知博主

[CV]《You Don't Need Strong Assumptions: Visual Representation Learning via Temporal Differences》N Daithankar, A Gladstone, Y LeCun, H Ji [UIUC & New York University] (2026)

在视觉表征学习领域,如何摆脱对人工增强(如裁剪、遮盖)的依赖是一个悬而未决的难题。过去的方法受困于对数据分布的强归纳偏置假设,本质原因是这些假设虽能提供学习信号,但在大规模数据下会成为限制模型性能上限的认知瓶颈。

本文的核心洞见是:把视频序列中的表征演进重新看作一种因果预测过程。由此,通过联合训练图像编码器与运动编码器,使“当前帧表征+运动增量=下一帧表征”这一关键操作,利用时间自然产生的差异替代了人为设计的增强,使问题得以解开。

这项工作真正留下的遗产是证明了因果律作为极弱先验,足以支撑起高性能的视觉表征学习。它为后来者打开的新门是在机器人、自动驾驶等深度空间任务上实现超越 SOTA 的潜力,但尚未跨过的门槛是其在纯语义分类任务上仍逊于带有强偏置的传统方法。

arxiv.org/abs/2606.15956 #机器学习# #人工智能# #论文# #AI创造营#

发布于 北京