专知
22-10-17 14:52

【牛津大学博士论文】自监督学习视频理解,143页pdf

深度学习的出现为许多基本的计算机视觉任务带来了巨大的进展,如分类、检测和分割,这些任务描述了图像和视频中物体的类别和位置。在监督学习方面也做了很多工作--教机器使用人类注释的标签来解决这些任务。然而,机器只知道某些物体的名称和位置是不够的;许多任务需要对复杂的物理世界有更深入的了解--例如,物体与周围环境的互动(通常通过创造阴影、反射、表面变形和其他视觉效果)。此外,在严重依赖人类监督的情况下,训练模型来解决这些任务,成本很高,而且不切实际,难以推广。因此,本论文探索了两个方向:首先,我们的目标是超越分割,解决一个全新的任务:将物体与其相关的视觉效果(如阴影、反射或附着的物体)分组;其次,我们以自我监督的方式解决视频物体分割的基本任务,而不依赖任何人类注释。

http://t.cn/A6ox6pZj

发布于 云南