Google Photos 的 Ask Photos 已经翻车一轮了。
最常见的吐槽是这种:以前能直接搜图里的文字,换成 Gemini 后反而搜不到;问"我在动物园拍的那只猴子",AI 一脸懵。😅 有人发帖怀念旧版搜索框,下面顶赞回复说「这是 2026 年最克制的吐槽」。
今天 HF 上挂了篇 camroll,把"个人相册 VQA"当严肃任务立起来:50 用户、3 万多张图、2500 QA,配了个 hierarchical memory + 工具调用的 agent。里面一个数字挺扎眼——普通人手机里平均 3139 张照片,但 55% 的人想回忆某个特定瞬间时都查不回来。
做过多模态的人会知道,这事的真正难点压根不在长上下文。
🔍 文本长上下文是顺序流,相册是杂乱无章的视觉碎片,时序、地点、人物、事件四套索引互相打架
🔍 用户问"上次吃的那家川菜在哪",要的不是相似度检索,是事件级的因果重组
🔍 Apple 走端侧 + 隐私保护匹配,搜索能力被砍一大截;Google 走云端上限高,但翻车率也高
更要命的是产品形态:用户想要的是搜索框秒出结果,不是跟 AI 来回聊三轮才挖到一张照片。Ask Photos 第一版被骂得最狠的就这点——把搜索改对话,绕远了。
学术界刚把这事当严肃问题立起来,但产业化的真瓶颈在工程那侧:不打扰、不上传、不强迫对话,怎么把一坨长尾视觉记忆变成秒级可查的东西。模型再强也救不了产品形态选错。 arXiv: 2606.05275
发布于 中国香港
