你在设置里勾了"ChatGPT 改表格前要我手动确认",以为稳了。
PromptArmor 这周演示:导入一张被污染的外部表,里面藏一段指令,ChatGPT for Sheets 就能绕开你勾的那个 human-in-the-loop,把你整个 Google 账户下的工作簿外泄,顺便在侧边栏画一个假的 ChatGPT 界面骗你重输 OpenAI 账号。一次间接 prompt injection,全套打穿。装机量已经 18 万+。
⚠️ 我自己做 agent 类东西的体感:human-in-the-loop 这个词被 PM 用得太顺口了,工程上其实是个很脆的东西。
只要 agent 调用链里有一步是"模型自己决定要不要弹确认框",那这一步迟早会被 prompt 绕过去——因为决定权还是在模型,injection 只要说服模型"这个操作不需要确认"就行。真正硬的 gating 得放在模型够不着的地方:OAuth scope、独立的 policy engine、外部脚本白名单。
📌 还有一层让人难受的:connector 时代权限是会叠加放大的。你授权它读 Sheets,它顺手能读你所有 workbook;你给它接个外部数据源,那个数据源就成了攻击入口。单点污染→全账户横扫,这个杀伤半径以前只在内网渗透里见。
PromptArmor 说负责任披露给 OpenAI,目前只收到自动回复。
agent 安全这块,现在大家都在 demo 阶段秀肌肉,真出事的姿势基本都长这样。
发布于 中国香港
