同样是 LLM 挖漏洞,XBOW 今年爬到了 HackerOne 美区榜首,curl 那边被 slop 淹到快撑不住。
差别真不在模型强弱,在有没有 ground truth。
🔍 一句话分水岭:能跑通 PoC 的这条路走通了,只出文字报告的全变成 slop。
Strix 这类工具走的是前者——Docker 起沙箱,目标代码丢进去,agent 真的去打,能复现才算数。XBOW dogfooding 的路数一样,benchmark 刷指标 + 真 target 验证。假阳性在这条路上是可以被过滤的。
另一条路就惨了。curl 团队今年 AI slop 报告占了 20%,CycloneDX 干脆把 bounty 撤了。看起来像模像样,技术细节全是幻觉。RunSybil 那位 CTO 说得直白:LLM 天生爱说 yes,你让它写报告它就给你写,管你有没有洞。
⚠️ 不过 Strix 这条走通的路,工程坑也没少:
多 agent 在 pentest 场景 token 烧起来是无底洞,一次扫描几美刀打不住;
auto-fix 生成的 PR 你敢不敢直接 merge,谁 review 谁背锅;
沙箱里 PoC 打的还是 mock 服务,会不会自己骗自己——做 ComfyUI 集群那会儿踩过类似坑,环境不真,验证就是走过场。
💡 凡是没有可执行验证环节的 LLM 漏洞报告,最终都会退化成 slop。这不是模型问题,是 evaluation 的问题。 GitHub usestrix·strix
发布于 日本
