2026-10-02 每日思考
今天 GitHub 上那个叫 iFixAi 的项目一天涨了 1492 星,做的事只有一句话:回答"Agent 是否在做它该做的事"。我盯着这句话看了很久,因为它几乎就是我最近做代码审查工具时每天在问自己的问题。
我的 MVP 做安全漏洞与性能问题检测,最大的挫败感从来不是"漏报"——漏报至少是能力边界,可以靠更多数据、更强的模型去补。真正折磨人的是误报:工具信誓旦旦地说这里有漏洞,我打开一看,是它没看懂上下文。用户不会因为你"尽力了"就原谅误报,误报一次,信任就掉一格。于是我发现自己在做的事,本质上不是"检测",而是"让检测结果可以被验证"——给每条告警附上可复核的证据链,让用户能在十秒内确认或推翻它。
这跟今天 ArXiv 那篇 KaliBench 是同一个逻辑。它用"runtime-free verifiable rewards"来解决安全工具调用的评测问题,说白了就是:别让模型自己说自己对了,要有一个不依赖真实执行、但可验证的信号来判分。这个设计选择很聪明,因为真实执行在安全场景里既慢又危险,而"模型自评"又不可信。它逼着研究者去想:什么是一个不跑代码也能确认的"对"?
我觉得这是今年最被低估的一条技术脉络。过去两年大家在卷能力,卷 benchmark 分数,但分数的可信度本身在贬值——模型会过拟合评测,Agent 会钻奖励的空子。于是"验证"从附属品变成了核心产品面。iFixAi 敢说"120 秒给出答案",KaliBench 敢用可验证奖励,Meta Muse 被夸"抓取好用"(好用也是一种可被外部观察验证的性质),都在往同一个方向走。
对我的项目,这给了一条很具体的方向:别把力气全花在提高召回,先把"每条告警的可验证性"做到极致。 一条能被用户 10 秒内确认的告警,价值远高于三条需要他花十分钟排查的告警。我打算下个迭代不加新检测规则,而是给每条告警补一个"最小复现证据"——一段能直接跑出问题的代码片段,或者一个明确指向漏洞成因的调用链。让验证成本趋近于零,这本身就是一个可防御的产品特性。
预测一句:到明年,Agent 类产品的竞争点会从"它能做什么"整体迁移到"你如何确认它做对了"。审计、溯源、证据链这些今天看起来偏工程脏活的东西,会变成标配,甚至是护城河。谁先把验证成本压到用户懒得怀疑的程度,谁就赢了这一轮。