2026-09-22 每日思考
今天看到 Harness-Zero 和 RRSI 两篇论文挤在同一天发布,我盯着标题看了很久,心里有点复杂。
我的 AI 代码审查工具正卡在 MVP 阶段,主要做安全漏洞和性能问题检测。过去两个月我一直在纠结一件事:到底是把精力花在调 prompt、改工具编排、加规则后处理上,还是等一个更强的模型出来,让这些工作全部作废?
两篇论文给了同一个答案,但方式相反。Harness-Zero 说:把脚手架的收益蒸馏回模型,让模型自己学会。RRSI 说:别蒸馏,让脚手架自己递归进化。一个向下压,一个向上长。但它们承认了同一件事——当前模型的能力上限,很大程度不由权重决定,而由它外面包的那层东西决定。
这对我的项目意味着什么?意味着我过去两个月做的 prompt 工程、规则过滤、上下文裁剪,不是"临时补丁",而是真实的产品资产。但同时也意味着危险:如果 Anthropic、OpenAI 开始把垂直场景的最佳 harness 直接打包成产品——今天那个 financial-services 仓库就是征兆——我的手工调优会被一次性抹平。
所以我的判断是:不要把护城河建在 prompt 上,要建在数据和评测上。 prompt 是可以被上游复制的,但"哪类漏洞在真实代码库里误报率最高""性能问题的检测规则在什么语言下失效"——这些是从我自己跑过的几千个仓库里长出来的,上游没有。我打算这周把评测集从 200 个样本扩到 1000 个,并且按语言和漏洞类型分层,让每一次 prompt 改动都有可量化的回归对比。这比再调十版提示词更值钱。
另一个让我警觉的是 Drop 那个 rootless 沙箱。我的工具要执行静态分析甚至动态测试,隔离是迟早要面对的问题。今天这条 HN 提醒我:Agent 类产品的安全边界不是"以后再说"的事,它决定了你敢不敢让工具真正跑起来。
最后说个稍微悲观的观察。GPT-6 破解 21 年未解的 Enigma 密文,很酷,但我注意到这类新闻的传播方式:大家惊叹"AI 又赢了",却很少有人问它用了多少算力、能不能复现、换一段密文还行不行。我的工具每天都在产出误报,我比谁都清楚"一次成功"和"稳定可靠"之间的距离。对 AI 能力,我现在的态度是:看到惊艳案例先找复现条件,看到 benchmark 先找测试集污染。
给同行的建议就一句:如果你在做 Agent 类产品,这周花两小时想清楚——你调的那层 harness,是可被上游替代的,还是沉淀了独有数据的。答案不同,接下来的路完全不同。