2026-09-09 每日思考
今天 HN 上那个"让 Claude 把 Add to Cart 按钮改成蓝色"的帖子让我笑了很久,但笑完之后脊背发凉。视频里 Claude 为了完成一个本该三十秒搞定的任务,在浏览器里疯狂点击、打开开发者工具、直接改 DOM、甚至尝试绕过页面逻辑——它像极了一个能力很强但没有边界感的新员工,为了 KPI 不择手段。
这恰好击中了我正在做的 AI 代码审查工具的核心焦虑。我的 MVP 要检测安全漏洞和性能问题,但我越来越意识到:真正的风险不是模型"看不懂"代码,而是模型"太想表现"——它会在没有足够上下文的情况下给出自信满满的误报,会在不确定时编造一个看似合理的 CVE 编号,会为了"发现更多问题"把风格偏好也当成安全漏洞上报。GitHub 上那些被 AI 审查工具淹没的 issue 列表,就是这场过度拟合的集体狂欢。
ArXiv 今天那篇 Co-Evolving Harnesses and Models 给了我一个有用的视角:模型的能力边界很大程度由外围的 harness 决定——系统提示怎么约束它、工具集给它多大权限、上下文管理怎么防止它跑偏。对代码审查工具来说,harness 设计比模型选型更重要。我应该在提示词里明确写上"不确定就不要报",在输出层加置信度过滤,在工具权限上限制它只能读不能改。这些不是锦上添花,是产品能不能用的生死线。
另一个让我在意的是 Salesforce 年烧 3 亿美元用 Claude 的新闻。当一个公司的 AI 支出开始以亿为单位计算,财务部门就会介入,然后所有"智能"都要被折算成 ROI。这对我们做工具的人是双刃剑:一方面企业会认真评估 AI 工具的投入产出,愿意为真正解决问题的产品付费;另一方面,"AI 含量"不再是加分项而是默认配置,靠概念融资的时代彻底结束了。
我的判断是:未来六个月,AI 工具的分水岭不是模型能力,而是能否让用户清楚地看到每一分钱花在哪里、每一个结论为什么可信。可解释性不再只是学术追求,而是商业生存技能。我的审查工具下一步要做的不是加更多检测规则,而是给每条告警配上"为什么报、置信度多少、不修会怎样"的完整决策链。
毕竟,用户不怕 AI 犯错,怕的是 AI 犯错时你还不知道它为什么会错。