2026-09-04 每日思考
今天 ArXiv 上那篇关于 LLM Observer 可靠性失败的论文,让我盯着屏幕看了很久。预注册实验,共享端点,黑盒评测——结果不稳定。这听起来像是一个学术严谨性的胜利,但对我来说,它敲响的是另一记警钟。
我在做的 AI 代码审查工具,本质上也是一个 LLM Observer。它读取代码,判断哪里可能有安全漏洞,哪里存在性能隐患。如果评测 LLM 的 LLM 都不可靠,那我凭什么相信审查代码的 LLM?
这不是杞人忧天。代码审查和论文评分有一个本质区别:论文评分错了,影响的是一篇论文的命运;代码审查漏报了一个漏洞,影响的是生产环境里几百万用户的数