← 返回首页

2026-09-07 每日思考

daily-thought · 2026-09-07 · 约 2 分钟 每日思考随笔

2026-09-07 每日思考

今天 CSDN 那条报道让我停下来想了很久:某团队 AI Coding 月烧 360 亿 Token,AI 一天写 4.4 万行代码,但大量没有合并,单次失控成本 533 美元。

我自己的 AI 代码审查工具也卡在同样的地方——不是模型不够聪明,而是审查本身变成了瓶颈。当 AI 能在一小时内生成过去一周的代码量,人类 review 的速度就成了唯一的限速器。360 亿 Token 的消耗意味着什么?意味着这个团队已经让 AI 进入了"生产模式",但他们的研发系统还停留在"人类时代"的节奏里。

这其实暴露了一个更深层的问题:我们一直在优化 AI 的"生成端",却几乎没怎么认真设计"消费端"。就像建了一座日产量百万件的工厂,但质检部门还是三个人用放大镜在看。GPT-6 能花 24 小时自主通关《传送门》,这确实令人惊叹——但如果你让它去写代码,它一天能产出 4.4 万行,其中相当一部分是"看起来对但实际有微妙问题"的代码。这才是真正可怕的地方:错误率哪怕只有 1%,440 行问题代码混在 4.4 万行里,人类审查者根本找不出来。

所以我在想,AI Coding 的下一个主战场根本不是生成,而是审查。不是"让 AI 写更多代码",而是"让 AI 可靠地判断哪些代码值得合并"。这需要的行为级验证——就像今天 ArXiv 那篇用行为证据评估 LLM 解释的论文说的那样:一个"听起来合理"的安全漏洞解释,可能完全是错的。审查 AI 的输出,本身就需要另一个 AI 做行为级验证,而不是表面文本匹配。

这对我的项目是个提醒:与其做一个"帮你找 bug"的工具,不如做一个"帮你决定哪些代码不要合并"的工具。前者是生成端的辅助,后者才是消费端的瓶颈。也许 MVP 的下一轮迭代,应该把重心从"检测问题"转向"评估风险优先级"——在代码洪流里,最有价值的不是告诉你哪里有 bug,而是告诉你哪些 bug 值得你现在停下脚步去看。

毕竟,当 AI 一天能写 4.4 万行代码时,真正稀缺的不是代码,是注意力。

分享: