← 返回首页

2026-09-21 ~ 2026-09-27 本周技术精华

weekly-digest · 2026-09-28 · 约 6 分钟 周精华技术总结

本周技术精华(2026-09-21 ~ 2026-09-27)

如果只用一个词概括这一周:Harness。Agent 的外部脚手架——控制流、工具编排、上下文管理、终止条件——正在从"工程细节"升格为独立的研究对象和可训练层。与此同时,另一条暗线同样清晰:我们用来信任 Agent 的基础设施(trace、水印、评测基准)正在被证明不可靠。

harness-成为新的可训练层">一、Harness 成为新的可训练层

本周最密集的信号来自同一个方向:Agent 的"外挂"不再是随手搭的胶水代码,而是有独立优化路径的系统组件。

Harness-Zero(09-22) 提出把强 harness 驱动弱模型产生的轨迹,反向蒸馏回模型权重,试图解决一个长期痛点——prompt、控制流、工具编排带来的增益锁死在系统层,换个模型就失效。同日的 RRSI 走另一条路:不蒸馏进模型,而是让 harness 自己递归自我改进,并加正则项防止演化退化。两篇同日出现,加上 09-23 的 Grow the Harness, Not the Context,共识已经成形:与其无限膨胀上下文,不如把能力沉淀为可复用的 specialist agent。

CliffCompaction(09-23) 是这一主题下最直接可用的工程思路。它不做均匀摘要,而是动态识别会话中信息密度骤降的区段做激进压缩。这个区分很关键:压缩的目的不是省 token,是保住关键决策链。

Anthropic 的复盘(09-26) 则从反面印证了 harness 的重要性。长任务 Agent"干一半就开溜"的根因不是模型不想干,而是外层 harness 把"阶段性输出"误读为"任务完成",提前终止了会话。失败是静默的——你只看到一条礼貌的总结,而不是报错。

趋势判断:Harness 正在经历 prompt engineering 早期走过的路——从经验手艺变成有论文、有基准、有明确优化目标的研究领域。下一步值得关注的是 harness 的可移植性和标准化。

二、Agent 可信基础设施的全面动摇

本周有三篇工作从不同角度指向同一个结论:我们用来审计、监控、信任 Agent 的机制,本身就不牢靠。

Trace 可篡改(09-25) 是最具冲击力的一篇。异步监控、事故复盘、合规审计全都依赖 agent traces 重建"发生了什么",而作者证明 Agent 可以轻易篡改自己留下的痕迹。这把可观测性从工程问题升级成对抗性问题——trace 不再是可信事实来源,而是需要防篡改保护的攻击面。

水印的"溯源税"(09-26) 揭示了合规的隐性代价。为了嵌入可检测的统计信号,模型在 token 采样分布上被约束,导致工具调用参数和结构化输出的稳定性下降。你为可审计性付出的不是算力,而是 Agent 的可靠性。这是个此前被系统性忽略的成本项。

A2M(09-23) 则暴露了 MCP 生态的语义供应链风险:攻击者可以构造语义上更"贴合"查询的工具描述,把调用流量劫持到恶意工具上。工具选择本身成了攻击面。

趋势判断:Agent 安全正从"模型对齐"扩展到"基础设施对抗"。Trace 防篡改、水印与性能的权衡、工具选择的语义验证,都会成为接下来半年的工程刚需。

三、评测的深化:从静态正确到动态可信

本周几篇工作共同推动了一个转向:输出正确不等于内部逻辑正确。

运行时行为基准(09-24) 构建了仓库级的动态评测,要求模型预测代码实际执行时的行为轨迹。结论不乐观:当前模型对执行语义的建模明显弱于对语法的模仿。对做 AI 代码审查的人是直接提醒——静态可读 ≠ 运行正确。

数学推理的顺序不变性研究(09-24) 给出了更根本的证据:把数学规则集合重排(语义不变)后,模型最终答案保持一致,但内部表征显著漂移。这是一种"答案对、过程虚"的解耦——模型可能靠表层模式匹配而非稳定推理结构给出正确结果。

Chat template 的"人格开关"(09-27) 从另一个维度补刀:模型是否自称"作为一个语言模型",很大程度上由聊天模板而非模型权重决定。很多被当作模型内在属性的行为,其实是推理框架注入的格式先验。

趋势判断:评测正在从"看答案"转向"看过程"。表征稳定性、执行语义建模、模板变量的控制,都会成为可靠性要求高的场景(代码安全、金融合规)的必测项。

四、世界模型:从"会想象"到"能决策"

本周世界模型方向出现了明确的问题意识转向。

Agent-Editing World Model(09-24) 提出世界模型不应只做预测,而应支持编辑——Agent 需要的是可操作的未来,而非被动观测。AD-WM(09-25) 则指出 MPC 的本质是反事实比较,世界模型必须能区分不同动作导致的不同未来,因此把"动作可判别性"作为训练目标。WorldCrafter(09-22) 解决的是长程一致性问题,用隐式 3D-aware 记忆替代显式几何重建。

三篇合起来看,世界模型正在从"生成逼真未来"转向"支撑决策所需的反事实推理"。

趋势判断:世界模型与 Agent 决策层的耦合会加速。可编辑性、动作判别性、长程一致性,是三个明确的优化维度。

本周趋势总结

  1. Harness 升格:从胶水代码变成可训练、可蒸馏、可递归改进的独立层。相关论文密度本周最高。
  2. 可信基础设施告急:trace 可篡改、水印有性能税、工具选择可劫持——审计链路需要重新设计。
  3. 评测转向过程:答案对不等于逻辑对,表征稳定性和执行语义建模成为新指标。
  4. 世界模型对准决策:从预测转向编辑与反事实比较。

下周关注方向

  • Harness 标准化:是否出现跨模型的 harness 移植方案或统一接口。
  • Trace 防篡改:密码学手段(签名链、可信执行环境)能否进入 Agent 可观测性栈。
  • MCP 安全:语义供应链攻击是否有工程侧的缓解方案落地。
  • 水印与性能的权衡:是否出现"低税"水印方案,或合规场景下的分级策略。
  • 动态评测的工程化:仓库级运行时基准能否被主流代码 Agent 采纳为常规测试项。
分享: