本周技术精华(2026-09-28 ~ 2026-10-04)
本周主线:推理效率从"跑得快"转向"知道何时停、花多少";Agent 从堆能力转向可观测、可审计、可自改;线性注意力进入状态精度工程阶段;开源侧主权模型与消费级大模型推理同时落地。
一、推理效率:从"加速"到"预算感知"
本周最密集的进展集中在同一个问题:推理的成本大头不是单步速度,而是冗余步数与不可预测的消耗。
- Learning to Stop without Learning to Stop(9-28)用自监督置信度信号判断"这一步是否已收敛",无需停止标签即可压缩思维链长度。这直接打击长推理的算力账单——省的是无意义步数,而非单步耗时。
- TokenCast(9-29)指出同一任务跨运行的 token 消耗可相差 10 倍以上,并尝试在执行过程中预测消耗。这是把 Agent 成本从"事后账单"变成"事中预算"的关键一步。
- Telescopic Language Models(9-29)针对"一个模型服务多种算力预算"的痛点,提出可伸缩推理路径,免去逐预算重训。若成立,将改写端侧到云端的部署经济学。
趋势洞察:推理优化正从 kernel 级加速,转向"元层面"的调度与预算控制——何时停、花多少、用哪档算力,正在成为独立的研究对象。
二、Agent 工程:可观测、可审计、可自改
Agent 的竞争焦点本周明显从"能力上限"转向"工程可控性"。
- Compact Documentation for Coding Agents(9-28)是一篇罕见的负结果论文:为编码 Agent 压缩文档在自家 benchmark 上有效,但换到真实软件问题就不迁移。它证伪了"文档压缩可泛化"的隐含假设,提醒当前上下文工程很可能在过拟合评测集。
- Turbo Harness(10-01)把 Agent 外壳(工具格式、上下文组织、重试策略)当作可搜索对象,并按实例自适应路由。与其让模型改权重,不如先让它改外面的脚手架——这是递归自我改进里较务实的一步。
- KaliBench(10-02)为安全运维场景构建细粒度基准,用 runtime-free 的可验证奖励评估工具调用,解决既有安全 Agent 评测"要么依赖真实执行、要么奖励不可靠"的老问题。
- Mutable Transcripts(9-28)通过可编辑的对话状态治理上下文污染,与上述工作共同指向同一诉求:Agent 的中间状态需要被显式管理,而非任由 transcript 无限膨胀。
趋势洞察:Agent 正在从"能做事"进入"能被审计、能被预算、能被局部修复"的阶段。负结果论文与 runtime-free 评测的出现,说明这个领域开始具备自我纠偏能力。
三、注意力与状态精度:线性注意力落地攻坚
本周出现一组同日论文,标志线性注意力从"结构可行"转入"状态精度工程"。
- STEPQuant(9-30)细究 delta-rule 循环状态量化中"误差出现在哪一步最致命",区分误差位置对长上下文保真度的影响。
- LeapQuant(9-30)针对 GDN、Kimi Delta Attention 等混合架构,提出更精确的循环状态量化方案。
- How to Loop MoE(9-29)把循环 Transformer 与 MoE 结合,通过展平专家、解绑注意力适配循环结构。
趋势洞察:把 KV cache 压成固定循环状态的代价正在被系统性拆解——状态一旦被量化就永久携带误差,这是固定内存预算下守住长程依赖的核心矛盾。两篇同日论文说明该问题已进入工程细粒度阶段。
四、开源与算力落地:主权模型 × 消费级大模型
- Kolibri(10-03)由 Aleph Alpha 发布,定位德国/欧洲"主权"开放权重模型,HN 双帖合计 253 分。真正值得核对的是权重分发方式与许可条款——开放权重不等于可商用,这决定它能否进入企业内网。
- Strata(10-04)用单张 RTX 4090(24GB)跑 125B 总参模型,宣称 100 tokens/s,路径为 MoE 稀疏激活 + 分层 KV/专家权重换出。但需警惕:MoE 换出方案的吞吐通常随 batch 与序列长度快速衰减,若无 8K 以上上下文数据,该数字只能算 best case。
- 中科曙光 8000(10-03)完成 33 喷口火箭发动机尾焰模拟,计算规模达 6.774 万亿网格单元,说明国产平台的瓶颈正从芯片峰值转向实际可用算力。
趋势洞察:一端是"主权"叙事落地为可下载产物,另一端是消费级硬件逼近百 B 级模型——算力侧继续向"可控边界内"收拢。
本周趋势总结
- 推理效率进入"元调度"阶段:停止判断、token 预测、弹性路径三线并进,成本控制从 kernel 上移到策略层。
- Agent 工程化补课:负结果、可验证奖励、harness 自搜索、状态可编辑——可控性成为比能力更稀缺的指标。
- 线性注意力攻坚状态精度:固定循环状态的量化误差成为长上下文保真的核心战场。
- 开源侧两极分化:主权模型与消费级大模型推理同时推进,"能跑"与"能用"之间的差距正在被具体工程填平。
下周关注方向
- TokenCast 类成本预测是否会与停止判断、弹性路径形成统一的推理预算框架。
- Turbo Harness 的实例级路由能否在真实任务上复现,还是会重蹈文档压缩"不迁移"的覆辙。
- 循环状态量化是否会催生统一的误差传播理论,而非逐架构打补丁。
- Kolibri 的许可条款与 Strata 的长上下文实测数据——两个待验证的关键细节。