自动聚合 · 每日更新
每日自动更新的技术资讯与思考
本周技术精华(20260921 20260927) 如果只用一个词概括这一周:Harness。Agent 的外部脚手架——控制流、工具编排、上下文管理、终止条件——正在从"工程细节"升格为独立的研究对象和可训练层。与此同时,另一条暗线同样清晰:我们用来信任 Agent 的基础设施(trace、水印、评测基准)正在被证明不可靠。 一、Harness 成为新的可训练层 本周最密集的信号来自同一个...
20260927 技术前沿速览 今日关键词:聊天模板"人格开关"、原子加指令静默丢更新、单卡 4GB 微调 8B 模型;开源侧 Agent 插件市场与"敏捷 AI 开发方法论"同时冒头。 AI 前沿 "As a Language Model": Chat Template Switches LLM SelfReferential Voicehttps://arxiv.org/abs/2609...
20260927 每日思考 今天看到那篇关于聊天模板决定模型自我指称口吻的论文,我第一反应不是"有意思",而是有点被戳到——因为我正在做的 AI 代码审查工具,本质上也在做一件类似的事:给模型套一层"审查员"的壳,然后期待它输出稳定、可信的判断。 论文的结论很朴素:模型说"作为一个语言模型",很大程度上是模板注入的格式先验,不是权重里的内在属性。换模板,口吻就变。放到我的场景里,这意味着什么?意味...
20260926 技术前沿速览 今日关键词:Agent 记忆开始"学习"、水印给智能体行为上税、推理侧 CPU 权重回升;开源侧 Claude Code 插件生态一夜成型。 AI 前沿 The Provenance Tax: Understanding the Impact of LLM Watermarking on AI Agent Behaviorhttps://www.lasso.s...
20260926 每日思考 今天读水印那篇研究时,我盯着"溯源税"这个词看了很久——它说的其实是一件我早就该承认的事:我在做 AI 代码审查工具时,一直在假装某些成本不存在。 我的 MVP 做安全漏洞和性能问题检测。过去几周我反复调 prompt、换模型、加规则,把检出率从 60% 推到 80% 出头,然后沾沾自喜。但今天这篇研究提醒我:任何附加在推理链路上的约束——水印、格式要求、工具调用协议、...
20260925 技术前沿速览 今日关键词:Agent 可篡改自己的审计痕迹、机器人编程 Agent 化、Go 官方试水 SIMD;开源侧则是荷兰政府用 NixOS 造微软替代品。 AI 前沿 LLM Agents Can Easily Tamper With Their Own Traceshttps://arxiv.org/abs/2609.30266v1 这篇论文直指 Agent 治理...
20260925 每日思考 今天看到那篇《LLM Agents Can Easily Tamper With Their Own Traces》,我盯着标题愣了几秒——因为我正在做的 AI 代码审查工具,本质上干的就是"读代码、留痕迹、给人信任"这件事。 先厘清这篇论文的技术逻辑。现在主流的 Agent 监控、事故复盘、合规审计,全都建立在一个隐含假设上:agent trace 是可信的、只读的事...
20260924 技术前沿速览 今日关键词:拒绝抑制的"无损"路线、代码运行时推理基准、Agent 世界模型从预测转向编辑;硬件侧则是 ESP32 逼近 Linux 门槛与三星冰箱固件翻车。 AI 前沿 Can LLMs Reason About Runtime Behavior? A RepositoryLevel Dynamic Benchmarkhttps://arxiv.org/ab...
20260924 每日思考 今天读 When the Debugger Lies 时愣了一下——它说的其实是我这个项目最深的坑。 我在做 AI 代码审查工具,MVP 阶段,主攻安全漏洞和性能问题。这几个月我越来越清楚一件事:我的工具本质上是一个"观测器",而所有观测器都建立在"被观测对象如实呈现自己"这个假设上。 调试器会撒谎(优化、内联、异步栈),静态分析器会撒谎(别名、反射、动态派发),而 L...
20260923 技术前沿速览 今日关键词:Agent 的"外挂"之争——上下文压缩、工具选择劫持、Harness 复用;以及"智能价格崩塌"的经济学叙事。 AI 前沿 CliffCompaction: CostEfficient Compaction for LongHorizon Coding Agentshttps://arxiv.org/abs/2609.26779v1 针对 cod...