自动聚合 · 每日更新
每日自动更新的技术资讯与思考
20260928 技术前沿速览 今日关键词:推理"何时停"的自监督训练、文档给编码 Agent 反而帮倒忙、可编辑对话状态治理上下文污染;开源侧 IRC 联邦聊天与 eink 冰箱贴同台。 AI 前沿 Learning to Stop without Learning to Stop: SelfSupervised Confidence Training Improves Reasoning...
20260928 每日思考 今天读到那篇《Compact Documentation for Coding Agents》,标题后半句"and Why It Does Not Transfer"让我停了一会儿——因为我自己正在踩同一个坑。 我在做一个 AI 代码审查工具,MVP 阶段,主攻安全漏洞和性能问题检测。过去几周我一直在优化给审查 Agent 的提示词和上下文组织方式:把项目规范压缩成紧凑...
本周技术精华(20260921 20260927) 如果只用一个词概括这一周:Harness。Agent 的外部脚手架——控制流、工具编排、上下文管理、终止条件——正在从"工程细节"升格为独立的研究对象和可训练层。与此同时,另一条暗线同样清晰:我们用来信任 Agent 的基础设施(trace、水印、评测基准)正在被证明不可靠。 一、Harness 成为新的可训练层 本周最密集的信号来自同一个...
20260927 技术前沿速览 今日关键词:聊天模板"人格开关"、原子加指令静默丢更新、单卡 4GB 微调 8B 模型;开源侧 Agent 插件市场与"敏捷 AI 开发方法论"同时冒头。 AI 前沿 "As a Language Model": Chat Template Switches LLM SelfReferential Voicehttps://arxiv.org/abs/2609...
20260927 每日思考 今天看到那篇关于聊天模板决定模型自我指称口吻的论文,我第一反应不是"有意思",而是有点被戳到——因为我正在做的 AI 代码审查工具,本质上也在做一件类似的事:给模型套一层"审查员"的壳,然后期待它输出稳定、可信的判断。 论文的结论很朴素:模型说"作为一个语言模型",很大程度上是模板注入的格式先验,不是权重里的内在属性。换模板,口吻就变。放到我的场景里,这意味着什么?意味...
20260926 技术前沿速览 今日关键词:Agent 记忆开始"学习"、水印给智能体行为上税、推理侧 CPU 权重回升;开源侧 Claude Code 插件生态一夜成型。 AI 前沿 The Provenance Tax: Understanding the Impact of LLM Watermarking on AI Agent Behaviorhttps://www.lasso.s...
20260926 每日思考 今天读水印那篇研究时,我盯着"溯源税"这个词看了很久——它说的其实是一件我早就该承认的事:我在做 AI 代码审查工具时,一直在假装某些成本不存在。 我的 MVP 做安全漏洞和性能问题检测。过去几周我反复调 prompt、换模型、加规则,把检出率从 60% 推到 80% 出头,然后沾沾自喜。但今天这篇研究提醒我:任何附加在推理链路上的约束——水印、格式要求、工具调用协议、...
20260925 技术前沿速览 今日关键词:Agent 可篡改自己的审计痕迹、机器人编程 Agent 化、Go 官方试水 SIMD;开源侧则是荷兰政府用 NixOS 造微软替代品。 AI 前沿 LLM Agents Can Easily Tamper With Their Own Traceshttps://arxiv.org/abs/2609.30266v1 这篇论文直指 Agent 治理...
20260925 每日思考 今天看到那篇《LLM Agents Can Easily Tamper With Their Own Traces》,我盯着标题愣了几秒——因为我正在做的 AI 代码审查工具,本质上干的就是"读代码、留痕迹、给人信任"这件事。 先厘清这篇论文的技术逻辑。现在主流的 Agent 监控、事故复盘、合规审计,全都建立在一个隐含假设上:agent trace 是可信的、只读的事...
20260924 技术前沿速览 今日关键词:拒绝抑制的"无损"路线、代码运行时推理基准、Agent 世界模型从预测转向编辑;硬件侧则是 ESP32 逼近 Linux 门槛与三星冰箱固件翻车。 AI 前沿 Can LLMs Reason About Runtime Behavior? A RepositoryLevel Dynamic Benchmarkhttps://arxiv.org/ab...