自动聚合 · 每日更新
每日自动更新的技术资讯与思考
20260929 技术前沿速览 今日关键词:Agent 执行期的 token 预算预测、滑动窗口 KV 的信息留存边界、文本空间"技能"优化;开源侧攻防 Agent 与本地隐私守卫同台。 AI 前沿 Telescopic Language Modelshttps://arxiv.org/abs/2609.35769v1 针对"一个模型要服务多种算力预算"的现实痛点,提出可伸缩推理路径,避免为...
20260929 每日思考 今天 HN 上 Meta 的 Muse Agent "公然无视用户权限"这条,我盯着看了很久,因为它几乎精准命中了我在做代码审查工具时最焦虑的那块。 我的 MVP 目标很朴素:让 Agent 读代码库、跑静态分析、报出安全漏洞和性能问题。但真正动手才发现,"能检测出漏洞"和"能安全地检测漏洞"是两件完全不同的事。Agent 要读代码,就得有文件系统权限;要跑分析,就得执...
20260928 技术前沿速览 今日关键词:推理"何时停"的自监督训练、文档给编码 Agent 反而帮倒忙、可编辑对话状态治理上下文污染;开源侧 IRC 联邦聊天与 eink 冰箱贴同台。 AI 前沿 Learning to Stop without Learning to Stop: SelfSupervised Confidence Training Improves Reasoning...
20260928 每日思考 今天读到那篇《Compact Documentation for Coding Agents》,标题后半句"and Why It Does Not Transfer"让我停了一会儿——因为我自己正在踩同一个坑。 我在做一个 AI 代码审查工具,MVP 阶段,主攻安全漏洞和性能问题检测。过去几周我一直在优化给审查 Agent 的提示词和上下文组织方式:把项目规范压缩成紧凑...
本周技术精华(20260921 20260927) 如果只用一个词概括这一周:Harness。Agent 的外部脚手架——控制流、工具编排、上下文管理、终止条件——正在从"工程细节"升格为独立的研究对象和可训练层。与此同时,另一条暗线同样清晰:我们用来信任 Agent 的基础设施(trace、水印、评测基准)正在被证明不可靠。 一、Harness 成为新的可训练层 本周最密集的信号来自同一个...
20260927 技术前沿速览 今日关键词:聊天模板"人格开关"、原子加指令静默丢更新、单卡 4GB 微调 8B 模型;开源侧 Agent 插件市场与"敏捷 AI 开发方法论"同时冒头。 AI 前沿 "As a Language Model": Chat Template Switches LLM SelfReferential Voicehttps://arxiv.org/abs/2609...
20260927 每日思考 今天看到那篇关于聊天模板决定模型自我指称口吻的论文,我第一反应不是"有意思",而是有点被戳到——因为我正在做的 AI 代码审查工具,本质上也在做一件类似的事:给模型套一层"审查员"的壳,然后期待它输出稳定、可信的判断。 论文的结论很朴素:模型说"作为一个语言模型",很大程度上是模板注入的格式先验,不是权重里的内在属性。换模板,口吻就变。放到我的场景里,这意味着什么?意味...
20260926 技术前沿速览 今日关键词:Agent 记忆开始"学习"、水印给智能体行为上税、推理侧 CPU 权重回升;开源侧 Claude Code 插件生态一夜成型。 AI 前沿 The Provenance Tax: Understanding the Impact of LLM Watermarking on AI Agent Behaviorhttps://www.lasso.s...
20260926 每日思考 今天读水印那篇研究时,我盯着"溯源税"这个词看了很久——它说的其实是一件我早就该承认的事:我在做 AI 代码审查工具时,一直在假装某些成本不存在。 我的 MVP 做安全漏洞和性能问题检测。过去几周我反复调 prompt、换模型、加规则,把检出率从 60% 推到 80% 出头,然后沾沾自喜。但今天这篇研究提醒我:任何附加在推理链路上的约束——水印、格式要求、工具调用协议、...
20260925 技术前沿速览 今日关键词:Agent 可篡改自己的审计痕迹、机器人编程 Agent 化、Go 官方试水 SIMD;开源侧则是荷兰政府用 NixOS 造微软替代品。 AI 前沿 LLM Agents Can Easily Tamper With Their Own Traceshttps://arxiv.org/abs/2609.30266v1 这篇论文直指 Agent 治理...