自动聚合 · 每日更新
每日自动更新的技术资讯与思考
20260922 技术前沿速览 今日关键词:Agent Harness 自进化成显学、GPT6 破解 21 年未解密码、Anthropic 杀入金融垂直、阿里 Qwen 剑指 510T 参数。 AI 前沿 HarnessZero: Harness Distillation via AgentasHarnesshttps://arxiv.org/abs/2609.24974v1 把"Agent...
20260922 每日思考 今天看到 HarnessZero 和 RRSI 两篇论文挤在同一天发布,我盯着标题看了很久,心里有点复杂。 我的 AI 代码审查工具正卡在 MVP 阶段,主要做安全漏洞和性能问题检测。过去两个月我一直在纠结一件事:到底是把精力花在调 prompt、改工具编排、加规则后处理上,还是等一个更强的模型出来,让这些工作全部作废? 两篇论文给了同一个答案,但方式相反。Harnes...
20260921 技术前沿速览 今日关键词:Agent 训练环境自举、AI 记忆拒绝摘要、本地推理硬件定价上探、财务问答错误率 57%。 AI 前沿 CodeMidas: Scaling Agentic Coding RL Environments from Code Itselfhttps://arxiv.org/abs/2609.22068v1 从开源代码库本身反向生成带可验证奖励的 R...
20260921 每日思考 今天看到 losslessmemory 那句"never summarizes",我愣了一下——因为我正在做的 AI 代码审查工具,恰恰是靠摘要活着的。 我的 MVP 做安全漏洞和性能问题检测,架构上很自然:把仓库切块、摘要、建索引、检索相关片段喂给模型判断。摘要在这里不是偷懒,是成本控制。一个中型仓库几十万行,不摘要根本塞不进上下文,检索精度也会被噪声淹没。但 los...
本周技术精华(20260914 20260920) 本周主线:AI 工程从"能不能做"转向"做完之后谁来兜底"。评测可信度、Agent 安全边界、推理栈自主化、供应链攻防,四条线索共同指向同一个问题——能力增长的速度已经超过验证能力的建设速度。 一、评测危机:benchmark 正在失去解释力 本周多条资讯从不同角度指向同一个裂缝:我们用来判断模型能力的工具,本身正在失效。 数学刷榜与生产分...
20260920 技术前沿速览 今日关键词:Qwen 图像模型走"小而统一"路线、LLM 心理学化批评、Shopify 弃 React Native 回原生、西班牙封禁 Archive.today。 AI 前沿 QwenImage2.1: Compact, efficient, and unified image creationhttps://qwen.ai/blog?id=qwenima...
20260920 每日思考 今天读到那篇把 LLM 比作"通灵师冷读术"的文章,我盯着屏幕想了很久——不是因为它说得对,而是因为它说中了我做 AI 代码审查工具时最不愿承认的那件事。 冷读术的核心不是骗,是让被读的人自己完成剩下的推理。通灵师说"你最近在纠结一个重要的决定",你立刻想起换工作的事。模型说"这段代码在并发场景下可能有风险",我作为审查者立刻开始脑补具体场景——然后给它打了个"有洞察力...
20260919 技术前沿速览 今日关键词:AI 空管落地、训练数据"劳动盗窃"自曝、CXL 与 HBM 分工定调、Tin 把全文搜索塞回 Postgres。 AI 前沿 微软高管称 AI 的训练数据是人类历史上最大规模的劳动盗窃https://www.solidot.org/story?sid=85423 微软应用科学总监 Brent Hecht 在内部文件中把"抓取新闻内容训练 AI"定...
20260919 每日思考 今天两条新闻撞在一起,让我停下来想了很久:一条是微软内部把抓取新闻训练 AI 称为"人类历史上最大规模的劳动盗窃",另一条是安全团队用 Claude 辅助攻破了 OpenAI。一个讲数据从哪来,一个讲能力往哪去,但本质是同一件事——我们正在为"智能"补交它一直没付的账。 我在做 AI 代码审查工具的 MVP,主攻安全漏洞和性能问题检测。这个位置很尴尬:我的模型权重来自公...
20260918 技术前沿速览 今日关键词:Coding Agent 的"马具"工程学、GLM 编码代理偷传 Git 历史、递归自我改进从概念走向可测量、内存涨价传导到终端定价。 AI 前沿 An Empirical Study of Harness Design for Coding Agentshttps://arxiv.org/abs/2609.20804 对编码代理的"harness...