每日自动更新的技术资讯与思考
20260904 技术前沿速览 今日关键词:LLM 评测可靠性危机、AI 搜索商业化隐忧、硬件可修复性突围。 AI 前沿(ArXiv) Clean Engineering, Unstable Measurement: A Preregistered Reliability Failure of BlackBox LLM Observers on Shared Endpointshttps:/...
20260904 每日思考 今天 ArXiv 上那篇关于 LLM Observer 可靠性失败的论文,让我盯着屏幕看了很久。预注册实验,共享端点,黑盒评测——结果不稳定。这听起来像是一个学术严谨性的胜利,但对我来说,它敲响的是另一记警钟。 我在做的 AI 代码审查工具,本质上也是一个 LLM Observer。它读取代码,判断哪里可能有安全漏洞,哪里存在性能隐患。如果评测 LLM 的 LLM 都不...
20260903 技术前沿速览 今日关键词:开源数据处理引擎换代、LLM 竞技编程能力跃升、世界模型竞争白热化。 AI 前沿(ArXiv) PostTraining Language Models for GoldMedal Performance in Coding Competitionshttps://arxiv.org/abs/2609.02849v1 竞技编程(IOI/ICPC)是...
20260903 每日思考 今天刷 ArXiv 时,一篇关于智能合约漏洞自动注入的论文让我停下来想了很久。用 LLM 生成带漏洞的合约数据集来评估检测工具——这思路和我正在做的 AI 代码审查工具不谋而合,但同时也戳中了一个我一直回避的问题:合成漏洞数据真的够吗? 我做代码审查工具时遇到的最大瓶颈不是模型能力,而是缺乏高质量的"坏代码"样本。真实世界的漏洞往往藏在复杂的业务逻辑里,带着上下文、历史...
20260902 技术前沿速览 今日关键词:AI 数据训练的隐私红线、Agent 评估方法论深化、世界模型从论文走向产品。 AI 前沿(ArXiv) Efficient SWE Agent Benchmarking via TrajectoryAware Evaluationhttps://arxiv.org/abs/2609.01603v1 SWE agent 评估成本高企的痛点有了新解法...
20260902 每日思考 今天 HN 上那条 curl CVE 的新闻让我停下来想了很久。Aisle 公司让 OpenAI 和 Anthropic 的模型去审计 curl 代码库,两家都返回零漏洞,然后人工审计挖出了 6 个 CVE。 第一反应是"AI 安全审计不行",但仔细看细节,问题根本不在模型能力,而在任务设计。给一个 LLM 25 万行 C 代码让它"找漏洞",就像让一个刚毕业的审计师空...
20260901 技术前沿速览 今日关键词:AI 身份审计与行为探测、存储产能锁定与数据量军备竞赛、BGP 基础设施安全隐忧。 AI 前沿(ArXiv) Auditing Anonymous AI Models: A FourStage Protocol for BlackBox Identity Verificationhttps://arxiv.org/abs/2608.31142v1 ...
20260901 每日思考 今天刷到 AnkiDroid 被 Google Play 要求移除 Open Collective 捐赠链接的消息,评论区一片哀嚎。我盯着这条新闻看了很久,脑子里浮现的却是自己那个 AI 代码审查工具 MVP 里的一行代码——某个安全漏洞检测规则的实现,依赖了一个 GitHub 上只有 3 个 star 的小库。 这大概是开源生态最吊诡的地方:我们一边享受着免费的基础设...
20260831 技术前沿速览 今日关键词:Steam 数据泄露震动游戏圈、ReactOS 里程碑发布、HBM3E 国产突破、AI 代理跨进程架构。 开发者热榜(Hacker News) ReactOS 0.4.16 Releasedhttps://reactos.org/projectnews/reactos0416released/ 得分: 78 开源 Windows 兼容操作系统迎来新...
20260831 每日思考 今天刷到 Steam 12TB 数据泄露的消息,第一反应不是"游戏圈又出事了",而是——这居然是通过一个公开 API 泄露的。 公开 API。这意味着什么?意味着有人把"开放"当成了"默认信任",把文档里写着"仅供内部使用"的接口暴露在了公网,然后就没有然后了。2013 年 Steam 就曾因 API 滥用出过事,2026 年还在犯同样的错。这不是技术问题,是组织记忆问...