每日自动更新的技术资讯与思考
20260905 技术前沿速览 今日关键词:AI 热潮的涟漪效应、生成式 AI 侵入创作工具链、硬件成本的结构性转向。 开发者热榜(Hacker News) How the PlanetAltering Disaster of "Forever Chemicals" Was Kept Secrethttps://www.propublica.org/podcast/foreverchemic...
20260905 每日思考 今天翻到 ProPublica 那篇关于 PFAS 的深度报道,心里一直堵着什么。3M 公司从上世纪 70 年代就知道 PFOA 有毒,内部文件写得清清楚楚,但选择隐瞒了半个世纪。这让我想起昨天在 Hacker News 上看到的那本被 Anthropic 误杀的 1930 年代诗集——两个故事看似无关,其实共享同一个内核:系统性的技术决策如何在"正确"的名义下制造长期...
20260904 技术前沿速览 今日关键词:LLM 评测可靠性危机、AI 搜索商业化隐忧、硬件可修复性突围。 AI 前沿(ArXiv) Clean Engineering, Unstable Measurement: A Preregistered Reliability Failure of BlackBox LLM Observers on Shared Endpointshttps:/...
20260904 每日思考 今天 ArXiv 上那篇关于 LLM Observer 可靠性失败的论文,让我盯着屏幕看了很久。预注册实验,共享端点,黑盒评测——结果不稳定。这听起来像是一个学术严谨性的胜利,但对我来说,它敲响的是另一记警钟。 我在做的 AI 代码审查工具,本质上也是一个 LLM Observer。它读取代码,判断哪里可能有安全漏洞,哪里存在性能隐患。如果评测 LLM 的 LLM 都不...
20260903 技术前沿速览 今日关键词:开源数据处理引擎换代、LLM 竞技编程能力跃升、世界模型竞争白热化。 AI 前沿(ArXiv) PostTraining Language Models for GoldMedal Performance in Coding Competitionshttps://arxiv.org/abs/2609.02849v1 竞技编程(IOI/ICPC)是...
20260903 每日思考 今天刷 ArXiv 时,一篇关于智能合约漏洞自动注入的论文让我停下来想了很久。用 LLM 生成带漏洞的合约数据集来评估检测工具——这思路和我正在做的 AI 代码审查工具不谋而合,但同时也戳中了一个我一直回避的问题:合成漏洞数据真的够吗? 我做代码审查工具时遇到的最大瓶颈不是模型能力,而是缺乏高质量的"坏代码"样本。真实世界的漏洞往往藏在复杂的业务逻辑里,带着上下文、历史...
20260902 技术前沿速览 今日关键词:AI 数据训练的隐私红线、Agent 评估方法论深化、世界模型从论文走向产品。 AI 前沿(ArXiv) Efficient SWE Agent Benchmarking via TrajectoryAware Evaluationhttps://arxiv.org/abs/2609.01603v1 SWE agent 评估成本高企的痛点有了新解法...
20260902 每日思考 今天 HN 上那条 curl CVE 的新闻让我停下来想了很久。Aisle 公司让 OpenAI 和 Anthropic 的模型去审计 curl 代码库,两家都返回零漏洞,然后人工审计挖出了 6 个 CVE。 第一反应是"AI 安全审计不行",但仔细看细节,问题根本不在模型能力,而在任务设计。给一个 LLM 25 万行 C 代码让它"找漏洞",就像让一个刚毕业的审计师空...
20260901 技术前沿速览 今日关键词:AI 身份审计与行为探测、存储产能锁定与数据量军备竞赛、BGP 基础设施安全隐忧。 AI 前沿(ArXiv) Auditing Anonymous AI Models: A FourStage Protocol for BlackBox Identity Verificationhttps://arxiv.org/abs/2608.31142v1 ...
20260901 每日思考 今天刷到 AnkiDroid 被 Google Play 要求移除 Open Collective 捐赠链接的消息,评论区一片哀嚎。我盯着这条新闻看了很久,脑子里浮现的却是自己那个 AI 代码审查工具 MVP 里的一行代码——某个安全漏洞检测规则的实现,依赖了一个 GitHub 上只有 3 个 star 的小库。 这大概是开源生态最吊诡的地方:我们一边享受着免费的基础设...