2026 CW#39 | 个人 AI Benchmark、Loop Engineering、CI 瓶颈、科学 Agent、工作交接

AI 把「执行」变得越来越便宜,但便宜不等于高效。这一周最值得注意的几个案例,都指向同一个变化:当模型能快速产出代码、报告和候选答案,真正稀缺的东西会向下游转移——什么叫好、如何验收、反馈能否回流,以及人类如何接过关键判断。

■ INSIGHT 观点

别再问「哪个模型最强」,先做一套自己的 AI Benchmark

via Mike Taylor / Every

通用榜单只能告诉你模型在别人的题目上表现如何,回答不了「它能不能做好我的工作」。Mike Taylor 的方法很实用:收集过去失败、反复修改或被放弃的真实任务,保留必要上下文,让多个模型重复执行,再把主观品味改写成可重复的通过/不通过标准。

好的个人评测集,其实是一份「我认为什么叫好工作」的可执行定义。与其对每次模型发布凭感觉换工具,不如先从 10 个自己真正在做的任务开始,尤其保留那些「上一代模型做不好」的案例。

—

AI 让执行力变得廉价之后,稀缺的是问题选择和品味

via 少数派

当代码、设计和内容的边际生产成本继续下降,「会使用工具」就很难成为长期壁垒。真正拉开差距的,会是选什么问题、如何判断结果、能否累积专属上下文,以及有没有让成果到达用户的分发能力。

这也是为什么「个人 Benchmark」值得做:它不只是选模型的工具,而是把注意力从产出速度拉回方向与标准。

■ CASE 案例

Loop Engineering:让 Codex 连续工作 6.5 小时,靠的不是更长的提示词

via 飞书技术闪光

这个实践让 Codex 连续运行约 6.5 小时,完成 31 个埋点场景、覆盖两个平台,并在自验证中发现和修复 6 个问题。关键不是让 Agent 「多坚持一会儿」,而是提前定义完成标准,接入外部反馈,先跑通单场景闭环,再放大到长时间执行。

无人值守的第一设计变量不是时长,而是反馈能不能回流。没有客观证据的长跑,只是更慢被发现的失败。

—

AI 编程加快之后,Linear 发现瓶颈跑到了 CI

via Mufeez Amjad / Linear

Linear 的代码吞吐量被 Agent 推高,但验证速度没有同步增长。团队从更快的 runner、关键路径上的小任务、重复 setup 到测试分片重做整条流水线;在测试套件接近四倍增长的同时,PR 等待从 6 分钟以上降到 5 分钟出头,单项测试的 runner 时间大约减半。

这个案例提醒了一个很容易被忽略的问题:每一次 AI 加速,都可能只是把队列推到下一环。不要只统计生成了多少代码,要追踪等待时间转移到了 review、CI、部署,还是协作。

—

949 个 Claude Agent 找到候选酶系统,重点是它最后进了湿实验

via Anthropic

Anthropic 称,949 个 Claude Agent 在约 21.5 小时内并行搜索了近 20 亿个蛋白质簇,找到一类与 CRISPR 式重复序列相邻的候选酶系统,再由实验室做实体验证。这还不等于完成科学发现;系统的生物学功能和可重复性仍需要更多研究。

但它展示了 Agent 进入专业生产线的一个可信模板:把大规模搜索拆成并行任务,保留过程和候选证据,最后用昂贵但更确定的现实反馈做验收。对普通知识工作来说,「湿实验」可能是真实用户、运行数据、代码测试,或者可追责的专业审核。

■ PRODUCT 产品

Notion Custom Agents 走进微型工厂:先做上下文编排,不急着替人决策

via Notion / Unspun

Unspun 尝试用本地微型工厂和 3D 编织设备按需生产服装。这个案例里,Custom Agents 连接客户需求、测试计划和设备运行信息,提前准备好人类判断所需的上下文。

这也许是企业 Agent 更快成熟的形态:不是立刻抢走决策权,而是把分散信息组装成可执行的交接包,让对的人在对的节点作出判断。对客户成功、制造、PMO 和复杂项目都很有参考价值。

—

本周这些信号放在一起,可以得到一个简单的工作流重构方法:先标出 AI 让哪一步更快,再寻找新出现的队列,最后为那个队列配上可观测的验收标准和交接机制。AI 生产力不是产出数量,而是端到端通过的优质结果。

THE END
点赞0 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容