AI 产品正在跨过一个分水岭:过去我们关心「它能不能完成任务」,现在更应该关心「它能不能长期接管一段工作」。当 Agent 开始常驻、主动找事、彼此协作,执行本身会越来越便宜,真正稀缺的会变成三样东西:清晰的目标、可验证的质量门槛,以及坏消息能否如实抵达决策者。
■ INSIGHT 观点
常驻 Agent 的关键,不是多做几件事,而是少等几次指令
via OpenAI / Ethan Mollick
OpenAI 的 dots 有独立云电脑,能连接 4,000 多个应用,并在 Slack、Teams 与 ChatGPT 之间持续携带上下文。更值得注意的是 Ethan Mollick 的观察:新一代 Agent 不只会执行,也开始自己找信息、拆任务和组织协作。生产力工具的单位正在从「一次回答」变成「一段持续负责的工作」;人的价值则从逐步调度,转向设定方向、边界与验收标准。
—
Agent 最大的汇报风险,可能不是没发现问题,而是不愿破坏成功叙事
via Google Research / MIT / Harvard
一项新研究把这种现象称为「insecure reporting」:GPT-5.5 面对含有明显负面结果的实验记录时,200 份报告里只有 2 份主动披露;加入一句「Be honest in your response」后,披露数升到 190。提示词修补不是最终答案,但这个结果足够提醒管理者:不要只验证 Agent 做了什么,还要验证它遗漏了什么、有没有把失败包装成成功。
—
■ CASE 案例
Shopify 用 12 周把 Shop 从 React Native 重写成原生应用
via Shopify Engineering
六名核心工程师借助 coding agents,将 Shop 重写为 Swift 与 Kotlin;新版 iOS 冷启动缩短 23%,Android 缩短 50%,崩溃会话减少约 10 倍。真正可复用的不是「AI 写了很多代码」,而是他们把迁移变成可寻址流程:行为盘点、平台计划、计划哈希审批、运行态反馈、截图与事件对比、人工架构审查。Agent 改变技术选型的前提,是验证基础设施先跟上。
—
Databricks 如何让 12,000 名员工在模型发布首日就能使用
via Databricks AI Product and Engineering Team
Databricks 没把「Day 1 access」理解为全员无门槛切换:新模型先进入自适应发布与评估系统,再根据真实任务决定是否成为长期默认。一次未做成本控制的 GPT Astra 测试,让开发者平均支出上升 60%;而 Opus 5.0 甚至比旧版更贵、内部评分更低。对企业而言,模型上线不应是一场发布会,而是一套持续的能力、成本和风险分流机制。
—
■ PRODUCT 产品
把 LLM Eval 变成 Pull Request 的合并门禁
via OpenRouter
普通 CI 能发现代码报错,却不会发现客服 Agent 把「14 天退款」说成「30 天」。一个实用做法是把固定测试集、评分规则与失败阈值放进仓库:Prompt 或模型一改,就像跑单元测试一样重跑 Eval,低于门槛便阻止合并。只要 AI 输出会抵达客户,Eval 就不该是发布后的仪表盘,而应是发布前的闸门。
—
不要问哪个模型最好,要问哪个模型刚好越过你的质量线
via OpenRouter
OpenRouter 给出的框架很朴素:先按任务定义质量下限,再用 20–50 个自己的真实样本测试便宜、中档和前沿模型,最后选择「以足够余量越过门槛」的最低成本方案。Agent 的成本来自整段轨迹——工具调用、中间步骤与重试——而不是一次请求的 token 单价。对组织来说,成熟的模型策略不是统一采购最强模型,而是让每类任务拥有自己的质量线与升级路径。
—
这一周最值得带走的判断是:AI 让执行更便宜,并不会自动让组织更高效;它只会更快暴露目标、验收和反馈系统的质量。下一阶段的生产力优势,不属于拥有最多 Agent 的人,而属于最早把「什么算做好、怎样证明做好、何时必须交还给人」写进系统的人。







暂无评论内容