这一周最值得关注的,并不是又多了几个会写、会搜、会调用工具的模型,而是 AI 开始进入工作的「控制面」:它要做判断、调度流程、维护知识、访问数据,还要在上线后发现自己悄悄犯下的错。
这也让生产力问题换了一个重心。真正拉开差距的,不再只是模型能完成什么,而是组织能否把判断、权限、记忆、交付和复盘做成一套可持续运行的系统。
■ INSIGHT 观点
Jev:不要只让模型写答案,也可以让它输出决策信号
via TypeSafe AI
Jev 放弃生成长文本,直接返回带概率的类型化结果,适合分类、路由、评分和验证。它提供的不是一个更会聊天的模型,而是一种可以嵌进普通软件逻辑的「模糊 if 语句」:例如内容是否值得读、请求应该交给谁、结果是否需要人工复核。
这个方向很有价值,但也要警惕把复杂判断压成一个看似客观的浮点数。概率适合触发流程,不等于解释责任;越是招聘、风控等高影响场景,越需要保留证据、申诉和人工复核。
—
AI 让工作变好,不代表它让人变强
via Google Research
Google Research 在 11 家知识产权律所、133 名律师中做了三个月随机实验:AI 提升了整体工作质量,但资深律师的独立判断有所增强,初级律师平均没有获得同样的技能增长,结果反而出现更明显的强弱分化。
这提醒管理者区分两个指标:交付物质量和人的能力增长。如果 AI 接管了所有琐碎但能形成判断力的工作,组织可能得到更好的短期产出,同时积累更深的「能力债务」。新人仍然需要做预测、解释取舍、接受反馈,并在没有 AI 的条件下定期校准自己的判断。
—
■ CASE 案例
Notion 的 Data Scout:把数据队列改造成权限受控的自助分析
via Notion
Notion 内部最常用的 Agent 会查询 Snowflake 中的受治理数据,再结合 Notion、Slack 和会议上下文解释业务含义。过去一个月有一半员工使用过它;上线两个月后,数据团队 Slack 频道里的请求减少了 80%。
这不是简单地给数据库加一个聊天框。关键在于它同时拥有数据权限、业务语境和明确的工作出口:销售人员拿到的不只是数字,而是可以继续编辑的客户会议准备页。BI 的下一代界面,很可能不是更多 Dashboard,而是能在权限边界内把数据变成行动材料的 Agent。
—
Baseten 的答案机器人:知识库要会暴露缺口,也要会自我修复
via Notion × Baseten
Baseten 把企业知识 Agent 拆成三个协同角色:KatzGPT 从可信来源回答 GTM 问题;Sales Reporter 找出缺失或过时的内容,起草更新并交给专家审批;Sales Hub Verifier 持续检查所有者、标签和内容状态。
最重要的设计不是「什么都能答」,而是承认不知道,并把不确定性转成一项可分配的人类任务。专家修正随后回写可信来源,成为下一次回答的上下文。知识飞轮的起点不是更大的向量库,而是把失败答案稳定地变成维护动作。
—
■ PRODUCT 产品
定时 Agent 的六个部件:来源、出口、调度、记忆、护栏和交付账本
via Anthropic
Anthropic 的 Managed Agents 参考实现把每日简报当作一个小型服务,而不是「cron 加一段 prompt」:来源使用只读权限,偏好在每次运行时重新读取,状态用 bookmark 和 ledger 记录,只有 Slack 明确返回成功后才推进游标;结果不确定时标记为「maybe posted」,避免既漏报又重复发送。
这套原则适用于任何后台 Agent。不要把「没有新内容」和「来源读不到」混为一谈,也不要在交付尚未确认时提前更新状态。一个看起来很聪明的自动化,往往会死在权限漂移、重复发送和静默失败这些普通工程问题上。
—
AQuA:让另一个 Agent 去发现生产环境里的静默失败
via Google Developers
AQuA 定时抽样生产会话,经过评审、聚类、验证和跟踪,把 HTTP 200 背后的质量问题整理成可复查的失败模式。它不会直接修改生产 Agent,而是把错误轨迹与部署时的源码快照对照,给出带文件和行号的根因线索,再交给工程团队处理。
Google 的示例很说明问题:一次 32 会话测试中,基础设施全部正常,但 Agent 会绕过座位可用性检查、丢失素食偏好,甚至因为工具列表为空而捏造链接。上线后的 Agent 质量管理,不能只盯延迟、报错率和一次性 Benchmark;还要有一条持续读取真实轨迹的「外循环」。
—
过去我们常把效率理解为「把任务做得更快」。AI 进入工作系统之后,更重要的问题变成:哪些判断可以机器化,哪些能力必须刻意保留,哪些失败要自动暴露,哪些状态只有在交付确认后才能推进。
个人和组织真正需要建设的,不是更多零散的 AI 使用技巧,而是一套能持续回答这些问题的运行机制。







暂无评论内容