AI Builders Digest 0706:Agent 管理范式转变,测试时计算重塑基准评测

发布于 2026年07月06日 23:52 #Follow Builders#Agents

AI Builders Digest 0706:Agent 管理范式转变,测试时计算重塑基准评测 封面图
  • Noam Brown 指出 test-time compute 让模型能力变成花钱多少就有多少能力的函数,传统 benchmark 单点数值失去意义
  • Nan Yu 断言 RTS 微操式 Agent 管理是死胡同,从 Cat Wu 到 Dan Shipper 都在展示新的管理范式
  • 主线是 Agent 管理范式与评测框架的双重转变,整个行业正在重新定义如何衡量和管理 AI 能力
  • 测试时计算的引入,让评测从静态打分变成动态成本效益分析,需要全新的评测方法论

今天的 AI Builders Digest 主线是 Agent 管理范式与评测框架的双重转变:Noam Brown 指出 test-time compute 让模型能力变成“花多少钱就有多少能力”的函数,传统 benchmark 的单点数值已失去意义;与此同时,Nan Yu 断言 RTS 微操式 Agent 管理是死胡同,从 Cat Wu 到 Dan Shipper 都在展示“委托而非控制”的新范式。

今日总结

主线:Agent 管理和模型评测正在同步经历范式级转变 —— 从“微操控制”到“预算委托”,从“单点分数”到“计算量曲线”。

Test-time compute 让 benchmark 失能。 Noam Brown 在 No Priors 播客中指出,GPT-5.5 发布时 benchmark 提升只有几个百分点,但实际体验远超纸面数据。原因很简单:现代模型可以持续思考数周才达到性能平台期,但 benchmark 不控制推理计算量。这不仅是评测方法问题,更关系到安全政策:如果模型能力是预算的函数,那应该在什么预算水平上评估风险?

Agent 管理从 RTS 转向委托模式。 Nan Yu 说得直接:“用 RTS 游戏的方式管理 Agent 显然是死胡同。”AI 在微操层面早已碾压人类 —— 真正的问题不是如何控制每一个 Agent 动作,而是如何设定目标和预算,然后放手。Cat Wu 的 Claude Code 候选人搜索工作流正是这种范式的实践:描述需求、启动动态工作流、锁屏出门、回来审查结果。

经济杠杆的终极释放。 Garry Tan 的洞察将技术趋势拉回人性层面:人类财富的真正约束从来不是资源,而是好想法和执行杠杆。AI 正在删除“杠杆”这个约束,剩下的只有想法本身。Nikunj Kothari 甚至认为 VC 路演会议也该被 Claude prompt 取代:与其听创始人鹦鹉学舌讲 deck,不如直接让双方把 prompt 上传给 AI 做高效对话。

今日关键词: Test-Time Compute · Agent 委托 · Benchmark 曲线 · 杠杆释放 · Claude Code 工作流

播客精选

No Priors:大规模 Test-Time Compute 如何改变基准评测、安全与研究 —— Noam Brown(OpenAI)

Noam Brown 是 OpenAI 研究科学家,业界公认的 AI 推理先驱之一。他在 No Priors 播客中系统阐述了 test-time compute 对模型评测和安全政策的深远影响。

GPT-5.5 的 benchmark 困境。 5.5 发布时,benchmark 表格只显示比 5.4 提升几个百分点,引发大量质疑。但几小时后用户实际体验完全翻转了评价。Brown 解释:5.5 的推理效率远超 5.4,在控制相同思考时间的前提下提升显著。问题是 5.4 的 max 设置思考时间长得多,benchmark 没有控制这个变量。

“如果你给模型 10 美元预算,它能做的事远多于 10 美元。给 1000 万美元,它还能做更多。那应该在什么预算水平上评估这些模型?现有的政策根本不回答这个问题。”

平台期远在数周之外。 2022 年的 GPT-3 时代,模型无法长时间进行有效推理,benchmark 跑到性能平台期并不遥远。但今天的模型经过合理 scaffolding,可以在某些 benchmark 上持续思考数周才达到平台期。这意味着“跑到平台期再评估”在操作上已不可行。

安全政策的盲区。 Brown 指出一个关键问题:现有的负责任扩展政策(RSP)只按模型能力定级,不考虑 test-time compute 预算。在一个模型能力等于预算函数的时代,这留下了巨大的评估盲区。他建议 benchmark 结果应该以 token 数量或成本为 x 轴绘制曲线,而不是给出单个数字。

路由 vs. 专注。 关于模型路由(用多个模型取共识)是否优于单一模型长时间思考,Brown 保持原则性谨慎:必须在控制 test-time compute 的前提下比较,而且路由方案容易在 benchmark 上过拟合,真实场景未必有效。

🔗 https://www.youtube.com/watch?v=AZrU6y3pUcU

X/Twitter 动态

Nan Yu(Linear 产品负责人):RTS 式 Agent 管理是死胡同

Nan Yu 连续两条推文直指 Agent 交互范式的核心问题。“用实时策略游戏的方式管理 Agent 显然是死胡同。按现有标准已算古老的 AI 就能碾压 99% 以上人类玩家,在微操层面做到极致。”他认为真正的方向不是更精细地控制 Agent,而是设定目标和约束后放手。

随后他补了一刀:“吹嘘自己同时开了 10 个 Claude Code 标签页,不过是在表演罢了。”言下之意:真正高效的 Agent 使用不应该需要人类时刻盯着多个会话。

🔗 https://x.com/thenanyu/status/2073920326304460847


Cat Wu(Anthropic):Claude Code 动态工作流实战

Cat Wu 分享了她在 Anthropic 内部使用 Claude Code 的最新场景:候选人 sourcing。

工作流很简单:

  • 告诉 Claude Code 职位需求和目标背景
  • 让它启动动态工作流找到 100 个候选人,包含 LinkedIn、Twitter、博客、播客和一页 pitch
  • 生成 Artifact 并邮件发送
  • 锁屏出门,在路上审查结果

这条推文获得 555 赞,说明“设定目标、委托执行、异步审查”的工作模式正在成为 Claude Code 用户的主流实践。

🔗 https://x.com/_catwu/status/2073806626965049686


Dan Shipper(Every CEO):Fable 的百 Agent 舰队

Dan Shipper 用两条幽默推文捕捉了 Fable/Ultracode 时代的荒诞感:

“我:把这个按钮颜色改一下。Fable:好的,我刚启动了 100 个 Agent 的舰队来处理这个任务。”

另一条更简洁:“Fable on ultracode: ‘make no mistakes’”

这两条推文合计近 200 赞,精准调侃了新一代编码 Agent 的“小题大做”倾向:为改一个按钮颜色,AI 可能调动的算力超出你的想象。

🔗 https://x.com/danshipper/status/2073764166700048480


Garry Tan(YC CEO):我们刚刚删除了杠杆约束

Garry Tan 在大阪发了一条被广泛转发的洞察:

“人类财富的真正约束从来不是资源,而是服务彼此的好想法,以及将其付诸行动的杠杆。我们刚刚为所有人删除了杠杆约束。现在只剩下想法本身。去想,然后去构建。这是你的时代。”

这条推文将 AI 的经济意义提炼到了最简:历史上资本、团队、渠道都是瓶颈,AI 正在逐个消解这些约束。剩下的唯一稀缺品是“好想法”。

🔗 https://x.com/garrytan/status/2073881439700168925


Nikunj Kothari(FPV Ventures 合伙人):VC 路演也该交给 Claude

Nikunj 从投资人视角发问:创始人对着 VC 鹦鹉学舌讲同一套 deck 有什么意义?他期待遇到这样的创始人:要求 VC 先深度体验产品、给出两条反馈,才允许通话。

“让双方把各自的 prompt 上传给 Claude,用数字方式完成高效对话,对两边都更有效率。”

这条推文 113 赞,反映出 AI 正在渗透到创业融资这一看似最需要“人情”的环节。

🔗 https://x.com/nikunj/status/2073903310982218088


Sam Altman(OpenAI CEO):GPT-5.6 发现新数学

Sam Altman 用家庭日常对比 AI 进展:“我家老大第一次把两个词连起来说了,我对这个认知成就的惊叹程度,大概和对 GPT-5.6 发现新数学差不多。”

1.1 万赞的背后是 Altman 标志性的轻描淡写:用育儿日常做参照系,暗示 GPT-5.6 在数学推理上达到了新的质变点。结合 Noam Brown 在播客中对 test-time compute 的讨论,这很可能与更大规模的推理预算有关。

🔗 https://x.com/sama/status/2073791666553844074


Peter Steinberger(OpenClaw):强烈推荐 OpenClaw

Steinberger 简单直接地推荐了 OpenClaw 项目,获得 184 赞。OpenClaw 作为开源 AI Agent 框架持续受到开发者关注。

🔗 https://x.com/steipete/status/2074007001802367446


数据采集时间:2026-07-06 23:52 CST

评论互动

© 2026 王若风的技术博客 · Powered by Astro