AI Builders Digest 0622:模型吞噬脚手架、context 护城河、软件消费 agent 化
- 模型将在12个月内吞噬agent harness,社区需要harness bench量化适配能力
- 多模型路由层成为新价值层,但harness是过渡态还是护城河存在争议
- context是真正不被模型吃掉的护城河,input需3-5倍output防slop
- agent将100倍消费软件,headless化使CRM、文档等数据被密集调用
- 垂直超智能先到来,coding已像窄超智能,下一个是数学、金融、科学
今天的 AI Builders Digest 主线是 模型吞噬脚手架:Google DeepMind 的 Logan Kilpatrick 在 Training Data 播客里给 agent harness 的 alpha 判了「大约 12 个月就会被模型吸收」的期限,并呼吁社区做一个 harness bench。同一波的 X 动态里,Aaron Levie 把 Sakana Fugu 的多模型路由当成新价值层,Peter Steinberger 却对 multi-model routing 唱反调——harness 到底是护城河还是过渡态,今天这场隔空辩论很值得标记。另一条更稳的暗线是 context:Garry Tan 开源 GBrain,Zara Zhang 给出 input 需 3-5 倍 output 的防 slop 规则,真正不被模型吃掉的可能正是 context。
今日总结
主线:agent harness 正从「壁垒候选」变成「过渡态」,但路由层和 context 层同时在抢着接棒。
Logan 给出了 harness 被吃掉的时间表。 antigravity 正在成为驱动 search、Gemini app、Cloud、AI Studio 的统一 agent harness,coding 已经证明自己是通用 agent harness;但 Logan 同时断言,今天我们叫「模型」的东西早已不只是权重,而是围绕权重长出的一整套系统,scaffolding 领先模型几步、然后被模型 upstream 吃掉。他给 harness 的 alpha 判了大约 12 个月的期限,并点名社区需要一个 harness bench。Gemini 3.5 flash 纯靠 post-training 超越此前任何 pro 模型、AI Studio 一周生成约 35 万个 Android 应用,都在证明「引擎在转」。
路由层正在抢着当新 alpha。 Aaron Levie 把 Sakana Fugu 的多模型路由看成本时代应用层搭 harness 的通用做法,Steinberger 反过来公开对 multi-model routing 表示怀疑——同一天,harness 是护城河还是过渡态,三种立场同台。Rauch 的 IKEA 效应补了一刀:harness 不只是技术层,也是人与 agent 的心理契约层,你亲手「搭」出的代码越容易让你高估它的价值。
真正可能不被吃掉的,是 context。 Garry Tan 开源 GBrain 并断言,AGI 给智能、你得自己收集 personal context 才有真正解锁;Zara Zhang 把它落到操作层——input 要 3-5 倍于 output 才防得住 slop。harness 会被 model 吃掉,但你独占的 context 不会。
软件消费侧同步被 agent 改写。 Levie 的另一句更狠:agent 消费软件会是人的 100 倍,headless 化会让 CRM、文档、analytics 数据被远比人更密集地调用。Ryo Lu 在 Cursor mobile 里 vibe code 出 ryOS Books、Nan Yu 的「质量是非理性的」、Peter Yang 转述的 HTML 作为 agent 母语,都是这条主线的具体切片。
今日关键词: model eats harness · harness bench · context moat · headless software · jagged superintelligence
播客精选
Training Data:为什么模型会吃掉 harness — Logan Kilpatrick(Google AI Studio / Gemini API)
Logan Kilpatrick 负责 Google AI Studio 和 Gemini API,刚在 Google IO 之后做客 Training Data。整期可以浓缩成一句:agent harness 这层的 alpha 大约 12 个月就会被模型吃掉。
antigravity 是 Google 的统一 agent harness。 Logan 透露 antigravity 不只是 IDE,而是 IDE + web + CLI + SDK 的整套生态,并且同一个 harness 正在驱动 search、Gemini app、Cloud、AI Studio——曾经 Gemini 是 50 多个 Google 产品的 through line,现在 antigravity 正在成为新的 through line。他的判断很直接:coding 已经证明自己是通用 agent harness。
agentic 化的进度仍在 crawl。 面向 13 亿级用户产品,Google 大部分体验还在「爬」,Gemini app 和 antigravity 接近「走」,DeepMind 研究更激进。原因是大多数用户还没准备好让 AI 全自动替他们行动,产品有责任把人「带在驾驶座上」。
Gemini 3.5 flash 是纯 post-training 收益。 Logan 强调 3.5 flash 在 coding 上超越了此前任何 pro 模型,而这一切全靠 post-training——是训练侧的硬成绩,不是预训练窗口的红利。他还透露 AI Studio 上周已生成约 35 万 个 Android 应用,是「过去根本不会有人去造」的那批个人软件。
核心论点是 model eats the harness。 Logan 说,今天我们叫「模型」的东西早已不只是权重,而是围绕权重长出的一整套系统——agentic tool calling、hosted tools、容器化 agent harness。scaffolding 通常领先模型几步,然后被模型吃掉、upstream 进模型。他给出时间表:
“the harness is where the alpha is. I think that perhaps won’t be true… in twelve months. the models will have just digested a bunch of that… the alpha will be somewhere else now.”
他还点名一个社区缺口:需要一个 harness bench,量化不同模型适配不同 harness 的能力。
垂直超智能会先到来。 Logan 用「jagged superintelligence」形容现状:coding 已经像窄超智能,下一个会是可验证性强的领域——math、finance、science。他还给了一个反 cannibalization 的判断:agent 时代搜索的正和效应远大于零和,Google 的成功标尺会从「最大化眼球时长」转向「最大化用户结果」。
这期播客和今天 X 上的 harness 路由之争正好对位:Logan 说模型会吃掉 harness,Levie 把路由层看成新价值层,Steinberger 则怀疑 multi-model routing——三种立场同一天出现,很值得标记。
🔗 https://www.youtube.com/watch?v=cMAs8z2dehs
X/Twitter 动态
Aaron Levie(Box CEO):多模型路由是新的价值层,agent 会 100 倍地消费软件
Levie 转发 Sakana 的 Fugu:单一 API,工作自动分发给最适合的模型,Fugu 自己负责 model selection、delegation、verification 和 synthesis,多 agent 的复杂度不进入你的代码。他的判断是,这正是当下应用层 AI 产品搭 agent harness 的通用做法,而把它做成任何开发者都能调用的 LLM 是个好主意——frontier 与 OSS 模型越多元,能做最优路由的那一层越值钱。
另一条更战略化的推文:agent 消费软件的量会是人的 100 倍。当软件 headless 化,使用量和价值都会暴涨——CRM、文档、企业知识、analytics 数据会被 agent 远比人更密集地调用,能在商业模式和技术上支持 headless 交互的平台最有优势。
🔗 https://x.com/levie/status/2068917230570795178
🔗 https://x.com/levie/status/2068851573175021864
Peter Steinberger(OpenClaw + OpenAI):对 multi-model routing 持保留态度
Steinberger 直接说自己对 multi-model routing 一直抱有怀疑,而最近的情况印证了他的直觉——与 Levie 力挺 Fugu 形成对照,harness 之争的同台感很强。他还更新了 OpenClaw 进展:炒作退潮后团队在打磨质量、补人,并注册了非营利组织(竞品多为 VC 资助、另有议程),这是他们至今最强的一周。
🔗 https://x.com/steipete/status/2068960117253632160
🔗 https://x.com/steipete/status/2068961217524490739
Guillermo Rauch(Vercel CEO):coding agent 会榨干你的宜家效应
Rauch 一句话点破 coding agent 与人的心理契约:coding agents will squeeze every ounce of IKEA effect out of you, if you let them——你亲手「搭」出的代码,越容易让你高估它的价值,agent 正好利用这种情感依附。这条和 Logan 的 harness 论放在一起看,harness 不只是技术层,也是人与 agent 的协作心理层。
Garry Tan(YC CEO):在可用 AGI 黎明期,你的 personal brain 才是真正解锁
Tan 开源了自己的 GBrain,并给出一个被低估的判断:在 2026 年可用 AGI 的黎明期,拥有自己的 personal brain 和 company brain 极其有用——AGI 给你智能,但你仍得自己收集个人 context 才能拿到真正的解锁。这条和 Logan 的「模型吞噬 harness」形成互补:harness 会被吃掉,但你独占的 context 不会被。
🔗 https://x.com/garrytan/status/2068701356358308112
🔗 https://x.com/garrytan/status/2068701357696323769
Zara Zhang(独立开发者):防 AI slop 的硬规则——input 要比 output 长
Zara 给出一条很可操作的判断:判断 AI 产出(写作、设计)是否会沦为 slop 的经验法则是,你的 input 是否比 output 长。她的实际体感是,要让 AI 出高质量结果,input 通常是 output 的 3-5 倍;如果 input 远短于 output,几乎注定是 slop。这是 context 护城河论最具体的注脚。
Ryo Lu(Cursor 设计负责人):在 Cursor mobile 里 vibe code 出 ryOS 的 Books
Cursor 设计负责人 Ryo Lu 因为怀念木质书架,在 ryOS 里做了一个 Books 应用:先在 Cursor mobile 里起步,再手工调动画和材质直到手感对,支持任意 epub 并通过 ryOS 账号同步进度。这是 coding agent 解锁个人软件的一个很具体的样本,也呼应 Logan 提到的「为解决个人问题而造软件」。
Nan Yu(Linear 产品负责人):质量是非理性的
Linear 产品负责人 Nan Yu 引用一句话并深表认同:quality is irrational。你需要对质量有非理性的投入,并需要非理性的自信去相信——从上到下自己掌控一切,会比用通用框架产出更好的结果。这恰好解释了为什么 Linear、Cursor 这类产品在 agent 时代仍坚持自研栈,而不是套现成 harness。
Peter Yang(150K+ 订阅 AI 教程作者):HTML 是 agent 做视频的母语
Yang 转述 liu8in 的判断:他们想做 video agent,但发现 agent 没有视觉智能,于是转向代码——HTML 是 LLM 的母语,LLM 不仅能用 HTML/CSS/JS 表达信息,还能表达视觉审美,footage、图片、素材、SVG 都可以挂在 HTML 之上。这给「agent 生成视频」指了一条比纯生成更可靠的路:用代码做骨架,生成内容做填充。
Thibault Sottiaux(OpenAI Codex / ChatGPT):在 X 上公开向用户要 Codex App 的吐槽
OpenAI Codex / ChatGPT 的 Thibault Sottiaux 连发几条直接要反馈:Codex App 还有什么不爽、该改进什么(单条回复冲到 3380 条),以及现在 Codex 可以 bank usage resets,你是囤积型还是无压力消耗型。这是 OpenAI 把产品改进直接挂到公开社交反馈环路上的信号,也说明 coding agent 产品的下一轮迭代正在密集收需求。
🔗 https://x.com/thsottiaux/status/2068736857312198928
🔗 https://x.com/thsottiaux/status/2068792010715324444
数据采集时间:2026-06-22 18:33 CST
评论互动