AI Builders Digest 0719:ChatGPT Work 进入工作流,个人 eval 取代排行榜
- ChatGPT Work 被展示为可执行的工作委派层,能够从数千条私信中筛选、分类、评分并生成表格
- Zara Zhang 建议为日常工作建立 personal eval set,用真实任务而非行业排行榜判断模型是否适用
- Jürgen Schmidhuber 认为屏幕后面的 AI 已经进步很快,但机器人硬件仍是通往真实世界 AI 的主要限制
- Guillermo Rauch 分享 Kimi K3、Sol 与 Fable 的网络安全评测观察,开放权重的防御性安全能力正在增强
- Aaron Levie 认为模型、垂直应用、推理基础设施与服务公司会共同推动 AI 扩散到真实 workload
今天的 AI Builders Digest 使用
2026-07-19T07:09Z的 follow-builders 快照:1 期播客、11 位作者、23 条推文,没有官方博客。最值得关注的变化是,Agent 不再只是回答问题,而是开始直接接管工作流、评估流程和真实任务。
今日总结
主线:Agent 的价值开始由“能不能做”转向“能不能替你持续做”。
ChatGPT Work 已经接近工作委派层。 Thibault Sottiaux 展示了从数千条私信筛选、抽取、分类、评分并生成表格的完整任务链;他还说自己“基本变成了把任务委派给 ChatGPT Work”。这比单次问答更接近可复用的工作流。
个人 eval 可能比行业排行榜更有用。 Zara Zhang 建议每个人收集几项与日常工作和生活直接相关的任务,持续测试模型能力边界。行业 benchmark 衡量平均能力,personal eval 才能判断一个模型是否真的适合你的工作。
模型层仍未商品化,应用层却在加速扩散。 Matt Turck 用连续三年的玩笑指出 model layer 仍未 commoditize;Aaron Levie 则看到 frontier labs、垂直应用、推理基础设施和服务公司共同扩张。模型更强只是起点,真正的瓶颈仍是把它稳定、低成本地部署到真实 workload。
今日关键词: ChatGPT Work · personal evals · model layer · cyber capability · AI workload
播客精选
Unsupervised Learning:Jürgen Schmidhuber 谈 AI、机器人与递归自我改进
Jürgen Schmidhuber 讨论了模型能力、物理世界和 recursive self-improvement。他认为屏幕后面的 AI 已经“运行得很好”,但真正的 AI 还包括机器人和现实世界中的机器,而硬件距离人类身体仍有明显差距。
谈到递归自我改进,他回顾了从 1987 年的 meta evolution、1994 年的 self-referential machines,到 2003 年形式化的 Gödel machine:机器可以提出修改自身的软件,但理想情况下应先证明修改能带来更高预期奖励。现实难点不是一句“模型会自我改进”,而是如何验证改动确实有益。
🔗 https://www.youtube.com/watch?v=RKjR8DQ40po
X/Twitter 动态
Thibault Sottiaux(Codex 与 ChatGPT):ChatGPT Work 承担端到端任务
Thibault 展示了一个具体工作流:读取数千条私信,筛选出提到 ChatGPT Work 的内容,生成姓名、链接、原文、8–12 类工作标签和成熟度评分。他还说自己“无法停止用听写,让它做所有事情”。ChatGPT Work 的产品形态因此从写文档扩展到检索、结构化和决策准备。
🔗 https://x.com/thsottiaux/status/2078702412085498087 · https://x.com/thsottiaux/status/2078697741455356367
Zara Zhang(Builder):先建立 personal eval set
Zara Zhang 建议每个人为模型建立一组与日常工作真正相关的任务。行业 benchmark 可以提供方向,但不一定反映“对你有用”的能力;持续用真实任务去撞模型边界,才能知道它适合承担什么。
🔗 https://x.com/zarazhangrui/status/2078666187026911488
Guillermo Rauch(Vercel CEO):开放权重的网络安全能力正在到来
Guillermo Rauch 分享内部评测观察:他认为 Kimi K3 在网络安全上属于顶级,Sol 在网络安全能力上有明显跃升但成本更高,而 Fable 在测试中拒绝完成任务。他把结论概括为:前沿级、开放权重的网络安全能力已经出现,但使用场景应限定在防御性加固。
🔗 https://x.com/rauchg/status/2078647648307880209
Aaron Levie(Box CEO):模型生态会向真实 workload 扩散
Aaron Levie 认为价值不会只集中在少数 frontier labs。围绕模型,正在形成面向特定用例的模型与推理服务、交付业务流程的应用公司、垂直领域实验室、Agent 基础设施与治理工具,以及推动企业变革的服务公司。他的判断是:现在还远未到宣布赢家的时候,最终会是异构生态。
🔗 https://x.com/levie/status/2078567715544121815
Swyx、Matt Turck 与 Peter Yang:效率、成本和低门槛原型
Swyx 预计 AEO 明年可能为他贡献 100 万美元收入,并继续讨论 on-policy auto-AEO 与可泛化 AEO 的差别;Matt Turck 用一句“model layer 仍未 commoditize”回应行业旧叙事;Peter Yang 则展示自己和 8 岁孩子用 ChatGPT Images、音乐与计时 boss level 做了乘法表学习网站。
🔗 https://x.com/swyx/status/2078581967768166591 · https://x.com/mattturck/status/2078520552680046920 · https://x.com/petergyang/status/2078638568784994686
数据采集时间:2026-07-19 15:09 CST(feed 快照生成时间)
评论互动