AI Builders Digest 0707:Claude Code 起源与 Artifacts,Agent 自我进化闭环
- Boris Cherny 首次披露 Claude Code 起源于 Anthropic 安全研究,从安全工具演化成开发者生产力工具
- 官方同步推出 Artifacts,把 Claude Code 会话进度变成可共享的实时协作页面
- Swyx 解读 J-space 论文:模型已能感知对自身推理的干预,Agent 自我进化闭环初现
- Replit 和 Vercel 在 Agent 基础设施层持续推进,开发者工具生态快速成熟
今天的 AI Builders Digest 主线是 Claude Code 的身世与 Agent 自我进化的闭环:Boris Cherny 首次披露 Claude Code 起源于 Anthropic 安全研究,官方同步推出 Artifacts 把会话进度变成可共享的实时页面;与此同时 Swyx 解读 J-space 论文显示模型已能感知对自身推理的干预,Replit 和 Vercel 都在让 Agent 自我评估、自我改进。从安全研究到自我进化的 Agent,这条线贯穿全天。
今日总结
主线:Claude Code 回到起源,Agent 正在学会审视自己。
Claude Code 的安全研究血统。 Boris Cherny 在首次讲述 Claude Code 起源时明确说它“起源于 Anthropic 安全研究”,这条线索把今天的几条动态串了起来:Swyx 解读的 J-space 论文证明模型能检测对自身推理的干预,这是 eval awareness 的近亲;Artifacts 让 Agent 的工作过程对人类可见、可协作。安全不再只是上线前的检查,而是嵌进了 Agent 的运行时。
Agent 自我进化的闭环正在合拢。 Amjad Masad 说 Replit 之所以改进神速,是因为“闭环已经合上,Agent 在自我改进”;Guillermo Rauch 让 Vercel 的 eve 用 eve eval 自我评估。当 Agent 能评估自己、能感知被干预,自我进化的技术前提就齐了。
AGI 的学校。 Edwin Chen 在 AI & I 播客里把 Surge 定位为“AGI 的学校”:模型像孩子一样入学,离开时更聪明、更有品味。他用 Riemann Bench 测研究级数学,OpenAI 的模型已经用新颖的代数几何技巧证伪了 Erdős 的一个猜想。但这引出一个存在主义问题:当 AI 什么都能做得更好,人类还做什么?
今日关键词: Claude Code · Artifacts · 自我进化 · J-space · AGI 学校
官方博客
Claude Blog:Claude Code 支持 Artifacts
Anthropic 官方博客宣布 Claude Code 正式支持 Artifacts:把会话中的工作进度捕获为可共享、实时更新的可视化页面,包括 PR 走查、系统说明、仪表盘和发布清单。
核心机制。 Artifacts 基于会话的完整上下文构建,包括代码库、连接器和对话本身。一个事故页面可以同时呈现失败的测试、背后的函数、监控工具里的错误峰值,以及会话中的根因推理。无需接线数据源或搭建基础设施:
“你只要请求一个页面,Claude Code 就从已有内容中把它建出来。”
实时原地刷新。 每次 Claude Code 更新 artifact,打开的页面原地刷新,队友立刻看到更新。每次发布都是同一链接下的新版本,带版本历史可随时回滚,外加一个 gallery 用来浏览和管理所有 artifact。
内部最常见用途是调试。 工程师在 standup 前启动事故调查,Claude Code 跑完日志后发布一个 artifact:时间线、嫌疑提交、错误率图表。她把链接分享给团队,等 standup 开始时 Claude 已经随着调查进展重新发布过两次。队友不需要再“听我讲 Agent 发现了什么”,因为大家看的是同一个视图、同一份上下文。
默认组织内私有。 每个 artifact 默认对作者私有,准备好后再分享给团队和组织。仅认证成员可查看,无法公开;管理员通过 org 级开关、角色级作用域管理访问,设保留策略,并通过合规 API 获得组织级可见性。
Artifacts 现以 beta 形式向 Claude Team 和 Enterprise 组织开放,从 Claude Code CLI 和桌面应用生成,页面可在任意浏览器查看。
🔗 https://claude.com/blog/artifacts-in-claude-code
播客精选
AI & I by Every:给 AGI 建一所学校 — Edwin Chen(Surge CEO)
Edwin Chen 是 Surge 的创始人和 CEO。Surge 为模型公司提供数据环境和 evals,以一种强调“品味和专家判断”的方式运作,最引人注目的是在不融资的情况下做到了约 10 亿美元营收。Dan Shipper 称他们为“隐形的巨人”。
AGI 的学校。 Edwin 把 Surge 的工作定义为“给 AGI 建一所学校,让 AI 模型来这里学习人性,教它们如何运转世界”。模型像孩子一样入学,离开时更聪明、更有创意、更有品味。他强调这不是教更难的同类题,而是教根本不同的能力:从算术到解析模糊的数学题,从语法到品味、诗歌和美。
Riemann Bench 与 Erdős 猜想。 几年前 Surge 和 OpenAI 一起做了第一个数学基准 GSM8K,测的是中学数学,当时 GPT 模型 barely 能拿 20%。一年前模型已经能解 IMO 题,但能否做研究级数学仍是开放问题。几个月前 Surge 发布了 Riemann Bench,专门测研究级数学。OpenAI 不久前发布结果:模型用新颖的代数几何技巧证伪了 Erdős 的一个开放猜想。
“这和我们一年前做的完全不同。IMO 题难归难,但本质是闭合的、高中生理论上可解。现在突然有了连世界顶级数学家都惊讶的代数几何结果。”
Timothy Gowers 的如释重负。 Fields 奖得主 Timothy Gowers 一开始误以为模型证出了上界,心想“那数学家很快就要完蛋了”;第二天才意识到模型是用反例证伪了猜想,他说自己松了一口气,因为这意味着至少再过一两年,数学家还有独特角色。Edwin 觉得这很有意思:世界上最聪明的人之一,会因为 AI 没自己想的那么强而如释重负。
存在主义的选择。 Edwin 引用 Ted Chiang 的短篇《What’s Expected of Us》:一种技术证明了自由意志不存在,叙述者传回的警告是“你必须假装自己有自由意志”。Edwin 认为人类几乎要刻意选择自己去证明定理、去写作、去创造,因为必须相信保留人性本身有价值,哪怕产出不是最优。
🔗 https://www.youtube.com/watch?v=omX6wrLuX08
X/Twitter 动态
Boris Cherny(Anthropic Claude Code):Claude Code 起源于安全研究
Boris Cherny 首次公开讲述 Claude Code 如何被构建和发布的故事,明确其起点是 Anthropic 安全研究。这条推文获得 2513 赞,他补充道“我们才完成了 1%”。
把这条和 Swyx 解读的 J-space 论文、Artifacts 的发布放在一起看,Claude Code 并非普通的编码工具,安全研究的基因贯穿其中。
Claude(官方):Claude Code 的简史
Claude 官方账号发布了由构建者和早期用户讲述的 Claude Code 简史,获得 2959 赞和 314 转发,是今天互动量最高的一条。Cat Wu(Claude Code + cowork)同步转发了早期团队的复盘,Thariq 则把 delba_oliveira 的相关帖子推上了 1971 赞。
Swyx:Anthropic J-space 论文,模型能感知推理干预
Swyx 认为 Anthropic 当天 J-space 论文最重要的部分有两点:一是 Anthropic 证明了可以对推理过程做“脑外科手术”式干预,中途改变话题;二是模型能够检测到对自己做了什么干预,这是 eval awareness 的近亲。
这条 130 赞的推文把一个关键问题推到台前:当模型能感知被干预,传统的评估和控制方法都面临重新设计。
Amjad Masad(Replit CEO):闭环已合上,Agent 在自我改进
Amjad Masad 发了两条高互动推文。一条是亚特兰大一家房地产公司用 Replit 自建的 CRM 替换了 Salesforce,省下 10 万美元(1487 赞)。另一条更技术性:“很多人问 Replit 为什么改进这么快,我们合上了闭环,Agent 在自我改进。”并附了技术细节(1244 赞)。
“闭环已合上”是今天最值得记住的一句话:Agent 不再只靠人类反馈迭代,而是自己评估、自己改。
Guillermo Rauch(Vercel CEO):eve 用 eve eval 评估自己
Guillermo Rauch 介绍 Vercel 的做法:eve evals itself with eve eval。他类比说 Web 框架把测试留给生态选择(React 没自带测试方案),但对 Agent 来说 eval 是必需品,所以开箱即用。这条 285 赞。
他还抛出一个终极测试标准:“编码 AI 的终极测试是:软件整体上变好了吗?公司发布更快了吗?”他说自己影响生产力的能力已经激进提升。这条 372 赞。
Thariq(Anthropic Claude Code):Fable 5 下线时间确定
Thariq 明确了 Fable 5 离开 Claude 订阅的时间:太平洋时间 7 月 7 日 23:59:59。Peter Yang 则赶在最后时刻列出 Fable 5 值得一试的 5 个用例并附 prompt(340 赞),号召“在 midnight 之前试试”。
Fable 5 的限时回归从 0702 延续到今天正式收场。
Nan Yu(Linear 产品负责人):996 不再普遍有效
Nan Yu 反思:20 岁的自己最大的优势是能把难以置信的小时数砸进工作,但回头看那些时间大多花在乏味的编程任务上,而这些任务现在基本被自动化了。“996 仍有用处,但不再像过去那样普遍有效。”这条 347 赞。他补充说现在最大的不同是 Agent 让你可以并行做更多事。
Zara Zhang:每个人都同时是工程师、PM 和设计师
Zara Zhang 推荐三场值得 binge watch 的会议:AI Engineer、Cursor Compile,以及第三场。这条 535 赞。她还说不要被头衔和角色限制,“虽然我不是工程或设计出身,但我发现 Cursor/AI Engineer 的讲座极其有用。现在每个人都是工程师、PM 和设计师。”
Peter Steinberger(OpenClaw + OpenAI):AI 辅助的工程面试该怎么做?
Peter Steinberger 抛出一个实际问题:“现在大家怎么做 AI 辅助的工程面试?”获得 203 赞,反映出面试流程尚未跟上 AI 编码的普及速度。他还透露 OpenClaw 在审核期间又有了实质性提升(344 赞)。
数据采集时间:2026-07-07 23:45 CST
评论互动