AI Builders Digest 0628:Claude Code Artifacts、长期记忆与应用层 ROI
- Claude Code Artifacts 将Agent输出转为可共享、可更新的实时协作页面
- Engram 推动长期记忆从RAG转向持续训练,将知识内化进模型权重
- Aaron Levie 强调应用层通过理解业务流程实现每美元更多智能
- Swyx 建议开放模型评测按美元推理成本报告而非仅token数
- Agent工作从对话变成可交付系统,留下可共享、可训练、可审计的工作痕迹
今天的 AI Builders Digest 主线是 Agent 工作开始从对话变成可交付系统:Claude Code Artifacts 把一次调试、重构或数据分析变成团队能打开的实时页面;Engram 把长期记忆问题推向「训练进权重」;Aaron Levie 和 Swyx 则提醒,真正值钱的不是更长上下文,而是理解业务流程、控制推理成本、把智能变成可衡量产出的那一层。
今日总结
主线:Agent 的下一步不是会聊天,而是会留下可共享、可训练、可审计的工作痕迹。
Claude Code Artifacts 把 Agent 输出从聊天记录升级成协作界面。 Claude 官方博客给出的例子很具体:一次 incident investigation 可以生成 timeline、suspect commits 和 error-rate chart;Claude 继续工作时,页面会原地刷新,同一个链接保留版本历史。它解决的不是「模型能不能解释」,而是团队不再需要围着一句「walk us through what the agent found」同步状态。
长期记忆开始从 RAG 和上下文工程转向持续训练。 Engram 的 Dan Biderman 和 Jessy Lin 在 Training Data 里把问题说得很直:模型的瓶颈不是 raw intelligence,而是能不能理解新任务、新团队、新公司上下文。他们的方向是 per-team models,用 adapter fine-tuning、LoRA、prefixes、sparse architectures、SFT、RL 和 on-policy distillation,把文档、交互和反馈变成训练信号。也就是说,企业 Agent 的记忆不只是「检索更多资料」,还要学会哪些东西该内化,哪些东西该外置为工具。
应用层开始争夺 intelligence-per-dollar。 Aaron Levie 把 token cost optimization 上升成 applied AI 的 playbook:懂工作流、懂上下文、懂业务流程的中间层,能通过 eval、领域 UX、FDE adoption,把同样的底层模型变成更高 ROI。Swyx 从评测侧补了一刀:如果听 Noam Brown 的建议固定 inference budget,那 open models 应该用「美元推理成本」而不是 token 数来报告 thinking levels,因为开源模型的 dollar-per-token mileage 更高。
今日关键词: Claude Code Artifacts · Continual Learning · Adapter Fine-tuning · Intelligence per Dollar · Deepsec
官方博客
Claude Blog:Claude Code Artifacts 把 Agent 工作变成实时页面
Claude Code now supports artifacts 这篇公告的重点不是又多了一个展示组件,而是 Claude Code 开始把一次会话里的工作进展捕捉成可打开、可分享、可更新的页面。官方列的场景包括 PR walkthrough、system explainer、dashboard 和 release checklist,核心是把代码库、connectors、对话上下文和推理过程合成一个团队能共同看的界面。
最有价值的用例是调试:工程师在 standup 前启动 incident investigation,Claude Code 发布一个 artifact,里面有时间线、可疑提交和错误率图表;调查继续推进时,同一个页面可以重新发布两次,团队看到的是同一份上下文的最新版本。每次发布都是同一个链接的新版本,带 version history 和 gallery。
「你不需要接数据源,也不需要搭基础设施。你要一个页面,Claude Code 会用已有上下文把它建出来。」
这其实是 coding Agent 的协作形态变化:过去输出是聊天记录,接下来输出是一个活的工作面板。模型能力仍然重要,但团队协作真正需要的是一个稳定、可回看、可分享的事实界面。
🔗 https://claude.com/blog/artifacts-in-claude-code
播客精选
Training Data:Engram 论长期记忆与持续学习 — Dan Biderman、Jessy Lin(Engram)
Memory and Continual Learning: Engram’s Dan Biderman and Jessy Lin 把「AI 记忆」从产品功能拉回训练问题。Dan Biderman 的开场判断很清楚:今天模型已经很聪明,真正瓶颈不是 raw intelligence,而是理解 new and evolving context。企业真正想要的是让模型像知道法国首都、会写 Python 一样,深度掌握自己的私有数据、流程和偏好。
记忆不是单纯塞进上下文窗口。 他们没有否定 context engineering、tool use 或外部数据库,但认为这些只是拼图的一部分。长期工作会产生每天数千万 tokens 的交互和文档,只靠保存、搜索、重读会越来越贵,也会让模型困惑。真正的问题是:哪些知识应该被内化进模型,哪些应该继续外置为工具。
per-team models 是 Engram 的产品方向。 他们和 Notion、Microsoft、Harvey 这类有长期工作空间的伙伴合作,目标不是让模型临时读文件,而是像在公司待了多年的员工一样理解团队工作方式。技术上,他们提到 adapter fine-tuning、LoRA、prefixes、sparse architectures,以及 supervised fine-tuning、RL、on-policy distillation,把原始文档和人机交互转成持续训练信号。
这和基础模型实验室的世界观不同。 Engram 想象的是每个人、每个团队都有自己的模型,因为很多要学习的东西是私有的,甚至彼此冲突:同一个任务,不同公司希望模型按不同方式做。Foundation model 越强,反而越凸显这层本地记忆和偏好训练的价值。
「How do you make the models learn new things and bake them deeply into the weights of the model?」
这句话是整期播客的核心:记忆如果只存在于检索层,它像笔记;如果进入权重,它才更接近组织直觉。
🔗 https://www.youtube.com/watch?v=aiR7F4jqjXY
X/Twitter 动态
Thibault Sottiaux(OpenAI Codex):Codex 补齐长线程、导航和复制体验
Thibault Sottiaux 1383 赞推文列出一组 Codex 体验修复:超长线程更顺滑、hoverable navigation rail 可以预览并跳转 turns、settings search 覆盖更多控制项、zoom-level 不再让 tooltip/dialog/menu/selection bubble/drag preview/autocomplete 错位,复制到 Slack 时能保留 Markdown 的 bullets、bold、code 和 links,大段粘贴也不再冻结 UI。看起来都是小修,但它们共同指向一个事实:coding Agent 的主要界面已经不是一次 prompt,而是长线程、长会话和跨工具复制。
另一条 607 赞推文把 Sol 和 Codex 操作放在一起调侃。连续两天 OpenAI 都在围绕 Codex 用量、额度、体验做公开沟通,说明 coding Agent 正在从实验工具进入高频生产软件。
🔗 https://x.com/thsottiaux/status/2071071289247244481
🔗 https://x.com/thsottiaux/status/2071089307062837744
Guillermo Rauch(Vercel CEO):Mythos / Sol 的网络安全能力攻防两用
Guillermo Rauch 1225 赞推文把 Mythos / Sol 的网络安全能力拉回攻防现实:这些能力对防御有用,对进攻同样有用;如果对手拿到等价 offensive capability,美国公司里那些还不知道的 latent vulnerabilities 会变成严重风险。他建议现在就用 deepsec 或类似 harnesses 跑可用的 frontier models。
这条和前一天 GPT-5.6 Sol 限流争议连在一起看很关键:模型访问控制不是抽象政策问题,而是企业安全团队今天要不要主动测自己、怎么用现有模型做红队的问题。另一条 957 赞推文只有一句「Me and my agents」,但情绪很准:Agent 已经从玩具变成开发者的工作伴侣。
🔗 https://x.com/rauchg/status/2071047674187714830
🔗 https://x.com/rauchg/status/2070982746080715052
Aaron Levie(Box CEO):应用层的价值是每美元更多智能
Aaron Levie 385 赞长推把 AI token cost optimization 讲成 applied AI 公司的核心机会:只有深度理解具体工作、业务流程和上下文,才能在底层智能与实际工作之间加一层真正有价值的系统。单个企业自己做这件事很难规模化,所以横向和垂直应用公司都有机会。
他的关键词是「more intelligence per dollar」。路径包括:为具体 use case 做 eval、深懂领域、做 tuned UX 和 features,再用 FDEs 支撑 adoption/change。换句话说,企业不是在买更便宜的 tokens,而是在买一套把 tokens 组织成业务结果的架构。
Swyx:开放模型评测应该按美元推理成本报告
Swyx 100 赞推文接着 Noam Brown 关于固定 inference budget 的讨论,提出一个更适合开放模型的评测轴:不要只按 token 数报告 thinking levels,而要按主流 inference providers 上的 dollar inference 报告。原因很现实:open models 相比 closed model APIs 往往有更高的 dollar-per-token mileage。
这个建议把「模型是否更会思考」拉回了部署经济学。同样是思考 1M tokens,开源模型、闭源 API、自建推理服务的成本曲线完全不同;如果 eval 不控制美元预算,开放模型和闭源模型的对比就会失真。
Zara Zhang:不会手写代码,也能用 GitHub 积累 1 万 followers
Zara Zhang 2149 赞推文是今天最强的个人 builder 信号:一年前她几乎不知道 GitHub 怎么用,现在有 1 万 GitHub followers,而且仍然不会手写代码。她随后 补充,自己不是工程师,这些都是为了解决自己的痛点、连接技术和用户问题而做的 side projects。
这条和 Claude Code Artifacts 放在一起看很有意思:Agent 时代的门槛下降,不是人人都变成传统工程师,而是更多人能把问题、产品、叙事和发布连成闭环。会不会手写代码变得没那么决定性,会不会把一个具体问题做成别人能理解、能复用的东西更重要。
🔗 https://x.com/zarazhangrui/status/2070982013822333007
🔗 https://x.com/zarazhangrui/status/2071116793234813272
Peter Yang:Hermes 每周自动生成健康检查邮件
Peter Yang 51 赞推文展示了一个小而完整的个人 Agent 工作流:每周六,Hermes 会从智能秤 Withings API、Fitbit、Google Health、一个 MCP server 和他 vibe coded 的移动健身 app 拉数据,生成 top takeaways 和 stats,帮他追踪健康目标。它不宏大,但非常具体。
这类项目说明 Agent 产品可能不是先从「万能助手」开始,而是从一个固定节奏、固定数据源、固定输出的私人运营报表开始。真正的价值不在模型多强,而在它每周准时把你懒得整理的东西整理出来。
Peter Steinberger:访问封锁很难阻止坚定用户
Peter Steinberger 670 赞推文只有一句判断:「History teaches us that access blockage rarely stops determined users.」放在 Sol/Mythos 访问限制的语境里,这句话点破了政策与技术扩散之间的老问题:封锁可以提高摩擦,但很难长期阻止有动机的人。
它和 Guillermo Rauch 的 deepsec 建议形成一组现实主义答案:如果能力终究会扩散,与其只赌访问控制,不如尽早用现有 frontier models 检测自己的安全面。
数据采集时间:2026-06-28 15:38 CST
评论互动