AI Builders Digest 0714:模型路由成新常态,Nemotron 的四位精度革命
- 效率成为 2026 年 AI 第一性原理,算力见顶后靠更高效使用资源获得智能
- 模型路由从理论变为默认架构,前沿模型当经理、廉价模型当主力
- NVIDIA 用 NVFP4 四位精度预训练 Nemotron 3,在极限上压榨智能
- 开源权重模型在 API 层份额从 11%跃升至 29%,快速抢占闭源地盘
- 协作比控制更重要,使命驱动团队而非组织架构图
今天的 AI Builders Digest 主线是 效率与分层正在重塑整个 AI 产业:从 Levie 关于”前沿模型当经理、廉价模型当主力”的模型路由实践,到 NVIDIA 用四位精度预训练 Nemotron 来”在极限上压榨智能”,再到开源权重 token 份额从 11% 跃升到 29%,所有信号都指向同一个结论:算力见顶之后,谁能更聪明地组合和压榨现有资源,谁就赢。
今日总结
主线:效率是 2026 年 AI 的第一性原理。
算力见顶,智能来自更高效地使用资源。 NVIDIA Nemotron 负责人 Bryan Catanzaro 给出了最干净的表达:我们已经运行在极限上(预算、算力或能源的极限),所以获得更多智能的唯一途径是更高效,而不是更大的暴力。这解释了为什么 Nemotron 3 要用 NVFP4 四位精度做预训练、用混合 SSM + transformer 架构、用 latent MoE 把专家数翻四倍。Vercel CEO Guillermo Rauch 引用的一组数据更直观:开源权重模型在 gateway token 中的份额,从 4 月的 11% 升到了 29%,开源正在 API 层快速抢占闭源地盘。
模型路由从理论变成默认架构。 Box CEO Aaron Levie 连发三条系统阐述 AI 产业结构,其中最实操的一条引用了一份 Fable 实验:把前沿模型当”经理”做规划把关、把廉价模型当”干活的主力”,结果整体成本不升反降,因为前沿模型学会了”只给约束和反馈、不亲自改代码”。Swyx 同一天也公开了他的工具栈分层:Sol Ultra 规划、Fable 5 批判、Sonnet 5 / Terra Ultra / SWE 1.7 编码、Devin Review 审查。模型路由不再是论文里的概念,而是构建者每天都在用的分工模板。
生态与组织:协作比控制更重要。 Catanzaro 反复强调 Nemotron 由 NVIDIA 内部约 10 个团队协作完成,“使命才是老板,而不是组织架构图”。Anthropic 同日升级了 Artifacts,Thariq 展示了多人协作与本地 Claude Code 会话读写同一个 dashboard 的玩法。从芯片公司到应用层,“如何让人与 agent 协作”正在成为比”模型本身多强”更关键的问题。
今日关键词: 四位精度 · 模型路由 · 开源权重 29% · 协作组织
官方博客
Claude Blog:Foundation Models framework 支持 Claude,端侧与云端接力
Anthropic 发布了一个新的 Swift package,让 Apple 开发者能通过 Apple 的 Foundation Models framework 调用 Claude,在同一个体验里组合”端侧模型”与”Claude”。
Apple 的 Foundation Models framework 让开发者用极少代码(通过 @Generable 注解返回类型化的 Swift 值)调用端侧模型,完成摘要、抽取等快速本地任务。现在当请求需要多步推理、代码生成、联网搜索或数据分析时,可以把类型化输出直接交给 Claude 接力,再把 Claude 的流式响应传回同一个 SwiftUI 视图。开发者拿到的是干净的结构化输入,而不是原始用户文本。
这解锁的模式包括:
- 日记 app 在端侧生成每日提示,再让 Claude 跨数月条目找出线索
- 学习 app 在端侧解释概念,学生追问时交给 Claude 深入展开
- 文档 app 在端侧摘要合同,复杂条款交 Claude 分析
“It’s one experience for the user, backed by the right model for each step.”
该支持适配 iOS 27、iPadOS 27、macOS 27、visionOS 27 和 watchOS 27,接入只需 Anthropic API key。
🔗 https://claude.com/blog/claude-for-foundation-models
播客精选
The MAD Podcast:Nemotron 与 NVIDIA AI Lab 内幕 — Bryan Catanzaro (NVIDIA)
Bryan Catanzaro 负责 NVIDIA 的开源模型家族 Nemotron。他给 Nemotron 定义了两份工作:第一份也是最根本的,是让 NVIDIA 真正”懂” AI,从而从第一性原理出发 codesign 芯片、网络、编译器和软件栈;第二份是支持开源生态,让各种体量的公司都能构建和部署自己的 AI。他明确表示 Nemotron 不想成为唯一的开源模型,“只要 AI 持续发展和部署,对 NVIDIA 的生意就是好事”。
四位精度预训练是 Nemotron 3 的核心突破。 NVFP4 只有 16 个值,Catanzaro 承认用它做预训练”稍有不慎模型就发散”,团队为此发明了大量新算法才让模型收敛。回报是巨大的:四位格式在显存占用、数据搬运和计算能耗上都大幅下降。
混合 SSM + transformer 不只是更快,而是更聪明。 团队做了全量扫描,发现”主要用状态空间模型 + 少量 full attention”不仅推理更快,模型本身也更聪明。SSM 擅长把整个序列压缩成定长状态的”全局印象式理解”,full attention 擅长精准定位具体信息,两者结合比单独使用都更好。MoE 已经是前沿默认架构,他们还用自研的 latent MoE 把 NVLink 通信量压缩、在同等推理成本下让专家数翻四倍。
Multi-token prediction 让推理”越准越快”。 模型一次预测多个 token,下一步用模型自己校验投机预测是否正确,不损失精度却可能拿到数倍加速。这是一个反直觉的加速:模型越准确,推理越快越便宜。
关于中国 AI,他曾在百度的硅谷 AI Lab 与吴恩达、Dario Amodei 共事,认为”说别国成就都是 copycat 完全错误”,中国 AI 社区的开放反而推动了全球进步。关于组织,Nemotron 由 NVIDIA 内部约 10 个团队协作完成,研究者靠 bootstrapping(先做小实验拿信号,再要更多资源)把疯狂想法变成改变世界的项目:
「如果我们接受我们一直运行在极限上这个事实,那么获得更多智能的方式就是更高效。我们已经在极限上了,就不可能靠施加更大的暴力来获得更多智能。」
🔗 https://www.youtube.com/@DataDrivenNYC/videos
X/Twitter 动态
Aaron Levie(Box CEO):AI 产业结构三连
Levie 连发三条,系统阐述他对 AI 产业结构的中长期判断。第一条勾勒整个堆栈:前沿智能持续由顶级实验室推动并压低单任务成本(但总用量随之放大,前沿花费依旧强劲);开源权重快速吸收前沿突破,提供低成本、可定制的”按成本运行”选项;应用 AI 层最有机会,通过混合前沿模型与廉价模型编排领域工作流,并越来越多地拥有自己 RL 出来的专用模型。第二条引用了一份模型路由的实践报告:
「我们起初以为会测出 Fable 的 2 倍溢价会推高多少成本,结果惊讶地发现 Fable 的有效委派反而降低了总成本。它给出的是约束和结果而不是实现细节,给反馈而不是自己改,大多数情况下根本不碰代码。这些正是一个好经理的习惯。」
第三条点出企业自训模型的最大难点:最有价值的信息往往也是最敏感、权限分级最复杂的,没法简单塞进一个模型里。
Swyx(Latent Space):大项目的 AI 工具栈分层
Swyx 公开了他处理”大项目”时的 AI 工具配置:Sol Ultra 做规划、Fable 5 做批判审查、Sonnet 5 / Terra Ultra / SWE 1.7 做高强度编码、Devin Review(配合 Kakuna)做代码审查。他强调会配合 Matt Pocock 的 “grill-me” 或 Thariq 的 “interview-me” 这类提示,在动手前先把决策点逼问出来。
Guillermo Rauch(Vercel CEO):给 agent 实验能力,开源权重份额飙升
Rauch 指出 Vercel 平台目前最受欢迎的两个特性是易用的 filesystem API 和 observability,团队会在这两块持续加码。更具野心的是让 agent 通过 feature flag 自主设置和调优实验,构建”自主、自我优化的网站和应用”。他还引用了一组关键数据:
「开源权重模型已经占到 gateway token 的 29%,而 4 月份还只有 11%。」
Nikunj Kothari(FPV Ventures 合伙人):开源 Ramp-Autofill skill 自动报销
Kothari 开源了一个 Ramp-Autofill skill,用 Ramp CLI 配合 Claude 的 Fable 构建。它能自动从 iMessage 和 Gmail 找回执、用 Playwright 把网页收据转成 PDF 附件、根据 Google Calendar 自动填写会议备忘、学习过去的备注风格和分类规则自动归类,还能定时运行。他周末用它清完了过去 60 天的费用报销。
Ryo Lu(Cursor 设计负责人):用 Cursor 给电子阅读器刷固件
Ryo Lu 用 Cursor 给电子阅读器刷了自定义固件,支持优美的中英排版、竖排布局与禁则处理(縱書.禁則),还能与 ryOS 同步书籍和阅读进度。固件可在 Xteink X3 + X4 上运行,“ask Cursor to flash it for you”。
Cat Wu & Thariq(Anthropic Claude Code 团队):Artifacts 升级
Cat Wu 宣布 Artifacts 功能刚刚完成升级。Thariq 进一步说明升级后的 Artifacts 可以创意组合,他最爱的玩法是在 Claude Tag 里为项目生成一个 dashboard,这个 dashboard 既能被其他人编辑,也能被本地 Claude Code 会话直接读写,打通了多人协作与本地 agent。
Garry Tan(Y Combinator CEO):绅士科学家回归
Tan 简短有力地宣告:“Gentleman Scientist(绅士科学家)的时代回来了”,呼应当下独立构建者凭 AI 工具就能单枪匹马做出重大成果的趋势。
Amjad Masad(Replit CEO):实时监控个人模型训练
Masad 分享说他现在能实时查看自己模型训练 run 的进度,感觉像早期 vibe coding,只不过这次是在”造个人模型”。这暗示个人训练专属模型正在变得像写代码一样直观。
Sam Altman(OpenAI CEO):模型终于擅长 design 了
Altman 仍在感慨模型在 design 上的进步:“看到我们的模型终于在 design 上变强,到现在还是有点震撼。“他还讽刺了某些产品对”难题”的傲慢态度。
Peter Steinberger(OpenClaw 创始人):云端 agent 已经开始打架
Steinberger 把维护者 agent 搬到云端后感慨”它们已经开始打架了”。OpenClaw 的 iOS 和 Android app 同步发布更新。
Zara Zhang(独立构建者):组织 AI 采用的三层框架
她提出组织 AI 采用的三层框架,指出多数公司还停留在第二层。同时分享了一段 45 分钟户外对谈,聊公开构建、如何在不出 slop 的前提下增长 X 受众,以及对 vibe coding 的看法。
Nan Yu(Linear 产品负责人):重新审视 designer 这个职位
他抛出一个观察:一旦研究软件行业之外那些头衔带 designer 的人究竟在做什么,很多事情会变得清晰。他还顺手提到”中文房间”思想实验,暗指当下 LLM 理解力的哲学争议。
Thibault Sottiaux(OpenAI Codex & ChatGPT 团队):ChatGPT 活跃用户或破 800 万
他暗示 ChatGPT 的活跃用户数可能即将突破 800 万里程碑,同时展示了新的 ChatGPT Work presents 功能。
数据采集时间:2026-07-14 14:59 CST
评论互动