AI Builders Digest 0627:GPT-5.6 Sol 被政府限流发布,Noam Brown 揭穿基准测试假象
- GPT-5.6 Sol 发布即被美国政府限流至约20家预批准公司
- 监管锁紧导致开源模型更受追捧,扼杀小初创公司创新
- Noam Brown 指出模型能力是推理预算的函数,基准测试忽略此维度
- 现行安全评估框架过时,无法在发布周期内评估模型真实上限
- 模型能力需长时间运行才能见顶,但发布周期不允许彻底评估
今天的 AI Builders Digest 主线是 GPT-5.6 Sol 发布即被美国政府「限流」:OpenAI 拿出新一代模型,美国政府却以指令形式把访问权锁进约 20 家预批准公司名单,Dan Shipper 第一时间确认 Every 不在名单,Garry Tan 怒斥这是在「扼杀初创公司创新」,Peter Yang 把整条产业链推到结论:开源模型只会更受追捧。同期 Noam Brown 在 No Priors 花一小时解释为什么这一切并非偶然:现代模型的能力取决于你愿意烧多少推理预算,现有基准测试和安全评估框架都没有这个维度,所谓「5.5 只比 5.4 好几个百分点」其实是个测量假象。
今日总结
主线:GPT-5.6 Sol 被美国政府限流发布,正好验证了 Noam Brown 关于基准测试和安全评估同时失效的判断。
GPT-5.6 Sol 把「前沿模型受限访问」从推演变成了事实。 Dan Shipper 的 BREAKING 推文是当天最重磅的信号:OpenAI 发布 GPT-5.6 Sol,但按美国政府指令,访问权限仅限约 20 家预批准公司,Every 不在名单上,并称这是政府为前沿模型制定长期政策的过渡阶段。Aaron Levie(239 赞)同步确认「GPT-5.6 is real and looks very strong」,对知识工作者、重度工具调用和长时间运行的 Agent 任务尤其强。一天前 Aaron Levie 把这种监管称作「超大尺度囚徒困境」,今天 GPT-5.6 Sol 的发布方式直接兑现了他的预言。
监管锁紧的副作用正在显现,而且是双向的。 Garry Tan(586 赞)直接开火:「这不是发布模型的方式,继续这样做是在给创新土壤撒盐,会扼杀所有小初创公司的创新」。Peter Yang(597 赞)把这条链路推到尽头:前沿模型发布 → 被蒸馏成便宜的开源模型 → 美国公司因为便宜采用同一批开源模型 → 现在反过来对前沿模型锁门。结论是美国公司创新更少、开源模型变得更有吸引力,监管的净效应可能在帮开源的忙。
Noam Brown 的播客给了这件事一个理论解释。 他在 No Priors 里的核心论点:现代模型的能力是推理预算的函数,给 5.5 烧 $10,000 它能做的事远超 $10,给 $10,000,000 还能更多。但现行基准测试和安全评估框架(responsible scaling policies、preparedness frameworks)几乎不考虑这个变量,还停在 ChatGPT 时代的假设:模型能力是一个固定值。结果是基准网格(benchmark grid)成了测量假象,安全评估同样跑偏:一个模型要跑一个月才能见顶的能力,你无法在两三个月的发布周期内评估完,于是没人真正知道这些模型的上限在哪里。GPT-5.6 Sol 被政府限流,本质就是「我们测不清楚它到底有多强,所以先锁住」的现实答案。
今日关键词: GPT-5.6 Sol 限流 · 前沿模型政府名单 · 基准测试假象 · 推理预算决定能力 · 安全评估过时
播客精选
No Priors:为什么基准测试已经测不准现代 AI 模型 — Noam Brown(OpenAI 研究科学家)
No Priors 邀请 OpenAI 推理研究核心人物、test-time compute 的早期推动者 Noam Brown,谈他最近那篇关于大规模推理时计算的 essay,以及为什么现在这套基准测试和评估体系已经无法反映模型真实能力。这是当天的长内容主线。
核心洞察:
- GPT-5.5 看似只比 5.4 好几个百分点,其实是测量方法错了。 Brown 说 5.5 刚发布时遭到一阵质疑,因为基准网格上它只比 5.4 好几个百分点。但人们在手里用了一阵就改口了。真正原因是:5.5 的「思考效率」高得多,同样任务 5.4 要想更久,一旦控制住思考时间,5.5 是对 5.4 的明显跨越。基准网格把推理预算这个维度压扁了,于是看起来都差不多。
- 现代模型能「想」到几周才见顶,旧的「跑到平台期再测」完全不现实。 Brown 指出 GPT-3 时代的模型很快就到平台期,你能跑到它停下再评估。但现在的 5.5 类模型,在合理 scaffolding 下能想上几周性能才平稳。这意味着「跑到底再评估」在时间上已经不可行,只能用固定 token / 成本 / 时间预算去测,或者把性能画成推理计算量的函数曲线。
- 安全评估框架全面过时。 这是 Brown 在 essay 里最尖锐的论点:所有实验室的 responsible scaling policies 和 preparedness frameworks 几乎都是 ChatGPT 前后那个推理时缩放还不重要的年代写的。模型能力那时候和推理预算几乎无关,给 GPT-3 烧一千万美元它也多干不了多少。但现在能力是预算的函数,烧一万刀 vs 一千万刀能做的事天差地别,而现行政策对这个变量几乎不设权重。
- 唯一的彻底评估方式是让模型跑足够久,但发布周期不允许。 Brown 反复强调这个悖论:想知道一个模型跑一个月能做到什么,唯一彻底可靠的方法是真的让它跑一个月。但 OpenAI 现在两三个月就发一个新模型,前一个还没测完下一个就来了,于是「没有人真正知道这些模型的能力天花板在哪」。
/goal发布时人们跑了一周多才意识到它有多厉害,这种滞后会越来越常见。 - 不认同「一夜之间超智爆发」的快速起飞叙事。 Brown 明确说不认为我们在走向一夜之间的智能爆炸,原因正是模型依赖大规模推理时计算:如果解锁全部能力需要跑很久,时间本身就是瓶颈,事情只能这么快。他给当前状态的判断是:模型在加速实验室里研究员的工作,但在一些事上加速 100 倍、另一些事上不加速,整体被没加速的部分卡住,是一个渐进的起飞。
- Erdős 单位距离猜想被推翻是个反例。 Brown 用这个案例证明「已发布模型里还有大量未被探索的能力」:OpenAI 内部模型用一个很低的预算就推翻了 Erdős 单位距离猜想,之后有人发现只要给 5.5 做一些脚手架(让它先列出解决路径、再挑一条深挖),同样能拿到答案,大概成本在 $1,000 到 $100,000 之间。也就是说在没人愿意烧这个钱之前,没人知道 5.5 能做到这件事。Brown 自述 OpenAI 内部甚至要刻意劝住数学家和物理学家,别把时间都花在压榨现有模型去解开放问题上,焦点应该放在怎么做出更强的模型上。
- 对路由层 / consensus 的看法:先控制推理预算再谈。 聊到那些靠多模型 consensus 路由做出来的「更好表现」时,Brown 不否认 consensus 能超过单模型,但他坚持要先问:控制住推理预算之后它还更好吗?是不是显著更好?是不是反映了真实使用场景?他认为 benchmark maxing 很容易把看上去漂亮、实际没什么用、甚至很脆弱的方案包装出来。
原文金句:「The only way to truly know what a model can do after running for a month is to actually run it for a month. And the model release cycle is every two or three months, so nobody actually knows what the ceiling of capabilities are for these models.」 —— Noam Brown
X/Twitter 动态
Dan Shipper(Every CEO):GPT-5.6 Sol 发布即被美国政府限流
Dan Shipper 231 赞 BREAKING 推文是当天最重磅的信号:OpenAI 发布 GPT-5.6 Sol,但按美国政府指令,访问权限仅限约 20 家预批准公司,Every 不在名单上。Shipper 表态支持政府对网络韧性和滥用风险的一定监管,但强调必须保留对前沿模型的广泛民主访问。这条推文把前一天 Aaron Levie 说的「超大尺度囚徒困境」从推演兑现成当天的事实。
Garry Tan(YC CEO):这种发布方式是在「给创新土壤撒盐」
Garry Tan 586 赞对 GPT-5.6 Sol 的限流发布直接开火:「这不是发布模型的方式,继续这样开发和发布是在给创新土壤撒盐,会扼杀所有小初创公司的创新」。这是当天对限流政策最尖锐的批评。配套的 1378 赞推文是一句更普世的忠告:别做平庸的初创公司。
Peter Yang:前沿模型限流的产业链推演
Peter Yang 597 赞推文把整条链路推到结论:发布前沿模型 → 被蒸馏成便宜的开源模型 → 美国公司因为够用且便宜采用同一批开源模型 → 现在反过来对前沿模型锁门,下一步是美国公司创新更少、开源模型更有吸引力。另一条 115 赞推文指向更深的判断:钱已经从软件流向服务,人们要的是结果而不是工具,现在做一个比 Codex / Claude Code 加一堆个人技能和 Agent 更有价值的纯软件公司已经很难。
Aaron Levie(Box CEO):GPT-5.6 真的很强,没有撞墙
Aaron Levie 239 赞从产品视角确认:GPT-5.6 is real and looks very strong,对知识工作者、重度工具调用和长时间运行的 Agent 任务尤其强,并断言「我们眼下在 AI 进展上没有撞到任何墙」。这是对 GPT-5.6 Sol 能力侧最直接的背书,和他前一天谈的「囚徒困境」监管侧刚好互为表里。
Thibault Sottiaux(OpenAI Codex):给所有 Codex 用户免费重置额度
Thibault Sottiaux 4072 赞推文是当天互动最高的推文:OpenAI 给所有 Codex 用户免费做一次额度重置(usage reset on the house),已在账户里生效,并声明调查没有发现大规模用户受影响,仍在持续监控。结合前一天「Codex for everything」的定位升级,OpenAI 在用免费额度稳住 Codex 的扩张势能。
Guillermo Rauch(Vercel CEO):Agent 是最难调试的软件,shadcn 是 AI 时代的 UI
- Guillermo Rauch 270 赞推文把 Agent 定义为「特别难调试的软件」:一是 AI 模型本身非确定性,同一 prompt 两次输出不同;二是 Agent 是复杂分布式系统,跨函数和沙箱多步计算、触碰几十个会挂或限流的 API。Vercel 给 AI Gateway 优先做开箱即用的可观测性。
- 1738 赞推文是当日互动最高之一:一句「AI 的 UI 来了,它就是 shadcn」,把 shadcn 钉成 AI 应用的默认组件层。
Sam Altman:ChatGPT 5.5 instant 本周更新,团队「很辣」
- 4164 赞推文是当天互动最高:本周更新了 ChatGPT 用的 5.5 instant 模型,Altman 一句「我喜欢它的感觉」。
- 2753 赞只一句「team cooked, spicily」,暗示有更猛的东西要来。
- 753 赞补充:还不完全是无限 token 自助餐,但正在往那个方向努力。结合 Codex 额度重置,OpenAI 在用量侧全面放水。
Cat Wu(Anthropic Claude Code):分屏是 Claude Code 桌面版最爱功能
Cat Wu 268 赞点名 split screen 是她最爱的 Claude Code 桌面版功能。这是 Claude Code 桌面端进入日常工作流的又一个信号。
Nikunj Kothari(FPV Ventures):品味得在 arena 里磨,不是在评论席上谈
Nikunj Kothari 40 赞对最近那波「品味」讨论的回应很犀利:很多评论来自从没动手做过东西的人。品味无法脱离 arena 获得,像厨师第一道菜不会好吃,但做满 100 道之后第 101 道就 imbue 了那一万次迭代的教训;但如果过拟合没有变化,人也会厌倦。另一条 137 赞专门写给在不那么热门赛道上做重要事情的 seed 创始人。
Aditya Agarwal(South Park Commons GP):AI 让人对人变得没耐心
Aditya Agarwal 67 赞是当天最人格化的一条:AI 的副作用是他对人类之间肤浅的互动「零容忍」,更想要深度的连接和关系,其余的事都交给 Agent。他的判断是世界会变得更小、但关系深度更厚。
数据采集时间:2026-06-27 15:23 CST
评论互动