OpenAI 预览 GPT-5.6 Sol:下一代前沿模型
- 发布GPT-5.6系列三款模型:Sol旗舰、Terra均衡、Luna经济,性能与成本梯度明确
- 采用迄今最稳健的分层安全栈,包括模型训练防护、实时分类器、账户级别审查
- 在编程、生物和网络安全基准上创下新SOTA,网络能力提升同时强化防护
- 应美国政府要求先限量预览,计划未来几周全面开放,并推动可复用发布流程
- 投入超70万GPU小时进行自动化红队测试,结合人工红队提升防护稳健性
我们开始对 GPT‑5.6 系列进行限量预览:Sol 是我们的旗舰模型;Terra 是面向日常工作的均衡型模型;Luna 则是快速且经济的模型。Terra 的性能可与 GPT‑5.5 媲美,但成本只有其一半;而 Luna 以我们的最低价位带来了强劲的能力。
GPT‑5.6 Sol 搭载了迄今最稳健的安全栈发布。我们加强了对高风险活动、敏感网络请求以及反复滥用的防护,并花了数周时间寻找弱点、压力测试整个系统,使其能够抵御真实世界的攻击。
我们坚信应该广泛开放访问,并计划在未来几周内将 GPT‑5.6 Sol、Terra 和 Luna 全面开放。作为我们与美国政府持续沟通的一部分,我们在今天发布之前预告了计划以及模型的能力。应其要求,我们先对一小群可信合作伙伴启动限量预览(参与情况已同步给政府),然后再扩大范围。预览期间,我们将持续测试并与合作伙伴紧密协调,为更广泛的可用性做准备。我们并不认为这种政府介入流程应当成为长期默认做法。它会让最需要这些工具的用户、开发者、企业、网络防御者以及全球合作伙伴无法获取。我们之所以采取这一短期举措,是因为相信这是未来几周实现更广泛开放的最稳妥路径,同时我们将与政府合作推进网络行政令框架,以及一套可复用的未来模型发布流程。
能力
GPT‑5.6 Sol 是我们目前最强的模型。为了预览模型性能,我们分享了一组评测,重点展示了在编程、生物和网络安全方面更强的 Agent 能力,更多安全与防备性评测详见我们的系统卡片。当模型全面开放时,我们会分享更完整的评测结果。
在 GPT‑5.6 中,我们引入了新的 max 推理强度档位,让 Sol 有更多时间进行深度推理。此外,我们还引入了新的 ultra 模式,它通过调用子 Agent 来加速复杂任务,从而突破单 Agent 的能力上限。
在编程工作流方面,GPT‑5.6 Sol 在 Terminal‑Bench 2.1 上创下新的 SOTA,该基准测试的是需要规划、迭代和工具协调的命令行工作流。
GPT‑5.6 Sol 在生物工作流方面也展现出全面改进。在评估长周期基因组学和定量生物学分析的 GeneBench v1 上,它的结果优于 GPT‑5.5,同时消耗的 token 更少。
GPT‑5.6 Sol 是我们目前网络安全能力最强的模型。它推动了长期安全任务(包括漏洞研究和利用)的性能-效率前沿。在 ExploitBench ² 上,GPT‑5.6 Sol 与 Mythos Preview 表现相当,但仅使用了约三分之一的输出 token。在由加州大学伯克利分校研究人员与 OpenAI 及其他前沿实验室合作创建的 ExploitGym 3 基准上,随着我们提升推理强度,GPT‑5.6 Sol、Terra 和 Luna 模型在网络能力方面都展现出显著进步。
更强的网络能力,搭配更强的防护
我们为 GPT‑5.6 Sol、Terra 和 Luna 配备了迄今最稳健的防护措施,并针对每个模型的能力匹配了相应配置。随着模型变得更强大,我们设计的防护机制需要越来越能抵御真实世界的对抗性压力,同时保留对代码审查、漏洞研究、补丁开发、调试、安全教育和防御性测试等正当工作的访问。我们的目标是让被禁止的攻击性活动变得更困难、更不确定、更易被检测,同时不过度限制这些有益用途。根据我们对模型和防护措施的评估,我们预期这将对正当防御工作带来实质性收益,同时对被禁止的攻击性使用形成有效约束。
GPT‑5.6 Sol 在帮助人们发现和修复漏洞方面,比可靠地端到端执行攻击更出色。随着这些能力持续进步,我们的首要任务是确保它们能触达并惠及防御者,他们可以利用这些工具发现弱点、开发补丁,并更广泛地加固系统。
根据我们的防备框架,GPT‑5.6 Sol 并未突破网络安全关键阈值。在涉及 Chromium 和 Firefox 的评测中,它识别出了 bug 和利用原语——也就是漏洞利用的基础构建块——但在测试条件下并未自主产出可用的全链漏洞利用。尽管如此,基准阈值无法涵盖模型被使用或与其他工具组合的所有方式。这种不确定性,加上模型整体能力的大幅跃升,正是我们将更强的防护措施与分阶段发布相结合的原因。我们在 GPT‑5.6 预览系统卡片中分享了更多防护细节。
分层防护栈
没有任何单一的防护措施足以对抗有决心或善于应变的滥用。在 GPT‑5.6 预览期间,我们采用了分层防护,各模型的具体配置有所不同,并针对真实世界的攻击进行了压力测试。这些防护包括训练进模型的保护、生成过程中的实时检查、账户级别的信号、差异化访问、监控、执行以及持续测试。
GPT‑5.6 被训练为拒绝被禁止的网络协助,即使用户试图伪装意图或对模型进行越狱也是如此。这些模型层面的防护确立了模型应当与不应当协助什么的第一道边界。
实时的网络和生物滥用分类器提供了另一层防护,在输出生成时进行评估。对于较高风险的情况,如果它们检测到潜在违规,生成可能会暂停,由一个更大的推理模型审查对话及其上下文。如果输出被判定为不允许的,它会在到达用户之前被拦截。
被标记的活动还可能触发跨相关对话和风险信号的账户级别审查,这符合我们围绕内容留存和审查的条款与政策。超越单次对话的视角,有助于我们的系统区分持续性的恶意行为与正当的双重用途安全工作——在这两者中,类似的技术概念可能出现在截然不同的语境里。
这些层叠加在一起,使整体方案比任何单一防护都更稳健。模型行为降低了有害响应的可能性,实时系统可以在生成过程中介入,账户级别的审查可以识别更广泛的模式,而差异化访问则在不让最敏感能力被默认广泛开放的前提下,保留重要的防御性工作。
尤其是在预览期间,用户可能会遇到防护措施拦截或拒绝某些请求的情况。其他请求可能耗时更长,因为生成会暂停以进行额外审查。防护措施偶尔会介入正当工作,尤其是在防御性和攻击性活动最初看起来很相似的双重用途领域。
这正是预览旨在测试的内容之一。我们想了解的不仅是防护措施是否约束了滥用,还包括正当用户是否仍能可靠、高效地完成日常工作。预览期间的反馈将帮助我们减少不必要的拦截和延迟,改进防护措施对上下文的解读方式,并在更广泛发布之前打造更顺畅的体验。
我们还与企业客户合作推进更长期的方案——包括隐私保护检测、由客户运营的安全控制,以及根据客户、用户或工作负载风险进行校准的访问——以在支持企业隐私需求的同时推进安全。
用自动化红队提升稳健性
防护措施还需要在攻击者调整战术后依然有效。一种只对固定的一组已知攻击有效的保护,对前沿模型来说不够稳健。
正因如此,我们把前所未有的智能和算力投入到安全上,用自己的模型来发现弱点并更快地改进防护。我们投入了超过 70 万个 A100 等效 GPU 小时用于自动化红队测试,目标是寻找通用越狱:那些能在多种 prompt 或上下文中生效的攻击,而不仅仅是某个狭窄的场景。聚焦于这些更难、更通用的攻击,让我们能够超越固定的一组已知失败案例来测试防护。这也让我们得以探索远超人工测试所能覆盖的攻击模式,更早识别失败模式,并缩短从发现弱点到修复它的路径。
除了自动化红队,我们还与第三方测试者合作开展了广泛的人工专家红队测试,这将在预览期间持续进行。人工红队通过让富有创造力的专家以我们系统可能预料不到的方式尝试滥用模型,来补充自动化测试的不足。
没有任何评测能代表所有产品配置、多步骤攻击或真实世界工作流。因此我们维护一套快速响应流程,用于复现、评估、排定优先级并修复新发现的越狱,然后将其纳入我们持续进行的评测中,以便在未来针对类似失败进行测试。
可用性与定价
预览期间,GPT‑5.6 模型将首先通过 API 和 Codex 提供给一小群精选的可信合作伙伴和组织。我们计划尽快将其更广泛地提供给使用 ChatGPT、Codex 和 API 的用户。
在随 GPT‑5.6 引入的新命名体系中,数字标识模型的代际,而 Sol、Terra 和 Luna 标识可按各自节奏独立演进的能力层级。这套家族共同为用户和开发者在智能、速度和成本之间提供了更清晰的选择。
GPT‑5.6 按 1M token 计价,分为三种模型规格:Sol 输入 $5 / 输出 $30;Terra 输入 $2.50 / 输出 $15;Luna 输入 $1 / 输出 $6。GPT‑5.6 还引入了更可预测的 prompt 缓存,包括对显式缓存断点的支持以及至少 30 分钟的缓存有效期。对于 GPT‑5.6 及后续模型,缓存写入按模型未缓存输入费率的 1.25 倍计费,而缓存读取继续享受 90% 的缓存输入折扣。
我们还将在 7 月于 Cerebras 上推出 GPT‑5.6 Sol,速度最高可达每秒 750 个 token,以前所未有的速度把前沿智能带给客户。随着我们扩展容量,访问将首先面向精选客户开放。
我们期待在这个预览期继续学习,并尽快把 GPT‑5.6 Sol、Terra 和 Luna 带给更多人。
1. 我们通过观察模型在生产环境中的行为并进行离线模拟,来估算延迟和 API 成本。这些估算考虑了工具调用细节、采样 token 和输入 token。真实世界的结果可能存在显著差异,并取决于许多我们的模拟未捕捉到的因素。我们在快速 API 速度下模拟延迟,在常规 API 定价下模拟成本。
2. 所有模型均使用 ExploitBench API 测试框架进行评测,采用 5 个种子和推理连续性。
3. 我们在 alpha API 上运行了 ExploitGym,其响应速度快于公开 API,随后重新缩放以匹配公开 API。在将延迟重新缩放为公开 API 预期的速度时,会导致部分估算延迟超过 2 小时和 6 小时的时限,尽管在评测运行中是正确遵守的。对于时间敏感的工作,我们在 API 中提供优先处理,在 Codex 中提供快速模式。
4. 未报告输出 token、延迟或成本的模型以水平虚线表示。
评论互动