GPT-6 Sol OpenAI 推出的中高端大模型
GPT-6 Sol是什么
GPT-6 Sol 是 OpenAI 推出的中高端大模型,源自 GPT-6 Astra 底座,将 Astra 的推理、编程、事实性与 Agent 能力下放至更低价层级。模型 API 定价为输入 2 美元、输出 10 美元每百万 token,较上一代降价 50%。模型 Agent 与编程表现接近 Claude Fable 5.1,单任务成本仅为其约十分之一,主打单位智能成本优势。

GPT-6 Sol的主要功能
专业工作流处理 :在企业跨应用工作流测试 AutomationBench 上以 xhigh 推理强度取得 33.2% 成绩,超过 Claude Opus 5 的最高表现,单任务成本仅为其 9%。
复杂 Agent 任务 :在覆盖 55 个细分行业的 Agents Last Exam 上以 max 推理强度得分 56.4%,超越 Claude Opus 5 的最高成绩且成本低约 60%。
高可靠性事实回答 :内部事实性评测中错误数量约为上一代 GPT-5.6 Sol 的一半,以远低于 Astra 的成本接近其可靠性水平。
编程与代码合并 :在 FrontierCode 上以更低成本追平 Claude Fable 5.1 xhigh,DeepSWE v1.1 得分 68.8%,仅落后 Fable 5 最高成绩 1.1 个百分点。
计算机操作(Computer Use) :OSWorld 2.0 离线测试得分 60.5%,与 Claude Opus 5 中强度表现相当,成本降低约 80%。
改进的协作表达 :继承 Astra 的沟通风格,减少术语堆砌和低价值细节,更清楚说明自己检查过什么、没检查什么。
缓存优化 :为 Agent 长任务提升默认缓存命中率,缓存输入读取享 90% 折扣,并支持调整推理强度与工具开关而不破坏缓存。
GPT-6 Sol的技术原理
蒸馏式能力下放架构 :GPT-6 Sol 沿用与 GPT-6 Astra 相近的训练方法,将 Astra 在专业工作、事实性、编程、电脑操作和对齐上的能力压缩进更轻量、吞吐量更高的运行版本。Astra 承担能力探索角色,Sol 则承担能力规模化应用的角色,在保持接近旗舰性能的同时大幅降低推理成本。
推理强度分级(Effort Scaling) :模型支持多档推理强度调节(low 至 xhigh),可根据任务难度动态分配计算资源,高难度任务使用 xhigh/max 获得更好结果,简单任务降低强度以节省成本。开发者可在对话中途调整推理强度且不破坏已有缓存上下文。
对齐与安全机制 :GPT-6 Sol 构建于 Astra 引入的对齐技术之上,在内部评测中编码欺骗、绕过审查、警告规避等指标均优于 GPT-5.6 系列,包括更低的对编码工作作出误导性声明比例。
推理基础设施与缓存优化 :通过改进 prompt caching 提高默认缓存命中率,让 Agent 复用更多上下文并获得缓存输入 token 90% 的读取折扣;显式断点机制允许开发者控制缓存前缀的结束位置,配合推理强度与工具可用性的动态调整,使缓存节省在长任务中持续放大。
如何使用GPT-6 Sol
确认账号资格 :GPT-6 Sol 面向 Plus、Pro、Business、Enterprise 和 Edu 用户开放,普通 Free/Go 用户暂只能使用 Luna。
通过 ChatGPT Work 使用 :登录 ChatGPT,在 Work 模式的模型选择器中切换到 GPT-6 Sol(若未显示,属分批次灰度开放,可稍后重试)。
通过 Codex 使用 :在 Codex 环境中选择 GPT-6 Sol 作为编程 Agent 的执行模型,适合长任务代码开发。
通过 API 调用 :开发者使用 OpenAI API,将模型名称设为 gpt-6-sol 即可调用,支持调节推理强度(如 xhigh)以平衡效果与成本。
优化缓存以省钱 :用显式断点控制缓存前缀,在对话中途调整推理强度或工具开关而不破坏缓存。
合理选择推理强度 :复杂专业任务与编程建议使用 xhigh/max,日常任务可降低强度,单任务成本可相差数倍。
GPT-6 Sol的核心优势
极致性价比 :API 价格较上一代降低 50%,在多数基准上以约十分之一的成本达到 Claude Opus 5、Fable 5.1 的水平。
Agent 能力突出 :AutomationBench 上超越 Claude Opus 5 最高表现,单任务成本仅为其 9%,专业工作流性价比行业领先。
编程性能强劲 :DeepSWE v1.1 得分 68.8%,仅落后 Claude Fable 5 最高成绩 1.1 个百分点,成本却低约 80%。
事实可靠性高 :错误数量约为上一代的一半,以远低于 Astra 的成本接近旗舰级事实准确性。
缓存成本优化 :缓存命中率默认提升,缓存输入读取享 90% 折扣,长任务 Agent 场景成本进一步压缩。
灵活的推理强度 :支持多档 effort 调节且中途切换不破坏缓存,可按任务难度精细平衡效果与花费。
GPT-6 Sol的项目地址
项目官网 :https://openai.com/index/introducing-gpt-6-sol-and-luna/
GPT-6 Sol的同类竞品对比
对比维度 | GPT-6 Sol | Claude Opus 5.5
对比维度 | GPT-6 Sol | Claude Opus 5.5 |
|---|---|---|
API 定价(输入/输出,每百万 token) | $2 / $10 | $4 / $20(恰为 2 倍) |
产品定位 | Astra 能力下放,主打单位任务成本最低 | 多数任务达 Fable 5.1 水平,主打效率 |
AutomationBench | 33.2%(xhigh),超 Opus 5 | Opus 5(max)为 26.9% |
DeepSWE v1.1(编程) | 68.8%(max),接近 Fable 5 | 中等强度约 66% 水平 |
OSWorld 2.0(电脑操作) | 60.5%(xhigh) | 系列强项(Astra 仍为最佳) |
FrontierCode 性价比 | 更低成本追平 Fable 5.1 xhigh | medium 约 54.6%,max 多花钱不涨分 |
Adaptive Thinking | 多档推理强度可调,切换不破坏缓存 | 默认 medium 且永远开启 |
缓存折扣 | 缓存读取 90% 折扣,命中率默认提升 | Cache Read 降价 60%($0.50→$0.20) |
典型任务成本 | 约为 Opus 5 的 9%–20% | 较 Opus 5 降约 40% |
GPT-6 Sol的应用场景
企业级 Agent 工作流 :销售、营销、运营、客服、财务、HR 等跨应用自动化流程,以 Opus 5 约 9% 的成本完成同等甚至更优任务。
编程开发与代码审查 :长周期软件工程任务、批量代码修改、多 Agent 并发开发,DeepSWE 得分接近 Claude Fable 5 但成本仅约五分之一。
高频规模化数据处理 :以 Luna/Sol 的低单价承接海量文档分析、内容生成、批量问答等高频任务,配合 90% 缓存折扣进一步压低成本。
长上下文专业研究 :覆盖 55 个细分行业的复杂长链路任务,如法律、金融、医疗领域的深度调研报告生成。
电脑操作自动化 :通过 Computer Use 执行跨软件的长流程桌面任务,如自动填表、数据录入、跨系统操作等。