首页/ 资讯/ GPT-6 Sol OpenAI 推出的中高端大模型

GPT-6 Sol OpenAI 推出的中高端大模型

拆宝 2026-09-23 12 阅读

GPT-6 Sol是什么

GPT-6 Sol 是 OpenAI 推出的中高端大模型,源自 GPT-6 Astra 底座,将 Astra 的推理、编程、事实性与 Agent 能力下放至更低价层级。模型 API 定价为输入 2 美元、输出 10 美元每百万 token,较上一代降价 50%。模型 Agent 与编程表现接近 Claude Fable 5.1,单任务成本仅为其约十分之一,主打单位智能成本优势。

GPT-6 Sol

GPT-6 Sol的主要功能

  • 专业工作流处理 :在企业跨应用工作流测试 AutomationBench 上以 xhigh 推理强度取得 33.2% 成绩,超过 Claude Opus 5 的最高表现,单任务成本仅为其 9%。

  • 复杂 Agent 任务 :在覆盖 55 个细分行业的 Agents Last Exam 上以 max 推理强度得分 56.4%,超越 Claude Opus 5 的最高成绩且成本低约 60%。

  • 高可靠性事实回答 :内部事实性评测中错误数量约为上一代 GPT-5.6 Sol 的一半,以远低于 Astra 的成本接近其可靠性水平。

  • 编程与代码合并 :在 FrontierCode 上以更低成本追平 Claude Fable 5.1 xhigh,DeepSWE v1.1 得分 68.8%,仅落后 Fable 5 最高成绩 1.1 个百分点。

  • 计算机操作(Computer Use) :OSWorld 2.0 离线测试得分 60.5%,与 Claude Opus 5 中强度表现相当,成本降低约 80%。

  • 改进的协作表达 :继承 Astra 的沟通风格,减少术语堆砌和低价值细节,更清楚说明自己检查过什么、没检查什么。

  • 缓存优化 :为 Agent 长任务提升默认缓存命中率,缓存输入读取享 90% 折扣,并支持调整推理强度与工具开关而不破坏缓存。

GPT-6 Sol的技术原理

  • 蒸馏式能力下放架构 :GPT-6 Sol 沿用与 GPT-6 Astra 相近的训练方法,将 Astra 在专业工作、事实性、编程、电脑操作和对齐上的能力压缩进更轻量、吞吐量更高的运行版本。Astra 承担能力探索角色,Sol 则承担能力规模化应用的角色,在保持接近旗舰性能的同时大幅降低推理成本。

  • 推理强度分级(Effort Scaling) :模型支持多档推理强度调节(low 至 xhigh),可根据任务难度动态分配计算资源,高难度任务使用 xhigh/max 获得更好结果,简单任务降低强度以节省成本。开发者可在对话中途调整推理强度且不破坏已有缓存上下文。

  • 对齐与安全机制 :GPT-6 Sol 构建于 Astra 引入的对齐技术之上,在内部评测中编码欺骗、绕过审查、警告规避等指标均优于 GPT-5.6 系列,包括更低的对编码工作作出误导性声明比例。

  • 推理基础设施与缓存优化 :通过改进 prompt caching 提高默认缓存命中率,让 Agent 复用更多上下文并获得缓存输入 token 90% 的读取折扣;显式断点机制允许开发者控制缓存前缀的结束位置,配合推理强度与工具可用性的动态调整,使缓存节省在长任务中持续放大。

如何使用GPT-6 Sol

  • 确认账号资格 :GPT-6 Sol 面向 Plus、Pro、Business、Enterprise 和 Edu 用户开放,普通 Free/Go 用户暂只能使用 Luna。

  • 通过 ChatGPT Work 使用 :登录 ChatGPT,在 Work 模式的模型选择器中切换到 GPT-6 Sol(若未显示,属分批次灰度开放,可稍后重试)。

  • 通过 Codex 使用 :在 Codex 环境中选择 GPT-6 Sol 作为编程 Agent 的执行模型,适合长任务代码开发。

  • 通过 API 调用 :开发者使用 OpenAI API,将模型名称设为 gpt-6-sol 即可调用,支持调节推理强度(如 xhigh)以平衡效果与成本。

  • 优化缓存以省钱 :用显式断点控制缓存前缀,在对话中途调整推理强度或工具开关而不破坏缓存。

  • 合理选择推理强度 :复杂专业任务与编程建议使用 xhigh/max,日常任务可降低强度,单任务成本可相差数倍。

GPT-6 Sol的核心优势

  • 极致性价比 :API 价格较上一代降低 50%,在多数基准上以约十分之一的成本达到 Claude Opus 5、Fable 5.1 的水平。

  • Agent 能力突出 :AutomationBench 上超越 Claude Opus 5 最高表现,单任务成本仅为其 9%,专业工作流性价比行业领先。

  • 编程性能强劲 :DeepSWE v1.1 得分 68.8%,仅落后 Claude Fable 5 最高成绩 1.1 个百分点,成本却低约 80%。

  • 事实可靠性高 :错误数量约为上一代的一半,以远低于 Astra 的成本接近旗舰级事实准确性。

  • 缓存成本优化 :缓存命中率默认提升,缓存输入读取享 90% 折扣,长任务 Agent 场景成本进一步压缩。

  • 灵活的推理强度 :支持多档 effort 调节且中途切换不破坏缓存,可按任务难度精细平衡效果与花费。

GPT-6 Sol的项目地址

  • 项目官网 :https://openai.com/index/introducing-gpt-6-sol-and-luna/

GPT-6 Sol的同类竞品对比

对比维度 | GPT-6 Sol | Claude Opus 5.5

对比维度

GPT-6 Sol

Claude Opus 5.5

API 定价(输入/输出,每百万 token)

$2 / $10

$4 / $20(恰为 2 倍)

产品定位

Astra 能力下放,主打单位任务成本最低

多数任务达 Fable 5.1 水平,主打效率

AutomationBench

33.2%(xhigh),超 Opus 5

Opus 5(max)为 26.9%

DeepSWE v1.1(编程)

68.8%(max),接近 Fable 5

中等强度约 66% 水平

OSWorld 2.0(电脑操作)

60.5%(xhigh)

系列强项(Astra 仍为最佳)

FrontierCode 性价比

更低成本追平 Fable 5.1 xhigh

medium 约 54.6%,max 多花钱不涨分

Adaptive Thinking

多档推理强度可调,切换不破坏缓存

默认 medium 且永远开启

缓存折扣

缓存读取 90% 折扣,命中率默认提升

Cache Read 降价 60%($0.50→$0.20)

典型任务成本

约为 Opus 5 的 9%–20%

较 Opus 5 降约 40%

GPT-6 Sol的应用场景

  • 企业级 Agent 工作流 :销售、营销、运营、客服、财务、HR 等跨应用自动化流程,以 Opus 5 约 9% 的成本完成同等甚至更优任务。

  • 编程开发与代码审查 :长周期软件工程任务、批量代码修改、多 Agent 并发开发,DeepSWE 得分接近 Claude Fable 5 但成本仅约五分之一。

  • 高频规模化数据处理 :以 Luna/Sol 的低单价承接海量文档分析、内容生成、批量问答等高频任务,配合 90% 缓存折扣进一步压低成本。

  • 长上下文专业研究 :覆盖 55 个细分行业的复杂长链路任务,如法律、金融、医疗领域的深度调研报告生成。

  • 电脑操作自动化 :通过 Computer Use 执行跨软件的长流程桌面任务,如自动填表、数据录入、跨系统操作等。

相关工具
与本文相关的 AI 工具
AI 智能推荐 ×
输入关键词,AI 从 1000+ 工具中精准匹配推荐