GPT-6.1 Sol OpenAI 推出的新一代主力模型
GPT-6.1 Sol是什么
GPT-6.1 Sol是OpenAI推出的新一代主力模型,作为GPT-6 Sol的升级版,以Astra旗舰五分之一的Token价格实现接近后者的智能水平。GPT-6.1 Sol专注于智能体编程、电脑操作和专业工作三类高消耗场景,在真实代码库工程任务上追平Astra,在OSWorld电脑操作评测中仅落后2.1个百分点,同时将缓存输入价格压至每百万Token仅0.1美元。官方为模型配套了最高8倍速的Ultrafast档位,现已通过API和ChatWork、Codex面向付费用户开放。

GPT-6.1 Sol的主要功能
- 智能体编程 :在 DeepSWE v1.1 真实代码库工程任务上追平 GPT-6 Astra,比 GPT-6 Sol 提升 6.4 个百分点。
- 电脑操作 :OSWorld 2.0 计算机使用评测中比 GPT-6 Sol 高 7 个百分点,与 Astra 差距仅 2.1 个百分点。
- 专业文档处理 :GDP.pdf 评测中超过 Claude Opus 5.5,单任务成本不到其一半。
- 多步业务工作流 :AutomationBench 上以中等推理强度比 Opus 5.5 高 2.2 个百分点,成本约为其三分之一。
- 科学工作流 :Terminal-Bench Science 上单任务成本 5.47 美元,比 Opus 5.5 和 Astra 低超 75%。
- 事实准确性 :低推理强度下事实错误率从 11.4% 降至 7.7%,高推理强度下达 4.1%。
- Ultrafast 高速档 :Token 生成速度最高可达标准版 8 倍,API 与 $500/月 Pro 档可用。
- 多档位推理强度 :支持从低到高的可调推理 effort,供用户在成本与质量间取舍。
GPT-6.1 Sol的技术原理
- 旗舰能力下放的模型定位 :GPT-6.1 Sol 属于 GPT-6 系列的中端推理模型,官方将 GPT-6 Astra 级别的能力通过后续训练优化下沉到更低的成本区间,在保持推理模型架构的前提下,重点加强智能体编程、电脑操作、专业任务三类场景的 post-training。
- 可调推理强度(Reasoning Effort)机制 :模型支持多档推理 effort 设置:低档位响应快、成本低,适合简单任务;最高档会分配更多推理计算预算,在 DeepSWE、OSWorld、Terminal-Bench 等评测中官方均以最高档报告成绩。
- 上下文缓存的成本优化 :缓存输入价格定为每百万 Token 0.10 美元,比标准输入低 95%、比 GPT-6 Sol 再降 50%,是本次降价的真正核心。当智能体在多次请求间复用同一份上下文时,服务端可复用已缓存的 KV/prefix,只对新增的增量输入计费。
- Ultrafast 推理加速 :Ultrafast 档最高提供 8 倍于标准速度的 Token 生成,代价是更高的计费倍率(Codex 中约 6 倍价格)。
如何使用GPT-6.1 Sol
- ChatGPT 入口使用 :登录 ChatGPT,在 ChatGPT Work 或 Codex 中选择 GPT-6.1 Sol 模型(普通 Chat 暂未提供)。
- API 调用 :在代码中将模型 ID 设为 gpt-6.1-sol ,用标准 Chat Completions 接口发起请求。
- 设置推理强度 :根据任务难度选择 reasoning effort 档位,低难度用低档省成本,复杂任务用最高档。
- 启用上下文缓存 :跨请求复用系统提示和任务上下文,缓存输入按 0.10 美元/百万 Token 计费。
- 需要极速时开 Ultrafast :通过 API 或 500 美元/月 Pro 档启用最高 8 倍速的生成。
GPT-6.1 Sol的核心优势
- 极致性价比 :以 GPT-6 Astra 五分之一的标准 Token 价格提供接近旗舰的智能水平。
- 智能体编程强 :DeepSWE v1.1 真实代码库评测追平 Astra,比 GPT-6 Sol 提升 6.4 个百分点。
- 电脑操作领先 :OSWorld 2.0 评测距 Astra 仅 2.1 个百分点,单任务成本约为其七分之一。
- 专业任务超越竞对 :GDP.pdf 和 AutomationBench 评测中均超过 Claude Opus 5.5,成本仅为其一半到三分之一。
- 事实错误率更低 :低推理强度下事实错误率从 11.4% 降至 7.7%,降幅约 32%。
- 8 倍速 Ultrafast :高速档下以接近此前 Astra 的费用获得最高 8 倍生成速度。
GPT-6.1 Sol的同类竞品对比
对比维度 | GPT-6.1 Sol | GPT-6 Astra
| 对比维度 | GPT-6.1 Sol | GPT-6 Astra |
|---|---|---|
| 模型定位 | 能力/成本最优平衡的主力模型 | 综合能力最强的旗舰 |
| 输入价格/百万Token | $2.00 | $10.00(为其 5 倍) |
| 缓存输入 | $0.10 | $1.00(为其 10 倍) |
| 输出价格 | $10.00 | $50.00(为其 5 倍) |
| DeepSWE v1.1 编程 | 追平 Astra | 基准线 |
| OSWorld 2.0 计算机使用 | 距 Astra 2.1 分,成本约 1/7 | 基准线 |
| Terminal-Bench Science | 单任务 $5.47,得分未超 Astra | 最高分 68.1%,单任务 $23.80 |
| GDP.pdf 专业文档 | 接近 Astra 业界领先性能,成本约 1/5 | 业界领先 |
| 事实错误率(高档) | 4.1% | 4.0%(略优) |
| 搜索工具故障披露 | 未披露率 2.1% | 1.5%(略优) |
| Ultrafast 高速档 | 有,最高 8 倍速 | 有,全球最快前沿模型档 |
GPT-6.1 Sol的应用场景
- App 全生命周期维护 :开发者发布应用后,由常驻 Agent 持续跟踪用户反馈、自动整理高频问题、修复 Bug 并提交完整 PR 和改动视频。
- 产品研发跟进 :新产品发布期间,Agent 持续了解产品定位与团队要求,在需求变更后自动更新发布材料、调整文档并标记需人工确认的部分。
- 科研数据分析 :新实验数据入库后,自动重跑分析流程、调查异常值、更新论文图表并同步修订相关文字解释。
- 企业财务自动化 :监控应收账款,发现漏开发票时自动准备好发票文件,经人工确认后发出——OpenAI 已披露有早期测试用户的 Dot 实际完成了这一任务。
- 多渠道信息监控 :定时检查指定 Slack 频道或邮件,将新发现自动汇总进共享的 ChatGPT Space 页面并生成动态图表,供团队实时查看。
相关工具
与本文相关的 AI 工具