Skip to content

GPT-6.1 Sol 发布:性能、价格、API 与适用场景(2026) ​

更新日期:2026年9月30日

GPT-6.1 Sol 是 OpenAI 面向智能体编程、计算机使用和复杂专业工作推出的 Sol 系列升级模型。它的核心定位并非取代旗舰模型 GPT-6 Astra,而是在明显更低的推理成本下,尽可能接近 Astra 在高难度任务中的表现。

本文根据 OpenAI 公布的信息,整理 GPT-6.1 Sol 的能力变化、API 价格、开放范围、典型场景及模型选择建议。评测数字均来自特定测试集与推理设置,实际效果会随提示词、工具、上下文长度和任务类型变化。

GPT-6.1 Sol 桌面端界面示意图

一、GPT-6.1 Sol 是什么? ​

GPT-6.1 Sol 是 GPT-6 Sol 的升级版本,重点改善四类工作负载:软件工程、复杂文档理解、多步骤业务自动化和计算机操作。对需要大量调用模型的团队来说,它更重要的变化是能力与成本的平衡:官方将其定位为“接近 Astra 能力、保持 Sol 价格带”的模型。

项目GPT-6.1 Sol 的定位
主要优势编程、专业文档、工具调用、计算机操作与科学工作流
相比 GPT-6 Sol多项高难度评测得分提高,同时降低完成单次任务的成本
相比 GPT-6 Astra综合能力仍有差距,但部分任务接近 Astra,API 单价更低
适合用户智能体开发者、软件团队、研究人员和自动化业务团队
不宜直接下结论的场景强事实性、高风险决策以及未经过业务数据验证的生产任务

需要注意,“接近 Astra”指官方列出的部分基准测试结果,并不等于所有任务都能达到相同性能。若任务失败代价很高,仍应使用自己的真实样本进行评测。

二、GPT-6.1 Sol 性能提升在哪里? ​

1. 编程与软件工程 ​

在衡量真实代码库复杂软件工程任务的 DeepSWE v1.1 中,GPT-6.1 Sol 以约五分之一的任务成本达到与 GPT-6 Astra 接近的结果;相较 GPT-6 Sol 的最高得分,其成绩提高 6.4 个百分点。

GPT-6.1 Sol 在 DeepSWE v1.1 编程评测中的表现

这类提升更适合解释为“完成复杂修改的成功率提高”,而不只是代码补全更快。实际应用可覆盖跨文件修改、测试修复、代码审查和长流程开发智能体,但上线前仍需保留测试、静态检查和人工审查。

2. 专业文档与业务自动化 ​

GDP.pdf 测试模型理解复杂 PDF 的能力,包括表格、图表、示意图和小字号信息。在官方测试的各档推理设置下,GPT-6.1 Sol 的得分均高于带回退机制的 Opus 5.5,单任务成本不到其一半;与 GPT-6 Astra 相比,它以约五分之一的任务成本取得接近的成绩。

GPT-6.1 Sol 在 GDP.pdf 文档理解评测中的表现

在衡量多步骤业务流程的 AutomationBench 中,GPT-6.1 Sol 使用中等推理强度时,比 Opus 5.5 高 2.2 个百分点,成本约为后者的三分之一;相较相同设置下的 GPT-6 Sol,则提高 4.8 个百分点。

GPT-6.1 Sol 在 AutomationBench 自动化评测中的表现

3. 计算机使用 ​

在 OSWorld 2.0 离线测试集中,GPT-6.1 Sol 在最高推理强度下比 GPT-6 Sol 高 7 个百分点,单任务成本不到其一半;与 GPT-6 Astra 的差距缩小到 2.1 个百分点以内,任务成本约为 Astra 的七分之一。

GPT-6.1 Sol 在 OSWorld 2.0 计算机使用评测中的表现

这项结果说明它更适合承担跨应用、多步骤的桌面操作。不过,涉及删除数据、付款、权限变更或对外发布时,仍应设置明确的审批节点与最小权限。

4. 科学研究 ​

Terminal-Bench Science 0.1 覆盖数据分析、模拟与定理证明等科学工作流。在最高推理强度下,GPT-6.1 Sol 的得分超过 GPT-6 Sol 的两倍,平均单任务成本为 5.47 美元;同一评测中,Opus 5.5 和 GPT-6 Astra 的平均成本分别为 23.21 美元和 23.80 美元。

GPT-6.1 Sol 在 Terminal-Bench Science 0.1 科研评测中的表现

GPT-6 Astra 仍以 68.1% 的成绩居于受测模型首位。因此,对成功率优先、预算次要的高难度科研任务,Astra 仍是更稳妥的候选;需要批量实验和反复迭代时,GPT-6.1 Sol 的成本优势更明显。

5. 事实准确性 ​

在官方选取的高难度提示中,GPT-6.1 Sol 使用超高推理强度时的事实错误率为 4.1%,低于 GPT-6 Sol 的 4.5%,接近 GPT-6 Astra 的 4.0%,单任务成本则比 Astra 低约 83%。

GPT-6.1 Sol 事实准确性评测结果

该测试使用去标识化的高难度对话,统计回答中是否出现至少一处事实错误。样本经过刻意筛选,不代表普通对话的平均错误率,也不能替代检索、引用核验和人工复核。

三、GPT-6.1 Sol 与 GPT-6 Sol、Astra 怎么选? ​

模型选择应由任务难度、调用规模和错误成本共同决定,而不是只看单项 benchmark。

使用需求建议模型原因
高频代码修改、自动化测试与智能体循环GPT-6.1 Sol能力和调用成本较均衡,适合增加迭代次数
批量文档提取、表格理解与业务流程GPT-6.1 Sol专业文档和 AutomationBench 表现提升明显
日常、低难度且极度关注成本的任务GPT-6 Sol若现有质量已达标,没有必要为每次调用升级
高难度科研、关键决策支持或最高成功率优先GPT-6 Astra综合能力仍然领先,适合失败代价高的任务
低延迟的交互式工作流Ultrafast 版本适合速度敏感场景,但需单独评估价格与质量

一个实用做法是设置模型路由:默认使用 GPT-6.1 Sol,仅在低置信度、验证失败或任务复杂度超过阈值时升级到 Astra。这样可以在控制预算的同时,把旗舰模型留给真正困难的请求。

四、GPT-6.1 Sol API 价格与成本估算 ​

OpenAI 公布的 GPT-6.1 Sol 标准 API 价格如下:

Token 类型每百万 Token 价格
输入2 美元
缓存输入0.10 美元
输出10 美元

缓存输入价格比标准输入低 95%,因此,系统提示词、工具说明和稳定背景资料较长且会在多次请求中复用的智能体,通常能获得更明显的成本收益。

例如,一次请求使用 100,000 个输入 Token、20,000 个输出 Token,在不考虑缓存的情况下,估算费用为:

text
输入成本:100,000 / 1,000,000 × 2 美元 = 0.20 美元
输出成本: 20,000 / 1,000,000 × 10 美元 = 0.20 美元
合计:0.40 美元

实际账单还会受到缓存命中、推理强度、工具调用和批处理方式影响。价格可能调整,生产预算应以 OpenAI API 定价页 显示的信息为准。

五、GPT-6.1 Sol API 怎么用? ​

开发者可通过 OpenAI API 使用模型标识 gpt-6.1-sol。下面给出基于 Responses API 的基础 JavaScript 示例;运行前需要安装官方 SDK 并设置 OPENAI_API_KEY 环境变量。

js
import OpenAI from "openai";

const client = new OpenAI();

const response = await client.responses.create({
  model: "gpt-6.1-sol",
  input: "分析这个代码库中的性能瓶颈,并按影响程度给出修复建议。",
});

console.log(response.output_text);

生产环境接入时,建议先完成三项准备:

  1. 建立包含真实业务样本的评测集,并同时记录质量、延迟和单任务成本。
  2. 为工具调用设置权限边界、超时、重试、幂等和人工审批规则。
  3. 对需要事实准确性的输出接入检索与引用,并在关键流程中保留人工复核。

API 参数和 SDK 用法可能随版本更新,具体以 OpenAI Models 文档 与 Responses API 文档 为准。

六、GPT-6.1 Sol 的可用范围 ​

根据发布信息,GPT-6.1 Sol 面向 ChatGPT 工作场景、Codex 与 OpenAI API 开放,覆盖 Plus、Pro、Business、Enterprise 和 Edu 等计划,但当时尚未作为普通聊天模型提供。开发者可通过 API 使用 gpt-6.1-sol。

OpenAI 同期还公布了 GPT-6 Astra Ultrafast 与 GPT-6.1 Sol Ultrafast,重点提升响应速度。不同地区、账户、套餐与工作区的开放时间可能不同;是否可用应以账户中的模型列表和官方文档为准。

七、GPT-6.1 Sol 的安全性与使用边界 ​

在 OpenAI 公布的对齐评测中,GPT-6.1 Sol 相比 GPT-6 Sol 更能说明工具故障、遵守明确限制,并减少智能体执行中的未授权结果。例如,在“搜索工具故障后是否如实披露”的特定压力测试中,GPT-6.1 Sol 的未披露率为 2.1%,GPT-6 Sol 为 4.9%,GPT-6 Astra 为 1.5%。

GPT-6.1 Sol 搜索工具故障披露评测

这些数据来自为诱发失误而设计的高难度测试,不等于日常使用中的失误率。模型改进也不能替代权限控制、操作日志、结果验证和人工审批。

常见问题 ​

GPT-6.1 Sol 是 GPT-6 Astra 的替代品吗? ​

不是完整替代。GPT-6.1 Sol 在部分编程、文档、自动化和计算机使用评测中接近 Astra,但 GPT-6 Astra 仍是综合能力更强的旗舰模型。大规模、高频任务可优先测试 Sol,最高成功率优先的任务可评估 Astra。

GPT-6.1 Sol API 的模型名称是什么? ​

发布信息给出的模型标识是 gpt-6.1-sol。如果 API 返回模型不可用,应先检查项目权限、地区与账户开放状态,并以模型列表中的实际标识为准。

GPT-6.1 Sol API 多少钱? ​

发布时的标准价格为每百万输入 Token 2 美元、缓存输入 Token 0.10 美元、输出 Token 10 美元。价格与计费规则可能变化,使用前应核对 OpenAI 官方定价页。

GPT-6.1 Sol 适合写代码吗? ​

适合。官方 DeepSWE v1.1 结果显示,它相较 GPT-6 Sol 有明显提升,适用于跨文件修改、调试和软件工程智能体。模型生成的代码仍需通过测试、安全扫描与代码审查。

普通 ChatGPT 对话能选择 GPT-6.1 Sol 吗? ​

发布信息显示它首先用于 ChatGPT 工作场景、Codex 和 API,当时尚未在普通聊天中提供。最终开放范围以当前账户显示为准。

总结:GPT-6.1 Sol 适合谁? ​

GPT-6.1 Sol 的主要价值,是让开发者以低于旗舰模型的成本处理更复杂的编程、文档与智能体任务。对调用量大、需要多轮尝试并且可以自动验证结果的工作流,它通常比直接全量使用 Astra 更具成本吸引力;对失败代价很高的任务,则应先做真实数据评测,并保留升级模型与人工复核机制。

本文数据来自 OpenAI 发布信息与官方文档整理。模型能力、价格和开放范围会变化,请在部署前核对 OpenAI 模型文档 与 API 定价页。使用 ChatGPT、Codex 或第三方服务时,请遵守当地法律法规、OpenAI 使用政策与所在组织的数据安全要求;第三方平台与 OpenAI 官方账户、数据和服务并不互通。

Gemini 中文版博客