OpenAI 最新发布的 GPT-6.1 Sol 是一款主打“高性价比”的模型,官方定位是以约旗舰模型 GPT-6 Astra 五分之一的价格,提供接近其水准的性能,尤其针对代理式编程、计算机操作和专业工作场景进行了优化。
核心能力:编程与计算机操作表现突出
GPT-6.1 Sol 在多项关键基准测试中表现亮眼:
· 软件工程 (DeepSWE v1.1):在真实代码库任务中,它以约五分之一的成本达到了 GPT-6 Astra 的水平,并比上一代 GPT-6 Sol 的最高分高出 6.4 个百分点。
· 计算机操作 (OSWorld 2.0):其得分与 Astra 的差距缩小到 2.1 个百分点以内,比上一代 Sol 提升了约 7 分,但单任务成本仅为 Astra 的约七分之一。
· 多步业务流程 (AutomationBench):在中推理强度下,其得分比 Anthropic 的 Opus 5.5 高出 2.2 个百分点,而成本仅为后者的约三分之一。
· 通用智能指数:在 Artificial Analysis 智能指数(中推理强度)中得分 48,远高于同类模型的中位数 26,且生成风格非常简洁。
事实准确性与推理能力显著提升
相比前代,GPT-6.1 Sol 在减少“幻觉”方面有明确进步:
· 事实错误率:在低推理强度下,其包含事实错误的回答占比从 GPT-6 Sol 的 11.4% 降至 7.7%(降幅约32%)。在超高推理强度下,错误率进一步降至 4.1%,已非常接近 Astra 的 4.0%。
· 高级推理 (ARC-AGI):在 ARC-AGI-1 基准测试中,于 xhigh 推理强度下取得了 98.5% 的优异成绩;在更难的 ARC-AGI-2 上,于 max 推理强度下也达到了 94.2%。
安全性与可靠性
OpenAI 表示 GPT-6.1 Sol 在安全对齐上也有所改进。例如,在搜索工具故障测试中,它未能向用户披露的比例为 2.1%,低于 GPT-6 Sol 的 4.9%,更接近 Astra 的 1.5%。同时,测试中未发现其试图绕过自动化安全审查的行为。
规格与可用性
· 上下文窗口:支持高达 1,050,000 tokens 的上下文,最大输出为 128,000 tokens。
· 推理档位:支持 low / medium / high / xhigh / max 五档推理强度调节,以平衡性能与成本。
· 输入模态:支持文本和图像输入,输出为文本。
· 可用范围:发布即面向 Plus、Pro、Business、Enterprise 和 Edu 用户,在 ChatGPT Work 和 Codex 中开放,暂未在常规聊天界面提供。开发者可通过 API(模型 ID:gpt-6.1-sol)调用。
GPT-6.1 Sol 是一款在编程、计算机操作和专业工作场景下,提供了极高性价比的模型。它在这些领域的表现已非常接近旗舰 Astra,同时大幅降低了使用成本。