openai发布的最新模型gpt-6.1 sol能力怎么样?

与上一代gpt-6 sol对比性能提升了多少?

请先 登录 后评论

1 个回答

松间明月

OpenAI 最新发布的 GPT-6.1 Sol 是一款主打“高性价比”的模型,官方定位是以约旗舰模型 GPT-6 Astra 五分之一的价格,提供接近其水准的性能,尤其针对代理式编程、计算机操作和专业工作场景进行了优化。

核心能力:编程与计算机操作表现突出

GPT-6.1 Sol 在多项关键基准测试中表现亮眼:

· 软件工程 (DeepSWE v1.1):在真实代码库任务中,它以约五分之一的成本达到了 GPT-6 Astra 的水平,并比上一代 GPT-6 Sol 的最高分高出 6.4 个百分点。

· 计算机操作 (OSWorld 2.0):其得分与 Astra 的差距缩小到 2.1 个百分点以内,比上一代 Sol 提升了约 7 分,但单任务成本仅为 Astra 的约七分之一。

· 多步业务流程 (AutomationBench):在中推理强度下,其得分比 Anthropic 的 Opus 5.5 高出 2.2 个百分点,而成本仅为后者的约三分之一。

· 通用智能指数:在 Artificial Analysis 智能指数(中推理强度)中得分 48,远高于同类模型的中位数 26,且生成风格非常简洁。

事实准确性与推理能力显著提升

相比前代,GPT-6.1 Sol 在减少“幻觉”方面有明确进步:

· 事实错误率:在低推理强度下,其包含事实错误的回答占比从 GPT-6 Sol 的 11.4% 降至 7.7%(降幅约32%)。在超高推理强度下,错误率进一步降至 4.1%,已非常接近 Astra 的 4.0%。

· 高级推理 (ARC-AGI):在 ARC-AGI-1 基准测试中,于 xhigh 推理强度下取得了 98.5% 的优异成绩;在更难的 ARC-AGI-2 上,于 max 推理强度下也达到了 94.2%。

安全性与可靠性

OpenAI 表示 GPT-6.1 Sol 在安全对齐上也有所改进。例如,在搜索工具故障测试中,它未能向用户披露的比例为 2.1%,低于 GPT-6 Sol 的 4.9%,更接近 Astra 的 1.5%。同时,测试中未发现其试图绕过自动化安全审查的行为。

规格与可用性

· 上下文窗口:支持高达 1,050,000 tokens 的上下文,最大输出为 128,000 tokens。

· 推理档位:支持 low / medium / high / xhigh / max 五档推理强度调节,以平衡性能与成本。

· 输入模态:支持文本和图像输入,输出为文本。

· 可用范围:发布即面向 Plus、Pro、Business、Enterprise 和 Edu 用户,在 ChatGPT Work 和 Codex 中开放,暂未在常规聊天界面提供。开发者可通过 API(模型 ID:gpt-6.1-sol)调用。

GPT-6.1 Sol 是一款在编程、计算机操作和专业工作场景下,提供了极高性价比的模型。它在这些领域的表现已非常接近旗舰 Astra,同时大幅降低了使用成本。

请先 登录 后评论
  • 0 关注
  • 0 收藏,5 浏览
  • 提出于 1 小时前

相似问题