价格性能比正在改变“默认上旗舰模型”的习惯
OpenAI 把 GPT‑5.6 描述成一个需要做模型路由的家族,而不是所有任务都固定调用最大模型。官方案例中,Browser Use 用 Luna 处理 106 个高难浏览器任务,完成率为 78%,成本约 14 美元;对比的当时 SOTA 模型完成率 80%,成本约 235 美元。
在 BrowseComp 示例中,GPT‑5.6 Luna 的 Extra High 推理得分为 84.04%,成本 1.33 美元;文章用于比较的 GPT‑5.5 Extra High 为 84.36%,成本 33.27 美元。这些数字属于 OpenAI 给出的基准与客户实践数据,更重要的工程信号是:模型路由已经可以成为 Agent 成本治理的一部分。
Responses API 正把确定性工作移出模型上下文
指南重点强调三类架构能力:Retained Reasoning 与原生 Compaction 让长任务复用之前的推理,不必每轮重建上下文;原生 Multi-agent 让真正可并行的工作交给多个子 Agent;Programmatic Tool Calling 则允许模型用 JavaScript 在上下文窗口之外过滤、聚合和编排工具结果,把 token 留给真正需要判断的部分。
OpenAI 报告称,在 ARC-AGI-3 上,仅启用推理保留与压缩,就让 GPT‑5.6 Sol 从标准 Harness 的 13.3% 提升到 38.3%,同时输出 token 约减少 6 倍。这里更值得关注的不是单一分数,而是同一个模型会因为 Harness 设计不同产生完全不同的质量与成本曲线。
缓存、多 Agent 和程序化调用应该一起进入架构评审
GPT‑5.6 全系列的 Prompt Cache TTL 被延长到至少 30 分钟,并支持在上下文中设置确定性的 Cache Breakpoint;配合 prompt_cache_key,可以提高大型共享前缀和长期会话的缓存命中率。
因此,生产级 Agent 的问题已经不只是“选哪个模型”,还包括:哪些步骤需要模型判断、哪些应该放进代码、哪些任务可以并行、哪些上下文应被保留、压缩或缓存。真正的成本优化越来越像系统架构问题,而不是单纯压低模型单价。
本文为 AI 智库基于 OpenAI News 原文整理的编辑摘要;涉及产品能力、价格或可用性时,请以原始来源的最新说明为准。 OpenAI News