读 OpenAI 关于 GPT-5.6 的文章时,我最关心的并不是新模型在榜单上超过了谁,而是文章反复强调的另一个词:效率。
人们谈论大模型时,很容易把“更聪明”当成唯一的进步。但一个模型即使能解更难的问题,如果每次调用都很贵、等待很久、时常失败,它就仍然很难进入真实的工作流程。能力决定上限,效率决定这个上限有多少人能够真正使用。
这篇文章让我看到,所谓“模型效率”远不只是把模型做小一点、跑快一点。它至少同时发生在三个层次:
模型:用更少的 token 完成同样的任务
↓
推理系统:用同样的硬件服务更多请求
↓
Agent harness:减少上下文、工具和循环中的重复劳动
这三层中,任何一层做得不好,都会把其他层的进步吃掉。
一个很强的模型,也可能被一个糟糕的系统浪费
文章提到,推理成本不仅取决于模型本身,还取决于请求被发送到哪里、什么时候执行、缓存能否命中、数据怎样在内存和芯片之间移动。
模型可以很高效,但如果负载分配不均,一部分硬件排队,另一部分硬件空闲,最终的服务仍然会很贵。算子可以很快,但如果大量时间花在内存搬运和同步上,GPU 照样可能在等待。KV 缓存可以避免重复计算,但它的分配和分片策略又会随输入长度、输出长度、批大小和命中率而变化。
这也是为什么,推理优化不能只看一个孤立的 benchmark。局部变快了,不等于用户的等待时间真的缩短;单卡吞吐提升了,也不等于整个集群的利用率提升了。真正的优化对象,应该是从请求进入到结果返回的完整链路。
OpenAI 在文章中表示,GPT-5.6 Sol 参与了负载均衡、前向计算和生产 kernel 的分析与优化,相关 kernel 和系统改进使端到端服务成本下降了 20%。它还帮助设计并运行了数百个推测解码实验,使 token 生成效率提升了 15% 以上。
这些数字当然是公司对自身系统的披露,但它们仍然展示了一个很值得注意的方向:AI 已经不只在生成面向用户的文字和代码,它也开始进入运行 AI 的系统内部,参与寻找和消除自己的资源浪费。
Agent 真正昂贵的,往往是重复的那一段
文章里有一个观点让我印象很深:一个 Agent 任务会包含多次模型请求和工具调用,任何位于循环内的微小开销,都会被重复支付。
如果一个任务需要 30 次模型请求,每次多一秒,最后就是半分钟。每一轮都携带一批实际用不到的工具定义,就会反复处理同样的上下文。一段日志多输出几千个 token,不仅增加成本,还可能把真正重要的信息淹没。
这让我对 harness 工程有了一个更具体的理解。一个好的 harness 不是尽可能把所有东西塞给模型,而是知道什么信息应该现在出现,什么能力可以等到真正需要时再发现。
更多上下文不总是更好。更多工具也不总是更强。如果上下文不受控制地膨胀,模型需要花更多力气找到重点;如果工具全部常驻,每一轮请求都要为不会使用的能力付费。延迟发现、输出截断、结果摘要和按需加载,看起来都是很朴素的工程手段,但它们在多轮循环中会产生很大的复利。
文章还提到了一个容易被忽视的细节:prompt caching 依赖稳定、完全一致的前缀。所以 harness 会尽量把模型可见历史设计成只追加结构,保持工具顺序稳定,避免在早期上下文中反复插入变化。这些设计不会让模型的 benchmark 分数变高,却会让同一个任务更快、更便宜,也更稳定。
AI 参与优化 AI,不等于不再需要人
“模型自主重写生产 kernel”是一个很容易被写成科幻新闻的句子。但我更在意文章后面的另一个细节:为了验证这些 kernel 的正确性,团队同时投入了浮点检查等验证工具。
这很重要。
AI 能让实验更快、候选方案更多、代码改动更频繁,但这也意味着验证系统必须同步变强。否则,我们只是更快地生成了更多无法确认的结果。
所谓 AI 优化 AI,并不是模型在没有边界的情况下自己进化。更准确地说,是人先定义目标、指标、正确性边界和验收方法,然后让模型在这个可验证的空间里扩大搜索范围。模型加速循环,人决定这个循环是否在朝正确的方向收敛。
前沿不只是能力的边界
读完这篇文章,我开始觉得,可以用一个很粗糙的式子理解“可用智能”:
能力 × 可靠性
可用智能 ≈ ------------------
成本 × 延迟 × 重复劳动
这不是一个严格的数学公式,但它提醒我:智能的进步不只发生在分子上,也发生在分母上。
让模型能够解决更难的问题,当然是前沿。但让同样的能力少用一半成本、少等一半时间、少做一遍重复工作,同样是前沿。前者扩大了“能做什么”,后者决定了“能多久做一次、多少人用得起、多少工作值得交给它”。
我以前更容易把工程理解为模型能力之后的配套。现在我越来越觉得,工程本身就在定义智能的实际边界。路由、调度、缓存、kernel、上下文管理和工具加载,这些听起来不如“新模型”那么有想象力,却决定了智能能否从一次惊艳的演示,变成一种可反复依赖的基础能力。
所以,这篇文章带给我的最大启发,不是 GPT-5.6 又变强了多少,而是我们需要重新理解什么叫“更强”。
一个真正更强的智能系统,不只能做对更难的事,也应该用更少的浪费、更短的等待和更可验证的方式,把它做对更多次。
模型能力决定智能能走多远,整个系统的效率,决定它能否真正走进日常。
参考: