|
据悉: 本站注:ARC-AGI-3 由 ARC Prize 团队推出的全新交互式推理基准测试,是目前全球公认衡量 AI 通用智能(AGI)最严苛、最顶尖的交互式推理评测基准。 该基准完全打破了传统 AI“做题”和知识问答的静态测试模式,将 AI 直接扔进一个完全陌生的“游戏环境”中,来评估其是否具备像人类一样的实时探索、学习与自适应能力。 ![]() https://www.xyfan.com/data/attac ... 529e32d05874823.png 在未调整优化前,GPT-5.6 Sol 在 ARC-AGI-3 基准测试中的得分为 7.8%,而 GPT-5.5 模型的得分只有 0.4%。 OpenAI 公司在复盘后发现,GPT-5.6 系列模型官方框架存在 2 个影响 GPT-5.6 Sol 表现的机制: ![]() https://www.xyfan.com/data/attac ... d3c06e5b9c80e48.png 第一,每次游戏动作后,私有推理都会被丢弃。这意味着 GPT-5.6 Sol 每执行 1 次动作后,都需要重新理解游戏。模型仍可看到过去动作记录和简短备注,但看不到促成这些动作的计划、洞察和思考过程。 第二,官方框架采用滚动截断窗口。随着历史变长,较早动作会从上下文中消失。也就是说,GPT-5.6 Sol 不仅无法保留过去思考,也会丢失过去动作记忆。 ![]() https://www.xyfan.com/data/attac ... d2e83bd04325605.png 针对上述问题,OpenAI 提出了推理保留(inference preservation)和上下文压缩(context compression)两个解决方案。 推理保留方面,OpenAI 使用 Responses API 重新实现 ARC-AGI-3 测试框架,对于 GPT-5.6,只需传入前一次 response ID,即可在工具调用和多轮交互中自动保留推理。 ![]() https://www.xyfan.com/data/attac ... aa4820731be22d1.png OpenAI 表示在启用推理保留后,GPT-5.6 不必每轮重新解释游戏,从而减少每次动作前花在思考上的时间,模型保留过去想法后,更善于随时间学习,并采用更连贯的策略。 在上下文压缩方面,官方 ARC-AGI-3 框架在对话上下文超过 175000 个字符后,会丢弃最早消息。OpenAI 称,滚动截断有 2 个缺点:模型会丢失早期观察和动作;模型在任务的大部分时间里会带着更满的上下文窗口运行,这可能轻微损害表现。 ![]() https://www.xyfan.com/data/attac ... da0867c7cf2c601.png 启用上下文压缩后,GPT-5.6 Sol 在较长任务中更能保留对每个游戏的已学信息,并以更少输出 token 获得更高得分。 harness(常被称为驭缰工程)是指包在大模型外部、为其提供运行环境、工具集成、规则约束与反馈机制的整套系统架构。 ![]() https://www.xyfan.com/data/attac ... 57f01574d0851e9.png 如果把强大的 AI 模型比作一匹充满力量但容易失控的烈马,那么 harness 就是它的缰绳、马鞍与骑手路线,不改变模型本身的架构,而是决定模型如何被安全、可靠地驾驭并真正完成复杂工作。 (转载IT之家) |






