利好

OpenAI称评估框架限制GPT-5.6性能

2026-07-30 16:13:12

OpenAI指出ARC-AGI-3框架缺陷致GPT-5.6失分,优化后得分升至38.3%,但Opus 5表现更优。

Woofun AI 获悉,OpenAI 指出 ARC-AGI-3 评估框架存在缺陷,未保留 GPT-5.6 Sol 之前的推理逻辑,且在长上下文中删除早期记录,导致模型遗忘游戏规则并重复推理。OpenAI 通过自研 Responses API 改进框架,保留历史推理并压缩上下文,使 GPT-5.6 Sol 得分从 13.3% 提升至 38.3%,生成 token 量降至约六分之一。

然而,采用同一框架的 Opus 5 在‘高推理层级’下得分达 30.2%,高于 GPT-5.6 Sol 最高层级的 13.3%。OpenAI 承认该框架对 GPT-5.6 造成负担,但未对 Opus 5 产生同等负面影响,显示 Opus 5 在此项全球最具挑战性的 AI 评估中表现更优。

WOOFUN AI

影响力评估 · 一键速读

OpenAI 通过技术优化显著提升了 GPT-5.6 在 ARC-AGI-3 中的表现,但 Opus 5 在原始框架下仍保持领先,凸显其推理稳定性优势。这一对比可能反映不同模型架构对上下文管理的适应能力差异,或影响市场对下一代 AI 模型竞争力的评估。若框架缺陷被广泛验证,可能推动行业重新审视现有评估标准的有效性。
WOOFUN AI 生成 · 仅供参考,非投资建议

评论

回复 @用户
0/800

暂无评论

消息提醒

登录后查看消息
查看全部消息管理订阅