利好
OpenAI稱評估框架限制GPT-5.6性能
2026-07-30 16:13:12
OpenAI指出ARC-AGI-3框架缺陷致GPT-5.6失分,優化後得分升至38.3%,但Opus 5表現更優。
Woofun AI 獲悉,OpenAI 指出 ARC-AGI-3 評估框架存在缺陷,未保留 GPT-5.6 Sol 之前的推理邏輯,且在長上下文中刪除早期記錄,導致模型遺忘遊戲規則並重復推理。OpenAI 通過自研 Responses API 改進框架,保留歷史推理並壓縮上下文,使 GPT-5.6 Sol 得分從 13.3% 提升至 38.3%,生成 token 量降至約六分之一。
然而,採用同一框架的 Opus 5 在‘高推理層級’下得分達 30.2%,高於 GPT-5.6 Sol 最高層級的 13.3%。OpenAI 承認該框架對 GPT-5.6 造成負擔,但未對 Opus 5 產生同等負面影響,顯示 Opus 5 在此項全球最具挑戰性的 AI 評估中表現更優。
WOOFUN AI
影響力評估 · 一鍵速讀
OpenAI 通過技術優化顯著提升了 GPT-5.6 在 ARC-AGI-3 中的表現,但 Opus 5 在原始框架下仍保持領先,凸顯其推理穩定性優勢。這一對比可能反映不同模型架構對上下文管理的適應能力差異,或影響市場對下一代 AI 模型競爭力的評估。若框架缺陷被廣泛驗證,可能推動行業重新審視現有評估標準的有效性。
WOOFUN AI 生成 · 僅供參考,非投資建議
評論
暫無評論