利好

基米託開源視覺感知基準測試,頂尖模型準確率不足60%

2026-08-02 23:17:19

基米託發佈PerceptionBench,拆解10項原子級視覺能力。GPT-5.6-Sol以59.7%居首,視覺幻覺成最大短板。

據 Woofun AI 消息,Kimi 宣佈將多模態大型模型視覺感知評估基準測試 PerceptionBench 開源。該基準旨在將視覺感知能力拆解爲視覺關係識別、計數、屬性判斷等10項可獨立評估的原子級能力,基於42個現有評估集中的模型失敗案例構建,包含3,000道經人工驗證的題目,每道題僅測試單一視覺能力,無需模型進行推理或調用外部知識。

評估數據顯示,在16款最先進的多模態大型模型中,無一款總體準確率超過60%。GPT-5.6-Sol以59.7%的準確率位居第一,Kimi K3(58.5%)、Claude-Fable-5(57.2%)、Gemini-3.1-Pro(56.2%)和GPT-5.5(55.8%)緊隨其後位列前五。報告指出,視覺幻覺仍是所有模型中最薄弱的環節,表明當前模型的整體感知能力仍有較大提升空間。

WOOFUN AI

影響力評估 · 一鍵速讀

PerceptionBench 的開源爲多模態模型的視覺基礎能力提供了更精細的評估標準,有助於開發者精準定位模型在原子級視覺任務上的缺陷。頂尖模型準確率均未突破60%,且視覺幻覺問題突出,反映出當前多模態大模型在底層感知層面仍存在顯著瓶頸。這一基準測試的普及可能推動行業從追求通用推理能力向夯實基礎視覺感知能力轉變。
WOOFUN AI 生成 · 僅供參考,非投資建議

評論

回覆 @用戶
0/800

暫無評論

消息提醒

登入後查看消息
查看全部消息管理訂閱