利好
基米托开源视觉感知基准测试,顶尖模型准确率不足60%
2026-08-02 23:17:19
基米托发布PerceptionBench,拆解10项原子级视觉能力。GPT-5.6-Sol以59.7%居首,视觉幻觉成最大短板。
据 Woofun AI 消息,Kimi 宣布将多模态大型模型视觉感知评估基准测试 PerceptionBench 开源。该基准旨在将视觉感知能力拆解为视觉关系识别、计数、属性判断等10项可独立评估的原子级能力,基于42个现有评估集中的模型失败案例构建,包含3,000道经人工验证的题目,每道题仅测试单一视觉能力,无需模型进行推理或调用外部知识。
评估数据显示,在16款最先进的多模态大型模型中,无一款总体准确率超过60%。GPT-5.6-Sol以59.7%的准确率位居第一,Kimi K3(58.5%)、Claude-Fable-5(57.2%)、Gemini-3.1-Pro(56.2%)和GPT-5.5(55.8%)紧随其后位列前五。报告指出,视觉幻觉仍是所有模型中最薄弱的环节,表明当前模型的整体感知能力仍有较大提升空间。
WOOFUN AI
影响力评估 · 一键速读
PerceptionBench 的开源为多模态模型的视觉基础能力提供了更精细的评估标准,有助于开发者精准定位模型在原子级视觉任务上的缺陷。顶尖模型准确率均未突破60%,且视觉幻觉问题突出,反映出当前多模态大模型在底层感知层面仍存在显著瓶颈。这一基准测试的普及可能推动行业从追求通用推理能力向夯实基础视觉感知能力转变。
WOOFUN AI 生成 · 仅供参考,非投资建议
评论
暂无评论