利好
DeepSeek-V4-Flash在DeepSWE测试得分54.4
2026-07-31 14:37:13
DeepSeek-V4-Flash在DeepSWE基准测试中获54.4分,较旧版Pro提升显著,接近Claude Opus 4.8水平。
Woofun AI 监测数据显示,在 DeepSWE 长距离软件工程基准测试中,DeepSeek-V4-Flash 官方版本获得 54.4 分。该成绩远超此前 V4-Pro-Preview 版本的 8 分,且接近 Claude Opus 4.8 的 59 分。
尽管低于 Kimi K3 的 69 分,但高于 GLM-5.2 的 44 分,处于国内模型顶尖水平。此次测试采用了未公开的 Harness 极简 Mode,智能体性能受模型与运行框架共同影响。
WOOFUN AI
影响力评估 · 一键速读
DeepSeek-V4-Flash 在软件工程任务上的表现大幅提升,缩小了与行业头部模型 Claude Opus 4.8 的差距。虽然测试环境包含特定框架加持,但 54.4 分的成绩仍验证了其在复杂代码生成与调试场景下的竞争力,有助于巩固其在 AI Agent 领域的市场地位。
WOOFUN AI 生成 · 仅供参考,非投资建议
评论
暂无评论