利好
Kimi K3参数达2.8万亿,缩放效率较K2提升2.5倍
2026-07-28 00:20:56
Kimi K3采用全新架构与训练策略,计算量需求降至K2的40%,多项测试表现接近Fable 5。
Woofun AI 获悉,Dark Side of the Moon 发布 Kimi K3 技术报告,该模型总参数达 2.8 万亿,每 Token 激活 1040 亿参数。得益于架构、数据及训练方法升级,K3 总体缩放效率较 K2 提升约 2.5 倍,达到相同验证损失所需的训练计算量仅为 K2 的 40%。
K3 重构了注意力机制,采用 KDA 处理长序列并引入全局 MLA 层,同时加入注意力残差机制防止早期信息稀释。MoE 机制方面,K3 拥有 896 个路由专家,每 Token 激活 16 个专家,为 K2 的两倍。
此外,模型通过整合通用、智能体及代码方向的九种思维模式进行训练,在代码处理等测试中表现接近或超越 Fable 5 和 GPT-5.6 Sol。
WOOFUN AI
影响力评估 · 一键速读
Kimi K3 通过架构创新显著降低了训练成本,计算效率的提升使其在资源受限下仍具备竞争力。每 Token 激活专家数量的翻倍及注意力机制的重构,直接增强了模型对长上下文和复杂逻辑的处理能力。其在代码与工具调用测试中逼近头部模型,表明国产大模型在底层算法优化上已取得实质性突破,可能进一步加剧 AI 领域的技术竞争。
WOOFUN AI 生成 · 仅供参考,非投资建议
评论
暂无评论