Gemini 4 Argon 平齐 GPT-6 Astra,成本更低性能更强
核心要点
谷歌Gemini 4 Argon在AI分析指数中获53分,与GPT-6 Astra持平但成本更低。该模型幻觉率显著降低,自主执行能力增强,目前通过Fairwind计划向筛选专家开放,定价极具竞争力。
据 Woofun AI 消息,谷歌 DeepMind 于 9 月 30 日通过 Fairwind 计划有限发布 ,其性能已对标 。这款专为编码、企业知识工作及网络安全防御设计的前沿模型,标志着谷歌在高端 AI 领域的强势回归,目前仅向少数经过筛选的网络安全专家开放访问权限。
在独立基准测试机构 发布的最新人工智能分析指数中,Gemini 4 Argon 以 53 分的成绩与 的 GPT-6 Astra 持平,这一表现使谷歌重新跻身全球人工智能实验室前三强。
值得注意的是,该模型得分比 OpenAI 另一款竞品 GPT-6.1 Sol 高出 1 分(后者得分为 52 分),且比谷歌此前发布的非 Flash 版本 大幅领先 23 分。作为参照系, 的 在同一指数上仅获得 46 分,而早在 9 月初发布的 及其网络安全专用型号则构成了内部迭代的基础。Artificial Analysis 指出,Gemini 4 Argon 的优势源于其显著降低的幻觉率与增强的自主执行能力。在 AA-Omniscience 测试中,Gemini 4 Argon 的幻觉发生率仅为 15%,远低于 Astra 的 51%;
然而,在低幻觉问题的正确作答率上,Gemini 4 Argon 为 50%,比 Astra 低 13 个百分点。在自主执行能力方面,Woofun AI 整理数据显示,Gemini 4 Argon 在 AutomationBench-AA 测试中得分率为 77.5%,超越 的 (71.3%);但在 Terminal Bench 4 测试中,其表现仍落后于 Sonnet 5.5、 以及 Astra 模型,显示出在不同任务类型下的性能差异。
定价策略与成本结构是此次发布的关键变量。谷歌为 Gemini 4 Argon 设定的初始促销价格为每百万输入 token 2 美元、每百万输出 token 10 美元;活动结束后,价格将上调至每百万输入 token 4 美元、每百万输出 token 20 美元。基于折后价格,Artificial Analysis 测算出 Gemini 4 Argon 执行每项测试任务的成本为 1.99 美元,显著低于 Astra 的 3.26 美元。
若按正常价格计算,Gemini 4 Argon 的单任务成本为 3.98 美元,约为 Astra 的 1.2 倍。成本差异的核心在于 Token 消耗量的不同:Gemini 4 Argon 平均每项任务需消耗 62,000 个输出 token,而 Astra 仅为 27,000 个。为支持更长、更复杂的应用场景,开发团队将 Gemini 4 Argon 的输出 token 上限从 64,000 个大幅提升至行业领先的 100 万 token,这一调整直接影响了其在高负载任务中的成本效率与适用边界。
谷歌首席执行官桑达尔·皮查伊证实,内部多个团队已在编程至量子计算等领域大量使用该模型,并强调其具备先进的防护机制。目前,Gemini 4 Argon 已通过 Fairwind 计划提供给美国政府及部分可信的网络安全专家,且因具备自行发现、验证并修复严重软件缺陷的能力,这些用户可在无额外安全限制下使用。随着推广范围扩大,付费 API 用户及谷歌 AI Ultra 订阅用户将优先获得权限,但折价政策是否延续尚未明确。谷歌正参与美国政府的自愿预发布访问计划,此举旨在通过严格的安全验证流程,逐步扩大模型在关键基础设施中的应用范围。

评论
暂无评论