Aioga
AI资讯 / 行业动态
返回 AI资讯

Google 发布 Gemini 4 Argon:缩小与 OpenAI 和 Anthropic 的差距但未明显领先

The Decoder:AI News(RSS)Aioga 编辑团队2026-09-30T22:06:30.000Z热度 58

Google 发布新旗舰模型 Gemini 4 Argon,是继 Gemini 3.1 Pro 之后七个多月来的首款前沿模型。

行业动态The Decoder:AI News(RSS)

今日 AI 情报摘要

Google 发布新旗舰模型 Gemini 4 Argon,是继 Gemini 3.1 Pro 之后七个多月来的首款前沿模型。

中文正文 · AI 翻译

谷歌发布了Gemini 4 Argon,这是其新的前沿模型,缩小了与OpenAI和Anthropic竞争对手的差距,并在一些关键基准测试中超过了它们中的一些。虽然它可能没有明显领先,但对于前沿模型来说,它的价格相对便宜,至少在介绍价格阶段如此。

Image description

Argon是谷歌在七个多月以来推出的首个前沿模型,继Gemini 3.1 Pro之后。它使这家广告巨头重新进入前三大AI实验室的行列,尽管Anthropic很可能仍然占据领先地位。在经历了一个艰难且漫长的开发周期之后:https://the-decoder.de/googles-ki-krise-deepmind-verliert-unabhaengigkeit-und-hassabis-ist-so-gut-wie-weg/ 已经宣布的Gemini 3.5前沿模型被完全跳过,谷歌重新回到了竞争中。

Argon最初将分发给一批“受信任的网络防御者”,作为Fairwind计划的一部分:https://deepmind.google/fairwind-program/。他们以及谷歌的内部团队将获得不带网络防护措施的模型。谷歌以AI在这个水平上需要“分阶段方法”来证明逐步推出的合理性。该公司还参与了美国政府的自愿计划,使各机构在模型公开发布前获得访问权限。广告

定价已经确定,至少作为初始费率:输入令牌每百万$2,输出令牌每百万$10。缓存的输入令牌成本低95%,折合约每百万$0.10。Gemini 3.8 Flash有90%的缓存折扣。这使得谷歌在原始令牌价格上远低于其他前沿模型,但在令牌消耗方面则不然(见下文)。

*谷歌没有明确说明这个数字,但表示缓存比常规输入令牌价格便宜95%。广告

谷歌还将输出限制从64,000令牌提高到一百万令牌,并称之为行业首例。其理念是,如果模型能在单次轨迹中生成数十万个令牌,它就可以更彻底地思考复杂问题,并一次性解决它们。为支持这一点,谷歌在Gemini API中新增了“长解码续延”(Long Decode Continuation)功能。它可以暂停长响应,并通过后续请求恢复,以防推理超时。

输入上下文窗口保持在一百万令牌。Argon可以接受文本、图像、视频和音频作为输入,但只输出文本。广告

人工分析:https://artificialanalysis.ai/models/gemini-4-argon 提供了早期的独立评估。在其最高可用推理水平“High”下,Gemini 4 Argon 在人工分析智能指数中得分为53分。这与 OpenAI 的 GPT-6 Astra(最高)和 Claude Fable 5.1 持平,领先 GPT-6.1 Sol(最高)一分。

Anthropic 的模型仍然领先。Claude Opus 5.5 得分58分,Claude Sonnet 5.5 得分56分。相比 Google 的最后一代模型 Gemini 3.1 Pro Preview,Argon 提升了23分。“High” 通常是 Gemini 模型的顶级推理层次,尽管有时也支持特殊的“Deep Think”模式。

以当前促销价格计算,一个智能指数任务费用为1.99美元,仅为 GPT-6 Astra(3.26美元)成本的60%,但比 GPT-6.1 Sol 高 2.7 倍。一旦折扣结束,费用将上升至3.98美元,比 GPT-6 Astra 高约20%。价格优势来自较低的 token 费率,而非效率。Argon 每个任务平均使用62,000个输出 token,而 GPT-6 Astra 仅需27,000个。

Google 发布 Gemini 4 Argon:缩小与 OpenAI 和 Anthropic 的差距但未明显领先

Argon 在代理任务上也取得了显著进展,而根据人工分析,这一直是 Gemini 模型的弱项。在 AutomationBench-AA(人工分析版本)中,Argon 以77.5%的成绩位居第一,比 Claude Sonnet 5.5(最高)高出六分。在 Terminal Bench 4 上,它达到57%,比 Gemini 3.1 Pro Preview 提升53分。但仍落后于 Claude Sonnet 5.5(64%)、Claude Opus 5.5(60%)和 GPT-6 Astra(59%)。

人工分析还强调了 Argon 的低幻觉率。在 AA-Omniscience 上,这是一个测试事实知识及对知识空缺诚实处理能力的基准测试,Argon 的幻觉率为15%。GPT-6 Astra(最高)为51%,GPT-6.1 Sol(最高)为54%。Argon 更倾向于承认自己不知道答案,而不是猜错。然而,其准确率仅为50%,比 Gemini 3.1 Pro Preview 低五分,比 GPT-6 Astra(最高,63%)低13分。在该基准测试的总体评分中,Argon 获得42分,约与 GPT-6 Astra(43)和 GPT-6.1 Sol(42)持平。

谷歌自有的基准测试结果:https://storage.googleapis.com/deepmind-media/gemini/gemini_4_argon_model_evaluation.pdf 描绘了更乐观的情况。Argon 在大多数基准测试中领先,有时优势很大。

Google 发布 Gemini 4 Argon:缩小与 OpenAI 和 Anthropic 的差距但未明显领先

Argon 也在 Vals 指数中领先:https://x.com/ValsAI/status/2105388446844072033。以 68.9% 的得分,根据 Vals AI,它名列第一,成为首个登顶该指数的 Gemini 模型。Argon 在 22 项测试的基准中,有 20 项进入前五,尤其在金融、法律、编程和安全领域表现强劲。不过,在这项测试中,中端模型 Sonnet 5.5:https://the-decoder.com/anthropics-claude-sonnet-5-5-nearly-matches-opus-5-5-on-benchmarks-while-costing-up-to-30-percent-less-per-task/ 也超过了 Anthropic 的顶级模型 Opus 5.5,因此结果需谨慎看待。

一如既往,AI 模型必须在实际使用中证明自身,性能不仅取决于模型本身,还取决于其周围的软件。这正是谷歌目前的弱点:与 Claude Cowork 和 ChatGPT Work 相比,Gemini 应用仍然落后。

在 Arena.ai:https://x.com/arena/status/2105394855644139908 上,人类通过一对一比较对模型输出进行评分,Argon 表现良好。在 Text Arena 中,Gemini 4 Argon (High) 以 1,525 分名列第一,领先第二名 Claude Opus 4.6 (High) 20 分。这使其成为写作任务的有力竞争者,尤其在长时间没有竞争性写作模型的情况下,而 Opus 5.5 仍未在人工偏好排名中超过 Opus 4.6:https://the-decoder.com/anthropic-engineer-explains-why-claudes-writing-got-worse-although-the-model-got-smarter/。谷歌之前的模型 Gemini 3.8 Flash (High) 曾排在第十一位。

根据 Arena 的数据,Argon 在编程、困难提示、遵循指令、长查询和创意写作方面领先。它在所有评估的专业领域,以及英语、中文、俄语和非英语查询中均排名第一。

网页开发的结果较为平淡。在 Code Arena: WebDev 中,Argon 得分 1,679 分,位居第八。相比 Gemini 3.8 Flash (High),提升了 96 分,从第 29 位跃升,但仍未进入前列。

在性价比方面,Arena 将 Argon 放在了领先位置。以每百万令牌 8 美元的综合价格计算,Argon 改变了 Text Arena 的帕累托前沿,目前是排行榜中成本效率最高的模型。

保持对 AI 的关注。清晰、有用,无冗余。

关注 The Decoder,获取 AI 新闻、背景故事和专家分析。

解码器:https://the-decoder.com/

情报判断

Aioga 编辑摘要

Aioga 编辑摘要:Google 发布新旗舰模型 Gemini 4 Argon,是继 Gemini 3.1 Pro 之后七个多月来的首款前沿模型。 Aioga 将其归入「行业动态」方向,重点关注它对真实使用和行业竞争的影响。

背景分析

背景分析:公司与行业类动态需要放在竞争格局、商业化路径、资本信号和监管环境中观察,单条公告不能代表最终结果。

Aioga 观点

Aioga 判断:这条动态更适合作为行业观察信号,当前信息足以建立线索,但不足以推导长期结论。

影响与后续

影响分析:对相关团队而言,短期应先核对来源、可用范围和实际成本,再判断是否值得接入或跟进。 后续观察:继续观察官方文件、合作落地、收入或用户信号、竞品动作和监管后续。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: the-decoder.com

来源: The Decoder:AI News(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-09-30T22:06:30.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

Google 发布新旗舰模型 Gemini 4 Argon,是继 Gemini 3.1 Pro 之后七个多月来的首款前沿模型。

The Decoder:AI News(RSS)2026-09-30T22:06:30.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。