跳到文章正文
Google Gemini 编辑推荐

谷歌发布 Gemini 4 Argon:单次能吐 100 万 token,却先只给“网络安全盟友”用

想象这样一个场景:一家银行的代码库里潜伏着一个两年没人发现的漏洞。过去,安全团队要花几周逐行审计…

想象这样一个场景:一家银行的代码库里潜伏着一个两年没人发现的漏洞。过去,安全团队要花几周逐行审计;现在,一个 AI 读完整个仓库,不仅指出问题,还写好补丁、跑通测试,最后把修改直接提交上去。这就是谷歌在 Gemini 4 Argon 上想讲的故事。

一分钟速览

  • 谷歌 9 月 30 日发布 Gemini 4 Argon,自称公司“迄今最先进”的 AI 模型
  • 主打三件事:长流程软件工程、企业知识工作、网络安全防御
  • 单次输出上限从此前的约 6.4 万 token 提升到约 100 万 token
  • 目前不面向公众开放,只通过 Fairwind 安全计划提供给少数网络安全合作伙伴
  • 官方称它能“自主发现、验证并修补关键软件漏洞”

深度分析

不是“更大”,而是“更能干”

谷歌这次没有把参数规模挂在嘴边,而是反复强调“长周期任务”。过去的大模型更像一个聪明的实习生,能回答问题,但让它连续干几个小时的活就容易跑偏。Argon 的卖点是把“连续工作能力”当成核心指标:一次能输出约 100 万 token,意味着它可以一口气读完大型代码库、消化几百页文档,再按多阶段计划往下做,而不用人类在中间反复“喂”上下文。

安全能力:从“检测”走向“修复”

更值得玩味的是它对网络安全的定位。传统安全 AI 大多停在“发现风险”,而 Argon 被训练去做防御性安全工作,官方描述是“自主发现、验证并修补关键软件漏洞”。换句话说,它想做的是自动化“修复”,而不是只交一份体检报告。谷歌并没有让所有人立刻用上它,而是先塞进 Fairwind 安全计划,只给一批经过挑选的安全合作伙伴——这既是对高风险能力的克制,也是在真实攻击场景里收集反馈。

基准成绩:软件工程与安全“双料第一”

按谷歌说法,Argon 在真实世界软件工程测试中创下纪录,在网络安全基准上与最强对手并列第一,并在金融、法律等专业任务基准上领先。其中最容易被引用的对比,是长周期代码工程测试 DeepSWE——据报道其得分超过了 Claude Opus 5.5。

数据支撑

  • 单次输出:约 100 万 token,为此前上限(约 6.4 万 token)的约 15 倍以上
  • 定位:长流程软件工程 + 企业知识工作 + 网络安全防御
  • 开放范围:仅限 Fairwind 安全计划合作伙伴,暂无公众时间表
  • 同日,谷歌 DeepMind 博客将其列为当月头条成果

趋势洞察

把这三件事放在一起看,方向其实很清楚:前沿模型的竞争正在从“谁的聊天更聪明”,转向“谁能稳定地把活干完”。企业客户真正愿意付钱的,不是一次漂亮的回答,而是一整条能自动化跑通的工作流。Argon 选择先服务安全场景,也说明谷歌在给“高风险自动化”划边界——能力先给可信伙伴,出了事故的代价才可控。

对普通用户来说,短期用不上 Argon 不必着急;对开发者来说,真正该盯的是它释放出的信号:模型正在被要求“负责到底”,而不再只负责“说得好听”。

产品链接

结语

Gemini 4 Argon 未必是今年最出圈的模型,但它很可能是最“务实”的一个:不急着让所有人尝鲜,而是先把自动化能力放进最需要它、也最怕出错的角落。等它真正对外开放,考的可能不是聊天水平,而是它替我们改过的那些代码有没有出事。

本文地址:https://www.163264.com/15902