
还没正式来。 截至 2026 年 9 月 18 日,Google 没有发布 Gemini 4,也没有 API、模型卡、定价或官方基准。它目前仍是 Google DeepMind 确认中的下一代旗舰训练计划。
不过这两天圈里确实炸了:Arena 上冒出一款挂着 gemini-3.8-flash 名字的匿名模型,社区普遍怀疑那是 Gemini 4 Pro 的早期检查点(内部代号常被说成 Argon)。这就是“来了?”这个问题突然变热的原因。
Google 官方说了什么
2026 年 7 月 21 日,Google 在发布 Gemini 3.6 Flash 等模型时,在文末写了一句:
We have already started our most ambitious pre-training run yet, for Gemini 4.
第二天,Sundar Pichai 在 Alphabet Q2 财报会上再次确认:正在训练 Gemini 4,规模比以往更大,重点补强 编程 和 智能体(agentic)能力,并表示内部进展让他很兴奋。公司还提到希望把 Gemini 更新节奏推向接近每月一次。
这之后,公开信息基本停在这里。没有发布日期,没有 Pro / Flash 分型细节,也没有进入 Gemini API 或 Vertex AI 目录。
目前对外能用的最新一代,仍是 9 月 2 日的 Gemini 3.8 Flash,以及 9 月 15 日的 Gemini 3.8 Live / Live Extended Thinking。Gemini 3.5 Pro 此前多次延期,社区普遍认为 Google 干脆把算力压到了下一代。
这两天的“偷跑”传闻
9 月 17 日起,LMSYS Chatbot Arena 的匿名对战里出现同名 gemini-3.8-flash 的新检查点。真正的 3.8 Flash 已经在月初正式上线,再出现一个同名、体感却明显更强的模型,本身就很反常。
测试者反馈集中在几件事上:
- SVG / 矢量图生成质量很高,例如“鹈鹕骑自行车”、侧视猫、复杂产品结构图,路径和空间关系明显好于现款 Flash。
- 长输出更稳,有人做超长 JSON 压力测试,称它不像现款那样中途摘要或放弃。
- 流传的社区对比表里,DeepSWE、GDPval、Terminal-bench、OSWorld 等任务上领先 GPT-6 Astra、Claude Fable 5.1 等对手。
这些数字目前都是社区测试或截图,Google 没有确认。把它直接当成正式 Gemini 4 Pro 还为时过早,更像是训练后期检查点被放进 Arena 做盲测。这类“换马甲测试”在大模型圈并不罕见。
Gemini 4 被期待成什么样
结合官方表述和社区猜测,下一代大概会往这几个方向走:
更大、更偏行动。 Pichai 明确说下一代需要更大的基座模型,才能在“当时的前沿”竞争。重点不是再多几个聊天分数,而是能写代码、能多步操作工具、能扛住长周期任务。
智能体与编程。 这是 Google 自己点名的短板。3.x Flash 系列已经在往 agentic coding 迭代,4 代被期待一次性把能力台阶抬上去。
多模态与长上下文。 Gemini 一直吃多模态和长窗口的饭。传闻里出现过千万级输入、25.6 万输出、跨会话记忆等说法,同样未经官方证实,只能当风向标。
发布节奏可能变快。 如果“接近每月发一版”兑现,4 代不会像早期那样一年等一次,更可能是先出检查点 / 预览,再快速切 Flash、Pro、Live 等变体。
开源侧已经有 Gemma 4(2026 年 4 月,Apache 2.0),那是把 Gemini 3 技术下放到可本地跑的权重;Gemini 4 本身仍是闭源旗舰线。
大概什么时候真正能用
没有官宣日期。按以往大约半年一轮大训练、再加后训练和安全评估,市场和观察者多押 2026 年 10 月到年底。预测盘近期也把中位预期往 10 月中下旬推。
可观察的信号很简单:
- Google 博客或 I/O 风格发布会点名 Gemini 4
- API / AI Studio / Vertex 出现
gemini-4模型 ID - 官方模型卡和定价页上线
这三件事先出现任何一件,才算“真的来了”。Arena 匿名模型再强,也只是预热。
现在该怎么看这件事
Gemini 4 作为产品还没到,作为训练计划已经确认快两个月。今天的热度,主要来自一次看起来非常像旗舰检查点的 Arena 盲测,以及 Google 已经很久没交出新一代 Pro 的空窗。
如果泄露属实,说明后训练已经推进到能对外打的程度,正式发布可能比“年底才见”更近。如果只是 3.8 系的隐藏高算力档,那社区又要再等一轮。
对普通用户和开发者来说,眼下能用的仍是 3.8 Flash / Live;真正换代,还得等 Google 把名字从训练日志写进产品目录。在那之前,“Gemini 4 来了?”最准确的回答是:人已经在门口,门还没开。
这两天几乎全是案例驱动的传闻,不是空口“很强”。但要先把边界说清:Google 仍未官宣 Gemini 4;这些都是 Arena 匿名对战里,一个挂名 gemini-3.8-flash 的模型被社区当成 Gemini 4 Pro 早期检查点(代号 Argon) 来测。有人后来也说抽到的其实很随机,不一定每次都是同一档。下面按“传闻类型 + 具体案例”整理。

1. 核心传闻在说什么
几条同时在传,可信度从高到低大致是:
| 传闻 | 内容 | 靠谱程度 |
|---|---|---|
| 换马甲测试 | Arena Battle 里同名 gemini-3.8-flash 体感远超 9 月 2 日正式版 | 中高:很多人复现到“有时特别强” |
| 内部名 Argon | 4 Pro 检查点代号 | 中:测试号口头流传,无官方 |
| 跑分碾压 | DeepSWE 88.7%、GDPval 2064 Elo、HLE 72.1%、OSWorld 86.8%、Terminal-bench 95.3% | 低到中:是流传对比表,不是官方评测 |
| 后端规格 | 千万级输入、256K 输出、跨会话记忆、能直接上网 | 低:有人声称“ghost route 进后端”,无法独立核实 |
正式 3.8 Flash 的公开卡是约 1M 上下文、6.5 万输出。社区用“无限 JSON / 行星目录”压测,说新检查点能一直写到接近 256K 才停,现款 Flash 则会中途摘要或放弃。这是目前最常被用来“证明不是同一模型”的论据。
2. 已经传开的具体案例
这些才是让人觉得“不像 Flash”的东西。SVG 特别吃空间关系和路径,模型胡编像素图容易,写对矢量结构很难,所以圈里一直拿它当试金石(经典题就是 Simon Willison 的“鹈鹕骑自行车”)。
鹈鹕骑自行车 SVG
Harshith 等在 Arena 用一句 prompt:尽可能漂亮地画一只骑自行车的鹈鹕。社区对比里,这版构图更稳,鸟和车的咬合、轮子、喙的结构不容易穿模;有人直接并排 GPT-6 Astra。IT之家、36氪都转了这类截图。这不是新考题,而是旧考题突然变好看,所以冲击大。
侧视家猫 SVG
同一批测试:clean SVG of a domestic cat in side view。左边被标成“4 Pro”,右边是 Astra。评语集中在轮廓干净、四肢比例不像早期模型那样“四不像”。Harshith 还补了一张 AI Studio 里正式 3.8 Flash 的猫作对照,强调差距。
PS5 整机矢量图
LuminaBench:让它画 PlayStation 5 的 SVG。号称想了大约 10 分钟,吐出上千行路径,曲线、光驱、阴影对得上。测试者原话接近“这是我从模型里拿到过最疯的输出之一”。耗时长本身也被当成“Pro 级深度思考”,Flash 通常不会为一张矢量图想这么久。
体素宝塔 / Voxel Pagoda
同样是 Lumina,大约 5 分钟出一版 3D 体素塔。B 站合集里也把它单列成示例。评价是几何对齐和层次比旧 Gemini 检查点干净。
其它被剪进合集的题
中文视频里还堆了:3D 公路自行车、空客 H145、赛车小游戏页、三维细胞结构、飞机小游戏。共同特点是“能交结构”,不是只交一张好看的图。另有开发者说让它做专题网站,大约 14 分钟 从结构、视觉到交互走完,评论是早期 Gemini 被骂的“设计品味”这次像样了。
这些案例的共同点:不是 MMLU 那种选择题,而是看得见对不对的空间 / 前端 / 长输出任务。所以传播很快,也最容易被截图带节奏。

3. 跑分表在传什么(请当小作文)
流传最广的一张社区表,把“Gemini 4 Pro”放在 13 项全第一,对手包括 GPT-6 Astra、Claude Fable 5.1、Opus 5、GPT-5.6 Sol。常被点名的几项:
- DeepSWE v1.1(长程编程智能体)约 88.7%,Astra 约 86.9%
- GDPval-AA v2(知识工作)2064 Elo,Astra 约 1994
- HLE 约 72.1%
- Terminal-bench 2.1 约 95.3%
- OSWorld-2.0 电脑操作约 86.8%
对照一下公开的 Gemini 3.8 Flash 模型卡:DeepSWE 大约 73.7%,GDPval 大约 1545 Elo,Terminal-bench 约 89%。如果匿名模型真打到表上那些数,确实不像现款 Flash。问题是:表没有可复核的原始日志,Arena 排行榜上也还没有叫 Gemini 4 的条目。当成“有人在用未公开检查点打私榜”,比当成“Google 已发布 4 Pro”更合适。

4. 怎么理解这些案例,比较不容易被带跑
- Arena 匿名战本来就会混检查点。 同一标签抽到强弱两档,在历史上发生过。Harshith 后来甚至发过“有的结果其实是 3.8 / 3.7,而且很随机”。
- SVG 好看 ≠ 全面 SOTA。 空间代码强,不自动等于数学、安全、拒答、工具调用全赢。Google 自己点名要补的是编程和智能体,SVG 只是最适合发朋友圈的切片。
- 想 10 分钟再出图,更像高思考档。 也可能只是 3.8 的 High / Extended Thinking 被悄悄接到 Arena,不一定非是 4。
- 规格泄露最弱。 “千万上下文、自带上网、喂恶意软件会生成陷阱环境”这类,目前只有单人截图叙事,没有第二来源。
5. 若你想自己碰运气
去 Arena 开 Battle,看对手是不是标成 gemini-3.8-flash。适合复现的短题:
- Generate an SVG of a pelican riding a bicycle as nicely as you can
- Clean SVG of a domestic cat in side view
- Vector render of a PlayStation 5, accurate proportions
中文圈 B 站已经有人把 9 个示例剪成 6 分钟合集,比自己从时间线上翻推更省事。记住:抽到“神之一手”不能证明你用上了 Gemini 4;抽到普通 3.8 也不能证明传闻是假的。
一句话: 传闻很密,案例也具体,尤其是 SVG 和长代码输出;官方状态仍然是“4 还在训练,产品没上架”。这些例子更适合当“Google 可能已经把下一代检查点放到外面打磨了”,而不是“Gemini 4 已经发布”。
本文地址:https://www.163264.com/15498


微信扫一扫,鼓励一下~