
Gemini 3.6 Flash 免费了:我拿它跟 Claude、GPT、Kimi K3 正面刚了一遍
Google 又往 AI 这口锅里扔了一块大石头。
这次不是小修小补——一口气三款模型:Gemini 3.6 Flash、3.5 Flash-Lite、3.5 Flash Cyber。主角毫无疑问是 3.6 Flash,而且目前免费能用。
我把它跟手头能调到的模型(GPT-5.6 Sol、Claude Fable 5、Kimi K3、Grok 4.5)在同一个网关下跑了同一批任务,数据全摆出来,你自己看。

这次放了什么货:三款模型一口气来
先理清名字,别被绕晕:
- Gemini 3.6 Flash — 主角,全能型,Agent/代码/多模态全面升级
- Gemini 3.5 Flash-Lite — 更轻更快,适合简单任务
- Gemini 3.5 Flash Cyber — 安全增强版,面向企业合规场景
后面所有测试聚焦 3.6 Flash,因为它是这次发布里唯一值得你认真对待的那个。
跑分到底怎么样:四组数据看门道
Google 官方放了一组 agentic benchmark 对比,我直接贴核心数字:
| 基准测试 | 3.1 Pro | 3.5 Flash | 3.6 Flash |
| DeepSWE v1.1(长周期软件工程) | 12% | 37% | 49% |
| MLE-Bench(机器学习工程) | 42.6% | 49.7% | 63.9% |
| GDPVal-AA v2(知识工作 Elo) | 965 | 1349 | 1421 |
| OSWorld-Verified(计算机操作) | 76.2% | 78.4% | 83.0% |
注意 DeepSWE 那一行——49% 已经摸到 Claude Opus 推理模型的门槛了。对一个标着 "Flash"(意味着快+便宜)的模型来说,这个数字有点离谱。
还有一张更完整的表,把价格也拉进来了:
完整对比表涵盖 Input/Output 价格、SWE-Bench Pro(58.7%)、Terminal-bench 2.1(78.0%)、CharXiv Reasoning(85.2%)、GDM-MRCR v2 长上下文(54.0%,1M pointwise)等十几个维度。3.6 Flash 在大多数项上不是第一就是第二,而价格只有 Claude Sonnet 5 的零头。
前端代码 arena 排行榜上它拿了 Rank #12(1537 分),排在 Kimi K3(1677)、Claude Fable 5(1636)、GPT-5.6 Sol(1633)后面——对于一个 Flash 级别的模型,这个位置已经够看了。

Token 省钱这件事,比跑分更老实
跑分可以刷,账单不会骗人。
实测发现一个让我意外的点:同样的任务,3.6 Flash 输出的 Token 数明显变少了。官方说法是最多省 65%。我自己的体感:让它写一段功能代码,以前其他模型会给你一堆解释性注释和"这是第二种方案",3.6 Flash 直接给结果,废话少一半。
翻译成钱就是:同样提示词,调用成本降了近一半。
对高频调 API 的人来说,这个比任何 benchmark 都实在。
编程实测:从水果忍者到 3D 物理台球
光看数字没感觉,我直接让它干活。
第一个测试:生成一个完整的水果忍者 HTML 游戏。要求就一句——"做一个水果忍者,能切水果、计分、有音效"。结果:一次生成,下载打开直接跑,没报错,暗夜背景、月亮、西瓜飞起来、发光刀刃切下去 +10 分飘出来,游戏逻辑完整。
然后加难度:生成带真实物理效果的 3D 台球游戏。要求列了五条——碰撞检测、摩擦力模拟、球袋判定、力度控制、摄像机视角控制。它选了 Three.js + Cannon.js 这个组合,一次出完整项目。打开之后击球、碰撞、反弹、滚动全部符合物理逻辑。对于一个 AI 一次性生成的 HTML 文件来说,这效果已经超出预期。
我不是说它能替代专业游戏开发。但如果你需要快速出一个原型/demo 给客户看,或者自己验证一个玩法想法——这个速度和质量,够用了。

多模态:数签子这种活儿它居然能干
很多人爱测 AI 数筷子。我换了更刁钻的:牙签和麻辣烫签子。
牙签那张图,70 根左右重叠在一起,它数出来约 70 根,实际 71 根——误差 1 根。麻辣烫签子那张,17 根细签子密密麻麻堆着,它精确数对了 17 根。
能准确识别这种大量重叠的细小物体,说明视觉理解已经不是"大概看看"的水平了。这对做质检、库存盘点、医疗影像标注的人来说,是个实打实的信号。
Agent 能力:打开 GitHub 自己找项目分析
这一块是我最感兴趣的。我在 Antigravity(Google 出的 Agent 调用管理平台)里选了 3.6 Flash,给它一个任务链:
- 打开 GitHub
- 找 Star 数最高的 AI Agent 项目
- 分析项目代码结构
- 总结框架设计
整个过程几乎全自动。它先用 Python 工具访问 GitHub API 搜索,找到目标项目后把目录结构、核心模块、关键代码逻辑全过了一遍,最后输出了一份结构清晰的分析报告。执行速度快到让我怀疑是不是偷懒了——但没有,内容确实到位。
这说明 3.6 Flash 在 Agent 场景下不是"能跑脚本"的程度,而是"能理解任务链条并自主拆解执行"。

百份 PDF 一口气处理完
接着测长文档。一次性上传超过 100 个 PDF 文件,要求找出所有 API 更新内容并整理成 Markdown。
它先调用 Python 把全部 PDF 解析一遍,然后交叉比对提取变更点,最终输出一份结构化的 Markdown 文档。效果比我预想的好——没有遗漏关键更新,格式也干净。
做技术文档维护、合规审计、研报整理的人应该会喜欢这个能力。
一句话生成风力发电机安装动画
最后一个案例让我印象最深。
在 Antigravity 里,用一句话提示词让 3.6 Flash 配合 Three.js 生成了一个完整的风力发电机安装施工动画。整个流程包括:
- 重型卡车沿盘山公路运输叶片(贴合道路曲线转向)
- 到达山顶平台停稳
- 履带式起重机吊装叶片(吊臂角度随高度变化)
- 叶片精准对接风机轮毂
- 安装完成后风机开始旋转
相机自动跟随当前阶段主体(跟车→环绕吊装→拉远全景),运镜平滑。所有模型用 Three.js 基础几何体拼的,不需要外部模型文件。
真正厉害的不是画面有多炫——而是 AI 已经理解了整个工程施工流程和设备之间的空间逻辑。过去这种演示要建模师搞几天甚至几周,现在一句话几分钟出雏形。这就是生成式 AI 在改变工程设计、工业演示这条路上的真实进展。

API 成本:$0.12 打全场
最后说钱。同一个提示词,同一套任务,通过统一网关跑出来的账单:
| 模型 | 成本 | 耗时 |
| Kimi K3 | $0.52 | 968s |
| GPT-5.6 Sol | $1.81 | 833s |
| Claude | $1.51 | 310s |
| Gemini 3.6 Flash | $0.12 | 75s |
3.6 Flash 不仅最便宜(不到 Kimi K3 的 1/4),还最快(75 秒搞定别人几百秒的活)。当然这是单次测试,不同任务类型比例会有波动——但趋势很明显:Flash 系列在成本效率上确实有结构性优势。
该不该用:我的判断
说了这么多优缺点,给个直白的结论:
适合用的场景:
- 个人开发者/学生/创业者——免费额度够日常折腾
- 高频 API 调用的团队——Token 效率 + 低单价 = 月账单砍半
- 需要 Agent 自动化但又不想烧钱的场景——3.6 Flash 的 Agent 能力在这个价位段几乎没有对手
- 原型/MVP 快速验证——代码生成质量够用,迭代成本低
别指望它干的事:
- 替代顶级推理模型做数学证明/科研推理——49% 的 DeepSWE 很强但还没到碾压级别
- 复杂企业级工程项目的"一键交付"——骨架能搭,细节你得盯
- 完全离线/隐私敏感环境——它是云端模型,数据过 Google 的服务器
一句话总结:如果 Google 继续保持免费策略并持续优化,3.6 Flash 很可能成为目前最值得体验的免费 AI 大模型之一。 不是因为它每项都最强,而是它在"能力×价格×速度"这个三角里找到了一个极其舒服的位置。
去 Google AI Studio 或者装个 Antigravity 试试,反正不要钱。
官方下载:

评论(0)