
DeepSeek V4 Flash 0731 开源实测:性能逼近 Claude Opus 4.8,价格仅 GLM 5.2 百分之一
又一个深夜炸场。这次不是参数规模的故事,是能力、价格、生态三件事同时被打到桌面上。
昨晚 DeepSeek 把 DeepSeek V4 Flash 0731 正式发了出来。和之前那版 Preview 不同,这次是真正意义上的"开源 + 上线"——模型权重可以拉、API 可以直接调、Responses API 原生兼容、Codex 也能跑。我第一时间接进自己的 Agent 工作流里折腾了大半天,下面把官方数据、实测结果和本地部署的坑都说清楚。
这次 0731,到底动了哪些刀
先说官方公布的更新清单。看一眼就明白,这一版不是修补,是冲着"开发者真正会用到的能力"去的:
- Agent 能力大幅增强——这是我最在意的一条,下面实测会展开
- 原生支持 Responses API,不用再套一层适配
- 完全兼容 Codex,写代码的工作流迁移成本低
- 整体推理能力进一步提升
- 多项 Benchmark 直接超过此前的 V4-Pro-Preview
- 还顺带修了不少老问题
这六条里,Responses API 是我反复强调的重点。原因很现实:Hermes Agent 这类工具早就吃透了 OpenAI 的 Responses 协议,模型端原生兼容意味着你几乎不用改代码就能切过来。我接到 Hermes 的时候,整个流程顺畅得有点不像换模型。

前端代码能力暴涨,竞技场冲到全球第七
官方数据之外,AI Arena 最新公布的成绩单才是真正炸裂的部分。DeepSeek V4 Flash High 在 Frontend Coding Arena 的排名:
- 全球排名第 7
- 得分 1586
- 开源模型排名第 3
- 消费级产品排名第 4
- Data & Analysis、Reference Design、Game 分类排名第 6
- Brand & Marketing 排名第 7
- 相比 Preview 版本,一次提升 154 分
154 分什么概念?很多模型一个季度都涨不到这个数。这说明这次升级最猛的方向就是代码生成——尤其是前端。这也是为什么我接下来特意挑了两道"硬菜"去压它。
我拿两道硬菜实测了一把
Benchmark 再好看,不如自己跑一遍。我直接把它接进 Hermes Agent(Responses API 原生兼容这点在这里帮了大忙),然后丢了两道我平时用来摸底的题。
测试一:让它写一个商业级 HTML 跑酷游戏
提示词就一句:
编写一款接近商业级的跑酷游戏(HTML 单文件)。
模型一次性吐出完整代码。我没有去追问、没有补刀,它直接把这几样东西都给了我:
- 游戏逻辑
- UI 界面
- 动画效果
- 音效调用
- 分数系统
- 游戏结束逻辑
完成度高到什么程度?基本接近"可以直接拿去演示"的状态。我以前用 Preview 版本干过同样的活,那时候至少要来回改两三轮,这次一轮就过。

测试二:3D 版超级马里奥
继续加码。提示词:
制作一个 3D 版超级马里奥。
结果又一次让我愣了一下。Three.js 场景搭建速度非常快,人物、地图、交互逻辑都能一次性出来,后续几乎不用大改。我手上有几个长期客户的项目就靠 Three.js 吃饭,过去光是把场景跑起来就要反复调 Prompt,现在这一版 Flash 基本一次成型。
能明显感觉到,这一代 Flash 在前端代码生成上已经迈过了某个临界点。

社区已经卷起来了:和 Gemini、GPT-5.6 比一圈
模型刚发,海外社区就开始疯狂对线了。我挑了几个有代表性的。
对阵 Gemini 3.6 Flash:Three.js Raptor3 模型
有人用完全相同的提示词、规划文档和参考图片,让 DeepSeek V4 Flash 和 Gemini 3.6 Flash 同时生成 Three.js 的 Raptor3 模型。结论是——不少网友认为 DeepSeek 的整体生成质量已经非常接近 Gemini。一个开源、一个闭源,能打到这个份上,本身就说明问题。
对阵 GPT-5.6 Luna:同价位硬碰硬
有开发者把 DeepSeek V4 Flash 和 GPT-5.6 Luna 放到同一价格区间,跑了三道:
- 魔方动画 → DeepSeek 更稳定
- 烟花效果 → 双方接近
- 手写 Hello 动画 → DeepSeek 更自然
- 综合同价位 → DeepSeek 胜出
还有几道更硬的
汽车发动机建模,整体完成质量达到 Kimi K3 的 70%~80%——细节略逊,但考虑价格,这点差距完全可以忽略。
大型 Three.js 场景:钢铁厂、机械工厂、机器人跳舞、工业流水线,这些过去要反复改 Prompt 才能跑起来的东西,现在很多都能一次生成。
还有一个可交互的 3D 细胞探索器,支持放大缩小、环绕旋转、查看细胞器、阅读真实生物学知识——整个页面一句 Prompt 就出。
最近流行的 SVG 鹈鹕骑自行车测试也有人做了,对手是 GPT-5.6 Terra,DeepSeek 的完成度同样不输。
价格离谱到让 GLM 5.2 显贵
能力是开头,价格才是这次真正让人坐不住的点。有开发者把三个模型执行完全相同任务的成本摆在一起:
| 模型 | 单次任务成本 |
|---|---|
| DeepSeek V4 Flash | $0.0005 |
| DeepSeek V4 Pro | $0.0008 |
| GLM 5.2 | $0.048 |

也就是说,GLM 5.2 的成本大约是 DeepSeek V4 Flash 的近百倍。这个倍数本身就值得停下来想一想。
更直观的两个数字:
- DeepSeek V4 Flash 在 Hermes Agent 中连续执行任务 32 分钟,总成本 0.07 美元
- 另一位开发者一次完整任务,花费约人民币 0.78 元,Cache 命中率达到 99.5%
99.5% 的缓存命中率对 Agent 场景意味着什么?意味着大量重复调用的成本还能再往下压一截。按这个价位,很多 Agent 工作流一天只要几美元就能持续跑。这对做自动化的人来说,是能直接改变业务模型的那种变化。
想本地跑?168GB 内存就能上无损 4-bit
喜欢本地运行的朋友这次也有福了。官方放出了 GGUF 量化模型,已经适配 llama.cpp、Unsloth 等主流框架。
下载地址我直接放这:
- Hugging Face 下载:unsloth/DeepSeek-V4-Flash-0731-GGUF
- 模型打包下载:git.cloudeop.com 打包镜像
内存门槛官方给了明确数字:
- 168GB 内存 → 可运行无损 4-bit
- 110GB 内存 → 可运行 3-bit
- 更小尺寸的量化版本后续会继续推

说实话,168GB 这个数对个人玩家还是有点劝退,但对工作室、对小公司服务器来说完全够得着。等更小尺寸的量化版本出来,门槛会再降一档。
不想申请 Key?免费公共 API 已经上线
如果你暂时不想折腾 API Key,社区已经有人把免费接口搭好了——部署在 Hugging Face Inference Endpoints 上。
它的特点是:
- 免费使用
- 不需要 Token
- 完全兼容 OpenAI API
- 社区共享实例
免费接入地址:DeepSeek-V4-Flash-0731-free-endpoint
提醒一句:毕竟是公共服务,会有轻度限流。适合先体验、再决定要不要申请官方 Key,别拿它跑生产任务。
社区怎么评价的
模型发布之后,海外社区几乎是一片好评。最被反复引用的一句评价:
Flash 居然已经全面超过 GLM 5.2,能力几乎达到 Claude Opus 4.8,而价格却只有十分之一左右。
不少开发者认为,DeepSeek V4 Flash 已经成为 Hermes Agent、OpenRouter 等平台中性价比最高的模型之一。Hermes 社区的统计也佐证了这点——过去 30 天里,DeepSeek V4 Flash 一直是使用率最高的模型之一。
速查卡片
- 模型:DeepSeek V4 Flash 0731
- 竞技场:全球第 7 / 开源第 3 / 得分 1586
- 单次成本:$0.0005(GLM 5.2 约 100 倍)
- Responses API:原生支持
- Codex:完全兼容
- 本地部署:168GB 跑无损 4-bit,110GB 跑 3-bit
- 免费体验:Hugging Face 公共接口
接下来该怎么用
从我这一天的折腾来看,DeepSeek V4 Flash 0731 不是"又一个新模型",而是把性能、价格、Agent 能力和开发生态这四件事同时压到了一个新平衡点。
对需要大量调用 AI 接口的开发者来说,这意味着同样预算能干更多活;对本地部署用户来说,GGUF 量化版本降低了体验门槛;对做 Agent 自动化的人来说,原生 Responses API 兼容让迁移几乎无痛。
AI 大模型早就不只是比参数规模了,而是在性能、价格、Agent 能力和生态之间全面开卷。DeepSeek V4 Flash 0731 的出现,无疑让这场价格战和能力战进入了一个新的阶段。
我的建议很简单:先去免费公共接口丢两道你自己的真实任务试试,比看一百篇测评都管用。

评论(0)