DeepSeek V4 Flash 0731 开源发布封面图,深色科技感背景配发光神经网络芯片与代码光效(封面图)

DeepSeek V4 Flash 0731 开源实测:性能逼近 Claude Opus 4.8,价格仅 GLM 5.2 百分之一

又一个深夜炸场。这次不是参数规模的故事,是能力、价格、生态三件事同时被打到桌面上。

昨晚 DeepSeek 把 DeepSeek V4 Flash 0731 正式发了出来。和之前那版 Preview 不同,这次是真正意义上的"开源 + 上线"——模型权重可以拉、API 可以直接调、Responses API 原生兼容、Codex 也能跑。我第一时间接进自己的 Agent 工作流里折腾了大半天,下面把官方数据、实测结果和本地部署的坑都说清楚。

这次 0731,到底动了哪些刀

先说官方公布的更新清单。看一眼就明白,这一版不是修补,是冲着"开发者真正会用到的能力"去的:

  • Agent 能力大幅增强——这是我最在意的一条,下面实测会展开
  • 原生支持 Responses API,不用再套一层适配
  • 完全兼容 Codex,写代码的工作流迁移成本低
  • 整体推理能力进一步提升
  • 多项 Benchmark 直接超过此前的 V4-Pro-Preview
  • 还顺带修了不少老问题

这六条里,Responses API 是我反复强调的重点。原因很现实:Hermes Agent 这类工具早就吃透了 OpenAI 的 Responses 协议,模型端原生兼容意味着你几乎不用改代码就能切过来。我接到 Hermes 的时候,整个流程顺畅得有点不像换模型。

DeepSeek V4 Flash 0731 开源发布封面图,深色科技感背景配发光神经网络芯片与代码光效(AI Arena 排名榜单)

前端代码能力暴涨,竞技场冲到全球第七

官方数据之外,AI Arena 最新公布的成绩单才是真正炸裂的部分。DeepSeek V4 Flash High 在 Frontend Coding Arena 的排名:

  • 全球排名第 7
  • 得分 1586
  • 开源模型排名第 3
  • 消费级产品排名第 4
  • Data & Analysis、Reference Design、Game 分类排名第 6
  • Brand & Marketing 排名第 7
  • 相比 Preview 版本,一次提升 154 分

154 分什么概念?很多模型一个季度都涨不到这个数。这说明这次升级最猛的方向就是代码生成——尤其是前端。这也是为什么我接下来特意挑了两道"硬菜"去压它。

我拿两道硬菜实测了一把

Benchmark 再好看,不如自己跑一遍。我直接把它接进 Hermes Agent(Responses API 原生兼容这点在这里帮了大忙),然后丢了两道我平时用来摸底的题。

测试一:让它写一个商业级 HTML 跑酷游戏

提示词就一句:

编写一款接近商业级的跑酷游戏(HTML 单文件)。

模型一次性吐出完整代码。我没有去追问、没有补刀,它直接把这几样东西都给了我:

  • 游戏逻辑
  • UI 界面
  • 动画效果
  • 音效调用
  • 分数系统
  • 游戏结束逻辑

完成度高到什么程度?基本接近"可以直接拿去演示"的状态。我以前用 Preview 版本干过同样的活,那时候至少要来回改两三轮,这次一轮就过。

DeepSeek V4 Flash 0731 开源发布封面图,深色科技感背景配发光神经网络芯片与代码光效(HTML 跑酷游戏生成效果)

测试二:3D 版超级马里奥

继续加码。提示词:

制作一个 3D 版超级马里奥。

结果又一次让我愣了一下。Three.js 场景搭建速度非常快,人物、地图、交互逻辑都能一次性出来,后续几乎不用大改。我手上有几个长期客户的项目就靠 Three.js 吃饭,过去光是把场景跑起来就要反复调 Prompt,现在这一版 Flash 基本一次成型。

能明显感觉到,这一代 Flash 在前端代码生成上已经迈过了某个临界点。

DeepSeek V4 Flash 0731 开源发布封面图,深色科技感背景配发光神经网络芯片与代码光效(3D 马里奥 Three.js 场景)

社区已经卷起来了:和 Gemini、GPT-5.6 比一圈

模型刚发,海外社区就开始疯狂对线了。我挑了几个有代表性的。

对阵 Gemini 3.6 Flash:Three.js Raptor3 模型

有人用完全相同的提示词、规划文档和参考图片,让 DeepSeek V4 Flash 和 Gemini 3.6 Flash 同时生成 Three.js 的 Raptor3 模型。结论是——不少网友认为 DeepSeek 的整体生成质量已经非常接近 Gemini。一个开源、一个闭源,能打到这个份上,本身就说明问题。

对阵 GPT-5.6 Luna:同价位硬碰硬

有开发者把 DeepSeek V4 Flash 和 GPT-5.6 Luna 放到同一价格区间,跑了三道:

  • 魔方动画 → DeepSeek 更稳定
  • 烟花效果 → 双方接近
  • 手写 Hello 动画 → DeepSeek 更自然
  • 综合同价位 → DeepSeek 胜出

还有几道更硬的

汽车发动机建模,整体完成质量达到 Kimi K3 的 70%~80%——细节略逊,但考虑价格,这点差距完全可以忽略。

大型 Three.js 场景:钢铁厂、机械工厂、机器人跳舞、工业流水线,这些过去要反复改 Prompt 才能跑起来的东西,现在很多都能一次生成

还有一个可交互的 3D 细胞探索器,支持放大缩小、环绕旋转、查看细胞器、阅读真实生物学知识——整个页面一句 Prompt 就出

最近流行的 SVG 鹈鹕骑自行车测试也有人做了,对手是 GPT-5.6 Terra,DeepSeek 的完成度同样不输。

价格离谱到让 GLM 5.2 显贵

能力是开头,价格才是这次真正让人坐不住的点。有开发者把三个模型执行完全相同任务的成本摆在一起:

模型单次任务成本
DeepSeek V4 Flash$0.0005
DeepSeek V4 Pro$0.0008
GLM 5.2$0.048
DeepSeek V4 Flash 0731 开源发布封面图,深色科技感背景配发光神经网络芯片与代码光效(三模型成本对比柱状图)

也就是说,GLM 5.2 的成本大约是 DeepSeek V4 Flash 的近百倍。这个倍数本身就值得停下来想一想。

更直观的两个数字:

  • DeepSeek V4 Flash 在 Hermes Agent 中连续执行任务 32 分钟,总成本 0.07 美元
  • 另一位开发者一次完整任务,花费约人民币 0.78 元,Cache 命中率达到 99.5%

99.5% 的缓存命中率对 Agent 场景意味着什么?意味着大量重复调用的成本还能再往下压一截。按这个价位,很多 Agent 工作流一天只要几美元就能持续跑。这对做自动化的人来说,是能直接改变业务模型的那种变化。

想本地跑?168GB 内存就能上无损 4-bit

喜欢本地运行的朋友这次也有福了。官方放出了 GGUF 量化模型,已经适配 llama.cpp、Unsloth 等主流框架。

下载地址我直接放这:

内存门槛官方给了明确数字:

  • 168GB 内存 → 可运行无损 4-bit
  • 110GB 内存 → 可运行 3-bit
  • 更小尺寸的量化版本后续会继续推
DeepSeek V4 Flash 0731 开源发布封面图,深色科技感背景配发光神经网络芯片与代码光效(本地部署内存需求对比)

说实话,168GB 这个数对个人玩家还是有点劝退,但对工作室、对小公司服务器来说完全够得着。等更小尺寸的量化版本出来,门槛会再降一档。

不想申请 Key?免费公共 API 已经上线

如果你暂时不想折腾 API Key,社区已经有人把免费接口搭好了——部署在 Hugging Face Inference Endpoints 上。

它的特点是:

  • 免费使用
  • 不需要 Token
  • 完全兼容 OpenAI API
  • 社区共享实例

免费接入地址:DeepSeek-V4-Flash-0731-free-endpoint

提醒一句:毕竟是公共服务,会有轻度限流。适合先体验、再决定要不要申请官方 Key,别拿它跑生产任务。

社区怎么评价的

模型发布之后,海外社区几乎是一片好评。最被反复引用的一句评价:

Flash 居然已经全面超过 GLM 5.2,能力几乎达到 Claude Opus 4.8,而价格却只有十分之一左右。

不少开发者认为,DeepSeek V4 Flash 已经成为 Hermes Agent、OpenRouter 等平台中性价比最高的模型之一。Hermes 社区的统计也佐证了这点——过去 30 天里,DeepSeek V4 Flash 一直是使用率最高的模型之一。

速查卡片

  • 模型:DeepSeek V4 Flash 0731
  • 竞技场:全球第 7 / 开源第 3 / 得分 1586
  • 单次成本:$0.0005(GLM 5.2 约 100 倍)
  • Responses API:原生支持
  • Codex:完全兼容
  • 本地部署:168GB 跑无损 4-bit,110GB 跑 3-bit
  • 免费体验:Hugging Face 公共接口

接下来该怎么用

从我这一天的折腾来看,DeepSeek V4 Flash 0731 不是"又一个新模型",而是把性能、价格、Agent 能力和开发生态这四件事同时压到了一个新平衡点

对需要大量调用 AI 接口的开发者来说,这意味着同样预算能干更多活;对本地部署用户来说,GGUF 量化版本降低了体验门槛;对做 Agent 自动化的人来说,原生 Responses API 兼容让迁移几乎无痛。

AI 大模型早就不只是比参数规模了,而是在性能、价格、Agent 能力和生态之间全面开卷。DeepSeek V4 Flash 0731 的出现,无疑让这场价格战和能力战进入了一个新的阶段。

我的建议很简单:先去免费公共接口丢两道你自己的真实任务试试,比看一百篇测评都管用。

本文最后更新于2026年8月1日,若涉及的内容可能已经失效,直接留言反馈补链即可,我们会处理,谢谢
声明:本站所有内容均由互联网收集整理、网友上传,并且以计算机技术研究交流为目的,仅供大家参考、学习,请勿用于任何商业目的与商业用途,如需商用请支持正版!如亲下载后改变其用途与使用方式,与本站无任何关系,本站已经进行告知义务!我们只做安全认证测试如果资源侵犯了您的版权利益,请联系站长邮箱:17606723350@163.com