DeepSeek V4 Flash正式版即将启幕 低价高性能凸显行业新优势

来源:时代一线 分类:科技
DeepSeek V4 Flash正式版即将启幕 低价高性能凸显行业新优势

一位 AI 领域的研究者向我发来消息,称这是她入行以来最惬意的一个夏天。

DeepSeek-V4-Flash 正式版如期而至,性能表现超越了此前的 V4-Pro-Preview。

在基准测试中,它甚至能与 Claude Fable 5 同场竞技。

这款总参数达 284B、激活参数仅 13B 的“轻量版”模型,在多类任务中追平了曾经高不可攀的 Opus 4.8。

更令人咋舌的是定价。Flash 版便宜得有些离谱,两块就能换取 100 万 tokens 的输出量。她将手头所有项目重新优化一遍,花费甚至不足一杯奶茶钱。

昨日开发者群里,众人突然停下手中工作,纷纷转发评测截图。她难掩喜悦,坦言有种身处人类黄金时代的错觉。

谁也没料到,DeepSeek 这次又憋了个大招。卡着 7 月末尾,正式推出 DeepSeek V4 Flash。

实话说,起初世超对此次更新并未太在意。毕竟只是挂着 Flash 名头的更新,主力 Pro 系列纹丝不动。

上一次只更 Flash 不更 Pro 的大厂是谷歌,如今已成大家调侃的对象。心想你这 Flash 再强,总不能超越 Pro 吧?

结果呢?这 Flash 跑分竟比自家 Pro 还高?

这还是 Flash 吗?

不对啊,大模型不该这么玩。按套路,应先出 Flash 宣称速度快些,再让 Flash 追上 Pro,最后给个两块钱 / 百万 token 的低价,偶尔还有缓存命中的一折优惠。我周末用了 1 亿 token,才花了 5 块。

世超梳理了 V4 Flash 的跑分数据,发现其能力确实夸张。

不仅超越了自己大哥 Pro,虽不及 Claude Opus5、GPT-5.6 Sol 和 Kimi K3 等顶级模型,但正式版 V4 Flash 的表现已非常接近这些顶尖选手。

有热心网友汇总各家大模型的能力与价格,制作了一张图表:

图中每个点代表一个模型,越靠左越便宜,越靠上性能越好。

直观来看,市面上多数模型位置尴尬。性能不如 DeepSeek,价格却更贵。

那些性能更强的模型,处境也不乐观,因为价格实在太高。

注意上图横轴是对数坐标,但我们花钱可不是按对数算的。

世超用久违的 PS 技巧将图拉成线性坐标,真实比例便显露出来:

论性能,Claude Fable 5、GPT-5.6 Sol 等相比 V4 Flash,提升约两成。

但价格,可能多出两个零。

可以说,DeepSeek 再次重新定义了模型的“斩杀线”。

那么,它是如何做到的?架构参数未大变,为何能力突增?

世超查阅 DeepSeek 论文及公开资料,锁定两个最大可能性。

首要点是后训练。官方也承认,这是预览版与正式版差距最大的环节。

给不太了解大模型的读者科普一下,大模型训练通常分两阶段。

第一阶段预训练。需向模型注入海量文本、代码及其他数据,使其掌握回答问题的基础能力。

这 akin to 培养高中生,语数外物化生政史地音体美计算机,各领域知识都要灌输,以此夯实基础。

第二阶段后训练。旨在锻炼实际解题能力。

主要工作是刷题,通过反复练习提升应试能力,学会解决问题。

研究人员利用监督微调、强化学习和大量任务数据,教会模型理解指令、拆解问题、使用工具,并按人类偏好输出答案。

同样预训练的模型,经不同后训练刷题,表现可截然不同。

此前 DeepSeek R1 论文提及,他们将 V3 进行 GRPO(群组相对策略优化)强化学习后,数学能力大幅提升,AIME 2024 测试集正确率从 15.6% 飙升至 71%。

OpenAI 当年的 InstructGPT 亦然。

经监督微调和 RLHF,仅 13 亿参数的模型,在真人盲评中击败了参数量大 100 多倍的 GPT-3。

若说预训练决定模型脑中是否有知识,后训练则决定其能否提取并运用这些知识。

当然,仅靠后训练或许无法完全解释 V4 Flash 的惊人成绩。

细看发布说明,另一个细节浮现:部分跑分并非模型裸跑得出。

而是借助了一款名为 DeepSeek Harness 的未发布工具。

Harness 一词近半年屡见不鲜。火爆的 Claude Code、Codex、OpenClaw 皆可视为 Harness,或 Agent 工具的一种。

包括常刷到的 Workbuddy、Qoder、Trae 也属此类。

如今,DeepSeek 也要推出自己的 Agent 工具入场竞争。

此事或许比单纯更新模型更为关键。

在 Agent 时代,模型最终能达成何种成果,不只取决于本身智商,还取决于外挂的工具套件。

裸模型如考场学生,遇复杂问题只能硬算。

Agent 则为模型装上搜索引擎,配备代码运行环境,管理项目上下文,检查结果,甚至出错后可直接重来。

通过外置工具为模型加持,AI 实际做事能力得以极大增强。

今年初,多伦多大学团队开展研究,将同一大模型放入不同 Agent 工具中测试。

结果显示,同一模型在不同工具中表现迥异,完成任务概率最高相差数倍。

前有人言,AI 发展如逐级攀登阶梯。

去年阶梯是思维链,让模型学会思考,拓展 AI 能力边界。

今年,最重要的阶梯则是 Agent。

此刻,DeepSeek 交出了其对 Agent 的答案。

凭借高质量后训练与 Agent 工具,原本负责轻量应用的 Flash,被直接推至全球旗舰模型身后。

说实话,看到这套超级强化后的 Super Pro Max 版 Flash,世超已开始期待。

既然主打下沉市场的小弟,靠着精湛后训练和 DeepSeek Harness 工具,便能与身娇肉贵的“太上皇”们掰手腕……

那若将这套版本答案套在更强的 V4 Pro 上呢?

撰文:早起

编辑:江江 & 面线

美编:焕妍

图片、资料来源:

https://api-docs.deepseek.com/zh-cn/quick_start/pricing/

https://www.reuters.com/business/retail-consumer/deepseeks-new-ai-model-is-by-far-cheapest-well-known-models-run-research-firm-2026-08-03/

https://artificialanalysis.ai/leaderboards/models

https://artificialanalysis.ai/models

https://artificialanalysis.ai/methodology

https://artificialanalysis.ai/methodology/intelligence-benchmarking

https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash

https://arxiv.org/abs/2606.19348

https://api-docs.deepseek.com/zh-cn/news/news260424

https://www.deepseek.com/transparency/

https://arxiv.org/abs/2501.12948

https://arxiv.org/abs/2203.02155

https://arxiv.org/abs/2602.09540

https://swebenchmobile.com/

相关推荐