换脑不换身:DeepSeek-V4-Flash 仅凭重做后训练,13B 激活如何碾压 49B 旗舰预览版
2026 年 7 月 31 日DeepSeek 通过 API 发布日志宣布 V4-Flash 正式版版本号 V4-Flash-0731上线公测。最值得玩味的不是它发了什么新模型而是它没换什么——2840 亿总参数、130 亿激活参数的 MoE 架构、100 万 token 上下文与三个月前的预览版完全一致唯一的变量是重新做了一遍后训练Post-Training。结果却是9 项 Agent 基准测试全面碾压激活参数大近 4 倍的 V4-Pro 预览版49B 激活[来源DeepSeek 官方模型卡](https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731)。这件事的工程价值在于它用一组硬数据挑战了参数即护城河的行业惯性。衡量 Agent 自主修复代码、处理 GitHub Issue 能力的 DeepSWE从预览版的 7.3 飙升至 54.4涨幅 645%终端操作 Terminal Bench 2.1 拿下 82.7 分逼近 Opus-4.8 的 85.0而 V4-Flash 的激活参数只是后者的一个零头[来源DeepSeek 官方模型卡](https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731)。当一家头部厂商公开示范不堆参数也能跨越式提升整个赛道关于 scaling 的叙事就需要重写。本文不停留在发了什么而是拆解换脑不换身背后的设计决策后训练为何能产生远超预期的杠杆、DSPark 投机解码如何在架构不变下拿到速度加成、DeepSeek Harness 极简模式怎样定向放大 Agent 能力以及这套范式自带的局限与代价。所有数据均来自 DeepSeek 官方模型卡与发布日志并逐条标注来源。一、事件还原架构不动成绩全面翻倍先把换脑不换身这句话坐实。DeepSeek 在发布日志中明确V4-Flash-0731 的总参数 284B、激活参数 13B、MoE 架构、100 万 token 上下文与 Preview 版完全一致仅重新进行了后训练未涉及底层架构改动[来源DeepSeek 发布日志经新浪财经报道](https://cj.sina.cn/articles/view/7879996431/1d5af340f06801iw5c)。官方模型卡也印证了这一点0731 版与自带投机解码模块的 DeepSeek-V4-Flash-DSpark 结构相同即在原模型基础上挂载了一个推测解码speculative decoding模块[来源DeepSeek 官方模型卡](https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731)。变量只有一个成绩却全面翻倍。下表是官方模型卡给出的横向对比注意 V4-Flash-073113B 激活在每一项上都超过了 V4-Pro 预览版49B 激活BenchmarkV4-Flash-0731 (13B激活)V4-Flash 预览版V4-Pro 预览版 (49B激活)GLM-5.2Opus-4.8Terminal Bench 2.182.761.872.181.085.0NL2Repo54.239.438.548.969.7Cybergym76.738.752.7-83.1DeepSWE54.47.312.846.258.0Toolathlon-Verified70.349.755.959.976.2Agents Last Exam25.215.816.523.825.7AutomationBench Public25.110.812.812.927.2DSBench-FullStack †68.737.041.861.871.6DSBench-Hard †59.625.831.154.571.7数据来源DeepSeek 官方模型卡。† 表示 DSBench-FullStack 为内部全栈开发测试集DSBench-Hard 为内部高难度编码 Agent 测试集非公开可复现。最戏剧性的一行是 DeepSWE预览版仅 7.30731 版 54.4相对自身涨幅 645%即便对比 49B 激活的 V4-Pro 预览版12.8也是 4 倍以上的领先。这条指标衡量的是模型在真实长周期、多步骤编程任务中的自主解决能力正是 Agent 价值的核心。二、为什么换脑比换身更有效后训练的杠杆效应要理解这组数据为何反直觉需要先把两条优化路径的成本结构拆开。预训练Pre-Training是换身动的是模型架构、参数规模和训练数据。每多一倍参数算力、显存、数据量、工程复杂度都近似指数级上升且收益递减——这是业界熟知的 scaling law 曲线。DeepSeek-V4-Pro 预览版总参 1.6 万亿、激活 49B预训练数据 33T token[来源DeepSeek 官方发布与第三方架构分析](https://cloud.tencent.cn/developer/article/2669731)这条路径的边际成本极高。后训练Post-Training是换脑模型权重骨架不动通过监督微调SFT、强化学习RL、奖励建模等手段重塑模型的行为分布。它的算力开销通常只有预训练的几十分之一到几百分之一却直接决定模型在特定任务上的动作选择。V4-Flash-0731 的案例说明在 Agent 这类高度依赖会不会调用工具、能不能坚持多步纠错的任务上行为策略的权重远大于知识容量。为什么 Agent 能力对后训练格外敏感因为 Agent 任务的本质不是知道答案而是在不确定环境里做一连串决策。一个编码 Agent 要读懂 Issue、定位文件、改代码、跑测试、根据报错回溯每一步都是一次选择。预训练给的是原材料后训练给的是工作流。DeepSeek 官方在 Code Agent 任务中使用了自研的 DeepSeek Harness 极简模式作为测试框架并以max推理强度、temperature1.0、top_p0.95的配置评测[来源DeepSeek 官方模型卡](https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731)——这意味着后训练很可能针对工具调用循环失败重试长程规划做了大量定向强化而非泛泛提升。换句话说DeepSWE 从 7.3 到 54.4增量大概率不来自模型变聪明了而来自模型学会了在 Agent 框架里正确地犯错和纠错。这是一个可复制性极强的信号对应用层团队而言把预算砸在后训练的策略工程上可能比苦等下一个万亿参数模型回报更高。三、架构不变下的工程加成DSPark 投机解码架构不动不代表工程上没有加码。0731 版最显眼的工程增量是 DSPark 投机解码speculative decoding。官方模型卡说明该版本与 DeepSeek-V4-Flash-DSSpark 结构相同自带一个推测解码模块用一个轻量草稿模型并行预测多个 token再由主模型批量验证从而在几乎不损失质量的前提下大幅提升推理吞吐。对 Agent 场景这点尤为关键Agent 的思考-行动-观察循环天然是多轮、长输出任何延迟都会被轮数放大。DSPark 让单步生成更快直接缩短整个任务链的端到端耗时。官方给出的 vLLM 启动命令只多了一个 flagvllm serve deepseek-ai/DeepSeek-V4-Flash-0731 \ --trust-remote-code --kv-cache-dtype fp8 --block-size 256 \ --data-parallel-size 4 --enable-expert-parallel \ --moe-backend deep_gemm_mega_moe \ --attention-config {use_fp4_indexer_cache: true} \ --speculative-config {method:dspark,num_speculative_tokens:7,draft_sample_method:greedy}命令来源DeepSeek 官方模型卡。--speculative-config中num_speculative_tokens:7表示草稿模型一次预测 7 个 tokengreedy表示草稿用贪心采样。注意它运行在单台 4×GB300 节点上并启用了专家并行--enable-expert-parallel和 FP8 KV 缓存——MoE 的稀疏激活加上投机解码是这条命令能跑得动的组合前提。SGLang 侧同样一行开启且无需单独指定草稿模型路径因为目标权重和草稿权重来自同一个 checkpointsglang serve \ --trust-remote-code \ --model-path deepseek-ai/DeepSeek-V4-Flash-0731 \ --tp 4 \ --moe-runner-backend flashinfer_mxfp4 \ --speculative-algorithm DSPARK \ --mem-fraction-static 0.90 \ --chunked-prefill-size 4096 \ --swa-full-tokens-ratio 0.1值得强调的是同一 checkpoint 出草稿与目标这个设计它意味着投机解码不是额外维护一个小模型而是从大模型自身的结构里长出一个轻量预测头。这对部署方的工程负担是降级而非升级也是 0731 版能把它作为默认能力开放的原因。四、Agent 框架层的定向增强DeepSeek Harness 与推理强度前文提到官方用 DeepSeek Harness 极简模式评测这条信息比看上去更重要。一个模型的 Agent 成绩从来不是模型独自跑出来的而是模型 Agent 框架的联合产物。框架决定了模型能看到什么提示、能调用哪些工具、失败后怎么回退。DeepSeek 自研评测框架本质是在后训练与评测之间建立了一致的接口契约——训练时强化的行为模式评测时用同一套框架去触发。reasoning_effort参数是这种定向增强的另一个出口。官方模型卡将其分为low、high、max三档控制模型在回答前投入多少思考[来源DeepSeek 官方模型卡](https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731)。对复杂 Agent 场景官方建议用max并把最大输出长度设到 384K token。这意味着模型在想清楚再动手和快速响应之间有了显式旋钮应用层可以按任务难度动态切换而不必在两个模型间二选一。这套机制也体现在编码接口上。0731 版没有提供 Jinja 格式的 chat template转而给出一个encoding文件夹用 Python 脚本演示如何把 OpenAI 兼容格式的消息编码成模型输入串以及如何解析模型输出from encoding_dsv4 import encode_messages, parse_message_from_completion_text messages [ {role: user, content: hello}, {role: assistant, content: Hello! I am DeepSeek., reasoning_content: thinking...}, {role: user, content: 11?} ] messages - string prompt encode_messages(messages, thinking_modethinking, reasoning_effortmax) string - tokens import transformers tokenizer transformers.AutoTokenizer.from_pretrained(deepseek-ai/DeepSeek-V4-Flash-0731) tokens tokenizer.encode(prompt)代码来源DeepSeek 官方模型卡。放弃通用 Jinja 模板、改用显式编码脚本是为了精确控制思考模式与推理强度的注入位置——这种把对齐逻辑写进编码层的做法比靠模板字符串拼接更可控也更利于在 Agent 多轮交互中稳定复现行为。五、开发者生态Responses API Codex 适配与性价比模型再强接入成本高也推不开。0731 版在工具链上的配套升级瞄准的正是迁移摩擦。正式版原生支持 OpenAI 力推的 Responses API 格式更适合 Agent 场景的灵活工具调用和多轮交互开发者无需修改 Base URL 即可切换模型[来源DeepSeek 发布日志经新浪财经报道](https://cj.sina.cn/articles/view/7879996431/1d5af340f06801iw5c)。针对 Codex 编程助手官方做了专项适配覆盖 CLI、ChatGPT 桌面端、VS Code 扩展并提供了 Mac 和 Windows 一键配置脚本让 Codex 客户端自动切换到 DeepSeek 模型。这是一条很懂开发者的路径不要求用户换 IDE而是把自己塞进用户已有的工作流。性价比方面API 定价未上涨缓存命中时低至 0.2 元/百万 token输出端非高峰时段约 0.28 美元/百万 token是同级模型中成本最低的选择之一。有分析指出V4-Flash 完成单个任务的成本比智能水平相近的 GPT-5.6 Luna 低约 60%[来源DeepSeek 发布日志经新浪财经报道](https://cj.sina.cn/articles/view/7879996431/1d5af340f06801iw5c)。叠加海外评测机构 Artificial Analysis 的数据——V4-Flash 最高推理档位拿下 50 分而同类可比模型中位数仅 17 分[来源DeepSeek 官方日志经搜狐报道](https://m.sohu.com/a/1057502782_122921598/)——又便宜又能打并非营销话术而是有数据支撑的定位。这种定位在市场端已经兑现。全球最大模型聚合平台 OpenRouter 最新数据显示DeepSeek V4 Flash 周调用量 6.37 万亿 token位列全球第二中国模型整体份额达 63.5%[来源OpenRouter 公开数据经搜狐报道](https://m.sohu.com/a/1057502782_122921598/)。开源MIT 协议、低价MoE 稀疏激活、押注 Agent是中国模型在这条赛道上跑赢的三板斧。需要提醒的是该榜单只反映海外开源赛道的调用量国内大厂自有 App 流量与美国大厂封闭 API 流量均未计入调用量领先不等于技术全面领先。六、局限性与冷思考把成绩单捧得越高越要正视它的边界。第一两项核心指标是内部测试集。DSBench-FullStack 与 DSBench-Hard 在官方模型卡中明确标注为内部测试集非公开可复现[来源DeepSeek 官方模型卡](https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731)。内部集存在选择偏差和过拟合风险外部团队无法独立验证成绩的横向可比性要打折。第二评测框架自研且尚未开源。Code Agent 任务用的是 DeepSeek Harness 极简模式官方注明待发布to be released。在框架开源前模型成绩与框架实现强耦合别人用别的 Agent 框架跑同一个模型未必能复现 54.4 这个数字。这正是前文强调模型 框架联合产物的应有之义——也是潜在的水分所在。第三仅后训练不等于廉价。架构未动是事实但后训练本身的算力、数据工程量并未公开。强化学习阶段的训练 token 数、奖励模型规模、环境交互成本都可能很高。把换脑不换身理解成低成本就能 6 倍提升可能低估了 DeepSeek 在后训练基础设施上的投入。杠杆效应真实存在但杠杆的支点并不便宜。第四与顶级闭源仍有差距。从官方表看V4-Flash-0731 在 NL2Repo54.2 vs 69.7、DSBench-Hard59.6 vs 71.7、Cybergym76.7 vs 83.1等项上落后 Opus-4.8 明显Terminal Bench 2.1 只是逼近而非超越。说碾压旗舰预览版成立说碾压顶级闭源则不成立。第五能力版图仍是文本单模态超长上下文50 万 token 以上的信息留存仍有衰减。这些是架构层面的问题后训练无法根治。结论DeepSeek-V4-Flash-0731 的真正贡献不是又刷了几个榜而是用一份架构不动、只重做后训练的对照实验把后训练的杠杆效应量化了出来13B 激活的小模型凭借策略工程就能在 Agent 任务上反超 49B 激活的旗舰预览版。这对行业的启示是具体的——预训练决定模型的天花板后训练决定模型在真实任务里能摸到多高当预训练边际收益递减把资源转向后训练的策略与数据工程可能是性价比更高的下一站。对应用层开发者这意味着与其苦等更大的基座不如把功夫花在 Agent 框架、奖励设计、工具调用循环的打磨上。模型权重已以 MIT 协议在 HuggingFace 开放deepseek-ai/DeepSeek-V4-Flash-0731技术报告见 arXiv:2606.19348vLLM/SGLang 一行参数即可启用 DSPark 投机解码迁移成本被压到了最低。相关项目与持续更新的工程实践笔记已开源在 https://github.com/wangzifan396-wzf/TW 欢迎 Star 与交流。