
摘要2026年8月31日DeepSeek将V4-Flash推进到0731官方版取代此前上线一个多月的preview版本。架构与规模完全不变——仍为284B总参数 / 13B单Token激活的MoE256个路由专家 1个共享专家 / 每Token激活6个但通过完整的强化学习后训练重跑Agent与编程基准实现非连续跳跃Terminal-Bench 2.1从61.8跃升至82.7超GLM-5.2的81.0逼近Opus 4.8的85.0和GPT-5.6 Luna的84.7、DeepSWE从7.3暴涨至54.4超越GLM-5.2的46.2、NL2Repo从39.4升至54.2、Cybergym从38.7升至76.7、DSBench-FullStack从37.0升至68.7、Toolathlon-Verified从49.7升至70.3。价格保持**$0.14/输入 $0.28/输出 / $0.0028/缓存命中**比GPT-5.6 Sol的$5/$30便宜约35倍比Opus 4.8的$5/$25便宜约18倍比同日启动重新定价的Claude Sonnet 5的$3/$15便宜约11倍。权重以MIT许可证开源~167 GBFP4/FP8混合精度Day-1生态覆盖vLLM单flag启用DSpark推测解码/ Cline限时免费集成/ Ollama Cloudollama run deepseek-v4-flash:0731-cloud/ UnslothQ4 110GB、Q8 162GB GGUF/ Hugging Face。与GPT-5.6 Luna同日降价80%形成微妙对垒——OpenAI降价次日DeepSeek就推出这款性能远超Luna、定价却更低的模型。这是中国大模型以Flash之身做Opus之实路线最完整的一次公开演示也是OpenAI/Anthropic必须正面回应的真正压力点。全文约5800字一、发布背景一个MoE不动的纯后训练跃迁1.1 为什么这次发布震动市场8月30日深夜至8月31日凌晨DeepSeek通过API将deepseek-v4-flash模型名直接路由到新版本0731同时在Hugging Face上以MIT许可证发布配套权重。模型的结构、规模、参数完全没变——这并不是又一次新模型而是一次纯后训练升级用完整的强化学习流程把同一个284B/13B MoE的训练结果向前推了一大步。但这个推进的幅度足以让市场重新评估两个问题Flash级小激活模型的天花板在哪里OpenAI/Anthropic过去一年靠模型尺寸建立的护城河还有多深过去两年主流叙事一直是更大的模型、更长的训练、更高的成本。DeepSeek 0731用一组简单数字颠覆了这一叙事基准Preview版本0731官方版绝对跃升对比参照Terminal-Bench 2.161.882.720.9超GLM-5.2(81.0) / 逼近Opus 4.8(85.0)DeepSWE7.354.447.1超GLM-5.2(46.2)NL2Repo39.454.214.8—Cybergym38.776.738.0—DSBench-FullStack37.068.731.7接近Opus 4.8的71.6DSBench-Hard—59.6—接近Opus 4.8的71.7Toolathlon-Verified49.770.320.6—Artificial Analysis 智能指数405010—表1DeepSeek V4-Flash 0731核心基准跃升数据来源DeepSeek技术报告、Artificial Analysis、kimmonismus benchmark table2026-08-31仅看Terminal-Bench 2.1一项0731的82.7就超过GLM-5.2的81.0距离Opus 4.8的85.0只剩2.3分——这是Flash级模型首次系统性接近前沿。考虑到V4-Flash单次激活参数只有Opus 4.8的几分之一这样的以小博大在工程上和商业上都有深远意义。1.2 与OpenAI降价形成双日对垒这次发布的时机并非偶然8月29日OpenAI将GPT-5.6 Luna降价80%从$1/$6降至**$0.20/$1.20/百万Token**被普遍解读为应对中国大模型的价格压力。8月31日DeepSeek推出V4-Flash 0731价格$0.14/$0.28——比Luna还便宜30%而Terminal-Bench 2.1得分反超Luna82.7 vs Luna的84.7仅差2分。同日Claude Sonnet 5启动涨价详见本日第二篇市场焦点转向价格战 vs 价值战。DeepSeek选在Luna降价次日推出0731时机选择非常清晰要在OpenAI制造的成本叙事被市场接受之前把低价高性能组合的标杆钉死。1.3 一个不太被讨论的潜台词DeepSeek在V4-Flash 0731的发布节奏上还有一个值得注意的细节V4-Pro的预览版早在6月就已发布但官方版至今未落地。DeepSeek在变更日志中明确指出“本更新仅适用于V4-Flash APIV4-Pro API、消费端App/网页模型保持不变。官方版V4-Pro即将发布。”这意味着DeepSeek正采用先打磨好用的Flash、再回头补完Pro的反常规节奏。从工程上看这种节奏有利于稳定生态——企业用户接入Flash几乎没有迁移成本——但也意味着DeepSeek主动放弃了一部分前沿品牌的话语权。二、技术架构284B/13B MoE DSpark推测解码2.1 与Preview完全一致的MoE骨架V4-Flash 0731的架构与Preview版本完全一致继承自V4-Flash-DSpark项目的设计维度数值总参数284B约304B含DSpark推测头单Token激活参数13B激活率约4.6%上下文窗口1M Token与Preview一致路由专家数256个路由专家 1个共享专家每Token激活专家数6个Top-6路由注意力机制与V4-Flash一致的稀疏线性注意力混合配套模块DSpark推测解码头与模型一同发布推理Effort等级low / high / max三档表2V4-Flash 0731架构规格数据来源vLLM官方Recipe、Unsloth GGUF指南、DeepSeek技术报告2026-08-31DSpark是DeepSeek在V4-Flash Preview阶段就预置的推测解码头——一个独立的轻量模型与主模型一同发布通过vLLM的单个flag即可启用vllm serve deepseek-ai/DeepSeek-V4-Flash-0731\--speculative-method dspark\--num-speculative-tokens8\--max-model-len1048576启用DSpark后每个解码步可一次预测最多8个候选Token由主模型并行验证。这对Agent类工作负载尤其关键——长链路工具调用中的小步延迟会累积成数十秒的等待DSpark在V4-Flash上的实测加速比为1.6-2.4×。2.2 后训练从对齐到工作流能力DeepSeek在V4-Flash Preview阶段的核心卖点是参数效率用13B激活做出与同期前沿50-100B激活模型相当的能力。但Preview在Agent工作流上的短板也很明显——Terminal-Bench 2.1只有61.8分DeepSWE只有7.3分距离能干活的模型还有显著差距。0731版本的核心工作是对预览版模型重新跑了一次完整的强化学习后训练。从基准跃升的特征看这次后训练重点针对的是多步骤工具使用 真实软件工程任务这两类任务类别Preview表现0731表现跃升幅度评估方法真实软件工程DeepSWE7.354.447.1多文件PR生成 测试通过率多步任务Terminal-Bench 2.161.882.720.9终端Agent执行完整工作流数据科学DSBench-FullStack37.068.731.7端到端数据项目交付网络安全Cybergym38.776.738.0真实漏洞利用场景工具选择Toolathlon-Verified49.770.320.6多API工具调用决策表30731版本针对Agent工作流的专项跃升数据来源DeepSeek技术报告、Artificial Analysis2026-08-31几个值得注意的细节数据科学任务的跃升31.7说明后训练覆盖了长程规划多模态数据理解Python代码执行的复合任务而不仅仅是代码补全。网络安全类38.0的高分说明模型对安全Agent任务也具备较强能力这与GLM-5.3、阿里Qwen 3.8-MAX同期在CyberGym上的高分形成了开源大模型在这一领域的集中突破。DeepSWE从7.3到54.4的跃升是绝对值最大的单项——这个基准要求模型在真实仓库中阅读代码、定位问题、生成多文件补丁、并通过测试。7.3分说明Preview几乎不具备这种能力54.4分意味着0731已经可以作为初级开发者的辅助完成实际PR。2.3 DeepSeek Harness一个待解的评测体系黑盒DeepSeek在0731的技术报告中提到了内部使用的DeepSeek Harness v0.1.1——一套用于评估Agent工作流的标准化框架。这个框架同时支持多轮工具调用多语言代码执行Python/JS/Shell真实仓库工作流Git checkout、测试运行、PR生成联网检索多模态输入这套Harness并未开源仅作为评测协议提供给第三方复现。AI社区对此反应复杂支持方认为评测标准化是开源生态成熟的必经之路。批评方质疑Harness本身可能过拟合到DeepSeek自家模型——0731在Harness上的高分是否能泛化到其他Agent框架如SWE-Agent、AutoCodeRover仍是开放问题。DeepSeek对此的回应是鼓励独立第三方在SWE-bench、Terminal-Bench等公开基准上验证0731。从Hacker News和r/LocalLLaMA的早期用户反馈看0731在这些公开基准上的实际表现略低于DeepSeek官方数字差距约3-7分但仍然显著优于Preview版本——这意味着Harness可能存在轻度过拟合但以小博大的核心结论仍然成立。三、价格与商业$0.14/$0.28如何重写Agent经济学3.1 价格表与对比模型输入价 ($/MTok)输出价 ($/MTok)缓存命中上下文Terminal-Bench 2.1DeepSeek V4-Flash 0731$0.14$0.28$0.00281M82.7GPT-5.6 Sol$5$30$0.50256K~88GPT-5.6 Luna8/29降价后$0.20$1.20—256K84.7Claude Opus 4.8$5$25$0.501M85.0Claude Sonnet 58/31涨价前$2$10$0.201M80.4Claude Fable 5$10$50$1.001M~92阿里 Qwen 3.8-MAX$0.40 (估算)$1.20 (估算)—256K78.5 (估算)智谱 GLM-5.3-Flash$0.05 (估算)$0.10 (估算)—1M~70表4DeepSeek V4-Flash 0731与主流前沿模型的对比数据来源各厂商官方定价、DeepSeek技术报告2026-08-31注Qwen 3.8-MAX、GLM-5.3-Flash等中文模型定价部分基于公开API文档与社区估算可能与官方最终定价有出入。几个关键价格比比GPT-5.6 Sol便宜约35倍$0.14 vs $5/输入$0.28 vs $30/输出。比Claude Opus 4.8便宜约18倍$0.14 vs $5/输入$0.28 vs $25/输出。比Claude Sonnet 5涨价前便宜约7-14倍。比GPT-5.6 Luna刚降价便宜约30%——而性能反超Luna。换句话说用0731替代GPT-5.6 Sol做Agent任务成本下降约97%。3.2 Agent经济学一个1000步任务的价格差异Agent工作流的一个典型特征是多步骤、每步输出相对短。假设一次完整的Agent任务需要1000次LLM调用平均每次输入5000 Token 输出500 Token总计5M输入 0.5M输出各模型的成本对比模型输入成本输出成本总成本相对DeepSeek倍数DeepSeek V4-Flash 0731$0.70$0.14$0.841×GPT-5.6 Luna$1.00$0.60$1.601.9×Claude Sonnet 5$10.00$5.00$15.0017.9×Claude Opus 4.8$25.00$12.50$37.5044.6×GPT-5.6 Sol$25.00$15.00$40.0047.6×Claude Fable 5$50.00$25.00$75.0089.3×表51000次Agent调用的成本对比数据来源基于各模型官方定价计算2026-08-31对一个每天运行10万次Agent调用的中型企业模型选择的成本差异是用DeepSeek V4-Flash 0731$84/天≈$2.5K/月用Claude Opus 4.8$3,750/天≈$112.5K/月用GPT-5.6 Sol$4,000/天≈$120K/月月成本差距超过10万美元。这个数字足以改变任何中型企业的Agent架构决策。3.3 MIT开源的杠杆效应V4-Flash 0731的另一个杀手锏是MIT许可证开源——权重在Hugging Face zai-org/deepseek-ai组织下以FP4/FP8混合精度发布总大小约167GB。这意味着企业可以部署选项硬件门槛月度成本估算全API调用无按Token计费最便宜自托管推理vLLM 8×A100/H100~$150K一次性$5-8K电费折旧自托管推理vLLM 2×RTX 6000 Pro DSpark~$15K一次性$300-500电费本地GGUFUnsloth Q4 / 110GB RAM$3-5K极低Ollama Cloudollama run deepseek-v4-flash:0731-cloud无Ollama按使用计费表6V4-Flash 0731的部署选项数据来源vLLM官方、Unsloth指南、Hugging Face模型卡2026-08-31对于有数据合规需求的企业医疗、金融、政府本地部署MIT模型DSpark是当前最经济的合规方案——比Claude/GPT同档能力的合规部署便宜约50-100倍。四、Day-1生态Cline、Ollama、vLLM、Unsloth同步支持4.1 Cline集成限时免费的Agent调用AI编程工具Cline在0731发布当天即宣布在其Coding Agent中限时免费集成V4-Flash 0731——这意味着Cline用户可以用几乎免费的方式在IDE中体验Opus级Agent能力。Cline集成的特别之处在于# Cline的DeepSeek V4-Flash 0731配置简化版config{provider:deepseek,model:deepseek-v4-flash,# 自动路由到0731api_base:https://api.deepseek.com,reasoning_effort:high,# 三档可选low/high/maxcontext_window:1048576,supports_function_calling:True,supports_responses_api:True,# 兼容OpenAI Responses格式}4.2 Ollama Cloud与vLLM1条命令启动# Ollama Cloud最简单的体验方式ollama run deepseek-v4-flash:0731-cloud# vLLM生产级部署pipinstall-Uvllm vllm serve deepseek-ai/DeepSeek-V4-Flash-0731\--tensor-parallel-size8\--speculative-method dspark\--max-model-len10485764.3 Unsloth GGUF本地低显存部署Unsloth为本地部署提供了细致的量化方案量化方案显存/内存需求精度损失适用场景Q4_K_M~110 GB RAM极低lossless近似24GB显存不可得但有充足内存Q8_0~162 GB RAM几乎无损接近原精度的本地推理FP16原精度~310 GB RAM无损服务器/工作站FP4/FP8混合官方发布~167 GB官方推荐精度生产部署表7Unsloth V4-Flash 0731 GGUF部署规格数据来源Unsloth GGUF指南2026-08-31Q4版本的110GB内存需求意味着即使是Mac Studio M3 Ultra192GB统一内存也可以本地运行0731——这对个人开发者和小团队意义重大。4.4 与Codex/Cursor的兼容V4-Flash 0731 API原生支持OpenAI Responses格式这意味着它可以直接接入基于OpenAI生态构建的Agent框架Codex CLIDeepSeek官方文档明确提供了deepseekprovider配置指南可作为codex的backend。Cursor用户可以在Cursor中配置自定义OpenAI-compatible endpoint指向DeepSeek API获得接近Opus级的能力。Continue.dev / Aider / Cline所有支持OpenAI格式的工具都可零成本切换。五、市场反响与战略意义5.1 立即可见的市场反应V4-Flash 0731发布24小时内的几个关键反应平台/工具反应ClineDay-1限时免费集成OllamaCloud平台Day-1上线OpenRouterToken流量榜预计排名快速上升Hugging Face模型卡当日下载量破10万Hacker News主页热门评论聚焦评测黑盒问题r/LocalLLaMADeepSeek Harness成为讨论焦点5.2 对OpenAI/Anthropic的压力0731的发布对前沿厂商的冲击是结构性的OpenAI 5.6 Luna的80%降价被反超Luna的$0.20/$1.20在0731面前显得既不够便宜也不够强。Claude Sonnet 5同日涨价更显尴尬Sonnet 5从$2/$10涨到$3/$15而0731提供接近Opus 4.8的能力便宜7-14倍。Agent工作流市场重定价之前认为Agent必须用Opus/Sol的认知被0731的$0.84/1000次调用彻底打破。5.3 中国大模型以小博大路线的胜利0731是**MoE稀疏激活后训练强化学习路线**的又一次大胜。它证明13B激活参数足以做出82.7分Terminal-Bench——这不是参数效率的胜利而是后训练数据效率的胜利。架构不变也能实现20.9分的飞跃——基础模型的能力上限可能已经够用关键是如何释放。MIT开源DSpark推测解码多框架适配形成完整生态壁垒——竞争对手即使做出等价模型也很难在Day-1覆盖Cline/Ollama/vLLM/Unsloth。这条路线对中国大模型整体战略的启示不必追求参数规模的绝对领先把后训练做得更深、生态做得更密是更可持续的差异化路径。六、剩余风险与待验证问题6.1 DeepSeek Harness的评测过拟合风险如前所述DeepSeek Harness v0.1.1未开源社区对0731的真实泛化能力仍有质疑。建议在SWE-bench Verified、Terminal-Bench 2.1公开版本上做独立测试。用SWE-Agent、AutoCodeRover等第三方框架重新评估。在生产环境中先小流量A/B测试再大规模切换。6.2 长上下文稳定性V4-Flash宣称支持1M上下文但实际在200K长度的真实任务如大型代码库理解、超长文档总结中的表现尚未充分验证。建议用LongBench、Needle-in-a-Haystack等公开基准测试。在长上下文场景中观察是否出现上下文漂移Context Drift。6.3 多模态能力V4-Flash 0731目前仍是纯文本模型。DeepSeek在8/26才发布V4-Flash-Vision-Exp实验性视觉版但Vision版的性能尚未公开。Agent工作流中常见的截图理解OCRUI操作任务0731仍需配合独立视觉模型。6.4 DSpark的兼容性DSpark推测解码头与主模型一同发布但与vLLM的集成仍属新功能生产环境可能遇到显存峰值略高需额外加载推测头。边界case的稳定性推测错误时的回退机制。与其他推测解码方法如n-gram、Lookahead的兼容性。七、FAQQ10731是新模型还是模型升级是纯后训练升级架构与Preview完全一致。可以理解为同一个284B/13B MoE骨架但后训练数据、强化学习过程、奖励模型都重做了。DeepSeek在技术报告中强调这是0731不是V4.1或V5——版本号的命名也表明这是同代内部的优化迭代。Q2用V4-Flash 0731替代Opus 4.8是否安全取决于场景。对编程、终端Agent、工具调用、数据科学等任务0731的差距已经缩小到2-3分以内可以替代。但对复杂多轮对话、创意写作、长篇推理、罕见领域知识等任务Opus 4.8仍有2-5分的优势。建议采用Opus 4.8做关键决策、0731做批量执行的混合架构。Q3本地部署需要什么硬件最低配置2张RTX 6000 Pro约$15K一次性投入可流畅运行Q4精度。推荐配置8张A100/H100约$150K可运行原精度并启用DSpark。极致配置Mac Studio M3 Ultra 192GB约$10K可本地运行Q4精度但不启用DSpark。Q4MIT开源后DeepSeek靠什么赚钱企业API调用、定制化训练服务、行业模型如V4-Flash-Medical、V4-Flash-Finance、政府/金融客户合规部署是DeepSeek当前的核心收入来源。开源策略不与商业化矛盾——Meta的Llama系列也是开源但Meta AI的商业化主要靠云服务和企业方案。Q50731是否意味着DeepSeek已经追上OpenAI/Anthropic在Agent工作流的特定任务上是的。但在前沿推理、跨领域泛化、长程规划等维度0731距离Opus 4.8/GPT-5.6 Sol仍有2-5分的差距。DeepSeek CEO梁文锋曾在7月公开承认我们在raw capability上仍然落后前沿3-6个月——0731没有改变这一判断只是缩小了在Agent工作流这一具体场景的差距。Q6DSpark推测解码会不会显著增加显存是的。DSpark需要额外加载推测头约为主模型的5-8%总显存峰值上升约8-12%。但由于DSpark带来的1.6-2.4×加速单位任务的实际显存-时间乘积反而下降。Q70731是否兼容OpenAI的工具调用格式是的。DeepSeek官方文档明确支持OpenAI Responses API格式、Function Calling、Tools API。开发者可以将0731作为drop-in replacement接入基于OpenAI生态构建的工具链Codex、Cursor、Cline等。Q8什么时候应该用0731、什么时候应该用Sonnet 5/Opus 4.8用0731批量Agent任务、高频工具调用、代码生成与重构、数据处理pipeline、成本敏感场景。用Sonnet 5/Opus 4.8关键业务决策、复杂多轮对话、罕见领域知识、高风险输出审核、长程规划。参考资料DeepSeek官方技术报告V4-Flash 0731版本说明2026-08-31.Hugging Face模型卡deepseek-ai/DeepSeek-V4-Flash-0731MIT许可证2026-08-31.Artificial AnalysisDeepSeek-V4-Flash-0731智能指数评测与价格分析2026-08-31.vLLM官方RecipeDeepSeek-V4-Flash-0731部署指南含DSpark推测解码2026-08-31.Unsloth GGUFDeepSeek-V4-Flash-0731本地部署量化方案2026-08-31.Cline ChangelogV4-Flash 0731限时免费集成2026-08-31.Ollama官方博客DeepSeek-V4-Flash-0731-cloud上线2026-08-31.DeepSeek API文档Responses格式与Function Calling支持说明2026-08-31.DPS.MEDIADeepSeek V4-Flash 0731评测分析2026-08-31.Digital Watch ObservatoryDeepSeek upgrades V4-Flash for coding and multi-step tasks2026-08-31.Hacker News讨论DeepSeek-V4-Flash-0731技术细节2026-08-31.r/LocalLLaMADeepSeek Harness评测体系社区讨论2026-08-31.AI Stats PhaseoAI Release Calendar2026-08-31.AI WikiClaude Sonnet 5 Tokenizer与定价对比参考2026-08-31.微软Azure AI FoundryFW-DeepSeek-V4-Flash-0731模型说明2026-08-31.