DeepSeek-V4-Flash-0731 icon

DeepSeek-V4-Flash-0731

DeepSeek-V4-Flash-0731 是 DeepSeek-AI 在 Hugging Face 上发布的 DeepSeek-V4-Flash 官方版本,适用于 agent 工作流、长上下文推理,支持 speculative decoding,并提供 vLLM、SGLang 和本地部署指南。

DeepSeek-V4-Flash-0731

概览

DeepSeek-V4-Flash-0731 是 DeepSeek-AI 在 Hugging Face 上发布的大语言模型版本。根据页面说明,它是 DeepSeek-V4-Flash 的官方发布版本,取代了预览版,同时保持与 DeepSeek-V4-Flash-DSpark 相同的模型结构,并附加了一个 speculative decoding 模块。

该模型被定位为面向 agent 的发布版本,相比预览版具备更强的 agentic 能力。技术报告和配套文档重点介绍了长上下文使用、reasoning-effort 控制,以及使用 vLLM、SGLang 等推理运行时进行部署,并提供了本地运行说明和消息编码指南。

主要特性

官方发布更新

发布说明称 DeepSeek-V4-Flash-0731 是 DeepSeek-V4-Flash 的官方发布版本,并取代了预览版。

DSpark speculative decoding

该模型使用与 DeepSeek-V4-Flash-DSpark 相同的结构,并在检查点中附加了一个 speculative decoding 模块。

三种推理力度模式

页面说明该模型支持三种 reasoning effort 级别:low、high 和 max。

OpenAI 兼容编码辅助

仓库包含一个 encoding 文件夹,内有 Python 脚本和测试用例,用于将 OpenAI 兼容的消息数组转换为输入字符串并解析文本补全结果。

常见运行时的部署指南

主页包含 vLLM 和 SGLang 的启动示例,以及通过 inference 文件夹进行本地部署的说明。

已发布的基准表

技术报告列出了涵盖代码、agentic 和长上下文任务的基准测试结果,让读者可以具体了解模型的评测表现。

常见用例

  • 受推理力度控制的助手工作流

    当你需要一个能够根据任务是快速回复还是更复杂的 agentic 工作流来决定少量或更多推理投入的 LLM 时,可使用该模型。

  • 代码与软件代理任务

    页面中的基准表和 agentic 定位使其适合代码生成、仓库级任务,以及其他需要多步工具使用的软件开发流程。

  • 长上下文分析

    由于该发布版本强调 DeepSeek-V4 系列更广泛的一百万 token 上下文支持,并提供本地部署指南,因此适合需要长上下文处理或文档密集型提示的场景。

  • 自定义推理集成

    提供的编码脚本和 OpenAI 兼容消息处理方式,对希望将模型接入现有聊天或补全文本流水线、且不使用 Jinja 模板的团队很有帮助。

Pros and Cons

Pros

  • 官方发布版本,取代了早期预览版。
  • 通过 DSpark 设置,speculative decoding 支持已内置于检查点中。
  • 三档 reasoning-effort 级别让用户可以控制推理深度。
  • 仓库为 OpenAI 兼容消息、vLLM、SGLang 和本地运行提供了具体的编码与推理说明。
  • 模型卡发布了覆盖 agentic、代码和长上下文任务的基准结果。

Cons

  • 页面未提供 Jinja 格式的聊天模板,因此提示格式化需要使用提供的编码辅助工具,而不是标准模板文件。
  • 该模型体积较大,面向高级推理部署场景;示例部署假设使用专门的运行时配置和高内存硬件。
  • 页面建议为 agentic 与非 agentic 场景使用不同的采样设置,这意味着用户可能需要为工作流调优生成参数。

FAQ

DeepSeek-V4-Flash-0731 是什么?

它是 DeepSeek-V4-Flash 的官方发布版本,并取代了预览版。页面说明它与 DeepSeek-V4-Flash-DSpark 共享相同的模型结构,并附加了一个 speculative decoding 模块。

我该如何为这个模型格式化提示词?

该发布版本不包含 Jinja 聊天模板。相反,仓库提供了一个 encoding 文件夹,其中包含 Python 脚本和测试用例,展示如何将 OpenAI 兼容的消息转换为输入字符串并解析模型输出。

可以在常见的推理服务上运行吗?

页面提供了 vLLM 和 SGLang 的示例。对于 vLLM,可通过 dspark speculative config 标志启用 speculative decoding;对于 SGLang,应使用 DSPARK speculative 算法启动模型,并且不要使用单独的 draft-model 路径。

文档推荐哪些采样设置?

文档建议本地部署时将 temperature 设为 1.0;在 agentic 场景下将 top_p 设为 0.95,其他情况下设为 1.0。对于高和 max 推理力度级别,建议最大输出长度为 384K tokens。

页面上显示了哪些许可和托管选项?

仓库和模型权重采用 MIT License 许可。Hugging Face 页面还在文本生成下列出了推理服务提供方 DeepInfra。

Quick Facts

类别
大语言模型
发布方
DeepSeek-AI
平台
Hugging Face
模型规模
304B 参数
许可证
MIT License
推理选项
vLLM、SGLang、本地部署、DeepInfra 列表