官方版本更新
發行說明指出,DeepSeek-V4-Flash-0731 是 DeepSeek-V4-Flash 的官方版本,並取代了預覽版。
DeepSeek-V4-Flash-0731 是 DeepSeek-AI 在 Hugging Face 上發布的大型語言模型版本。根據頁面說明,它是 DeepSeek-V4-Flash 的官方版本,並取代了預覽版,同時保留與 DeepSeek-V4-Flash-DSpark 相同的模型結構,並附加 speculative decoding 模組。
該模型被定位為以 agent 為導向的版本,相較於預覽版具備更強的 agentic 能力。技術報告與隨附文件聚焦於長上下文使用、reasoning effort 控制,以及使用 vLLM、SGLang 等推理執行環境的部署方式,並包含本地執行說明與訊息編碼指引。
發行說明指出,DeepSeek-V4-Flash-0731 是 DeepSeek-V4-Flash 的官方版本,並取代了預覽版。
模型沿用 DeepSeek-V4-Flash-DSpark 的相同結構,並在 checkpoint 上附加 speculative decoding 模組。
頁面說明模型支援三種 reasoning effort 等級:low、high 與 max。
倉庫包含一個 encoding 資料夾,內有 Python 腳本與測試案例,用於將相容 OpenAI 的訊息陣列轉為輸入字串,並解析 text completions。
首頁提供了 vLLM 與 SGLang 的啟動範例,並附有透過 inference 資料夾進行本地部署的說明。
技術報告列出 coding、agentic 與長上下文任務的 benchmark 結果,讓讀者清楚了解模型評估位置。
當你需要一個能依任務難度調整 reasoning effort 的 LLM 時,可使用此模型,無論是快速回應還是較難的 agentic 工作流程。
頁面的 benchmark 表與 agentic 定位,使其適合用於程式碼生成、儲存庫層級任務,以及其他需要多步驟工具使用的開發流程。
由於這個版本強調 DeepSeek-V4 系列支援一百萬 token 上下文,並提供本地部署指引,因此適合需要長上下文處理或文件密集提示詞的情境。
提供的編碼腳本與相容 OpenAI 的訊息處理方式,適合將模型接入既有聊天或 completion 管線,而不使用 Jinja template 的團隊。
這是 DeepSeek-V4-Flash 的官方版本,並取代了預覽版。頁面說明它與 DeepSeek-V4-Flash-DSpark 具有相同的模型結構,並附加了 speculative decoding 模組。
這個版本不包含 Jinja 聊天模板。相反地,倉庫提供了一個 encoding 資料夾,內含 Python 腳本與測試案例,示範如何將相容 OpenAI 的訊息轉為輸入字串,並解析模型輸出。
頁面提供了 vLLM 與 SGLang 的範例。對於 vLLM,可透過 dspark speculative config flag 啟用 speculative decoding;對於 SGLang,應以 DSPARK speculative algorithm 啟動模型,且不要使用獨立的 draft-model path。
文件建議在本地部署時將 temperature 設為 1.0,agentic 情境使用 top_p = 0.95,其他情況使用 top_p = 1.0。對於 high 與 max reasoning effort 等級,建議最大輸出長度為 384K tokens。
倉庫與模型權重採用 MIT License。Hugging Face 頁面也在 text generation 下列出推理供應商 DeepInfra。
AakarDev AI 讓團隊透過單一儀表板管理 AI 供應商權限、專案設定、日誌與分析,支援 BYOK 工作流程,並可連接 OpenAI、Google Gemini、Anthropic、Groq、Mistral AI、Perplexity AI。
CreateOS Sandbox 是以 Firecracker micro-VM 執行程式與 agent 工作負載的隔離運算環境,支援私有網路、SDK、CLI 與 MCP 程式化控制。
Trigger.dev chat agent 是專為開發者打造的持久化 AI 聊天後端,支援有狀態對話、刷新與當機後續接、長時間回合,並可搭配 AI SDK `useChat` 與託管基礎架構,單回合無逾時。
Arduino VENTUNO Q 是一款適用於 AI 與機器人應用的邊緣 AI 電腦,結合 AI 推論與可預測控制,並可搭配 Arduino App Lab 使用。
ByteAsk 是專為 C 與 C++ 打造的終端機優先 AI coding agent,先編輯儲存庫再用真實編譯器、除錯器、sanitizer 與測試驗證變更,並提供免費方案與付費方案。
Codex Plugins 將可重用技能、應用程式整合與 MCP 伺服器打包成可安裝到 Codex app 或在 Codex CLI 使用的工作流程,方便延伸 Codex 的連線服務任務、重複使用指令與團隊共享流程。