公式リリースの更新
リリースノートでは、DeepSeek-V4-Flash-0731がDeepSeek-V4-Flashの公式リリースであり、プレビューバージョンに代わるものだと説明されています。
DeepSeek-V4-Flash-0731は、Hugging Faceで公開されたDeepSeek-AI公式のDeepSeek-V4-Flashです。エージェント型や長文コンテキスト処理、vLLM・SGLang・ローカル推論の導入に対応。
DeepSeek-V4-Flash-0731は、DeepSeek-AIによるHugging Face上での大規模言語モデルのリリースです。ページによると、これはDeepSeek-V4-Flashの公式リリースで、プレビュー版を置き換えるものであり、DeepSeek-V4-Flash-DSparkと同じモデル構造を保ちながら、speculative decodingモジュールが付属しています。
このモデルは、プレビュー版よりもagentic能力が強化されたエージェント向けリリースとして提示されています。technical reportと付属ドキュメントでは、long-contextの利用、reasoning effortの制御、vLLMやSGLangなどの推論ランタイムを使ったデプロイに重点が置かれており、ローカル実行手順やmessage encodingのガイダンスも含まれています。
リリースノートでは、DeepSeek-V4-Flash-0731がDeepSeek-V4-Flashの公式リリースであり、プレビューバージョンに代わるものだと説明されています。
モデルはDeepSeek-V4-Flash-DSparkと同じ構造を使い、checkpointにspeculative decodingモジュールが付属しています。
ページでは、low、high、maxの3段階のreasoning effortレベルをサポートすると述べられています。
リポジトリには、OpenAI互換のmessage arraysをinput stringsに変換し、text completionsを解析するためのPythonスクリプトとテストケースを含むencodingフォルダがあります。
ホームページには、vLLMとSGLangの起動例に加えて、inferenceフォルダを通じたローカルデプロイの注記があります。
technical reportには、coding、agentic、long-contextの各タスクにわたるbenchmark結果が掲載されており、評価対象を具体的に把握できます。
タスクがすばやい応答なのか、より難しいagenticワークフローなのかに応じて、reasoningに使う労力を増減できるLLMが必要な場面で使用します。
ページのbenchmark表とagenticという位置づけは、コード生成、リポジトリ単位のタスク、マルチステップのツール利用が重要なその他の開発ワークフローに適しています。
このリリースはDeepSeek-V4シリーズ全体で100万トークンのコンテキスト対応を強調しており、ローカルデプロイのガイダンスも提供しているため、long-context処理や文書量の多いプロンプトが必要な場面に向いています。
提供されるencodingスクリプトとOpenAI互換のmessage handlingは、Jinjaテンプレートなしで既存のチャットまたはcompletionパイプラインにモデルを組み込むチームに役立ちます。
DeepSeek-V4-Flash-0731は、DeepSeek-V4-Flashの公式リリースであり、プレビューバージョンに代わるものです。ページでは、DeepSeek-V4-Flash-DSparkと同じモデル構造を共有し、speculative decodingモジュールが付属していると説明されています。
このリリースにはJinjaのチャットテンプレートは含まれていません。代わりに、リポジトリ内のencodingフォルダにあるPythonスクリプトとテストケースで、OpenAI互換のメッセージを入力文字列にエンコードし、モデル出力を解析する方法が示されています。
ページにはvLLMとSGLangの例があります。vLLMではdspark speculative configフラグでspeculative decodingを有効化し、SGLangではDSPARK speculative algorithmを使い、別のdraft-model pathは指定しないように案内されています。
ドキュメントでは、ローカルデプロイ時にtemperature = 1.0を推奨しています。agenticシナリオではtop_p = 0.95、それ以外ではtop_p = 1.0を推奨しています。highおよびmaxのreasoning effortレベルでは、最大出力長を384Kトークンにするよう案内しています。
リポジトリとモデル重みはMIT Licenseで提供されています。Hugging Faceページでは、text generationの下に推論プロバイダーとしてDeepInfraも掲載されています。
AakarDev AIは、AIプロバイダーのアクセス管理、プロジェクト別設定、ログ、分析を1つのダッシュボードで管理できるチーム向けツールです。BYOKに対応し、OpenAI、Google Gemini、Anthropic、Groq、Mistral AI、Perplexity AIをサポートします。
CreateOS Sandboxは、FirecrackerマイクロVM上でコードやエージェントのワークロードを実行できる分離型コンピュート環境です。SDK、CLI、MCPで制御可能。
Trigger.dev chat agentは、リフレッシュやクラッシュ、長時間の会話も維持できる、開発者向けの耐久性あるAIチャットバックエンドです。AI SDKのuseChatに対応し、ターンにタイムアウトがありません。
Arduino VENTUNO Qは、AI・ロボティクス向けのエッジAIコンピューターです。AI推論と決定論的制御を1枚に集約し、Arduino App Labに対応します。
ByteAskは、C/C++向けのターミナル起点AIコーディングエージェント。リポジトリを編集し、コンパイラやデバッガ、サニタイザ、テストで変更を検証してから差分を表示。無料枠あり。
Codex Plugins は、再利用可能なスキル、アプリ連携、MCPサーバーを Codex app や Codex CLI で使えるワークフローにまとめます。接続サービスの作業や共有チームワークフローを拡張できます。