NezhaGateNezhaGate
チャット

DeepSeek V4.1 Flash

⧉
deepseek-v4.1-flash
モデルの種類 V4.10731

DeepSeek V4.1 Flash は DeepSeek の現行 Flash モデル(公式 API の deepseek-flash)です。思考モードは既定でオンで、推論の過程は reasoning_content で返ります。thinking={"type":"disabled"} を送ると思考せずにそのまま回答します。ツール呼び出しとストリーミングに対応。OpenAI 互換なので model に deepseek-v4.1-flash を指定するだけで使えます。ピーク時間の割増はなく終日同じ価格で、従量課金・失敗した呼び出しは課金しません。

チャット思考モードツール呼び出し低コストOpenAI 互換

オンラインテスト

今すぐ DeepSeek V4.1 Flash を試す(ログイン後に利用可能)。

入力

詳細設定
ウェブ検索
メモリ · マルチターン

会話

会話をはじめる下にメッセージを入力してはじめましょう

モデル紹介:DeepSeek V4.1 Flash

DeepSeek V4.1 Flash は DeepSeek の現行 Flash モデル(公式 API 名は deepseek-flash)で、NezhaGate では OpenAI 互換の API から提供しています。既定では考えてから答え、推論の過程は message.reasoning_content に、回答は常に content に返ります。thinking={"type":"disabled"} を送ると思考をオフにでき、簡単なタスクをより速く安く処理できます。ツール呼び出し(function calling)とストリーミングに対応。model に deepseek-v4.1-flash を指定すればそのまま使え、ピーク割増のない終日同一価格で、従量課金・失敗した呼び出しは課金しません。

ユースケース

日常の会話と質疑応答

カスタマーサポート、ナレッジ Q&A、文章作成アシスタントなど呼び出しの多い用途に、低い単価と速い応答で大規模に組み込めます。

コーディングと推論

思考モードをオンにすると先に問題を考えてから答えるため、コード生成、数学、多段階の論理問題に向いています。

エージェントとツール呼び出し

OpenAI 形式の tools / tool_calls に対応し、検索、関数呼び出し、多段階タスクをエージェントフレームワークにそのままつなげます。

大量のテキスト処理

分類、抽出、要約、書き換えなどの一括処理は思考をオフにして直接結果を得れば、さらにコストを抑えられます。

選び方

DeepSeek の最新の Flash を使いたいなら V4.1、プロンプトを V4 Flash に合わせて調整済みでバージョンを固定したいなら 0731 スナップショットを選んでください。より難しいコーディングやエージェント作業は GLM-5.3 と比べてみてください。どちらも model フィールドを変えるだけです。

よくある質問

DeepSeek V4 Flash 0731 とは何が違いますか?
V4.1 は DeepSeek の現行 Flash で、0731 はバージョンを固定した V4 Flash のスナップショットです。上流が更新されても挙動は変わりません。NezhaGate ではどちらも同じ価格で、呼び出し方も同じです。
思考モードはどうやってオフにしますか?
リクエストに "thinking": {"type": "disabled"} を加えてください。モデルは推論のステップを飛ばしてそのまま答え、reasoning_content は空になり出力トークンも減ります。このフィールドを省くと思考モードはオンです。
max_tokens をとても小さくするとどうなりますか?
思考型のモデルなので推論トークンも出力として数えます。上流は 1024 未満の max_tokens を 1024 として扱うため、実際の出力(推論を含む)が指定した値を超えることがあり、usage に記録された実際のトークン数で課金されます。短い回答だけが必要なら思考をオフにすることをおすすめします。
ツール呼び出しとストリーミングに対応していますか?
どちらも対応しています。tools / tool_calls は OpenAI 形式で、stream=true を送ると SSE のチャンクで返り、推論の内容は delta.reasoning_content でストリーミングされます。
失敗した呼び出しにも課金されますか?
いいえ。正常に応答した呼び出しだけを実際の使用量で精算します。上流のエラーやタイムアウトで残高が減ることはありません。

関連モデル

統合できる他のモデルを探索しましょう。

すべて見る →