NezhaGateNezhaGate
チャット

Qwen3.8 Flash

⧉
qwen3.8-flash
モデルの種類 Max0902Flash

Qwen3.8 Flash は Qwen3.8 ファミリーの軽量・高速版で、単価が低くスループットが高いため、バッチ処理や高い同時実行に向いています。計測では短い質問に 2.5〜6 秒で応答しました。常に考えてから答え(推論の過程は reasoning_content に返ります)、ツール呼び出し、JSON 出力、ストリーミング、画像入力(公開画像のリンクと base64 のどちらも可)に対応。テキストブロックの cache_control も受け付け、繰り返される長いプレフィックスを上流がキャッシュから返すことがあります。ヒットするかどうかは上流が決め、課金は返された usage に従います(キャッシュヒットと報告された部分はキャッシュ価格で精算)。OpenAI 互換なので model に qwen3.8-flash を指定するだけで使えます。従量課金・失敗した呼び出しは課金しません。

チャット軽量低コスト画像入力OpenAI 互換

オンラインテスト

今すぐ Qwen3.8 Flash を試す(ログイン後に利用可能)。

入力

詳細設定
ウェブ検索
メモリ · マルチターン

会話

会話をはじめる下にメッセージを入力してはじめましょう

モデル紹介:Qwen3.8 Flash

Qwen3.8 Flash は Alibaba Cloud の Qwen3.8 ファミリーの軽量・高速版で、NezhaGate では OpenAI 互換の API から提供しています。単価が低くスループットが高いため、バッチ処理や高い同時実行に向いており、計測では短い質問に 2.5〜6 秒で応答しました。常に考えてから答え、推論の過程は message.reasoning_content に返ります。ツール呼び出し、JSON 出力、ストリーミング、画像入力(公開リンクと base64)に対応します。cache_control も受け付け、繰り返される長いプレフィックスを上流がキャッシュから返すことがありますが、ヒットするかどうかは上流が決め、課金は返された usage に従います(キャッシュヒットと報告された部分はキャッシュ価格で精算)。model に qwen3.8-flash を指定すればそのまま使え、従量課金・失敗した呼び出しは課金しません。

ユースケース

テキストの大量処理

分類、抽出、要約、書き換えなどの大量タスクに。単価が低く、高い同時実行でのバッチ処理に向いています。

画像認識と OCR

スクリーンショット、レシート、商品写真の文字や内容を読み取ります。公開画像のリンクも base64 もそのまま送れます。

日常のチャットとサポート

ナレッジ Q&A や文章作成アシスタントなど、速く安い応答が必要な場面に。

エージェントとツール呼び出し

OpenAI 形式の tools / tool_calls と JSON 出力に対応し、軽量なエージェントの実行ステップに使えます。

選び方

タスクが単純で量が多く、コストと速度を重視するなら Qwen3.8 Flash を選んでください。より強い推論、コーディング、エージェント能力が必要なら Qwen3.8 Max、バージョンを固定したいなら 0902 スナップショットに切り替えます。3 つとも Qwen3.8 ファミリーなので、切り替えは model フィールドを変えるだけです。

よくある質問

プロンプトキャッシュはどう有効にしますか?
cache_control は受け付けます。messages のテキストブロックに "cache_control": {"type": "ephemeral"} を付けてください(content を [{"type": "text", "text": "...", "cache_control": {"type": "ephemeral"}}] の形で書きます)。繰り返される長いプレフィックスを上流がキャッシュから返すことはありますが、ヒットするかどうかは上流が決め、ヒットは保証されません。課金は返された usage に従い、usage.prompt_tokens_details.cached_tokens にキャッシュヒットとして報告された部分はキャッシュ価格、残りは入力価格で精算されます。
思考をオフにできますか?
できません。Qwen3.8 Flash は常に考えてから答え、enable_thinking、reasoning_effort、thinking_budget でも思考はオフになりません。推論トークンは usage.completion_tokens の中で出力価格で課金されます。短い回答が欲しい場合は、プロンプトで簡潔に答えるよう求めてください。
画像はどう送ればよいですか?
messages の content に image_url として入れてください。公開画像のリンクと base64 の data URI のどちらも使えます。計測では、画像内の文字を正確に読み取り、写っている物も認識できました。
Qwen3.8 Max とは何が違いますか?
Flash はより軽く、速く、安いモデルで、大量処理や比較的単純なタスク向けです。Max は 3.8 世代のフラッグシップで、複雑な推論、コーディング、エージェントにより強いモデルです。どちらも組み込み方は同じで、model フィールドを変えるだけです。
失敗した呼び出しにも課金されますか?
いいえ。正常に応答した呼び出しだけを実際の使用量で精算します。上流のエラーやタイムアウトで残高が減ることはありません。

関連モデル

統合できる他のモデルを探索しましょう。

すべて見る →