NezhaGateNezhaGate
チャット

Kimi K3

⧉
kimi-k3

Kimi K3 は Moonshot AI の新しいフラッグシップモデルで、長文の理解、複数文書の分析、中国語の文章作成に強く、エージェントとツール呼び出しの能力にも優れています。常に考えてから答え、推論の過程は reasoning_content に返ります。サンプリング温度はモデル側で固定されているため、リクエストの temperature / top_p は無視されます。ツール呼び出し、ストリーミング、プロンプトキャッシュ(繰り返される長いプレフィックスはキャッシュ価格で精算)に対応。OpenAI 互換なので model に kimi-k3 を指定するだけで使えます。従量課金・失敗した呼び出しは課金しません。

チャット長文エージェントツール呼び出しOpenAI 互換

このモデルを選ぶ理由

Moonshot の新フラッグシップ:2.8 兆パラメータ、重み公開、約 100 万トークンのコンテキスト

主な特長

  • 2.8 兆パラメータで重み公開。現時点で最大級のオープンウェイトモデル
  • 約 100 万トークンのコンテキスト(1,048,576)。長い資料も丸ごと渡せます
  • 既定で思考し、思考内容は reasoning_content に分けて返るため回答本文に混ざりません
  • ツール呼び出し、ストリーミング、プロンプトキャッシュに対応。繰り返す長い接頭部はキャッシュ価格で課金
  • OpenAI 互換:既存の SDK コードは base_url と model を変えるだけ

公式価格との比較

NezhaGate定価 入力$1.8$3 出力$9$15

100 万トークンあたり(米ドル) · 節約額 ↓40%

コピーしてすぐ呼び出す

curl
curl https://nezhagate.com/v1/chat/completions -H "Authorization: Bearer YOUR_API_KEY" -H "Content-Type: application/json" -d '{"model": "kimi-k3", "messages": [{"role": "user", "content": "Hello"}]}'
Python
from openai import OpenAI

client = OpenAI(api_key="YOUR_API_KEY", base_url="https://nezhagate.com/v1")
r = client.chat.completions.create(model="kimi-k3", messages=[{"role": "user", "content": "Hello"}])
print(r.choices[0].message.content)

YOUR_API_KEY をコンソールで作成したキーに置き換えてください。

オンラインテスト

今すぐ Kimi K3 を試す(ログイン後に利用可能)。

入力

詳細設定
ウェブ検索
メモリ · マルチターン

会話

会話をはじめる下にメッセージを入力してはじめましょう

モデル紹介:Kimi K3

Kimi K3 は Moonshot AI の新しいフラッグシップモデルで、NezhaGate では OpenAI 互換の API から提供しています。長文の理解、複数文書の分析、中国語の文章作成に強く、エージェントとツール呼び出しの能力にも優れています。常に考えてから答え、推論の過程は message.reasoning_content に、回答は content に返ります。サンプリング温度はモデル側で固定されているため、リクエストの temperature / top_p はゲートウェイが無視し、エラーにもなりません。ツール呼び出し、ストリーミング、プロンプトキャッシュに対応。model に kimi-k3 を指定すればそのまま使え、従量課金・失敗した呼び出しは課金しません。

ユースケース

長文と複数文書の分析

契約書、論文、決算資料などの長い資料の要約・比較・質疑応答に。10 万トークンを超える文書でも情報を正確に見つけられることを確認しています。

エージェントとツール呼び出し

OpenAI 形式の tools / tool_calls に対応し、検索拡張、関数呼び出し、多段階タスクの制御に向いています。

中国語の文章作成

長文、レポート、マーケティングコピー、推敲まで、自然で流れるような中国語で書けます。

複雑な推論

考えてから答えるので、数学、論理、多段階の推論が必要な問題に向いています。推論の過程は reasoning_content で確認できます。

選び方

長文、複数文書、エージェントのタスクなら Kimi K3 を優先してください。より低コストの日常会話なら DeepSeek V4.1 Flash や GLM-5.3 も選べます。切り替えは model フィールドを変えるだけです。

よくある質問

temperature パラメータは効きますか?
Kimi K3 のサンプリング温度はモデル側で固定されているため、リクエストの temperature と top_p はゲートウェイが無視します(エラーにはなりません)。出力のスタイルはモデル自身が決めます。
思考モードをオフにできますか?
できません。Kimi K3 は常に考えてから答え、推論トークンは usage.completion_tokens の中で出力価格で課金されます。より短い回答が欲しい場合は、プロンプトで簡潔な回答を求めてください。
長い回答を受け取るときの注意点は?
生成に 2 分ほど以上かかる長い内容は stream=true でストリーミング受信してください。非ストリーミングのリクエストはタイムアウトで途切れることがあります。max_tokens が 256 未満の場合、推論が予算を使い切らないようゲートウェイが 256 に引き上げます。
プロンプトキャッシュに対応していますか?
対応しています。同じ長い文書のように繰り返される長いプレフィックスはキャッシュに当たり、当たった部分は入力価格よりずっと安いキャッシュ価格で精算されます。
失敗した呼び出しにも課金されますか?
いいえ。正常に応答した呼び出しだけを実際の使用量で精算します。上流のエラーやタイムアウトで残高が減ることはありません。

関連モデル

統合できる他のモデルを探索しましょう。

すべて見る →