NezhaGateNezhaGate
채팅

Kimi K3

⧉
kimi-k3

Kimi K3는 Moonshot AI의 새 플래그십 모델로, 긴 문서 이해와 다중 문서 분석, 중국어 글쓰기에 강하고 에이전트와 도구 호출 능력이 뛰어납니다. 항상 먼저 생각한 뒤 답하며 추론 과정은 reasoning_content로 반환됩니다. 샘플링 온도는 모델이 고정하므로 요청의 temperature / top_p는 무시됩니다. 도구 호출, 스트리밍, 프롬프트 캐싱(반복되는 긴 접두어는 캐시 단가로 정산)을 지원합니다. OpenAI 호환이므로 model을 kimi-k3로 지정하면 되며, 사용한 만큼 과금하고 실패한 호출에는 과금하지 않습니다.

채팅긴 문서에이전트도구 호출OpenAI 호환

이 모델을 선택하는 이유

Moonshot의 새 플래그십: 파라미터 2.8조, 가중치 공개, 약 100만 토큰 컨텍스트

주요 특징

  • 파라미터 2.8조, 가중치 공개. 현재 가장 큰 오픈 가중치 모델 중 하나
  • 약 100만 토큰 컨텍스트(1,048,576): 긴 자료도 통째로 입력
  • 기본으로 사고하며, 사고 과정은 reasoning_content로 따로 반환되어 답변 본문에 섞이지 않음
  • 도구 호출, 스트리밍, 프롬프트 캐시 지원. 반복되는 긴 접두부는 캐시 가격으로 과금
  • OpenAI 호환: 기존 SDK 코드에서 base_url과 model만 바꾸면 됨

공식 가격과 비교

NezhaGate정가 입력$1.8$3 출력$9$15

100만 토큰당, 미국 달러 · 절약 ↓40%

복사해서 바로 호출

curl
curl https://nezhagate.com/v1/chat/completions -H "Authorization: Bearer YOUR_API_KEY" -H "Content-Type: application/json" -d '{"model": "kimi-k3", "messages": [{"role": "user", "content": "Hello"}]}'
Python
from openai import OpenAI

client = OpenAI(api_key="YOUR_API_KEY", base_url="https://nezhagate.com/v1")
r = client.chat.completions.create(model="kimi-k3", messages=[{"role": "user", "content": "Hello"}])
print(r.choices[0].message.content)

YOUR_API_KEY를 콘솔에서 만든 키로 바꾸세요.

온라인 테스트 · 플레이그라운드

Kimi K3 바로 여기서 사용해 보기 (로그인 후 사용 가능).

입력

고급 설정
웹 검색
메모리 · 멀티턴

대화

대화를 시작해 보세요아래에 메시지를 입력해 시작하세요

소개: Kimi K3

Kimi K3는 Moonshot AI의 새 플래그십 모델로, NezhaGate에서 OpenAI 호환 API로 제공됩니다. 긴 문서 이해와 다중 문서 분석, 중국어 글쓰기에 강하며 에이전트와 도구 호출 능력이 뛰어납니다. 항상 먼저 생각한 뒤 답하며, 추론 과정은 message.reasoning_content로, 답변은 content로 반환됩니다. 샘플링 온도는 모델이 고정하므로 요청의 temperature / top_p는 게이트웨이가 무시하며 오류도 나지 않습니다. 도구 호출, 스트리밍, 프롬프트 캐싱을 지원합니다. model을 kimi-k3로 두면 바로 연결되며, 사용한 만큼 과금하고 실패한 호출에는 과금하지 않습니다.

활용 사례

긴 문서와 다중 문서 분석

계약서, 논문, 재무 보고서 같은 긴 자료의 요약, 비교, 질의응답. 10만 토큰이 넘는 문서에서도 정보를 정확히 찾아내는 것을 확인했습니다.

에이전트와 도구 호출

OpenAI 형식의 tools / tool_calls를 지원해 검색 증강, 함수 호출, 다단계 작업 조율에 적합합니다.

중국어 글쓰기

긴 글, 보고서, 마케팅 카피와 다듬기까지 자연스럽고 매끄러운 중국어로 작성합니다.

복잡한 추론

먼저 생각한 뒤 답하므로 수학, 논리, 여러 단계의 추론이 필요한 문제에 적합하며, 추론 과정은 reasoning_content에서 확인할 수 있습니다.

어떻게 고를까

긴 문서, 다중 문서, 에이전트 작업이라면 Kimi K3를 먼저 고르세요. 더 낮은 비용의 일상 대화라면 DeepSeek V4.1 Flash나 GLM-5.3도 좋으며, model 필드만 바꾸면 전환됩니다.

자주 묻는 질문

temperature 파라미터가 적용되나요?
Kimi K3의 샘플링 온도는 모델이 고정하므로, 요청의 temperature와 top_p는 게이트웨이가 무시합니다(오류는 나지 않습니다). 출력 스타일은 모델이 스스로 정합니다.
사고 모드를 끌 수 있나요?
아니요. Kimi K3는 항상 먼저 생각한 뒤 답하며, 추론 토큰은 usage.completion_tokens 안에서 출력 단가로 과금됩니다. 더 짧은 답을 원하면 프롬프트에서 간결한 답을 요청하세요.
긴 답변을 받을 때 주의할 점은?
생성에 약 2분 이상 걸리는 긴 내용은 stream=true로 스트리밍 수신하세요. 비스트리밍 요청은 타임아웃으로 끊길 수 있습니다. max_tokens가 256보다 작으면 게이트웨이가 256으로 올려 추론이 예산을 모두 쓰지 않도록 합니다.
프롬프트 캐싱을 지원하나요?
지원합니다. 같은 긴 문서처럼 반복되는 긴 접두어는 캐시에 적중하며, 적중한 부분은 입력 단가보다 훨씬 낮은 캐시 단가로 정산됩니다.
실패한 호출에도 과금되나요?
아니요. 정상적으로 응답한 호출만 실제 사용량으로 정산합니다. 업스트림 오류와 타임아웃은 잔액에 전혀 영향을 주지 않습니다.

관련 모델

연동할 수 있는 다른 모델도 둘러보세요.

전체 보기 →