NezhaGateNezhaGate
채팅

Qwen3.8 Flash

⧉
qwen3.8-flash
모델 타입 Max0902Flash

Qwen3.8 Flash는 Qwen3.8 제품군의 가볍고 빠른 버전으로, 단가가 낮고 처리량이 높아 배치 작업과 높은 동시 처리에 알맞습니다. 측정해 보니 짧은 질문에 2.5~6초 만에 응답했습니다. 항상 먼저 생각한 뒤 답하며(추론 과정은 reasoning_content로 반환), 도구 호출, JSON 출력, 스트리밍, 이미지 입력(공개 이미지 링크와 base64 모두 가능)을 지원합니다. 텍스트 블록의 cache_control도 받으며, 반복되는 긴 접두어를 업스트림이 캐시에서 처리할 수 있습니다. 적중 여부는 업스트림이 정하고 과금은 반환된 usage를 따릅니다(캐시 적중으로 보고된 부분은 캐시 단가로 정산). OpenAI 호환이므로 model을 qwen3.8-flash로 지정하면 되며, 사용한 만큼 과금하고 실패한 호출에는 과금하지 않습니다.

채팅경량저비용이미지 입력OpenAI 호환

온라인 테스트 · 플레이그라운드

Qwen3.8 Flash 바로 여기서 사용해 보기 (로그인 후 사용 가능).

입력

고급 설정
웹 검색
메모리 · 멀티턴

대화

대화를 시작해 보세요아래에 메시지를 입력해 시작하세요

소개: Qwen3.8 Flash

Qwen3.8 Flash는 Alibaba Cloud Qwen3.8 제품군의 가볍고 빠른 버전으로, NezhaGate에서 OpenAI 호환 API로 제공됩니다. 단가가 낮고 처리량이 높아 배치 작업과 높은 동시 처리에 알맞으며, 측정해 보니 짧은 질문에 2.5~6초 만에 응답했습니다. 항상 먼저 생각한 뒤 답하며 추론 과정은 message.reasoning_content로 반환됩니다. 도구 호출, JSON 출력, 스트리밍, 이미지 입력(공개 링크와 base64)을 지원합니다. cache_control도 받으며, 반복되는 긴 접두어를 업스트림이 캐시에서 처리할 수 있지만 적중 여부는 업스트림이 정하고 과금은 반환된 usage를 따릅니다(캐시 적중으로 보고된 부분은 캐시 단가로 정산). model을 qwen3.8-flash로 두면 바로 연결되며, 사용한 만큼 과금하고 실패한 호출에는 과금하지 않습니다.

활용 사례

대량 텍스트 처리

분류, 추출, 요약, 재작성 같은 대량 작업에 알맞습니다. 단가가 낮아 높은 동시 처리로 배치를 돌리기 좋습니다.

이미지 인식과 OCR

스크린샷, 영수증, 상품 사진의 글자와 내용을 읽어 냅니다. 공개 이미지 링크와 base64 모두 그대로 보낼 수 있습니다.

일상 대화와 고객 지원

지식 질의응답, 글쓰기 도우미처럼 빠르고 저렴한 응답이 필요한 곳에 씁니다.

에이전트와 도구 호출

OpenAI 형식의 tools / tool_calls와 JSON 출력을 지원해 가벼운 에이전트의 실행 단계에 쓸 수 있습니다.

어떻게 고를까

작업이 단순하고 양이 많으며 비용과 속도가 중요하다면 Qwen3.8 Flash를 고르세요. 더 강한 추론, 코딩, 에이전트 능력이 필요하면 Qwen3.8 Max로, 버전을 고정하려면 0902 스냅샷으로 바꾸면 됩니다. 셋 다 Qwen3.8 제품군이라 model 필드만 바꾸면 전환됩니다.

자주 묻는 질문

프롬프트 캐싱은 어떻게 켜나요?
cache_control은 받습니다. messages의 텍스트 블록에 "cache_control": {"type": "ephemeral"}을 붙이세요(content를 [{"type": "text", "text": "...", "cache_control": {"type": "ephemeral"}}] 형태로 씁니다). 반복되는 긴 접두어를 업스트림이 캐시에서 처리할 수 있지만 적중 여부는 업스트림이 정하며 적중이 보장되지는 않습니다. 과금은 반환된 usage를 따르며, usage.prompt_tokens_details.cached_tokens에 캐시 적중으로 보고된 부분은 캐시 단가로, 나머지는 입력 단가로 정산됩니다.
사고 모드를 끌 수 있나요?
아니요. Qwen3.8 Flash는 항상 먼저 생각한 뒤 답하며, enable_thinking, reasoning_effort, thinking_budget으로도 사고가 꺼지지 않습니다. 추론 토큰은 usage.completion_tokens 안에서 출력 단가로 과금됩니다. 더 짧은 답을 원하면 프롬프트에서 간결하게 답하도록 요청하세요.
이미지는 어떻게 보내나요?
messages의 content에 image_url로 넣으면 됩니다. 공개 이미지 링크와 base64 data URI 모두 쓸 수 있습니다. 측정해 보니 이미지 속 글자를 정확히 읽고, 찍힌 대상도 알아보았습니다.
Qwen3.8 Max와 무엇이 다른가요?
Flash는 더 가볍고 빠르고 저렴해 대량 작업과 비교적 단순한 작업에 맞고, Max는 3.8 세대 플래그십으로 복잡한 추론, 코딩, 에이전트 능력이 더 강합니다. 연동 방식은 같아서 model 필드만 바꾸면 됩니다.
실패한 호출에도 과금되나요?
아니요. 정상적으로 응답한 호출만 실제 사용량으로 정산합니다. 업스트림 오류와 타임아웃은 잔액에 전혀 영향을 주지 않습니다.

관련 모델

연동할 수 있는 다른 모델도 둘러보세요.

전체 보기 →