NezhaGateNezhaGate
Чат

Qwen3.8 Flash

⧉
qwen3.8-flash
Тип модели Max0902Flash

Qwen3.8 Flash — лёгкая и быстрая версия семейства Qwen3.8 с низкой ценой за единицу и высокой пропускной способностью для пакетной обработки и высокой параллельности; в наших тестах короткие вопросы получали ответ за 2,5–6 секунд. Модель всегда думает перед ответом (рассуждение возвращается в reasoning_content) и поддерживает вызов функций, вывод в JSON, потоковый вывод и ввод изображений (публичные ссылки или base64). cache_control в текстовом блоке тоже принимается, и провайдер может отдать повторяющийся длинный префикс из кэша; попадёт ли он в кэш, решает провайдер, а оплата следует возвращённому usage (часть, отмеченная как попадание в кэш, оплачивается по тарифу кэша). Полностью совместима с OpenAI: укажите в поле model значение qwen3.8-flash. Оплата по факту использования, неудачные запросы никогда не оплачиваются.

ЧатЛёгкаяНедорогаяВвод изображенийСовместим с OpenAI

Онлайн-тест · Песочница

Попробуйте Qwen3.8 Flash прямо здесь (доступно после входа).

Ввод

Дополнительно
Веб-поиск
Память · многоходовой диалог

Диалог

Начните диалогВведите сообщение ниже, чтобы начать

О Qwen3.8 Flash

Qwen3.8 Flash — лёгкая и быстрая версия семейства Qwen3.8 от Alibaba Cloud, доступная на NezhaGate через совместимый с OpenAI API. У неё низкая цена за единицу и высокая пропускная способность для пакетной обработки и высокой параллельности; в наших тестах короткие вопросы получали ответ за 2,5–6 секунд. Модель всегда думает перед ответом, рассуждение возвращается в message.reasoning_content. Поддерживаются вызов инструментов, вывод в JSON, потоковый вывод и ввод изображений (публичные ссылки или base64); cache_control тоже принимается, и провайдер может отдать повторяющийся длинный префикс из кэша: попадёт ли он в кэш, решает провайдер, а оплата следует возвращённому usage (часть, отмеченная как попадание в кэш, оплачивается по тарифу кэша). Укажите model равным qwen3.8-flash; оплата по факту использования, неудачные запросы никогда не оплачиваются.

Сценарии использования

Пакетная обработка текста

Классификация, извлечение данных, суммаризация и переписывание в больших объёмах по низкой цене за единицу — удобно для пакетов с высокой параллельностью.

Распознавание изображений и OCR

Читает текст и содержимое скриншотов, чеков и фото товаров; подходят и публичные ссылки, и base64.

Повседневный чат и поддержка

Ответы по базе знаний и помощники в написании текстов, где нужны быстрые и недорогие ответы.

Агенты и вызов инструментов

tools / tool_calls в формате OpenAI и вывод в JSON для исполнительных шагов лёгкого агента.

Как выбрать

Выбирайте Qwen3.8 Flash, когда задачи простые, объём большой, а стоимость и скорость важнее всего; переходите на Qwen3.8 Max ради более сильных рассуждения, кода и работы с агентами или на снимок 0902 ради фиксированной версии. Все три входят в семейство Qwen3.8, поэтому переключение — это всего лишь поле model.

Частые вопросы

Как включить кэширование промптов?
cache_control принимается: добавьте "cache_control": {"type": "ephemeral"} к текстовому блоку в messages (запишите content как [{"type": "text", "text": "...", "cache_control": {"type": "ephemeral"}}]). Провайдер может отдать повторяющийся длинный префикс из кэша, но попадание решает провайдер, и оно не гарантируется. Оплата следует возвращённому usage: часть, указанная в usage.prompt_tokens_details.cached_tokens, оплачивается по тарифу кэша, остальное — по тарифу ввода.
Можно ли отключить мышление?
Нет. Qwen3.8 Flash всегда думает перед ответом, и enable_thinking, reasoning_effort или thinking_budget его не отключают. Токены рассуждения оплачиваются по тарифу вывода внутри usage.completion_tokens. Чтобы получать ответы короче, попросите краткость прямо в промпте.
Как отправить изображение?
Передайте image_url в content сообщения — подходят и публичные ссылки на изображения, и data URI в base64. В наших тестах модель точно прочитала текст на изображении и распознала изображённые объекты.
Чем она отличается от Qwen3.8 Max?
Flash легче, быстрее и дешевле — для большого объёма и более простых задач; Max — флагман поколения 3.8, сильнее в сложных рассуждениях, коде и агентных задачах. Подключаются они одинаково: меняется только поле model.
Взимается ли плата за неудачные запросы?
Нет. Списание происходит только за успешно завершённые запросы, по фактическому расходу; ошибки провайдера и тайм-ауты никогда не затрагивают ваш баланс.

Похожие модели

Изучите другие модели, которые можно подключить.

Смотреть все →