NezhaGateNezhaGate
Чат

Gemini 3.6 Flash

⧉
gemini-3.6-flash
Тип модели MediumHighLowTiered

Gemini 3.6 Flash — быстрая думающая модель нового поколения от Google: контекст на 1M токенов, вывод до 64K, ввод изображений. Стандартный уровень (Medium) даёт сбалансированный бюджет мышления для повседневного чата и агентных сценариев. Полностью совместима с OpenAI API: укажите model равным gemini-3.6-flash.

ЧатМышлениеКонтекст 1MСовместимость с OpenAI

Онлайн-тест · Песочница

Попробуйте Gemini 3.6 Flash прямо здесь (доступно после входа).

Ввод

Дополнительно
Веб-поиск
Память · многоходовой диалог

Диалог

Начните диалогВведите сообщение ниже, чтобы начать

О Gemini 3.6 Flash

Gemini 3.6 Flash — быстрая рассуждающая модель нового поколения от Google: она добавляет явный этап рассуждения (thinking) при задержке и цене уровня Flash, обрабатывает контекст на 1,000,000 токенов с выводом до 64K токенов и принимает ввод изображений. NezhaGate предоставляет четыре уровня бюджета рассуждения: стандартный gemini-3.6-flash, более глубокий gemini-3.6-flash-high, самый быстрый gemini-3.6-flash-low и gemini-3.6-flash-tiered, где модель сама решает для каждого запроса, сколько думать. Все четыре стоят одинаково за токен — то, насколько уровень «думает», просто отражается в токенах вывода. Модель работает через эндпоинт, совместимый с OpenAI: укажите base_url на NezhaGate и задайте в поле model значение "gemini-3.6-flash", чтобы использовать существующий код на OpenAI SDK без изменений — оплата по факту использования, неудачные запросы не оплачиваются.

Сценарии использования

Повседневный чат и агенты, которым нужно думать

Стандартный уровень уравновешивает скорость и рассуждение — подходит для ботов поддержки, ассистентов и агентных сценариев, которым нужно отвечать быстро, но при этом рассуждать.

Работа с документами на миллионы токенов

Контекстное окно 1M токенов вмещает целиком большой репозиторий, объёмный отчёт или пачку договоров — для суммаризации, поиска и перекрёстной проверки за один проход.

Совместное распознавание текста и изображений

Ввод изображений поддерживает вопросы по скриншотам, чтение форм и диаграмм и другой мультимодальный анализ.

Задачи с неравномерной сложностью

Вариант tiered позволяет модели самой выбирать бюджет рассуждения для каждого запроса — быстрые ответы на простые вопросы, больше раздумий над сложными — что подходит для боевого трафика с большим разбросом сложности.

Как выбрать

По умолчанию используйте стандартный gemini-3.6-flash; переключайтесь на gemini-3.6-flash-high для многошаговых рассуждений; используйте gemini-3.6-flash-low для массовой классификации, извлечения данных и переписывания текста, где на практике он одновременно и самый быстрый, и самый дешёвый; а gemini-3.6-flash-tiered выбирайте, когда сложность запросов непредсказуема и вы предпочитаете, чтобы решение принимала модель. Все четыре стоят одинаково, так что смена уровня — это просто смена поля model. Если нужна более глубокая проработка рассуждений, переходите на Gemini 3.1 Pro.

Частые вопросы

В чём разница между четырьмя уровнями Gemini 3.6 Flash?
Только бюджет рассуждения: low думает меньше всего и отвечает быстрее всего, стандартный id (без суффикса) занимает промежуточное положение, high думает больше всего и подходит для многошаговых рассуждений, а tiered даёт модели решать самой для каждого запроса. В основе у них одна и та же модель, контекстное окно и поддержка мультимодальности.
Почему все четыре уровня стоят одинаково?
Потому что разница уже отражается в usage: токены рассуждения оплачиваются как токены вывода, поэтому уровень high закономерно расходует больше токенов вывода, чем low. Добавление отдельной наценки за токен означало бы двойную оплату за одно и то же, поэтому у всех четырёх одна цена, а фактический счёт зависит от того, сколько уровень действительно «думал».
Насколько велико контекстное окно?
Около 1,000,000 входных токенов и до 64K токенов вывода за один вызов — одинаково для всех четырёх уровней.
Поддерживаются ли ввод изображений и потоковый вывод?
Да, и то, и другое. Передавайте изображения в формате image_url от OpenAI и указывайте stream=true в запросе, чтобы получать ответ токен за токеном.
Как вызывать её через OpenAI SDK?
Укажите base_url на NezhaGate, передайте свой API-ключ NezhaGate и задайте в поле model значение "gemini-3.6-flash" (или один из id с суффиксом уровня). Всё остальное совпадает с вашим существующим кодом на OpenAI.

Похожие модели

Изучите другие модели, которые можно подключить.

Смотреть все →