21 июля 2026 года команда Gemini объявила о выходе двух моделей среднего и лёгкого класса — Gemini 3.6 Flash и Gemini 3.5 Flash-Lite. Обе строятся поверх Gemini 3.5 Flash и адресованы прежде всего разработчикам, которые запускают ИИ-агентов и продакшн-нагрузки, где важны скорость, стоимость токена и стабильность результата.
Одновременно вышла и третья, узкоспециализированная модель — Gemini 3.5 Flash Cyber, — но она распространяется ограниченно, поэтому основное внимание в материале уделю двум флагманам анонса.
Почему релиз случился именно сейчас
Пока флагманская Gemini 3.5 Pro всё ещё тестируется с партнёрами и должна выйти позже, Google явно решила закрыть промежуток обновлением «рабочего» сегмента линейки. Логика понятна: именно модели Flash и Flash-Lite чаще всего используются в масштабируемых агентных сценариях — там, где счёт идёт не на «умность» модели, а на цену и скорость каждого вызова API. Параллельно компания сообщила, что уже начала предобучение модели следующего поколения — Gemini 4, что задаёт общий контекст: нынешний релиз — это оптимизация текущей архитектуры, а не революция.
Gemini 3.6 Flash: более экономная и точная «рабочая лошадка»
Google описывает 3.6 Flash как модель для кода, работы со знаниями и мультимодальных задач — разбор документов, анализ графиков и таблиц, подготовка отчётов. Ключевой акцент сделан не столько на «сырых» способностях, сколько на эффективности: модель тратит меньше токенов и делает меньше промежуточных шагов рассуждения и вызовов инструментов при выполнении многошаговых задач.
Цена и скорость. Токены на входе стоят $1,50 за миллион, на выходе — $7,50 за миллион — это дешевле, чем у предыдущей 3.5 Flash. По данным индекса Artificial Analysis, на выходе модель расходует примерно на 17% меньше токенов, чем предшественница, а на отдельных задачах (например, в бенчмарке DeepSWE от Datacurve) экономия токенов доходит до 65%.
Качество по бенчмаркам (в сравнении с 3.5 Flash, по данным самой Google):
| Бенчмарк | Что измеряет | 3.5 Flash | 3.6 Flash |
|---|---|---|---|
| DeepSWE (Datacurve) | Качество кода, «нежелательные» правки | 37% | 49% |
| MLE-Bench | Задачи, близкие к работе ML-инженера | 49,7% | 63,9% |
| OSWorld-Verified | Управление компьютером как инструмент | 78,4% | 83,0% |
| GDPval-AA v2 | Комплексные рабочие задачи | 1349 | 1421 |
Из практических новшеств — «computer use» (управление компьютером) стало встроенным инструментом прямо в Gemini API и Gemini Enterprise, без дополнительной настройки. О результатах на реальных задачах отзываются, в частности, клиенты Hebbia и Harvey, которые отмечают удобство модели при работе с мультимодальными документами — сканами, таблицами, финансовой отчётностью.
Безопасность. Google отдельно подчёркивает, что 3.6 Flash поставляется с усиленными защитами по фреймворку Frontier Safety — в первую очередь в областях, связанных с ХБРЯ-рисками (химическое, биологическое, радиологическое, ядерное) и киберугрозами. По заявлению компании, модель одновременно стала устойчивее к джейлбрейкам и реже отказывается выполнять легитимные запросы — то есть баланс безопасности и полезности пытались сдвинуть в обе стороны сразу.
Gemini 3.5 Flash-Lite: самая быстрая модель линейки 3.5
Если 3.6 Flash — это «универсальный солдат», то 3.5 Flash-Lite нацелена на узкую, но денежно значимую нишу: задачи с высокой пропускной способностью и низкой задержкой — агентный поиск, массовая обработка документов, потоковая обработка данных.
Цена и скорость. $0,30 за миллион входных токенов и $2,50 за миллион выходных — заметно дешевле «полной» Flash. По измерениям Artificial Analysis, скорость генерации достигает 350 токенов в секунду, что делает модель самой быстрой во всей линейке 3.5.
Качество по бенчмаркам (в сравнении с предыдущей Flash-Lite и с более крупной моделью 3 Flash):
| Бенчмарк | 3.1 Flash-Lite | 3.5 Flash-Lite |
|---|---|---|
| Terminal-Bench 2.1 (код и терминал) | 31% | 54% |
| GDM-MRCR v2 (длинный контекст) | 60,1% | 72,2% |
| GDPval-AA v2 (реальные задачи) | 642 | 1140 |
Показательно, что по ряду тестов Flash-Lite обгоняет не только своего прямого предшественника, но и более тяжёлую модель 3 Flash: на SWE-Bench Pro — 54,2% против 49,6%, на OSWorld-Verified — 74,0% против 65,1%. Для бизнеса это означает возможность заменить более дорогую модель на более дешёвую без потери качества на части сценариев — правда, тестировать стоит на своих данных, а не полагаться на общие бенчмарки.
Разработчики могут регулировать «уровень мышления» модели — от минимального (максимальная скорость и низкая цена для простых массовых операций) до повышенного (для сложных многошаговых агентных задач). Как и у старшей модели, «computer use» доступен как встроенный инструмент. Среди клиентов, упомянутых Google, — Ashler (работа с инфраструктурными данными), Palo Alto Networks и Ramp, отмечающие сочетание скорости, интеллекта и цены при масштабировании агентных пайплайнов.
Коротко о третьей модели — Gemini 3.5 Flash Cyber
Это узкоспециализированная версия Flash, дообученная на поиск и исправление уязвимостей в коде. Она работает в связке с агентом Google по безопасности кода CodeMender: несколько экземпляров модели совместно формируют один сводный отчёт об уязвимости. В отличие от двух моделей выше, доступ к ней ограничен — Google предоставляет её только государственным структурам и доверенным партнёрам в рамках пилотной программы, учитывая двойное назначение технологии (поиск уязвимостей одинаково полезен и защитникам, и атакующим).
Где доступны новые модели
- Разработчикам — через Gemini API в Google AI Studio и Android Studio; 3.6 Flash дополнительно доступна в Google Antigravity.
- Бизнесу — через Gemini Enterprise Agent Platform; 3.6 Flash также встроена в приложение Gemini Enterprise.
- Всем пользователям — через приложение Gemini; 3.5 Flash-Lite постепенно подключается и к Google Поиску.
На что стоит обратить внимание
Все цифры в этом материале — данные, которые публикует сама Google со ссылкой на сторонний индекс Artificial Analysis и отдельные бенчмарки (DeepSWE, MLE-Bench, OSWorld-Verified, Terminal-Bench, GDM-MRCR, GDPval-AA, SWE-Bench Pro). Это стандартная практика при анонсе моделей, но независимые замеры на реальных задачах и в проде почти всегда дают более скромную и не такую однородную картину, чем витринные графики в блоге вендора. Прежде чем переводить продакшн-нагрузку с одной модели на другую, разумно прогнать собственный набор тестовых кейсов — особенно если экономия на токенах для вас критична, а не просто приятный бонус.
Практический вывод для разработчиков: 3.6 Flash имеет смысл рассматривать как замену 3.5 Flash почти без компромиссов — она одновременно дешевле и точнее по большинству метрик. А 3.5 Flash-Lite стоит присмотреть там, где раньше приходилось выбирать между скоростью и качеством: судя по бенчмаркам, этот компромисс стал менее острым.
Источники: официальный блог Google (blog.google, 21 июля 2026), карточки моделей на deepmind.google, данные Artificial Analysis Index.