Лимиты Gemini невозможно назвать в запросах. Не потому что это секрет, а потому что Google перестал их так считать: с 17 мая 2026 года расход в приложениях Gemini меряется вычислениями, а публичной квоты в промптах больше нет. В документации API таблицы «столько-то запросов в минуту» тоже больше нет - на её месте строчка «смотрите свой лимит в личном кабинете».
Русские обзоры при этом продолжают печатать таблички с цифрами 5, 100 и 500 запросов в сутки. Эти цифры взяты из справки, которой уже не существует.
Я собрал то, что Google публикует на 10 сентября 2026 года: что осталось в цифрах, сколько стоит доступ через API, когда цена меняется, какие предохранители по тратам у вендора есть - и что в официальном списке стран России нет.
Каждую неделю разбираю, как малому бизнесу применять нейросети в рабочих задачах без штата разработчиков. Продолжение - в канале.
Что такое лимиты Gemini и в чём их считают?
Первое, что стоит развести, - три продукта с одним именем.
Приложение Gemini по подписке. Обычный чат в браузере и на телефоне. Здесь вы платите фиксированную сумму в месяц, а расход считается по внутренней «вычислительной» шкале.
Gemini API через Google AI Studio. Ключ, который встраивают в бота, скрипт или связку автоматизации. Здесь платят за токены: сколько прогнали, столько и вышло.
Gemini через корпоративную платформу Google Cloud. Там другой биллинг и другие лимиты, и список стран тоже свой.
В обсуждениях эти три штуки смешивают постоянно, и отсюда половина споров «у меня хватает - а у меня нет». Дальше я разбираю первые два: именно с ними работает малый бизнес.
Для API Google формулирует механику прямо в документации по лимитам. Лимит измеряется по трём осям: запросы в минуту, входные токены в минуту и запросы в сутки. Превышение любой из трёх даёт ошибку, даже если по двум другим у вас запас. Ещё один пункт из документации: лимит применяется к проекту целиком. Плодить ключи внутри одного проекта, чтобы получить больше запросов, бессмысленно - потолок у них общий.
У ChatGPT и Claude лимиты устроены иначе, и там своя арифметика - её я разбирал в отдельном материале про лимиты нейросетей и что делать, когда подписка кончилась.
Почему из документации пропала таблица «столько запросов в минуту»?
Это главный факт статьи, и он отрицательный.
Справка Google про лимиты подписки формулирует так:
«Gemini Apps have compute-based usage limits that determine how much you can interact with Gemini tools and features. These limits factor in the complexity of your prompt, the models and features you use, and the length of your chat. Your limit refreshes every 5 hours until you reach your weekly limit.»
«В приложениях Gemini действуют лимиты использования, основанные на вычислениях; они определяют, насколько активно вы можете работать с инструментами и функциями Gemini. Эти лимиты учитывают сложность вашего запроса, используемые модели и функции, а также длину чата. Ваш лимит обновляется каждые пять часов, пока вы не достигнете недельного лимита.»
Google, справка «Gemini Apps limits & upgrades for Google AI subscribers», support.google.com
Дата перехода стоит прямо в уведомлении на этой странице: 17 мая 2026 года. В отдельной справке Google «Changes to Gemini model access and limits» уточнено, что для пользователей старше 18 лет изменения вступили в силу именно тогда, а для остальных - 24 июля 2026 года. Любой материал про лимиты Gemini, написанный раньше и называющий конкретное число промптов, устарел с точностью до дня.
Что публикуется вместо цифр - только множители:
| План | Что обещает Google |
|---|---|
| Без подписки | Стандартные лимиты |
| Google AI Plus | В 2 раза выше стандартных |
| Google AI Pro | В 4 раза выше стандартных |
| Google AI Ultra | В 5 или в 20 раз выше, чем у AI Pro, в зависимости от подписки |
В последней строке две ставки под одним именем: Ultra - это два разных тарифа. В русских обзорах он почти всегда описан как один.
В документации API история повторяется. На странице лимитов, обновлённой 2 сентября 2026 года, нет ни одного числа RPM, TPM или RPD по уровням. Таблицы на странице остались, но в них объёмы пакетной очереди и потолки трат. Квот на запросы среди них нет, а на их месте стоит вот это:
«Rate limits depend on a variety of factors (such as your usage tier) and can be viewed in Google AI Studio. [...] Specified rate limits are not guaranteed and actual capacity may vary.»
«Ограничения скорости зависят от множества факторов (например, от вашего уровня использования) и доступны для просмотра в Google AI Studio. Указанные ограничения скорости не гарантируются, и фактическая пропускная способность может отличаться.»
Google, «Rate limits», ai.google.dev
Практический вывод простой. Свои лимиты Gemini вы увидите только в своём кабинете, под своим проектом. Ни в одном обзоре, включая этот, вашей цифры нет: она считается по вашему проекту и вашему уровню трат.
Когда обнуляется суточная квота по московскому времени?
В документации Gemini API это одна строчка: «Requests per day (RPD) quotas reset at midnight Pacific time» - «Квоты на количество запросов в сутки (RPD) обнуляются в полночь по тихоокеанскому времени».
Считаем. В сентябре в США действует летнее тихоокеанское время, это UTC минус 7 часов. Полночь по нему - 07:00 по всемирному времени. Москва - это UTC плюс 3, значит 10:00 по московскому времени. После перехода США на зимнее время сдвиг становится минус 8, и сброс приходится на 11:00 по Москве.
Что с этим делать на практике:
- Тяжёлые пакетные задачи ставить после 10 утра: у свежих суток запас максимальный.
- Если упёрлись в суточную квоту в 9 утра, ждать до полуночи бессмысленно: сброс будет через час.
- Если упёрлись в 11 утра, следующий сброс будет только через сутки, и весь рабочий день пройдёт на минутных лимитах.
Эту мелочь в русских материалах не пересчитывают, хотя на расписание она влияет напрямую: суточные лимиты Gemini отсчитываются по калифорнийскому времени.
Сколько даёт бесплатный уровень и чем за него платят?
На странице цен Gemini API у бесплатного плана четыре пункта: ограниченный доступ к части моделей, бесплатные входные и выходные токены, доступ в Google AI Studio и - четвёртой строкой - «Content used to improve our products», то есть «Контент используется для улучшения наших продуктов».
На платном плане в том же месте стоит «Content not used to improve our products» - «Контент не используется для улучшения наших продуктов».
Разницу стоит перевести на язык владельца бизнеса. Если вы гоняете через бесплатный ключ договоры, переписку с клиентами или выгрузку из базы, содержимое этих запросов вендор использует для улучшения своих продуктов. На черновиках и экспериментах это безразлично, а на клиентских данных решает всё. Что именно нельзя отдавать публичной модели, я разбирал в материале про персональные данные клиентов в нейросети.
Ещё два ограничения бесплатного уровня, которые всплывают не сразу. Лимиты Gemini тут ни при чём - дело в самом наборе доступных возможностей:
- Самая сильная модель линейки на бесплатном уровне недоступна. Gemini 3.1 Pro в бесплатной колонке помечен как «Not available». Бесплатно работают Flash-модели.
- Обращение модели к поиску тоже недоступно. Grounding через Google Поиск на бесплатном уровне выключен.
Собрать из этого рабочий процесс целиком - отдельная работа. То, что в статье, - только первый шаг: разобраться в тарификации инструмента. ClaudeLab собирает решения на нейросетях под конкретные задачи бизнеса и сопровождает их в работе.
Сколько стоит Gemini API и что меняется 1 января 2027?
Сноска вендора звучит дословно так:
«Introductory price expires on December 31, 2026. Starting January 1, 2027, $1.50/1M input tokens and $7.50/1M output tokens will apply.»
«Вводная цена действует до 31 декабря 2026 года. С 1 января 2027 года будут применяться 1,50 доллара за 1 млн входных токенов и 7,50 доллара за 1 млн выходных.»
Google, «Introducing Gemini 3.8 Flash and 3.8 Flash Cyber», 2 сентября 2026, blog.google
Полная картина по ставкам на 10 сентября 2026 года, из таблицы цен Gemini API (страница обновлена 8 сентября):
| Модель | Вход за 1 млн токенов | Выход за 1 млн токенов |
|---|---|---|
| Gemini 3.8 Flash | $0,75 (с 01.01.2027 - $1,50) | $3,75 (с 01.01.2027 - $7,50) |
| Gemini 3.5 Flash | $1,50 | $9,00 |
| Gemini 3.5 Flash-Lite | $0,30 | $2,50 |
| Gemini 3.1 Pro Preview | $2,00 до 200 тыс. токенов, $4,00 свыше | $12,00 до 200 тыс., $18,00 свыше |
В таблице есть контринтуитивная строка: новая модель дешевле старой. Gemini 3.8 Flash стоит вдвое меньше, чем вышедшая раньше Gemini 3.5 Flash. Читатель обычно ждёт обратного и по привычке выбирает модель постарше «чтобы сэкономить».
Две статьи расхода, о которых в обзорах почти не пишут, хотя на счёт они влияют не меньше, чем сами лимиты Gemini:
- Кэш контекста. У Gemini 3.8 Flash - 0,075 доллара за миллион токенов плюс хранение 0,50 доллара за миллион токенов в час. У Gemini 3.1 Pro хранение стоит 4,50 доллара за миллион токенов в час. Миллион токенов, оставленных в кэше Pro-модели на сутки, обходится в 108 долларов - без единого запроса к модели.
- Обращение к поиску. Пять тысяч запросов в месяц бесплатно на все модели Gemini 3.x суммарно, дальше 14 долларов за тысячу обращений.
Сравнение ставок между вендорами и общая динамика - в разборе про цены на нейросети.
Почему одинаковая ставка за токен не даёт одинаковый счёт?
Строка в ценовой таблице Google называется «Output price (including thinking tokens)» - цена выхода, включая токены размышления. То есть внутренние рассуждения модели, которых вы не видите, тарифицируются по самой дорогой ставке.
Сколько думать, решает модель. В документации это описано так: по умолчанию модели Gemini используют динамическое размышление и подстраивают объём усилий под сложность запроса, а управлять этим можно параметром thinking_level со значениями low, medium и high.
Отсюда типовая ошибка, о которой Google предупреждает прямым текстом:
«If the model hits this limit while reasoning, it stops generating with status "incomplete" and returns truncated or empty output (while still billing for any thinking tokens generated).»
«Если модель упрётся в этот лимит во время рассуждения, она прекращает генерацию со статусом "incomplete" и возвращает обрезанный или пустой ответ, при этом плата за все сгенерированные токены размышления всё равно списывается.»
Google, «Thinking», ai.google.dev
Читается это так: вы можете заплатить за ответ, которого не получили. Попытка сэкономить через маленький потолок длины ответа даёт пустой результат и полный счёт за размышления. Документация предлагает вместо этого понижать уровень размышления - для простых задач вроде классификации или извлечения факта хватает low.
Что такое лимит по тратам и откуда берётся ошибка 429?
Формулировка вендора о назначении этого механизма, из той же страницы лимитов: «the Gemini API enforces spend-based rate limits to protect against unexpected charges» - ограничения по расходу применяются, чтобы защитить от неожиданных счетов.
| Уровень | Потолок трат за 10 минут |
|---|---|
| Free | не применяется |
| Tier 1 | $10 |
| Tier 2 | $50 |
| Tier 3 | $200 |
Для владельца бизнеса это хорошая новость и плохая одновременно.
Хорошая: сломанный скрипт в цикле не потратит больше потолка - Google остановит его раньше. Плохая: остановит он посреди рабочего процесса, и ваш бот в этот момент отдаст клиенту ошибку вместо ответа. И потолок этот не такой уж низкий: 200 долларов за десять минут на третьем уровне - это 1 200 долларов в час, если запросы идут без остановки.
На стороне решения это закрывается тремя вещами:
- Обрабатывать код 429 отдельно от прочих ошибок: он означает упор в потолок при исправной сети и рабочем коде.
- Ставить повтор с задержкой. Окно скользящее, через несколько минут запас появится сам, а мгновенные повторы только добавят отказов.
- Держать запасной путь на случай, если 429 приходит подряд. Как собрать такую страховку, разбирал в материале про отказоустойчивость ИИ для бизнеса.
Как устроены платные уровни и как на них попасть?
| Уровень | Как попасть | Потолок биллинга |
|---|---|---|
| Free | активный проект или пробный период | - |
| Tier 1 | подключить активный платёжный аккаунт | $250 |
| Tier 2 | оплачено $100 и прошло 3 дня с первого успешного платежа | $2 000 |
| Tier 3 | оплачено $1 000 и прошло 30 дней | от $20 000 |
Переход с бесплатного на первый уровень Google описывает как мгновенный, последующие - в пределах десяти минут.
Тут есть два неочевидных момента:
- Квалификация считается по всем сервисам Google Cloud. Если компания уже платит Google за что-то другое, до второго и третьего уровня она доберётся быстрее, чем ожидает.
- У preview-моделей лимиты Gemini жёстче. Google указывает это отдельной строкой, а Gemini 3.1 Pro на момент публикации - именно preview. То есть на самой сильной модели упор в потолок наступит раньше, чем на Flash.
Доступен ли Gemini в России официально?
Список я пересчитал построчно на самой странице документации: непрерывный блок от Albania до Åland Islands, 230 позиций, без дублей. Слово «Russia» на странице не встречается ни разу.
Кто из соседей в этом списке есть: Казахстан, Армения, Грузия, Азербайджан, Узбекистан, Кыргызстан, Турция, Сербия, Украина. Кого нет, кроме России: Беларусь, Иран, Сирия, Куба и КНДР. Для компании с юрлицом в Армении или Казахстане это меняет картину целиком.
Формулировка Google для тех, кто вне списка:
«The Gemini API and Google AI Studio are available in the following countries and territories. If you're not in one of these countries or territories, try the Gemini API in Gemini Enterprise Agent Platform:»
«Gemini API и Google AI Studio доступны в следующих странах и территориях. Если вы находитесь не в одной из этих стран или территорий, попробуйте Gemini API в Gemini Enterprise Agent Platform.»
Google, «Available regions», ai.google.dev
Три детали, которые снимают частую путаницу. Первая: страница «сервис недоступен» открывается по трём разным причинам, и только одна из них про страну. Google перечисляет: региональное ограничение, возраст младше 18 лет и неподтверждённый возраст в аккаунте Google. Прежде чем искать обход, стоит проверить второе и третье.
Вторая: доступ проверяется по текущему местонахождению, а не по стране регистрации аккаунта. Интерфейс при этом продолжает показывать предложения оформить тариф, который вам недоступен. Отсюда классическое «мне же предлагают купить, значит, работает» - предложение в интерфейсе не означает, что подписка активируется.
И третья: в условиях использования API пункт про регион есть, и он прямой.
«You may only access the Services (or make API Clients available to users) within an available region.»
«Получать доступ к сервисам (и делать клиентские приложения доступными пользователям) можно только в пределах доступного региона.»
Google, «Gemini API Additional Terms of Service», раздел Use Restrictions, ai.google.dev
Отдельного пункта про наказание в условиях нет: слов о блокировке или приостановке аккаунта именно за доступ из неподдерживаемого региона в тексте не встречается. Ограничение сделано списком регионов. Додумывать за вендора не стоит в обе стороны.
Как устроена оплата зарубежного ИИ-сервиса из России в принципе и чем отличаются пути - разбирал на примере другого вендора в материале про оплату ChatGPT из России.
Как посчитать месячный счёт до того, как его выставят?
Разберу порядок на понятном примере. Цифры условные. Механика настоящая.
- Оцените объём одной задачи. Допустим, бот разбирает входящее письмо: на вход уходит текст письма и инструкция - около 4 тысяч символов. Ответ - около 1 тысячи символов.
- Переведите символы в токены. Для русского текста грубая прикидка - примерно два-три символа на токен. Берите худший вариант: 4 000 символов это около 2 000 токенов на входе, 1 000 символов - около 500 токенов на выходе.
- Добавьте размышление. Это самая частая ошибка в расчётах: токены размышления идут по выходной ставке и в простом счёте их забывают. Заложите к выходу запас - на уровне
lowон небольшой, наhighможет превысить сам ответ. - Умножьте на ставки и на количество задач в месяц. При ставке 0,75 доллара за миллион входных и 3,75 за миллион выходных тысяча таких писем в месяц - это 2 млн входных токенов и порядка 0,5-1 млн выходных с учётом размышления.
- Добавьте накладные. Обращения к поиску сверх пяти тысяч в месяц, хранение кэша по часам, наценка платёжного посредника, если платите через него.
- Удвойте весь счёт для проверки. С 1 января 2027 дорожает всё сразу: вход, выход, кэш и его почасовое хранение. Если при удвоении экономика перестаёт сходиться - строить процесс на этой модели рано.
Последний шаг отличает расчёт от прикидки. Промо-цена привязана к дате: она закончится у всех одновременно, независимо от того, сколько вы прогнали за год.
Отдельно замечу: считать окупаемость нужно по стоимости задачи целиком, вместе с работой по внедрению и сопровождением. Ставка за токен - только одна её часть. Методику разбирал в материале про окупаемость ИИ для бизнеса. Когда рутина уже вынесена в автоматизацию бизнеса на ИИ-агентах, счёт за API становится понятной строкой бюджета.
Когда лимиты Gemini закрывают задачу, а когда пора считать альтернативы?
| Сценарий | Что подходит | Почему |
|---|---|---|
| Один сотрудник работает в чате руками | Подписка | Фиксированная сумма в месяц, вычислительный лимит на одного человека выбрать трудно |
| Несколько сотрудников, разная нагрузка | Подписка на каждого | Лимит персональный, разделить его между людьми нельзя |
| Повторяющаяся задача внутри программы | API | Оплата за токены, лимит на проект, предохранитель по тратам |
| Нужен понятный счёт при росте объёма | API с батчами | Пакетная обработка дешевле обычной вдвое |
| Данные клиентов, которые нельзя отдавать наружу | Платный уровень API или своё решение | На бесплатном уровне контент используется для улучшения продуктов вендора |
| Компания в России без зарубежного юрлица | Вопрос доступа решается раньше вопроса цены | России нет в официальном списке стран |
Если доступ - главное ограничение, сравнение работающих в России вариантов есть в разборе про российские нейросети для бизнеса, а список замен зарубежному сервису - в материале про аналоги ChatGPT для бизнеса.
Что делать, если доступ закроется или цена удвоится?
Разница между этими двумя вариантами проявляется в тот момент, когда вендор что-то меняет. На запуске она незаметна. Как часто это бывает, видно по самому Google: по словам вендора, Gemini 3.8 Flash - «третий релиз Flash за шесть недель», модель лимитов сменилась 17 мая 2026 года, а ставки удваиваются 1 января 2027. Три изменения за неполный год у одного вендора, и каждое задевает того, кто уже собрал на нём процесс.
Что закладывать в решение, чтобы смена модели укладывалась в один день:
- Обращение к модели собрано в одном месте кода. Тогда смена вендора укладывается в правку одного модуля. Иначе придётся обходить каждый сценарий отдельно.
- Промпты хранятся отдельно от логики. Под другую модель их придётся подправить, и искать их по всему проекту не нужно.
- Запасной вендор проверен заранее. Проверка занимает час, авария - день простоя.
- Расход виден сразу. Счётчик, по которому превышение заметно в тот же день. Счёт в конце месяца для этого поздно.
В решениях, где ИИ подключён к рабочим системам, это стандартная часть архитектуры: чат-бот с интеграцией в CRM не должен зависеть от того, какая модель отвечает внутри.
Когда всё это не нужно. Если у вас одна-две задачи в день и вы делаете их руками в чате - никакой архитектуры не требуется. Хватает подписки, а если она недоступна - российского аналога. Если объём задач не вырос настолько, чтобы считать токены, вопрос смены модели для вас теоретический. Заказная разработка окупается там, где задача повторяется десятки раз в день и её выполняет программа. Пока это делает человек руками, считать нечего. Во всех остальных случаях это лишние деньги.
С чего начать на этой неделе?
- Определите, о каком продукте речь. Подписка на приложение и API тарифицируются по-разному. Половина путаницы уходит на этом шаге.
- Посмотрите свои лимиты Gemini в кабинете. Для API это единственное место, где Google показывает актуальные цифры.
- Посчитайте одну типовую задачу в токенах по порядку из раздела выше и умножьте на месячный объём.
- Удвойте весь счёт. Если экономика держится и при ставках 2027 года - решение можно строить. Если нет - выбирайте модель дешевле или считайте российский вариант.
- Проверьте, что уйдёт в запросах. Клиентские данные через бесплатный ключ отправлять не стоит: на бесплатном уровне вендор использует содержимое для улучшения своих продуктов.
- Опишите план на случай смены модели. Один абзац о том, что вы сделаете, если доступ закроется, - это уже больше, чем есть у большинства.
Источники
- Google. Introducing Gemini 3.8 Flash and 3.8 Flash Cyber, 2 сентября 2026 - blog.google
- Google. Gemini Developer API pricing, обновлено 8 сентября 2026 - ai.google.dev
- Google. Rate limits, обновлено 2 сентября 2026 - ai.google.dev
- Google. Thinking, обновлено 9 сентября 2026 - ai.google.dev
- Google. Available regions for Google AI Studio and Gemini API - ai.google.dev
- Google. Gemini Apps limits & upgrades for Google AI subscribers - support.google.com
- Google. Changes to Gemini model access and limits - support.google.com
- Google. Gemini Apps: где доступно и на каких языках - support.google.com
- Google. Gemini API Additional Terms of Service - ai.google.dev
Разбираю такие инструменты по одному правилу: сначала цена и границы, потом внедрение. За работающим решением на нейросетях под вашу задачу - к нам.