Заметки

Vertex AI: когда он нужен вместо AI Studio

M
Markabus
·
Тёмный рабочий стол разработчика крупным планом: ноутбук с абстрактной облачной консолью на экране, рядом аппаратный ключ безопасности и мини-сервер со светодиодами, на фоне в расфокусе второй монитор с кодом

Вопрос «AI Studio или Vertex AI» возникает у всех, кто дошёл от экспериментов с Gemini до реального проекта. Оба сервиса дают доступ к одним и тем же моделям, но устроены по-разному — и выбор влияет на аутентификацию, лимиты, счета и юридическую сторону дела. Разбираем, где проходит граница и когда переезд действительно оправдан.

Сразу важное обновление: в апреле 2026 года Google переименовал Vertex AI в Gemini Enterprise Agent Platform. Имя «Vertex AI» осталось в документации, адресах API и в голове у разработчиков, поэтому дальше в статье я использую оба названия как синонимы — речь про один и тот же сервис.

Коротко: в чём разница

Есть два способа обратиться к Gemini по API:

  • Gemini Developer API — тот самый, ключ от которого выдаёт Google AI Studio. Регистрация по обычному Google-аккаунту, ключ на руках за минуту, есть бесплатный уровень.
  • Gemini API на Agent Platform (бывший Vertex AI) — тот же Gemini, но внутри Google Cloud: проект, биллинг, сервисные аккаунты, роли IAM, выбор региона обработки.

Модели одни и те же. Отличается всё, что вокруг: как вы аутентифицируетесь, где выполняется запрос, какие лимиты вам дадут и что написано в договоре. Если сводить к одной фразе — AI Studio оптимизирован под скорость старта, Agent Platform под эксплуатацию.

Что изменилось после переименования

Ребрендинг анонсировали 22 апреля 2026 года, и это не только смена вывески: Google перестроил продукт вокруг агентов, а не вокруг моделей. Переехали названия разделов консоли — Agent Engine стал «Deployments», Model Registry превратился в Agent Registry, Vertex AI Search — просто в Search, Vertex AI Studio — в Agent Studio. Model Garden с 200+ моделями остался на месте.

Хорошая новость для тех, у кого уже есть работающий код: технический слой не сломали. Адрес API по-прежнему aiplatform.googleapis.com, REST-методы прежние, старые SDK продолжают работать. Вы ничего не переписываете — меняются только надписи в интерфейсе и ссылки на документацию.

Аутентификация — главное отличие

Это тот пункт, из-за которого переезд не сводится к замене одной строки.

AI Studio: один ключ

Получили строку вида AIza..., положили в переменную окружения, отправляете запрос. Просто и опасно: ключ даёт полный доступ к квоте проекта, отозвать его можно только целиком, разграничить права нельзя. Для прототипа нормально, для продакшена — постоянный источник тревоги. Подробнее про первые шаги я писал в заметке про получение ключа Gemini API.

Agent Platform: сервисный аккаунт и ADC

Здесь вместо ключа — Application Default Credentials (ADC, «учётные данные приложения по умолчанию»). На своей машине вы один раз выполняете:

gcloud auth application-default login

А на сервере выдаёте виртуальной машине или контейнеру сервисный аккаунт с ролью вроде roles/aiplatform.user. Библиотека сама находит учётные данные — в коде секретов нет вообще.

Что это даёт на практике: права режутся по ролям IAM, каждый вызов попадает в Cloud Audit Logs, доступ отзывается у конкретного сервиса без остановки остальных, а ротацией ключей занимается сам Google. Минус ровно один — настроить это сложнее, чем скопировать строку из AI Studio.

Код: одна библиотека, два режима

Google свёл оба варианта в единый SDK google-genai (на сентябрь 2026 актуальна версия 2.24.0). Переключение между бэкендами — это параметры клиента.

Developer API:

from google import genai
client = genai.Client(api_key="GEMINI_API_KEY")

Agent Platform:

from google import genai
client = genai.Client(
    enterprise=True,
    project="your-project-id",
    location="global",
)

То же самое через переменные окружения — тогда достаточно вызвать genai.Client() без аргументов:

export GOOGLE_GENAI_USE_ENTERPRISE=true
export GOOGLE_CLOUD_PROJECT="your-project-id"
export GOOGLE_CLOUD_LOCATION="global"

Обратите внимание на переименование: раньше флаг назывался vertexai=True, а переменная — GOOGLE_GENAI_USE_VERTEXAI. Старые имена работают, но если задать оба флага с противоречащими значениями, SDK выбросит ValueError, а не выберет один молча. Полезное поведение: молчаливый выбор бэкенда — худший способ узнать, куда уходили ваши данные.

Всё остальное — generate_content, потоковая выдача, структурированный вывод в JSON, вызов инструментов — работает одинаково. Именно поэтому миграция обычно занимает полчаса, а не неделю.

Когда AI Studio достаточно

Не стоит тащить Google Cloud в проект из уважения к слову «энтерпрайз». AI Studio закрывает задачу, если:

  • вы прототипируете, считаете гипотезы или пишете пет-проект;
  • трафик предсказуемо небольшой и бесплатного уровня хватает;
  • в запросы не уходят персональные данные клиентов;
  • вы работаете один и вопрос «кто и когда вызвал модель» не стоит;
  • нужен Files API — загрузка файлов на сторону Google поддерживается только в Developer API.

Бесплатный уровень в 2026 году урезали: Flash и Flash-Lite остались с пониженными квотами, а модели Pro вывели из бесплатного доступа с 1 апреля 2026 года.

Когда нужен Vertex AI

Регион обработки и требования к данным

Главный аргумент в пользу переезда. Agent Platform позволяет выбрать регион и получить обязательства по data residency — запрос обрабатывается там, где вы указали. В Developer API такого контроля нет. Если у вас договор с клиентом, где прописана география обработки, или вы работаете с чужими персональными данными, обсуждать больше нечего — вам нужен Google Cloud. Смежная тема — какие данные вообще нельзя отдавать модели.

Дообучение и гарантированная пропускная способность

Тюнинг моделей (supervised, на предпочтениях, с подкреплением) доступен только на платформе. Там же живёт Provisioned Throughput — выкупленная заранее пропускная способность. Это ответ на ситуацию, когда сервис падает в час пик: вместо борьбы с ошибкой 429 вы платите за зарезервированную мощность и получаете предсказуемую задержку.

Батчи, BigQuery и заземление

Batch-обработка на платформе умеет читать задания прямо из Cloud Storage и BigQuery и писать результат обратно — для разовой обработки сотен тысяч строк это экономит и время, и деньги: батч дешевле обычного вызова примерно вдвое. Grounding («заземление» — подмешивание проверяемых источников в ответ) на платформе работает не только с Google Search, но и с собственными API и данными, что близко к идее RAG. На моделях Gemini 3.x Google даёт 5000 бесплатных запросов с заземлением через Поиск в месяц.

Командная работа и учёт расходов

Счёт за модели приходит в общий биллинг Google Cloud, расходы раскладываются по проектам и меткам, квоты настраиваются на уровне организации. Когда над продуктом работает пять человек, это перестаёт быть формальностью.

Платите ли вы больше

Нет. Цена за токены у одних и тех же моделей одинаковая на обеих площадках — платформа не берёт наценку за «корпоративность». Разница в другом: на Agent Platform нет бесплатного уровня как такового, нужен включённый биллинг. Новым аккаунтам Google Cloud даёт 300 долларов кредитов на 90 дней.

Механики экономии работают везде: кэширование промптов (чтение из кэша стоит порядка 10% от цены обычного входного токена плюс почасовая плата за хранение) и батчи со скидкой около 50%. Как считать бюджет в принципе — разбирал в заметке про токены и лимиты, а цены разных провайдеров сравнивал в обзоре API Gemini, Claude и OpenAI.

Express-режим: промежуточный вариант

Если пугает настройка облака, у платформы есть express mode — доступ по обычному API-ключу, без полной обвязки с биллингом и сервисными аккаунтами. Это способ попробовать возможности платформы, не разбираясь сразу с IAM, и потом перейти на полноценный проект. Как постоянное решение для продакшена не подходит: главные преимущества платформы — как раз роли, аудит и выбор региона — в этом режиме недоступны.

Что с доступом из России

Практический момент, о котором стоит сказать прямо. Google Cloud не работает с российскими платёжными картами, а доступ к самим API из российских IP ограничен. Это касается обоих вариантов, но платформа требовательнее: там нужен не просто ключ, а оплаченный проект в облаке. Подробный разбор вариантов — в отдельной заметке про то, почему не работает Gemini в России.

Как мигрировать, не переписывая проект

Порядок действий, если решение принято:

  1. Создайте проект в Google Cloud и включите биллинг.
  2. Включите Agent Platform API (в консоли он же может называться Vertex AI API).
  3. Заведите сервисный аккаунт и выдайте ему роль roles/aiplatform.user — не «Редактор» и не «Владелец».
  4. Настройте ADC: локально через gcloud, на сервере — привязкой сервисного аккаунта к машине или контейнеру.
  5. Поменяйте инициализацию клиента и выберите регион в location.
  6. Прогоните тесты: имена моделей и доступность отдельных функций между бэкендами могут отличаться.

Последний пункт — единственное место, где обычно вылезают сюрпризы. Files API на платформе отсутствует, зато появляются тюнинг и часть операций с изображениями. Если проект их использует, заложите время на проверку.

Вывод

Начинать на AI Studio — правильно почти всегда: быстрее, дешевле, ничего лишнего. Переезжать на Agent Platform имеет смысл не «когда вырастете», а когда появится конкретная причина: требование к региону обработки данных, чужие персональные данные в запросах, нужда в дообучении или гарантированной пропускной способности, команда, которой нужны раздельные права и аудит.

Переименование Vertex AI в Gemini Enterprise Agent Platform на этот выбор не влияет — сменилась вывеска, а развилка осталась прежней: простой ключ против управляемого облака.

Частые вопросы

Q.Vertex AI и Gemini Enterprise Agent Platform — это одно и то же?

Да. Google переименовал Vertex AI в Gemini Enterprise Agent Platform, анонс был 22 апреля 2026 года. Технический слой не менялся: адрес API остался aiplatform.googleapis.com, старые SDK и код продолжают работать. Изменились названия разделов консоли и ссылки на документацию.

Q.Дороже ли обращаться к Gemini через Vertex AI, чем через AI Studio?

Цена за токены у одних и тех же моделей одинаковая — наценки за «корпоративность» нет. Отличие в том, что на платформе нет бесплатного уровня и нужен включённый биллинг, тогда как ключ из AI Studio даёт бесплатную квоту на модели Flash и Flash-Lite.

Q.Нужно ли переписывать код при переезде на Vertex AI?

Нет, в единой библиотеке google-genai меняется только инициализация клиента: вместо api_key передаются enterprise=True, project и location, а вместо ключа настраивается ADC через сервисный аккаунт. Остальные вызовы идентичны. Проверить стоит имена моделей и функции, доступные не на обоих бэкендах: например, Files API есть только в Developer API, а дообучение — только на платформе.

Q.Можно ли попробовать платформу без настройки Google Cloud?

Да, для этого есть express mode — доступ по обычному API-ключу без полной обвязки с биллингом и сервисными аккаунтами. Но главные преимущества платформы — роли IAM, аудит вызовов и выбор региона обработки — в этом режиме недоступны, поэтому для продакшена он не подходит.

Источники

Предыдущая
pgvector: векторный поиск прямо в PostgreSQL

Читайте также

Фотореалистичный кадр на рабочем столе: большая пробковая доска с сотнями цветных булавок, собранных в кучки по цветам, от одной красной булавки натянуты пять красных нитей к пяти ближайшим соседям, слева выдвинутый ящик деревянного библиотечного каталога с карточками — иллюстрация к статье о векторном поиске ближайших соседей в PostgreSQL с расширением pgvector.Заметки
22 сентября 2026 г.

pgvector: векторный поиск прямо в PostgreSQL

Расширение pgvector добавляет в PostgreSQL векторный тип, операторы расстояния и ANN-индексы. Разбираем установку, выбор между HNSW и IVFFlat, фильтры по метаданным, экономию памяти и границу, за которой нужен отдельный векторный движок.

Читать →
Тёмный рабочий стол разработчика: на мониторе четыре параллельных окна терминала с разными логами, рядом клавиатура, кабели и сетевой коммутатор с индикаторамиЗаметки
21 сентября 2026 г.

Агенты в Claude Code: как работают субагенты

Субагент уносит грязную работу — поиск по репозиторию, разбор логов, обход десятков файлов — в отдельное контекстное окно и возвращает только результат. Разбираем, где лежат файлы агентов, какие поля есть в YAML-заголовке, как основной диалог выбирает исполнителя и на чём здесь чаще всего спотыкаются.

Читать →
Рабочий стол в полумраке: монитор с черновиком статьи в текстовом редакторе, рядом распечатка с правками красной ручкой и блокнот с планомЗаметки
18 сентября 2026 г.

Промпт для текста: как получить от нейросети статью, а не воду

Короткий запрос «напиши статью про X» всегда даёт одно и то же — общие слова и списки без цифр. Разбираем, почему так происходит, и собираем каркас промпта из шести блоков, который даёт текст, готовый к вычитке.

Читать →