Обзор Google Gemini API: модели, возможности, примеры и стоимость в 2026 году
Актуальность информации: 29 сентября 2026 года.
Google Gemini API за последние два года превратился из относительно простого интерфейса к языковым моделям в большую мультимодальную платформу. Через один стек разработчик может работать с текстом, изображениями, PDF, аудио и видео, подключать Google Search и Google Maps, выполнять Python-код, строить RAG по собственным документам, создавать изображения, распознавать и синтезировать речь, запускать realtime-голосовых агентов и использовать управляемых AI-агентов с собственным Linux-sandbox.
Главное изменение 2026 года касается не только моделей. С июня Google рекомендует Interactions API как основной интерфейс для новых проектов. Старый generateContent продолжает работать, но теперь считается legacy API. Interactions объединяет обычную генерацию, мультимодальные запросы, stateful-диалоги, инструменты, background execution и управляемых агентов в одной модели взаимодействия.
В этой статье разберем актуальное состояние Gemini API, основные модели, тарификацию, встроенные инструменты, Nano Banana, Live API, File Search, Managed Agents и подключение Gemini из PHP.
Что такое Gemini API
Gemini API — developer-платформа Google для программного доступа к моделям Gemini и связанным специализированным моделям. Получить API key, протестировать prompt и посмотреть usage можно через Google AI Studio, а сами запросы идут на generativelanguage.googleapis.com.
Сегодня через Gemini API доступны не только обычные LLM-запросы. В одной экосистеме находятся:
- Gemini 3.8 Flash и другие текстово-мультимодальные модели;
- Nano Banana для генерации и редактирования изображений;
- Gemini Live для realtime-аудио и голосовых агентов;
- Gemini TTS и Transcribe;
- Gemini Omni Flash для генерации и редактирования видео;
- Gemini Embedding для semantic search и RAG;
- Deep Research и Antigravity Managed Agents;
- встроенные Google Search, Google Maps, File Search, URL Context, Code Execution и Computer Use.
Это одно из главных отличий современной платформы Google от раннего Gemini API: разработчику уже не обязательно собирать отдельные сервисы для текста, поиска, документов, голоса и части agentic-инфраструктуры.
Interactions API — основной интерфейс с 2026 года
До 2026 года большинство примеров Gemini строилось вокруг generateContent. Этот endpoint по-прежнему поддерживается, но с июня 2026 года Google рекомендует Interactions API для всех новых проектов.
Минимальный запрос выглядит так:
curl -X POST "https://generativelanguage.googleapis.com/v1/interactions" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.8-flash",
"input": "Кратко объясни разницу между REST и GraphQL."
}'
Interactions API рассчитан не только на одиночную генерацию. Один и тот же интерфейс используется для текста, мультимодального input, structured outputs, function calling, встроенных tools, stateful-разговоров, background-задач и managed agents.
Важное отличие от классического stateless API — сервер может хранить состояние диалога. Следующий запрос передает previous_interaction_id, после чего Google самостоятельно восстанавливает предыдущий контекст. Необязательно снова отправлять всю историю сообщений.
При необходимости можно работать и полностью stateless, указав store: false. Тогда история остается под контролем приложения, но разработчик должен самостоятельно передавать предыдущие model steps, включая tool calls и thinking-related шаги, которые нужны для продолжения диалога.
Актуальные основные модели Gemini
Линейка Google довольно большая, но для обычного backend-приложения сейчас особенно важны три модели.
| Модель | Статус | Контекст | Максимальный output | Standard input / output за 1 млн токенов |
|---|---|---|---|---|
| Gemini 3.8 Flash | GA | 1 048 576 | 65 536 | $0,75 / $3,75 до 31.12.2026 |
| Gemini 3.1 Pro | Preview | 1 млн | 64 тыс. | $2 / $12 до 200 тыс. input |
| Gemini 3.5 Flash-Lite | GA | 1 048 576 | 65 536 | $0,30 / $2,50 |
Для Gemini 3.8 Flash действует вводная цена до конца 2026 года. С 1 января 2027 года Google заявляет $1,50 за миллион входных и $7,50 за миллион выходных токенов.
Gemini 3.1 Pro тарифицируется иначе: при prompt до 200 тыс. токенов цена составляет $2/$12, а при превышении этого размера — $4/$18. Это важно учитывать, если миллионный context window нужен не теоретически, а реально используется в каждом запросе.
Gemini 3.8 Flash
Gemini 3.8 Flash — основная актуальная универсальная модель Google и уже имеет статус GA. Несмотря на название Flash, Google позиционирует ее не просто как быстрый облегченный вариант, а как модель для long-horizon software engineering, автономных агентов и сложных enterprise-workflows.
Она принимает текст, изображения, видео, аудио и PDF и возвращает текст. Контекст составляет 1 048 576 токенов, максимальный output — 65 536 токенов. Поддерживаются function calling, structured outputs, File Search, Google Search, Google Maps, URL Context, Code Execution, Computer Use в preview и context caching.
Модель также поддерживает регулируемый thinking level: low, medium и high, причем стандартным значением является medium. Это позволяет не оплачивать одинаковый reasoning budget для всех задач.
До 31 декабря 2026 года стандартная стоимость составляет $0,75 за миллион входных и $3,75 за миллион выходных токенов. Для новой production-интеграции это обычно первая Gemini-модель, которую имеет смысл тестировать.
Gemini 3.1 Pro Preview
Gemini 3.1 Pro остается наиболее тяжелой Pro-моделью текущей линейки для сложного мультимодального reasoning, agentic-задач и программирования, но важно учитывать ее статус Preview. Для production-системы это означает потенциально более частые изменения и более осторожный подход к привязке архитектуры к конкретной версии.
Контекст составляет примерно 1 млн токенов, output — до 64 тыс. Модель принимает текст, изображения, видео, аудио и документы и поддерживает инструменты Gemini.
Цена зависит от размера prompt:
- до 200 тыс. токенов — $2 input и $12 output за миллион токенов;
- свыше 200 тыс. — $4 input и $18 output.
Поэтому Pro не стоит автоматически использовать для всего трафика. Рациональнее сравнить ее с Gemini 3.8 Flash на собственных сложных задачах и подключать там, где улучшение результата оправдывает разницу в цене и preview-статус.
Gemini 3.5 Flash-Lite
Gemini 3.5 Flash-Lite — актуальная бюджетная GA-модель для high-volume workload. Она тоже имеет огромный context window в 1 048 576 токенов и output до 65 536, но стоит $0,30/$2,50 за миллион входных и выходных токенов.
Модель принимает текст, изображения, видео, аудио и PDF. Она поддерживает thinking, function calling, structured output, File Search, Google Search, Google Maps, URL Context и Code Execution, но не Computer Use.
Flash-Lite особенно подходит для классификации, извлечения данных, перевода, документ-парсинга, маршрутизации запросов и sub-agent-задач. При большом количестве вызовов разница между $0,30 и $0,75 за миллион входных токенов уже заметна, поэтому разделение workload между Flash и Flash-Lite может быть полезнее выбора одной модели «на все случаи».
Старые Gemini 2.5 и предыдущие Flash-модели
Gemini 2.5 Pro, Flash и Flash-Lite пока не объявлены deprecated, но Google уже ограничивает новый доступ к ним и рекомендует для новых проектов использовать актуальные Gemini 3.8 Flash и Gemini 3.5 Flash-Lite.
В линейке также остаются Gemini 3.5 Flash, 3.6 Flash и 3.7 Flash. Они поддерживаются, но относятся к предыдущим поколениям Flash. Если новый проект не зависит от конкретного поведения старой версии, начинать интеграцию с них обычно нет смысла.
Для production это важный общий принцип Gemini API: нужно следить не только за названием семейства, но и за статусом конкретного model ID. Preview-модели могут меняться быстрее, а у старых версий постепенно появляются даты shutdown и рекомендуемые replacements.
Мультимодальность: текст, изображения, видео, аудио и PDF
Одна из сильных сторон Gemini — мультимодальность не вынесена в отдельный анализатор. Gemini 3.8 Flash и Flash-Lite могут получать в одном запросе одновременно текст, изображения, видео, аудио и документы.
Например, приложение может передать фотографию товара, аудиозапись комментария пользователя и текстовую инструкцию, а модель обработает их как общий контекст. Для видео Gemini способен анализировать содержимое кадров и аудиодорожку, а для PDF — текст и визуальную структуру страниц.
Для небольших файлов данные можно передавать непосредственно в запросе. Общий inline payload ограничен примерно 100 MB, для PDF — 50 MB. Для больших файлов или повторного использования лучше применять Files API.
Files API
Gemini Files API позволяет один раз загрузить изображение, аудио, видео или документ и затем использовать его URI в запросах к модели.
Один файл может занимать до 2 GB, суммарно на проект разрешено хранить до 20 GB. Обычные загруженные файлы автоматически удаляются через 48 часов. Сам Files API бесплатен; оплачивается уже обработка файла моделью.
Есть и другие способы передавать данные. Для файлов в Google Cloud Storage можно зарегистрировать GCS URI, а публичные файлы допустимо читать напрямую по URL в поддерживаемых сценариях.
Files API решает транспортную задачу и не является автоматически базой знаний. Для поиска по большому набору документов у Google есть отдельный File Search.
File Search: готовый RAG внутри Gemini API
File Search — встроенный retrieval-инструмент Gemini. Вы загружаете документы в File Search store, Google разбивает их на chunks, создает embeddings и при запросе автоматически извлекает подходящие фрагменты в контекст модели.
Это уже гораздо ближе к готовому RAG, чем обычный Files API. Разработчику не обязательно отдельно разворачивать vector database, писать chunking pipeline и вручную добавлять найденные фрагменты в prompt.
Тарификация устроена сравнительно просто. Хранение файлов и embedding на этапе запроса не оплачиваются; при первоначальном индексировании embeddings стоят $0,15 за миллион токенов. Найденные фрагменты затем тарифицируются как обычный input выбранной Gemini-модели.
File Search поддерживает и мультимодальный retrieval: для текста используется Gemini Embedding, а Gemini Embedding 2 позволяет строить поиск по изображениям и другим типам данных. Аудио и видео непосредственно в File Search пока не поддерживаются.
Structured Outputs
Если backend ожидает определенную структуру, свободный текст модели неудобен. Gemini поддерживает Structured Outputs с JSON Schema: разработчик описывает требуемую структуру, а модель возвращает JSON, соответствующий этой схеме.
В Interactions API формат задается через response_format. Например, можно потребовать объект с названием товара, категорией, ценой и массивом характеристик.
Это полезно для:
- извлечения данных из документов;
- классификации обращений;
- заполнения объектов CRM;
- разбора входящих писем;
- построения API-ответов;
- agentic-workflows, где следующий этап ожидает строго определенные поля.
Gemini поддерживает подмножество JSON Schema, поэтому сложную схему перед production-запуском нужно проверить на совместимость с конкретным endpoint.
Function calling
Function calling позволяет модели обращаться к функциям приложения. Вы описываете имя функции, назначение и параметры, Gemini решает, когда ее вызвать, и возвращает структурированные аргументы.
Например, можно дать модели функции findCustomer, getOrder и createSupportTicket. Пользователь пишет: «Проверь заказ 54821 и создай обращение, если он задерживается». Gemini определяет последовательность вызовов, но реальные запросы к базе и изменение данных выполняет ваше приложение.
Gemini поддерживает не только один вызов. Возможны parallel function calling для независимых действий и compositional function calling, когда результат одной функции нужен для следующей.
Как и у других LLM API, доступ к функциям нельзя считать заменой backend-авторизации. Модель может выбрать действие, но приложение должно отдельно проверять права пользователя, аргументы и допустимость операции.
Встроенные инструменты Gemini
Кроме пользовательских функций Gemini имеет довольно большой набор server-side tools. Для Gemini 3.8 Flash доступны Google Search, Google Maps, URL Context, File Search и Code Execution; Computer Use работает как отдельный client-side инструмент в preview.
Эти инструменты можно комбинировать. Модель, например, может сначала найти актуальную информацию через Google Search, открыть конкретную страницу через URL Context, выполнить вычисления в Code Execution и затем вызвать функцию вашего приложения.
Для сложных AI-продуктов это важнее, чем небольшая разница в benchmark: часть инфраструктуры, которую раньше приходилось строить вручную, теперь является частью самого API.
Grounding with Google Search
Grounding with Google Search позволяет модели самой решить, когда ей нужны свежие интернет-данные. В ответе приложение получает не только итоговый текст, но и grounding metadata, которое можно использовать для отображения источников.
Для Gemini 3.x на paid tier первые 5000 search requests в месяц являются бесплатными в общем лимите семейства, затем Google берет $14 за 1000 запросов. Важный нюанс: тарифицируется именно поисковый запрос, выполненный моделью. Один пользовательский prompt может породить несколько поисковых запросов.
Search можно использовать вместе с другими встроенными tools и собственными function calls. Это позволяет, например, сначала получить актуальные данные из интернета, а затем сохранить нужную информацию в системе приложения через собственную функцию.
Grounding with Google Maps
У Gemini есть отдельная интеграция с Google Maps. Она предназначена для запросов о местах, организациях и географическом контексте, где обычного web search недостаточно.
Для Gemini 3 тариф похож на Search: 5000 бесплатных запросов в месяц на paid tier в рамках соответствующего лимита, затем $14 за 1000 search queries.
Для локальных travel-, recommendation- и business-приложений это заметное преимущество экосистемы Google: модель может работать с картографическими данными непосредственно через встроенный tool, а не через отдельную интеграцию Places API в каждом AI-сценарии.
URL Context
URL Context нужен, когда известен конкретный URL и модели нужно прочитать его содержимое. Вместо отдельного парсера приложение передает ссылку, а Gemini извлекает доступный контент и использует его при ответе.
В результате Interactions API возвращает annotations с url_citation, поэтому приложение может связать фрагменты ответа с исходной страницей.
Отдельной платы за сам вызов URL Context нет, но извлеченный материал считается input-токенами выбранной модели. Поэтому загрузка нескольких очень длинных страниц напрямую в контекст может оказаться дороже retrieval-подхода.
Code Execution
Code Execution позволяет Gemini генерировать и выполнять Python-код в server-side среде. Модель может итеративно посмотреть результат выполнения, исправить код и продолжить рассуждение.
Это удобно для вычислений, статистики, анализа данных и задач, где обычная генерация текста менее надежна, чем реальное выполнение программы.
Отдельной почасовой платы за runtime нет. Сгенерированный код и результаты выполнения учитываются через стандартную токенную тарификацию выбранной модели: когда они создаются, это output, когда модель использует их в следующем reasoning-цикле — input.
Встроенный Code Execution выполняет именно Python. Gemini может написать PHP, JavaScript или другой язык, но запустить его этим server-side инструментом не сможет.
Computer Use
Gemini 3.8 Flash поддерживает Computer Use в preview. Этот режим предназначен для агентов, которые видят интерфейс и выполняют действия вроде кликов, ввода текста и навигации.
В отличие от Google Search или Code Execution, Computer Use относится к client-side tools: приложение предоставляет состояние интерфейса и выполняет действия, запрошенные моделью.
Такой подход полезен для автоматизации сервисов без подходящего API, но требует особенно жестких ограничений. Любые финансовые, destructive или внешние действия разумно отделять подтверждением и обычной backend-проверкой, а не давать модели полностью неконтролируемый GUI.
Thinking и reasoning
Gemini 3.8 Flash поддерживает уровни thinking low, medium и high. По умолчанию используется medium.
Output pricing включает thinking tokens. Это важно для оценки стоимости: два запроса с одинаковым пользовательским текстом могут использовать разный объем внутренних reasoning-токенов в зависимости от сложности задачи и настройки thinking.
Поэтому в production нет смысла использовать максимальный thinking level автоматически. Простая классификация или форматирование данных обычно не требуют того же reasoning budget, что архитектурный анализ, сложное программирование или многошаговый агент.
Stateful-диалоги и background execution
Interactions API умеет хранить состояние разговора на стороне Google. Следующий turn можно продолжить через previous_interaction_id, не передавая весь разговор вручную.
Для долгих задач есть background: true. API сразу возвращает ID взаимодействия, после чего приложение может опрашивать статус или получать обновления. Это полезно для сложного анализа и agentic-workflows, которые выходят за рамки обычного HTTP timeout.
Streaming также поддерживается. Interactions API отдает события через SSE, включая text deltas, tool calls и другие execution steps, поэтому пользовательский интерфейс может отображать результат по мере выполнения.
Context caching
При длинном контексте один из главных источников расходов — повторная отправка одних и тех же данных. Gemini использует implicit caching, которое включено автоматически у моделей Gemini 2.5 и новее.
Для Gemini 3.8 Flash минимальный размер подходящего для cache prompt составляет 4096 токенов. Если prefix совпадает с предыдущими запросами, Google автоматически учитывает cache hit и применяет более низкую цену.
Для 3.8 Flash до конца 2026 года cached input стоит $0,075 за миллион токенов вместо обычных $0,75. Кроме этого, при explicit caching оплачивается хранение cached context — сейчас $0,50 за миллион токенов в час.
Есть важное различие между API. Interactions API поддерживает только implicit caching. Если нужно вручную создать cache object и задать TTL, придется использовать legacy generateContent; explicit caching там пока находится в beta.
Standard, Flex, Priority и Batch
Google позволяет выбирать не только модель, но и режим inference. Это дает дополнительный способ оптимизировать стоимость и latency.
Standard — обычный синхронный режим для большинства приложений.
Flex стоит примерно на 50% дешевле Standard, но использует best-effort capacity. Запрос остается синхронным, однако задержка может составлять минуты, а при высокой нагрузке возможны 429 и 503. Это удобный вариант для фоновых последовательных workflows, где Batch не подходит из-за зависимости одного шага от другого.
Priority стоит примерно на 75–100% дороже Standard, зато запросы получают более высокий приоритет и рассчитаны на критичные user-facing системы. При исчерпании Priority capacity API может автоматически обработать запрос как Standard и взять стандартную цену.
Batch API также дает скидку 50%, но работает асинхронно. Target turnaround — до 24 часов, хотя многие задания завершаются быстрее. Batch подходит для массовой классификации, обработки каталога, embeddings и evals. На момент написания статьи Batch API доступен через legacy generateContent, а не через Interactions API.
Сколько стоит один большой запрос
Возьмем условный запрос с 100 тыс. входных и 10 тыс. выходных токенов.
| Модель | Примерная стоимость Standard |
|---|---|
| Gemini 3.5 Flash-Lite | $0,055 |
| Gemini 3.8 Flash | $0,1125 |
| Gemini 3.5 Flash | $0,24 |
| Gemini 3.1 Pro Preview | $0,32 |
Для 3.1 Pro расчет относится к prompt до 200 тыс. токенов. При превышении этого порога тариф становится выше.
У Gemini 3.8 Flash такой же объем через Batch или Flex до конца 2026 года стоит примерно $0,05625. Через Priority — дороже Standard.
Это только стоимость модели. Google Search, Maps и другие платные tools считаются отдельно, а agentic-workflow может сделать несколько вызовов модели и инструментов на одну пользовательскую команду.
Nano Banana: генерация и редактирование изображений
Генерация изображений в Gemini API развивается как семейство Nano Banana. В 2026 году основные варианты такие:
- Nano Banana 2 Lite (
gemini-3.1-flash-lite-image) — самый дешевый и быстрый вариант; - Nano Banana 2 (
gemini-3.1-flash-image) — универсальная модель для генерации и редактирования; - Nano Banana Pro (
gemini-3-pro-image) — более дорогая модель для сложной contextual image generation.
Nano Banana работает нативно с мультимодальным контекстом. Можно передать текст, исходные изображения и другие поддерживаемые данные, а затем продолжать редактирование в диалоге.
Nano Banana 2 поддерживает изображения вплоть до 4K. При Standard-тарифе ориентировочная стоимость составляет $0,067 за 1K, $0,101 за 2K и $0,151 за 4K. Nano Banana 2 Lite дешевле — около $0,0336 за 1K. Nano Banana Pro стоит примерно $0,134 за 1K/2K и $0,24 за 4K.
Таким образом, Gemini API может закрыть и текстовую, и image-функциональность продукта без подключения отдельного image-провайдера.
Gemini Omni Flash и видео
Google также добавил Gemini Omni Flash — preview-модель для генерации и редактирования видео с native audio.
Модель принимает текст, изображения, видео и аудио. Текстовый output тарифицируется по $9 за миллион токенов, видео — по $17,50 за миллион output-токенов, что Google оценивает примерно как $0,10 за секунду 720p-видео при стандартной схеме генерации.
Это направление пока менее зрелое, чем текстовый Gemini 3.8 Flash, и имеет preview-статус. Для production-системы стоит отдельно учитывать возможные изменения API и model ID.
Live API и realtime-голос
Для голосовых ассистентов Google предлагает отдельное семейство Gemini Live. Актуальный Gemini 3.8 Live принимает текст, изображения, аудио и видео и может возвращать текст и аудио в realtime.
Модель имеет контекст 131 072 токена и output до 65 536. Поддерживаются streaming audio, function calling, Google Search и interleaved reasoning.
Стоимость audio input составляет примерно $0,005 в минуту, audio output — около $0,018 в минуту. Это дает возможность строить голосовых ассистентов и операторов без отдельной цепочки speech-to-text → LLM → text-to-speech.
Для сценариев, где требуется больше фонового reasoning, есть Gemini 3.8 Live Extended Thinking.
Text-to-Speech
Для обычного синтеза речи без realtime-диалога Google предлагает Gemini 3.8 Flash TTS и более дешевый Flash-Lite TTS.
Gemini 3.8 Flash TTS ориентирован на качество, выразительность и длинную речь. До конца 2026 года text input стоит $0,50 за миллион токенов, audio output — $9 за миллион audio tokens.
Gemini 3.8 Flash-Lite TTS предназначен для высоконагруженных и чувствительных к цене задач. Его audio output стоит $6 за миллион токенов, что Google оценивает примерно как $0,0015 за 10 секунд аудио до конца 2026 года.
Speech-to-Text: Gemini 3.5 Transcribe
Для транскрипции есть специализированная модель Gemini 3.5 Transcribe. Она автоматически определяет язык, поддерживает 85+ языков, speaker diarization, word-level timestamps и custom vocabulary.
Обычная версия принимает файл длительностью до часа. При включенных diarization или word timestamps лимит сокращается до 30 минут.
Ориентировочная combined price составляет около $0,005 за минуту аудио. Есть и realtime-модель gemini-3.5-transcribe-live, которая работает через WebSockets и обходится примерно в $0,009 за минуту совокупного input/output.
Embeddings
Для semantic search, рекомендаций, кластеризации и собственного RAG Google предлагает Gemini Embedding 2.
Это уже мультимодальная embedding-модель: в одно embedding space можно переводить текст, изображения, видео, аудио и PDF. Input ограничен 8192 токенами, а размер embedding можно выбирать от 128 до 3072 dimensions.
Text embeddings стоят $0,20 за миллион токенов; image input — $0,45 за миллион токенов, или ориентировочно $0,00012 за изображение. Batch снижает стоимость примерно вдвое.
Для старых text-only сценариев остается gemini-embedding-001.
Managed Agents
Gemini API в 2026 году содержит уже не только модели, но и готовую агентную инфраструктуру. Managed Agents позволяют одним API-вызовом получить agent harness с Linux sandbox, выполнением кода, файловой системой и web access.
Основной general-purpose агент называется Antigravity Agent. Актуальная версия использует Gemini 3.8 Flash по умолчанию. Агент может планировать задачу, выполнять код, работать с файлами и искать информацию в интернете внутри изолированной среды Google.
Его можно расширять собственными system instructions, tools, MCP-серверами, функциями и файлами вроде AGENTS.md и SKILL.md. Для управления расходами предусмотрен max_total_tokens, ограничивающий суммарный input, output и thinking внутри agent loop.
Managed Agents пока находятся в preview, поэтому для критичных production-процессов их действия необходимо контролировать и отдельно проверять.
Deep Research
Отдельный managed agent — Gemini Deep Research. Он предназначен не для быстрого chat-response, а для длительного исследования: сам строит план, делает поисковые запросы, читает источники, анализирует данные и формирует отчет с citations.
Deep Research доступен только через Interactions API и запускается в background mode. Есть обычный deep-research-preview-04-2026 и более глубокий deep-research-max-preview-04-2026.
Google приводит ориентир примерно $1–3 за типичную задачу Deep Research средней сложности, но это не фиксированная цена. Агент оплачивается по фактическим token usage и tool calls, поэтому сложное исследование с большим количеством Search запросов может стоить заметно больше.
Для обычного FAQ или чат-бота такой агент избыточен. Он нужен там, где сама задача подразумевает десятки поисков, чтение большого количества источников и многошаговый анализ.
Совместимость с OpenAI SDK
Google предлагает compatibility layer для OpenAI API. В простом случае приложение меняет API key, base_url и model ID:
from openai import OpenAI
client = OpenAI(
api_key="GEMINI_API_KEY",
base_url="https://generativelanguage.googleapis.com/v1beta/openai/"
)
response = client.chat.completions.create(
model="gemini-3.8-flash",
messages=[
{"role": "user", "content": "Explain how AI works"}
]
)
Это удобно для быстрого тестирования Gemini в существующем приложении. Однако Google прямо рекомендует нативный Gemini API, если приложение не обязано оставаться на OpenAI schema.
Причина проста: compatibility layer не отображает возможности Gemini один к одному. File API, отдельные built-in tools, Live API и часть agentic-функций требуют нативного интерфейса или дополнительной ручной логики.
Поэтому OpenAI compatibility хорош как быстрый migration path, но для нового продукта лучше строить интеграцию сразу на Interactions API.
Использование Gemini API в PHP
Официальных Google GenAI SDK для PHP сейчас нет. Google прямо рекомендует для языков без SDK, включая PHP, использовать Direct REST API.
Простейший пример на чистом PHP:
<?php
$apiKey = $_ENV['GEMINI_API_KEY'];
$payload = [
'model' => 'gemini-3.8-flash',
'input' => 'Кратко объясни, что такое dependency injection.',
];
$ch = curl_init('https://generativelanguage.googleapis.com/v1/interactions');
curl_setopt_array($ch, [
CURLOPT_POST => true,
CURLOPT_RETURNTRANSFER => true,
CURLOPT_HTTPHEADER => [
'Content-Type: application/json',
'x-goog-api-key: ' . $apiKey,
],
CURLOPT_POSTFIELDS => json_encode($payload, JSON_UNESCAPED_UNICODE),
]);
$response = curl_exec($ch);
if ($response === false) {
throw new RuntimeException(curl_error($ch));
}
$data = json_decode($response, true, flags: JSON_THROW_ON_ERROR);
foreach ($data['steps'] ?? [] as $step) {
if (($step['type'] ?? null) !== 'model_output') {
continue;
}
foreach ($step['content'] ?? [] as $content) {
if (($content['type'] ?? null) === 'text') {
echo $content['text'];
}
}
}
В Laravel такую интеграцию удобнее обернуть в отдельный service class и использовать HTTP Client. API key следует хранить в .env и переносить в config/services.php, а не передавать напрямую в frontend.
Для PHP direct REST имеет еще одно преимущество: вы сразу получаете полный Gemini API, не дожидаясь поддержки новых функций в сторонней библиотеке.
API keys и Google AI Studio
API key создается в Google AI Studio и привязывается к Google Cloud project. С мая 2026 года новые ключи создаются как auth keys, а документация Google требует перейти со старых standard keys: с сентября 2026 года стандартные ключи должны быть отклонены Gemini API.
Поэтому для нового проекта нужно использовать актуальный auth key, а не копировать старую инструкцию с unrestricted Google Cloud API key.
Rate limits применяются на уровне проекта, а не отдельного ключа. Основные ограничения считаются по RPM, input TPM и RPD; конкретные значения зависят от модели и usage tier.
Free Tier и Paid Tier
У Gemini API есть полноценный Free Tier для ряда моделей. Это удобно для разработки и небольших экспериментов, но между бесплатным и платным режимом есть важное различие, которое легко пропустить.
На pricing page Google прямо указывает: данные Free Tier могут использоваться для улучшения продуктов Google, а для Paid Tier — нет.
Paid Tier подключается через Cloud Billing. В AI Studio можно привязать billing account и перейти на платный проект; Google также поддерживает project-level spend caps и общие monthly limits в зависимости от usage tier.
С марта 2026 года обычный $300 Google Cloud Free Trial не применяется к расходам Gemini API.
Конфиденциальность и Zero Data Retention
Для Paid Services Google заявляет, что prompts, system instructions, cached content, загруженные файлы и responses не используются для улучшения продуктов.
Это не означает автоматический Zero Data Retention. Некоторые функции сохраняют данные для работы сервиса или abuse monitoring.
Interactions API по умолчанию хранит conversation state. Если нужно минимизировать state retention, необходимо указывать store: false. Files API сохраняет загруженные файлы до их удаления или expiration, обычные temporary uploads — до 48 часов. Explicit cache тоже хранится до заданного TTL.
Особенно важны Search и Maps. При Grounding with Google Search Google хранит prompt, контекст и generated output до 30 дней для создания grounded results и связанных целей; отключить это хранение при использовании Search нельзя. Для Google Maps также действуют отдельные правила хранения.
Google отдельно указывает, что для workload с гарантированным zero data retention или enterprise data processing agreements следует использовать Vertex AI.
Gemini Developer API и Vertex AI — не одно и то же
Модели Gemini доступны как через Gemini Developer API, так и через инфраструктуру Google Cloud Vertex AI. Это связанные, но не идентичные продукты.
Gemini Developer API через AI Studio проще для старта: API key, быстрый доступ к новым моделям, Free Tier и сравнительно простая тарификация. Для небольшого SaaS, прототипа или обычной backend-функции этого часто достаточно.
Vertex AI рассчитан на более глубокую Google Cloud-интеграцию: IAM, enterprise network configuration, data governance, корпоративный billing и дополнительные enterprise-гарантии. Если компания уже строит инфраструктуру в Google Cloud или имеет жесткие требования к data residency и ZDR, сравнивать нужно уже не только модели, но и два варианта платформы.
Сильная сторона Gemini API — не одна модель, а вся платформа
Если смотреть только на обычную генерацию текста, Gemini можно сравнивать с OpenAI, Claude, Grok или DeepSeek по цене и качеству конкретной модели. Но реальное отличие Google заметнее на уровне всей платформы.
В одном API доступны большой мультимодальный context, Google Search и Maps, анализ URL и файлов, встроенный RAG, code execution, image generation, realtime voice, transcription, TTS, embeddings, видео и managed agents. Для приложения, которому нужны несколько таких функций одновременно, это уменьшает количество отдельных интеграций.
Обратная сторона той же ширины — API быстро меняется. В одном проекте могут одновременно использоваться GA-, Preview- и Legacy-функции, а разные возможности доступны через Interactions, generateContent или Live API. Поэтому model IDs и endpoint-статус стоит хранить в конфигурации и регулярно проверять deprecations.
Какую модель Gemini выбрать
Для нового универсального приложения логичная отправная точка — Gemini 3.8 Flash. Это текущая GA-модель с миллионным контекстом, сильным набором tools и сравнительно низкой ценой до конца 2026 года.
Gemini 3.5 Flash-Lite имеет смысл тестировать для массовых простых операций, где стоимость и latency важнее максимального качества. Ее можно использовать для классификации, extraction, routing и части sub-agent workload.
Gemini 3.1 Pro Preview стоит подключать там, где сложные eval-задачи показывают реальное преимущество перед Flash. Для каждого запроса использовать ее необязательно, особенно учитывая более высокую цену при контексте свыше 200 тыс. токенов.
Для изображений, голоса, транскрипции и realtime-задач лучше использовать специализированные Gemini-модели, а не пытаться решить все через один text model endpoint.
Итог
Google Gemini API в 2026 году — это уже не просто доступ к конкуренту ChatGPT. Interactions API объединяет обычную генерацию, stateful-диалоги, мультимодальность, tool use и background execution, а вокруг него Google построил отдельные модели для изображений, речи, видео, embeddings и managed agents.
Для разработчика особенно интересны три вещи: миллионный контекст даже у бюджетных моделей, богатый набор встроенных Google tools и возможность выбирать не только модель, но и режим inference — Standard, Flex, Priority или Batch.
Если начинать новый проект сейчас, разумная базовая схема выглядит достаточно просто: Gemini 3.8 Flash через Interactions API как основная модель, Flash-Lite для дешевых массовых операций, собственные evals для проверки Pro, а Search, File Search, Code Execution и специализированные модели подключать только тогда, когда они действительно нужны сценарию.
При таком подходе Gemini API можно рассматривать не как отдельную LLM-интеграцию, а как полноценную платформу для AI-функций приложения.
Официальные источники
- Gemini API: https://ai.google.dev/gemini-api/docs
- Interactions API: https://ai.google.dev/gemini-api/docs/interactions-overview
- API versions: https://ai.google.dev/gemini-api/docs/api-versions
- Models: https://ai.google.dev/gemini-api/docs/models
- Gemini 3.8 Flash: https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash
- Pricing: https://ai.google.dev/gemini-api/docs/pricing
- Function calling: https://ai.google.dev/gemini-api/docs/function-calling
- Structured outputs: https://ai.google.dev/gemini-api/docs/structured-output
- Google Search grounding: https://ai.google.dev/gemini-api/docs/google-search
- File Search: https://ai.google.dev/gemini-api/docs/file-search
- Files API: https://ai.google.dev/gemini-api/docs/files
- URL Context: https://ai.google.dev/gemini-api/docs/url-context
- Code Execution: https://ai.google.dev/gemini-api/docs/code-execution
- Context caching: https://ai.google.dev/gemini-api/docs/caching
- Batch API: https://ai.google.dev/gemini-api/docs/batch-api
- Flex inference: https://ai.google.dev/gemini-api/docs/flex-inference
- Priority inference: https://ai.google.dev/gemini-api/docs/priority-inference
- Image generation / Nano Banana: https://ai.google.dev/gemini-api/docs/image-generation
- Gemini Live: https://ai.google.dev/gemini-api/docs/live
- Audio transcription: https://ai.google.dev/gemini-api/docs/transcribe
- Embeddings: https://ai.google.dev/gemini-api/docs/embeddings
- Agents: https://ai.google.dev/gemini-api/docs/agents
- Deep Research: https://ai.google.dev/gemini-api/docs/deep-research
- OpenAI compatibility: https://ai.google.dev/gemini-api/docs/openai
- API keys: https://ai.google.dev/gemini-api/docs/api-key
- Billing: https://ai.google.dev/gemini-api/docs/billing
- Zero Data Retention: https://ai.google.dev/gemini-api/docs/zdr
По теме: обзор xAI Grok API с актуальными моделями и инструментами.
По теме: обзор DeepSeek API с актуальными моделями и ценами.
Наши проекты
- Anilau
Веб-разработка и запуск цифровых продуктов. - Botmarketing
Telegram-бот, mini-app, витрина и CRM для малого бизнеса. - vietnam.anilau.com
Объявления, местные услуги и практичные гиды по Вьетнаму. - bali.anilau.com
Объявления о товарах и услугах на Бали. - ceylon.anilau.com
Объявления, услуги и полезная информация о Шри-Ланке. - mauricetop.anilau.com
Платформа объявлений и материалов о жизни на Маврикии. - funlab
Платформа для создания и запуска игр с помощью ИИ. - aura
AI-дневник настроения и пространство для творчества. - drained
Telegram Mini App для дневных отметок усталости и восстановления. - vietinfodesk
Практичные гиды, сервисы и помощь для жизни во Вьетнаме. - frau
Визитка уютного кафе в Нячанге с вафлями, завтраками и напитками.
Работаем в партнерстве с креативным агентством Deep.