Обзор xAI Grok API: модели, возможности, примеры и стоимость в 2026 году
Актуальность информации: 29 сентября 2026 года.
Grok начинался как ассистент внутри экосистемы X, поэтому его API долго было легко воспринимать как довольно специфическую альтернативу OpenAI. В 2026 году это уже не так. xAI развивает полноценную платформу для разработчиков: через Grok API доступны reasoning-модели, изображения, файлы, web search и поиск по X, выполнение Python-кода, RAG по собственным документам, MCP, генерация изображений и видео, realtime-голос, распознавание и синтез речи.
Есть и еще одно практическое отличие от многих конкурентов: REST API xAI совместим с форматом OpenAI. Для существующего проекта это заметно снижает стоимость первого эксперимента — во многих случаях достаточно поменять base_url, API key и model ID. При этом для новых интеграций сама xAI рекомендует Responses API, а старый Chat Completions уже относится к legacy-интерфейсам.
В этой статье разберем актуальные модели Grok, Responses API, reasoning, web/X search, работу с файлами, Grok Imagine, Voice API, тарификацию, prompt caching, privacy и подключение Grok из PHP.
Что такое Grok API
Grok API — программный интерфейс xAI для доступа к моделям Grok и связанным сервисам. Основной inference endpoint находится на https://api.x.ai, а авторизация выполняется обычным Bearer API key.
Через API сейчас доступны несколько крупных направлений:
- текстовые и мультимодальные модели Grok;
- Responses API и legacy Chat Completions;
- function calling и Structured Outputs;
- Web Search и X Search;
- Code Execution;
- Files и Collections для работы с документами;
- Remote MCP;
- Grok Imagine для изображений и видео;
- Voice API для speech-to-speech, TTS и STT;
- Batch API и deferred-запросы;
- prompt caching и context compaction.
Ключ создается в xAI Console. Для обычной работы наиболее распространена prepaid-схема: команда заранее покупает credits, которые затем списываются по мере использования API. Для отдельных организаций доступен monthly invoiced billing.
Responses API — основной интерфейс
Если старые примеры xAI часто используют /v1/chat/completions, для новой интеграции лучше начинать с:
POST /v1/responses
xAI называет Responses API основным интерфейсом для text generation, reasoning и tool use. Chat Completions остается совместимым и рабочим, но новые возможности в первую очередь появляются в Responses API.
Минимальный запрос выглядит так:
curl https://api.x.ai/v1/responses \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $XAI_API_KEY" \
-d '{
"model": "grok-4.7",
"input": "Кратко объясни разницу между REST и GraphQL."
}'
Responses API может хранить состояние разговора на стороне xAI. Первый ответ получает ID, после чего следующий запрос можно связать с ним через previous_response_id, не пересылая вручную всю историю.
Хранящиеся Responses доступны до 30 дней. Если приложение хочет полностью контролировать историю самостоятельно, ее можно сохранять локально и передавать в последующих запросах вместе с необходимыми reasoning-данными.
Для Grok 4.7 есть еще одна особенность: Responses API возвращает encrypted reasoning content. Его можно передавать обратно без расшифровки в следующем turn, чтобы модель продолжила работу с предыдущим reasoning state.
OpenAI-compatible API
xAI официально описывает свой REST API как совместимый с OpenAI REST API. Это относится, в частности, к Responses API и Chat Completions.
В Python существующий OpenAI client можно переключить примерно так:
from openai import OpenAI
client = OpenAI(
api_key="XAI_API_KEY",
base_url="https://api.x.ai/v1",
)
response = client.responses.create(
model="grok-4.7",
input="Объясни, как работает dependency injection.",
)
print(response.output_text)
Для быстрого A/B-теста это одно из самых удобных свойств Grok API. Но полную взаимозаменяемость считать гарантированной нельзя: у xAI есть собственные server-side tools, особенности reasoning, X Search, Collections и отдельные media/voice endpoint.
Поэтому простой генератор текста часто переносится почти без изменений, а сложный agentic-проект все равно требует отдельного слоя интеграции.
Актуальные текстовые модели Grok
У xAI довольно необычная нумерация моделей. Например, Grok 4.20 вышел раньше Grok 4.7, поэтому номер нельзя читать как обычную десятичную версию, где 4.20 обязательно «новее» 4.7. На конец сентября 2026 года сама xAI рекомендует Grok 4.7 как основную наиболее способную модель для code, agentic tasks и knowledge work.
Для большинства проектов имеет смысл ориентироваться на следующие варианты:
| Модель | Контекст | Short context input / cached / output | Long context input / cached / output | Особенность |
|---|---|---|---|---|
| Grok 4.7 | 500 тыс. | $2 / $0,50 / $6 | $4 / $1 / $12 | текущая frontier-модель |
| Grok 4.3 | 1 млн | $1,25 / $0,20 / $2,50 | $2,50 / $0,40 / $5 | дешевле, миллионный context |
| Grok 4.20 Reasoning | 1 млн | $1,25 / $0,20 / $2,50 | $2,50 / $0,40 / $5 | reasoning + tool calling |
| Grok 4.20 Non-Reasoning | 1 млн | $1,25 / $0,20 / $2,50 | $2,50 / $0,40 / $5 | быстрые задачи без reasoning |
| Grok 4.20 Multi-Agent | 1 млн | $1,25 / $0,20 / $2,50 | $2,50 / $0,40 / $5 | параллельная работа нескольких агентов |
У всех перечисленных моделей порог long-context тарификации начинается с 200 тыс. prompt-токенов. Как только prompt достигает этого порога, повышенная ставка применяется ко всему запросу, а не только к токенам после 200 тыс.
Кроме них доступны Grok 4.5 и 4.6, но для нового проекта без специальных причин логичнее сначала тестировать 4.7 и более дешевые 4.3/4.20.
Grok 4.7
Grok 4.7 вышел 21 сентября 2026 года и сейчас позиционируется xAI как frontier-модель для coding, agentic tasks и knowledge work.
Модель принимает текст и изображения и возвращает текст. Context window составляет 500 тыс. токенов, а отдельного фиксированного text output limit в документации xAI для нее сейчас не указано. Knowledge cutoff — май 2026 года.
Grok 4.7 поддерживает function calling, Structured Outputs и reasoning с уровнями:
low;medium;high;xhigh.
По умолчанию используется high. Полностью отключить reasoning у 4.7 нельзя.
При prompt меньше 200 тыс. токенов стоимость составляет $2 за миллион входных, $0,50 за миллион cached input и $6 за миллион output. При длинном контексте ставки удваиваются до $4/$1/$12.
Grok 4.7 поддерживает Responses API, Chat Completions, web search, X search и code execution. Именно ее xAI сейчас рекомендует как основной вариант для разработки и agentic-задач.
Grok 4.3 и Grok 4.20
Если Grok 4.7 — текущий выбор для максимальных возможностей, Grok 4.3 и семейство 4.20 интересны ценой и миллионным контекстом.
Grok 4.3 имеет context window 1 млн токенов и стоит $1,25/$2,50 за миллион input/output при short context. Cached input — $0,20. Для prompt от 200 тыс. токенов цена повышается до $2,50/$5.
У 4.3 можно регулировать reasoning, включая сценарии без него. Это делает модель полезной там, где сложный reasoning нужен не для каждого запроса.
Grok 4.20 представлен как минимум в трех важных вариантах:
- reasoning;
- non-reasoning;
- multi-agent.
Reasoning и non-reasoning версии имеют одинаковую базовую цену и миллионный context. Выбор зависит от того, нужно ли модели тратить вычисления на внутренний анализ или важнее быстрый прямой ответ.
Grok 4.20 Multi-Agent
Отдельно интересен Grok 4.20 Multi-Agent, находящийся в beta. Вместо одного agent loop модель запускает несколько агентов, которые параллельно исследуют разные части задачи, после чего leader agent объединяет результаты.
Это рассчитано прежде всего на deep research и сложные многошаговые задачи. Multi-Agent можно использовать с Web Search, X Search, Code Execution и Collections Search.
Параметр reasoning effort здесь имеет необычный смысл: он управляет не только глубиной reasoning, а количеством работающих агентов. xAI показывает сценарии с 4 и 16 агентами. Вариант с 16 агентами потребляет значительно больше токенов и имеет смысл только для действительно сложного исследования.
В наружный ответ при этом не обязательно выводится вся внутренняя дискуссия команды: API возвращает tool calls и финальный ответ leader agent.
Reasoning и encrypted reasoning
У Grok 4.7 reasoning нельзя полностью выключить. Разработчик регулирует его интенсивность через reasoning.effort.
Например:
{
"model": "grok-4.7",
"reasoning": {
"effort": "medium"
},
"input": "Проанализируй архитектуру этой системы и найди потенциальные точки отказа."
}
Чем выше reasoning effort, тем больше вычислений модель может потратить на задачу. Это влияет и на latency, и на стоимость, потому что reasoning tokens учитываются в usage.
Responses API возвращает reasoning в encrypted form. Приложению не нужно и не следует пытаться расшифровывать внутренний reasoning; блок передается обратно в следующий запрос как часть предыдущего state.
Для длинных agent loop это важно: модель может продолжать многошаговую работу, не теряя внутренний контекст предыдущего шага.
Function calling
Как и OpenAI, Grok умеет выбирать и вызывать функции приложения. Разработчик описывает функцию и ее JSON Schema, модель возвращает структурированный tool call, а реальное действие выполняет backend.
Например:
{
"type": "function",
"name": "get_order",
"description": "Получить данные заказа",
"parameters": {
"type": "object",
"properties": {
"order_id": {
"type": "string"
}
},
"required": ["order_id"]
}
}
Пользователь может написать: «Проверь заказ 54821 и скажи, когда его отправили». Grok решит вызвать get_order, приложение проверит пользователя и выполнит запрос к базе, после чего результат можно вернуть модели для формирования обычного ответа.
Function calling не должен заменять бизнес-логику. Даже если модель правильно выбрала функцию, backend должен отдельно проверять авторизацию, входные параметры и возможность выполнить операцию.
Structured Outputs
Для backend-сценариев xAI поддерживает Structured Outputs. Через response_format можно потребовать обычный JSON object либо JSON, строго соответствующий заданной JSON Schema.
Это позволяет использовать Grok для:
- извлечения полей из документов;
- классификации запросов;
- формирования объектов API;
- разбора входящих писем;
- подготовки данных для CRM;
- передачи результата следующему шагу agentic workflow.
При использовании поддерживаемых элементов схемы xAI гарантирует соответствие ответа указанной структуре. Это надежнее, чем обычная инструкция «верни только JSON».
Web Search
Встроенный web_search дает Grok доступ к актуальному интернету. Модель может сама выполнять поисковые запросы, открывать страницы и использовать найденную информацию при формировании ответа.
Пример:
{
"model": "grok-4.7",
"input": "Найди последние изменения в PHP и кратко перечисли главное.",
"tools": [
{
"type": "web_search"
}
]
}
Web Search стоит $5 за 1000 вызовов плюс обычная стоимость токенов модели. Через тот же tool можно включить поиск изображений, после чего найденные изображения попадают в контекст модели.
Это важно учитывать при расчете agentic-сценария: один пользовательский запрос может породить несколько поисков, поэтому стоимость определяется не только токенами финального ответа.
X Search — главное специфическое преимущество Grok
У xAI есть встроенный инструмент, которого нет в таком виде у других крупных LLM API: X Search. Он позволяет Grok искать публикации, пользователей и треды непосредственно в X.
Например:
{
"model": "grok-4.7",
"input": "Что сейчас обсуждают разработчики в X по поводу новой версии Laravel?",
"tools": [
{
"type": "x_search"
}
]
}
Для мониторинга общественной реакции, трендов, breaking news, обсуждений продукта или конкретного события это может быть серьезным преимуществом Grok API. Модель получает данные не из собственного knowledge cutoff, а из актуальной ленты X.
С 21 сентября 2026 года тарификация X Search изменилась. Вместо простой цены за вызов учитываются полученные элементы: $5 за 1000 fetched posts и $10 за 1000 fetched user profiles. Если один и тот же пост найден двумя поисками, он может учитываться дважды.
Responses API возвращает подробные usage-счетчики, включая количество найденных постов и профилей, поэтому реальную стоимость поиска можно отслеживать по каждому запросу.
Code Execution
Встроенный Code Execution позволяет Grok запускать Python в sandbox-среде. Инструмент полезен для вычислений, статистики, анализа данных и ситуаций, когда модель должна не «прикинуть» результат, а реально выполнить программу.
Стоимость — $5 за 1000 вызовов плюс токены модели.
Инструмент можно комбинировать с поиском и файлами. Например, Grok может найти данные в интернете, загрузить информацию из прикрепленного CSV, выполнить Python-анализ и затем сформировать итоговый отчет.
Remote MCP
Responses API поддерживает Remote MCP tools. Это позволяет подключать совместимые MCP-серверы и давать модели доступ к внешним системам через стандартизированный протокол.
Отдельной платы xAI за сам вызов Remote MCP tool сейчас нет; оплачиваются токены, которые модель использует при работе с ним. При этом стоимость или ограничения самого внешнего MCP-сервиса, конечно, могут быть отдельными.
MCP особенно полезен там, где не хочется вручную описывать десятки custom functions под каждую внешнюю систему. Но права доступа и критичные операции все равно лучше ограничивать на стороне сервера, а не полагаться только на инструкции модели.
Работа с файлами
Files API позволяет загружать документы и прикреплять их к сообщениям Grok. Максимальный размер одного файла — 512 MB.
Поддерживаются PDF, Markdown, TXT, CSV, JSON, исходный код и другие текстовые форматы. Можно прикрепить сразу несколько документов и задавать вопросы по ним.
Интересно, что attachment автоматически превращает обычный запрос в agentic workflow. xAI подключает внутренний attachment_search, а Grok сам ищет подходящие части документа вместо простой отправки всего файла в контекст.
Такой поиск стоит $10 за 1000 вызовов инструмента плюс обычные токены.
Файлы можно использовать и вместе с Code Execution, например чтобы Grok нашел нужные данные в CSV, затем написал Python и построил расчет.
Collections: встроенный RAG
Для постоянной базы знаний предназначены Collections. В отличие от обычных file attachments, это persistent-хранилище документов с embedding index и semantic search.
В Collection можно загружать документы, группировать их, настраивать chunking и embeddings и добавлять metadata. Поиск можно ограничивать фильтрами, например автором, категорией или другим атрибутом.
В Responses API доступен инструмент collections_search / file_search. Его стоимость — $2,50 за 1000 вызовов плюс токены найденного контекста и ответа модели.
Для небольшого RAG-проекта это позволяет обойтись без отдельной vector database. Для больших систем с собственными требованиями к retrieval и ranking внешняя инфраструктура все равно может дать больше контроля.
Prompt caching
xAI автоматически кеширует одинаковый prefix последовательных запросов. Если начало conversation совпадает, повторно использованные токены могут обслуживаться из cache и стоить существенно дешевле.
Для Grok 4.7 обычный short-context input стоит $2 за миллион токенов, а cached input — $0,50. Для Grok 4.3 и 4.20 разница еще заметнее: $1,25 против $0,20.
При этом cache hit не гарантирован. Запросы могут попасть на разные серверы или cache entry может быть вытеснен.
xAI рекомендует использовать:
prompt_cache_keyв Responses API;- заголовок
x-grok-conv-idв Chat Completions.
Это помогает направлять запросы одной conversation на тот же сервер и значительно повышает вероятность cache hit.
Context Compaction
Для длинных agent loop одного caching недостаточно: история продолжает расти, в ней накапливаются tool outputs и старые turns.
xAI предлагает Context Compaction. API сворачивает длинную историю в компактный opaque item, который сохраняет существенное состояние — system instructions, файлы, reasoning и важные результаты предыдущих шагов.
На следующем запросе вместо всей старой переписки передается этот compacted context. Это уменьшает input cost, latency и риск того, что модель начнет отвлекаться на давно неактуальные детали.
Для длинных автономных процессов эта функция может быть важнее номинального максимального context window.
Batch API
Для массовой фоновой обработки доступен Batch API. Он позволяет поставить множество запросов в очередь, а результаты обычно готовы в пределах 24 часов.
В отличие от OpenAI или Anthropic, где batch часто ассоциируется с фиксированной 50-процентной скидкой, у xAI скидка зависит от модели.
На конец сентября 2026 года для Grok 4.3 и семейства Grok 4.20 действует скидка 20% на токены в Batch API. Grok 4.7 Batch API пока не поддерживает.
Batch поддерживает не только text chat, но и часть image/video операций и server-side tools. Это делает его удобным для массовой классификации, анализа документов, генерации контента и других задач без realtime-требований.
Deferred Chat Completions
Для legacy Chat Completions есть отдельный deferred-режим. Приложение запускает запрос, сразу получает request_id, а результат забирает позже.
Готовый ответ можно получить один раз в течение 24 часов, после чего он удаляется.
Для новой архитектуры лучше ориентироваться на Responses API и Batch там, где это возможно. Deferred Chat Completions полезен в основном для существующих систем, уже построенных вокруг /v1/chat/completions.
Priority Processing
Для latency-sensitive задач xAI предлагает Priority Processing. В request body можно добавить:
{
"service_tier": "priority"
}
Если priority capacity доступна, запрос получает более высокий приоритет. Ответ содержит фактически примененный service_tier, поэтому приложение может логировать, был ли запрос реально обслужен как priority.
Priority имеет смысл для user-facing endpoint, где время первого токена влияет на UX. Для background processing экономически разумнее использовать обычный tier или Batch.
Prompt caching и Priority можно комбинировать: сначала применяется скидка cached tokens, затем соответствующая тарификация priority.
Exact Cost Tracking
У xAI есть полезная для production особенность: каждый inference response содержит точную стоимость именно этого запроса в поле usage.cost_in_usd_ticks.
Один доллар соответствует 10 млрд ticks:
cost_usd = cost_in_usd_ticks / 10_000_000_000
Поле учитывает реальный billable cost после caching и стоимость server-side tool calls. Оно доступно не только для обычного текста, но и для streaming, image и video generation.
Это позволяет считать unit economics непосредственно по пользовательскому действию. Например, приложение может без собственной приблизительной токенной математики определить, сколько реально стоило одно исследование, одна обработка документа или один agentic workflow.
Сколько стоит Grok на практике
Возьмем обычный запрос с 100 тыс. входных и 10 тыс. выходных токенов — без инструментов и cache.
| Модель | Стоимость |
|---|---|
| Grok 4.7 | $0,26 |
| Grok 4.3 | $0,15 |
| Grok 4.20 | $0,15 |
Теперь возьмем 250 тыс. input и 10 тыс. output. Здесь уже срабатывает long-context pricing для всего запроса:
| Модель | Стоимость |
|---|---|
| Grok 4.7 | $1,12 |
| Grok 4.3 | $0,675 |
| Grok 4.20 | $0,675 |
Разница показывает, почему максимальный context window не стоит использовать просто потому, что он есть. При переходе порога 200 тыс. токенов ставка повышается для всего prompt.
При реальном agentic-workflow к токенам добавляются Search, Code Execution, file search и другие tool calls. Поэтому точное поле cost_in_usd_ticks зачастую полезнее теоретического расчета из прайс-листа.
Grok Imagine: генерация изображений
Для изображений xAI использует отдельное семейство Grok Imagine.
Актуальный grok-imagine-image-2.0 поддерживает text-to-image и image editing, включая до пяти reference images. Стоимость зависит от resolution и quality:
| Режим | Цена за изображение |
|---|---|
| 1K Low | $0,04 |
| 1.5K Low | $0,05 |
| 2K Low | $0,06 |
| 1K Medium | $0,06 |
| 1.5K Medium | $0,07 |
| 2K Medium | $0,08 |
Использование исходного изображения как input стоит дополнительно $0,01 за image.
Есть и более дешевый grok-imagine-image, который генерирует 1K или 2K изображения по $0,02. Но для нового проекта стоит учитывать направление миграции xAI: старый grok-imagine-image-quality уже объявлен к retirement 2 ноября 2026 года и будет перенаправляться на grok-imagine-image-2.0.
Генерация и редактирование видео
Grok Imagine поддерживает не только изображения, но и видео.
grok-imagine-video-1.5 принимает текст, изображения и audio references и генерирует видео вплоть до 1080p:
- 480p — $0,08 за секунду;
- 720p — $0,14 за секунду;
- 1080p — $0,25 за секунду.
Предыдущий grok-imagine-video дешевле и поддерживает генерацию и редактирование видео до 720p: $0,05/с для 480p и $0,07/с для 720p.
Imagine API поддерживает text-to-video, image-to-video, reference-to-video, video editing и video extension. Поэтому xAI уже можно рассматривать как единую платформу не только для LLM, но и для media-generation.
Voice API
У xAI есть полноценное голосовое направление из трех частей.
Speech-to-Speech работает realtime через /v1/realtime. Актуальная модель стоит $0,08 за минуту audio и поддерживает tool use, поэтому на ней можно строить разговорных ассистентов без отдельной цепочки STT → LLM → TTS.
Speech-to-Text доступен в batch и streaming. Цена REST-транскрипции — $0,10 за час аудио, streaming — $0,20 за час. Модель поддерживает 25 языков.
Text-to-Speech стоит $15 за миллион символов и поддерживает выразительные multilingual voices и telephony codecs.
Для voice-приложения это уже полноценная альтернатива отдельному набору сервисов распознавания речи, LLM и синтеза голоса.
Работа с изображениями как input
Основные Grok-модели 4.7, 4.3 и 4.20 умеют анализировать изображения. Максимальный размер одного изображения — 20 MiB, поддерживаются JPEG и PNG.
Это отдельная функция от Grok Imagine. Обычная text-модель получает изображение как часть контекста и отвечает текстом; Imagine занимается созданием и редактированием изображений.
Web Search и X Search также могут передавать найденные изображения модели для visual understanding. Для X доступен и анализ найденных видео.
Model aliases и стабильность production
xAI использует несколько типов model ID.
Имя вроде grok-4.3 обычно является alias на актуальный стабильный вариант. Суффикс -latest также следует за новой версией, а model ID с конкретной датой фиксирует определенный release.
Для обычного приложения alias удобен: улучшения модели приходят без изменений в коде. Для workflow, где важна полная воспроизводимость — например, автоматизированного extraction или регулируемого процесса — лучше фиксировать конкретную версию и обновлять ее после собственных evals.
Это особенно актуально для xAI, которая достаточно быстро выводит и снимает модели. В мае 2026 года, например, были retired Grok 3, ранние Grok 4 и grok-code-fast-1, а старые slugs начали перенаправляться на Grok 4.3.
Grok 4.7 Fast — не публичная API-модель
Можно встретить название Grok 4.7 Fast, но здесь есть важное ограничение. Это та же модель на более быстрой инфраструктуре, однако она доступна только в Cursor и Grok Build.
В публичном xAI API grok-4.7-fast сейчас использовать нельзя. Обычный Grok 4.7 доступен по стандартной цене $2/$6, а Fast в соответствующих продуктах тарифицируется отдельно и дороже.
Для API-интеграции поэтому не стоит строить архитектуру вокруг Fast-варианта, пока xAI не откроет его как публичную модель.
Использование Grok API в PHP
Для PHP проще всего использовать обычный REST API. Благодаря OpenAI-compatible формату интеграция не требует специальной клиентской библиотеки.
Пример с Responses API:
<?php
$apiKey = $_ENV['XAI_API_KEY'];
$payload = [
'model' => 'grok-4.7',
'input' => 'Кратко объясни, что такое dependency injection.',
];
$ch = curl_init('https://api.x.ai/v1/responses');
curl_setopt_array($ch, [
CURLOPT_POST => true,
CURLOPT_RETURNTRANSFER => true,
CURLOPT_HTTPHEADER => [
'Authorization: Bearer ' . $apiKey,
'Content-Type: application/json',
],
CURLOPT_POSTFIELDS => json_encode(
$payload,
JSON_UNESCAPED_UNICODE
),
]);
$response = curl_exec($ch);
if ($response === false) {
throw new RuntimeException(curl_error($ch));
}
$data = json_decode(
$response,
true,
flags: JSON_THROW_ON_ERROR
);
foreach ($data['output'] ?? [] as $item) {
if (($item['type'] ?? null) !== 'message') {
continue;
}
foreach ($item['content'] ?? [] as $content) {
if (($content['type'] ?? null) === 'output_text') {
echo $content['text'];
}
}
}
В Laravel удобнее вынести работу с xAI в отдельный service class и использовать встроенный HTTP Client. API key следует хранить в .env, а получать через config/services.php, чтобы прикладной код не зависел напрямую от environment variables.
Ключ нельзя передавать в frontend. Запросы должны идти через backend, который контролирует пользователя, rate limits, доступные tools и финансовые ограничения.
API keys, billing и команды
Работа с API начинается с xAI Console: создается account/team, покупаются credits и генерируется API key.
Наиболее распространенная схема — prepaid credits. Организация заранее пополняет баланс и видит расход в Usage Explorer. Для компаний, которым нужна постоплата по счету, есть monthly invoiced billing, но его нужно отдельно запросить.
Управляющие операции вынесены в отдельный Management API и используют отдельный Management API key. Это позволяет не смешивать inference key приложения и ключи, имеющие доступ к управлению Collections, team settings, billing и другим административным функциям.
Rate limits
Rate limits зависят от модели и usage tier. xAI считает как минимум requests per second и tokens per minute.
Например, у Grok 4.7 начальный опубликованный лимит существенно выше, чем у Multi-Agent: frontier-модель рассчитана на большой обычный inference-трафик, тогда как multi-agent research запускает несколько агентов и по определению тяжелее.
При росте usage команда переходит на более высокие tiers; xAI указывает, что достигнутый tier затем не понижается.
Для bulk processing, который не должен конкурировать с realtime-трафиком за обычные rate limits, лучше использовать Batch API.
Региональный endpoint в США
По умолчанию https://api.x.ai является global endpoint, и xAI может маршрутизировать запрос между регионами.
Если нужно гарантировать обработку основного inference в США, есть:
https://us.api.x.ai/v1
На конец сентября 2026 года US endpoint поддерживает Grok 4.7 и 4.6. Token usage стоит на 10% дороже global endpoint.
Гарантия распространяется на API request handling, model inference, moderation и retained request data. Но Files, Collections, server-side tools и сетевой маршрут клиента под эту гарантию не входят.
Поэтому US endpoint полезен как инфраструктурная возможность, но его нельзя автоматически считать полноценным решением любых требований data residency.
Конфиденциальность данных
xAI заявляет, что не использует API inputs и outputs для обучения моделей без явного разрешения клиента.
По умолчанию API requests и responses сохраняются на серверах в зашифрованном виде на 30 дней для проверки возможных злоупотреблений, после чего удаляются.
Для команд с более жесткими требованиями есть Zero Data Retention. ZDR включается на уровне всей команды и означает, что prompts и responses не записываются на диск.
Но у ZDR есть существенная цена в функциональности. Функции, которым нужно server-side storage, становятся недоступны или ограничиваются — среди них stateful Responses, Files, Collections и Batch API.
Поэтому ZDR стоит включать не «для большей приватности вообще», а тогда, когда этого действительно требуют compliance-условия проекта.
safety_identifier для пользовательских сервисов
В сентябре 2026 года xAI добавила поле safety_identifier. Приложение может передавать непрозрачный стабильный ID конечного пользователя вместе с запросом.
Если нарушение policy связано с действиями конкретного пользователя, xAI может привязать событие к этому identifier, а не к API key целиком.
Для публичного SaaS или API-сервиса это полезнее, чем передавать email или другой персональный идентификатор: приложение может использовать собственный opaque hash и при этом различать конечных пользователей.
Что особенно выделяет Grok API
Если сравнивать только обычную генерацию текста, Grok находится на том же рынке, что OpenAI, Claude, Gemini, DeepSeek и другие API. Но у xAI есть несколько достаточно специфических сильных сторон.
Во-первых, X Search дает нативный доступ к текущим публикациям и тредам X. Для задач, связанных с реакциями пользователей, новостями, трендами и social listening, это действительно отдельный источник данных, а не просто еще один web search.
Во-вторых, API почти полностью строится вокруг знакомой OpenAI-схемы. Это упрощает миграцию и позволяет сравнительно дешево добавить Grok как второй backend.
В-третьих, xAI уже собрала вокруг одной платформы text, image, video и voice generation, документы, RAG, web/X search, code execution и MCP. То есть Grok API становится не одной моделью, а достаточно широкой AI-инфраструктурой.
Наконец, точный cost_in_usd_ticks в каждом response очень удобен для приложений, где нужно считать расходы по конкретному пользователю или операции, а не восстанавливать их приблизительно из token usage и постоянно меняющегося прайс-листа.
Ограничения, которые стоит учитывать
У xAI есть и особенности, которые нужно учитывать до выбора платформы.
Текущая рекомендуемая Grok 4.7 имеет контекст 500 тыс. токенов, тогда как более дешевые Grok 4.3 и 4.20 дают миллион. При этом после 200 тыс. prompt-токенов цена всего запроса повышается.
Не все возможности доступны у всех моделей: например, Grok 4.7 пока не поддерживает Batch API, а Multi-Agent остается beta-функцией.
Модельная линейка меняется быстро. Старые model slugs xAI иногда перенаправляет на новые модели, что удобно для совместимости, но может незаметно изменить качество, latency и стоимость. Для чувствительных production-workflow лучше фиксировать model version и обновлять ее контролируемо.
И наконец, server-side tools увеличивают стоимость и делают расход менее очевидным заранее. Web Search, X Search, file search или code execution могут вызываться моделью несколько раз за один пользовательский запрос. Поэтому agentic-функции нужно считать на реальном traffic sample, а не только по цене миллиона токенов.
Какую модель Grok выбрать
Для нового проекта, где важны максимальные текущие возможности, первая модель для теста — Grok 4.7. xAI сама рекомендует ее для coding, agents и general knowledge work.
Если важнее стоимость или нужен миллионный контекст, стоит параллельно проверить Grok 4.3 и Grok 4.20. Для простых операций non-reasoning-вариант 4.20 может быть рациональнее, чем постоянный reasoning.
Grok 4.20 Multi-Agent нужен не как обычная модель чата, а для deep research, где действительно полезна параллельная работа нескольких агентов и оправдан значительно больший token usage.
Для изображений лучше использовать grok-imagine-image-2.0, для видео — актуальный Imagine Video, а для разговорных интерфейсов — отдельный Voice API. Не стоит пытаться решить все одной text-моделью только ради единого model ID.
Итог
xAI Grok API в 2026 году — полноценная мультимодальная AI-платформа, а не просто программный доступ к чат-боту Grok. Responses API дает stateful-разговоры, reasoning и server-side tools; Web Search и особенно X Search добавляют актуальные внешние данные; Files и Collections закрывают работу с документами и RAG; Grok Imagine отвечает за изображения и видео, а Voice API — за realtime-голос, TTS и STT.
Для разработчика особенно интересны OpenAI compatibility, встроенный X Search, автоматический prompt caching, context compaction и точный расчет стоимости каждого запроса. При этом нужно учитывать long-context pricing, быстрый жизненный цикл моделей и то, что agentic tools способны заметно увеличить итоговую стоимость пользовательского сценария.
Практический подход здесь тот же, что и с другими современными AI API: не выбирать платформу по одному benchmark или цене токена. Лучше взять несколько реальных задач продукта, сравнить Grok 4.7 с более дешевыми 4.3/4.20, измерить качество, latency и фактический cost_in_usd_ticks, а уже после этого определить, какие запросы действительно стоит отправлять в каждую модель.
Официальные источники
- Grok API overview: https://docs.x.ai/overview
- Quickstart: https://docs.x.ai/developers/quickstart
- Models: https://docs.x.ai/developers/models
- Grok 4.7: https://docs.x.ai/developers/models/grok-4.7
- Grok 4.3: https://docs.x.ai/developers/models/grok-4.3
- Grok 4.20: https://docs.x.ai/developers/models/grok-4.20
- Grok 4.20 Multi-Agent: https://docs.x.ai/developers/model-capabilities/text/multi-agent
- Pricing: https://docs.x.ai/developers/pricing
- Responses API: https://docs.x.ai/developers/rest-api-reference/inference/responses
- Chat Completions: https://docs.x.ai/developers/model-capabilities/legacy/chat-completions
- Structured Outputs: https://docs.x.ai/developers/model-capabilities/text/structured-outputs
- Reasoning: https://docs.x.ai/developers/model-capabilities/text/reasoning
- Web Search: https://docs.x.ai/developers/tools/web-search
- X Search: https://docs.x.ai/developers/tools/x-search
- Files: https://docs.x.ai/developers/files
- Collections: https://docs.x.ai/developers/files/collections
- Prompt Caching: https://docs.x.ai/developers/advanced-api-usage/prompt-caching
- Context Compaction: https://docs.x.ai/developers/advanced-api-usage/context-compaction
- Cost Tracking: https://docs.x.ai/developers/cost-tracking
- Batch API pricing: https://docs.x.ai/developers/pricing
- Deferred Chat Completions: https://docs.x.ai/developers/advanced-api-usage/deferred-chat-completions
- Priority Processing: https://docs.x.ai/developers/advanced-api-usage/priority-processing
- Imagine API: https://docs.x.ai/developers/model-capabilities/imagine
- Voice API: https://docs.x.ai/developers/model-capabilities/audio/voice
- Regional endpoints: https://docs.x.ai/developers/advanced-api-usage/regions
- Security and Zero Data Retention: https://docs.x.ai/developers/faq/security
- Billing: https://docs.x.ai/console/billing
По теме: обзор DeepSeek API с актуальными моделями и ценами.
Наши проекты
- Anilau
Веб-разработка и запуск цифровых продуктов. - Botmarketing
Telegram-бот, mini-app, витрина и CRM для малого бизнеса. - vietnam.anilau.com
Объявления, местные услуги и практичные гиды по Вьетнаму. - bali.anilau.com
Объявления о товарах и услугах на Бали. - ceylon.anilau.com
Объявления, услуги и полезная информация о Шри-Ланке. - mauricetop.anilau.com
Платформа объявлений и материалов о жизни на Маврикии. - funlab
Платформа для создания и запуска игр с помощью ИИ. - aura
AI-дневник настроения и пространство для творчества. - drained
Telegram Mini App для дневных отметок усталости и восстановления. - vietinfodesk
Практичные гиды, сервисы и помощь для жизни во Вьетнаме. - frau
Визитка уютного кафе в Нячанге с вафлями, завтраками и напитками.
Работаем в партнерстве с креативным агентством Deep.