Обзор Moonshot Kimi API: Kimi K3, модели, инструменты, цены и доступ в 2026 году
Актуальность информации: 29 сентября 2026 года.
Kimi долго был известен прежде всего как китайский AI-ассистент с сильной работой по длинному контексту. Но у Moonshot AI есть отдельная developer-платформа — Kimi API Platform, через которую модели Kimi можно подключать к собственным приложениям, агентам и coding-инструментам.
В 2026 году главным продуктом платформы стал Kimi K3: открытая мультимодальная MoE-модель на 2,8 трлн параметров с контекстом в 1 млн токенов, нативным vision, reasoning и tool calling. Рядом остаются более дешевые Kimi K2.6 и специализированный Kimi K2.7 Code. API совместим с форматом OpenAI Chat Completions, поддерживает Structured Outputs, файлы, автоматический context caching, Batch API и набор официальных инструментов для agentic-сценариев.
При этом Kimi API заметно отличается и от OpenAI, и от других китайских платформ вроде DeepSeek или Alibaba Model Studio. Платформа сравнительно компактная, основной endpoint остается stateless Chat Completions, web search прямо сейчас находится в переходном состоянии, а правила обработки данных допускают использование customer content для улучшения моделей, если иное не согласовано отдельно.
Разберем, как устроен Moonshot Kimi API, какие модели доступны, сколько они стоят, как подключить K3 через OpenAI SDK или PHP, что дают cache и tools, где хранятся данные и какие нюансы есть с регистрацией, оплатой и использованием сервиса из разных стран.
Moonshot AI, Kimi и Kimi API — что есть что
Moonshot AI — компания, которая разрабатывает семейство моделей Kimi.
Kimi — пользовательские продукты компании: веб-ассистент, Kimi Code, Kimi Business и другие интерфейсы.
Kimi API Platform — отдельная платформа для разработчиков по адресу:
https://platform.kimi.ai
API и потребительские подписки Kimi оплачиваются отдельно. Подписка на Kimi не превращается в API-баланс, а API pay-as-you-go не дает автоматически преимущества пользовательской подписки.
Основной API endpoint:
https://api.moonshot.ai/v1
Наиболее распространенный интерфейс — OpenAI-compatible Chat Completions:
POST /v1/chat/completions
Через ту же OpenAI-совместимую схему доступны Files и Batch API.
Актуальные модели Kimi
На конец сентября 2026 года основная публичная линейка выглядит так:
| Модель | Контекст | Input | Cache hit | Output | Основной сценарий |
|---|---|---|---|---|---|
| Kimi K3 | 1 млн | $3 / 1M | $0,30 / 1M | $15 / 1M | сложный coding, knowledge work, reasoning, агенты |
| Kimi K2.7 Code | 256 тыс. | $0,95 / 1M | $0,19 / 1M | $4 / 1M | coding agents и длинные задачи разработки |
| Kimi K2.6 | 256 тыс. | $0,95 / 1M | $0,16 / 1M | $4 / 1M | универсальные text/vision/video-задачи |
Для K3 отдельно тарифицируется запись нового cache: на главной странице платформы указано $3 за миллион cache-write токенов. В конце сентября Moonshot также добавила варианты TTL для кеша на 5 минут и 1 час, поэтому перед production-расчетом стоит сверить конкретный режим в актуальном billing интерфейсе.
K2.7 Code и K2.6 стоят одинаково по обычным input/output токенам, но отличаются поведением: K2.7 ориентирован именно на программирование и всегда использует thinking, а K2.6 остается универсальной моделью и позволяет отключить reasoning.
Kimi K3
Kimi K3 — текущая flagship-модель Moonshot AI. Это Mixture-of-Experts модель на 2,8 трлн параметров, в которой для одного токена активируется 16 из 896 экспертов.
Модель построена на архитектурных компонентах Kimi Delta Attention и Attention Residuals и имеет нативное понимание изображений и видео. Контекст — 1 млн токенов.
Основные сценарии, на которые Moonshot ориентирует K3:
- long-horizon software engineering;
- работа с большими codebase;
- сложные agentic workflows;
- анализ больших наборов документов;
- knowledge work;
- глубокий reasoning;
- задачи, где text reasoning связан с изображениями или screenshots.
K3 всегда работает в thinking mode. Полностью отключить reasoning нельзя, но можно выбирать уровень:
low
high
max
По умолчанию используется max.
Это важный нюанс при сравнении стоимости с моделями, где reasoning можно отключить. Даже простой запрос K3 обрабатывает как thinking-model, поэтому для массовой классификации или простого extraction дешевый K2.6 иногда рациональнее.
K3 — открытая модель, но не Apache 2.0
27 июля 2026 года Moonshot опубликовала полные веса Kimi K3 и технический отчет. Поэтому официальный Kimi API — не единственный способ использовать эту модель.
Но лицензия K3 собственная, а не Apache 2.0 или MIT без дополнительных условий.
В обычном приложении модель можно использовать, модифицировать, распространять и разворачивать самостоятельно. Дополнительные условия появляются для очень крупных проектов.
Если компания ведет Model-as-a-Service бизнес и ее совокупная выручка превышает $20 млн за любые последовательные 12 месяцев, для коммерческого использования K3 требуется отдельное соглашение с Moonshot AI.
Если коммерческий продукт превышает 100 млн monthly active users либо $20 млн ежемесячной выручки, в интерфейсе продукта необходимо заметно отображать название Kimi K3.
Для обычного SaaS или внутренней корпоративной системы эти пороги чаще всего неактуальны, но называть K3 просто «моделью с полностью свободной MIT-лицензией» было бы неверно.
Kimi K2.7 Code
Kimi K2.7 Code — отдельная модель для программирования и coding agents.
Контекст составляет 256 тыс. токенов. Модель принимает текст, изображения и видео и поддерживает длинный reasoning и многошаговые tool calls.
Thinking у K2.7 Code отключить нельзя.
Moonshot предлагает и высокоскоростной вариант:
kimi-k2.7-code-highspeed
Документация указывает ориентировочно около 180 токенов в секунду и до 260 токенов в секунду в short-context сценариях, хотя компания отдельно предупреждает, что capacity high-speed модели пока ограничена.
K2.7 имеет смысл использовать не как более дешевую K3 «вообще», а именно для кодовой работы: генерации и редактирования кода, рефакторинга, автономных coding agents и продолжительных задач разработки.
Kimi K2.6
Kimi K2.6 — универсальная 256K-модель для текста, изображений и видео.
В отличие от K2.7 Code и K3, здесь thinking можно выключить:
{
"thinking": {
"type": "disabled"
}
}
Это делает модель удобной для сценариев, где сложный reasoning нужен не всегда. Например, одно и то же приложение может использовать K2.6 без thinking для extraction и включать thinking для анализа документа или более сложной пользовательской задачи.
K2.6 также поддерживает tool calling, но при включенном thinking есть дополнительные ограничения на tool_choice, а официальный web search временно несовместим с thinking mode.
OpenAI-compatible API
Kimi API совместим с форматом OpenAI API. На практике для большинства text-интеграций это означает, что можно использовать официальный OpenAI SDK и изменить два параметра:
base_url = https://api.moonshot.ai/v1
model = kimi-k3
Пример на Python:
from openai import OpenAI
client = OpenAI(
api_key="YOUR_KIMI_API_KEY",
base_url="https://api.moonshot.ai/v1",
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[
{
"role": "user",
"content": "Объясни, что такое dependency injection."
}
],
)
print(response.choices[0].message.content)
Для существующего приложения на OpenAI Chat Completions это заметно упрощает тестирование Kimi.
Но здесь есть важное отличие от OpenAI 2026 года: у Kimi нет публичного аналога OpenAI Responses API как основного нового интерфейса. Главный documented endpoint по-прежнему /v1/chat/completions, а историю разговора приложение хранит и передает самостоятельно.
Обычный запрос через cURL
Минимальный вызов K3:
curl https://api.moonshot.ai/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $MOONSHOT_API_KEY" \
-d '{
"model": "kimi-k3",
"messages": [
{
"role": "user",
"content": "Кратко объясни разницу между REST и GraphQL."
}
]
}'
Для K3 параметры sampling вроде temperature, top_p, presence_penalty и frequency_penalty фактически фиксированы. Документация рекомендует их не передавать.
Reasoning настраивается отдельно:
{
"model": "kimi-k3",
"reasoning_effort": "high",
"messages": [
{
"role": "user",
"content": "Проанализируй архитектуру приложения."
}
]
}
Reasoning нужно сохранять в multi-turn диалоге
У Kimi thinking является частью состояния модели.
При streaming API reasoning приходит отдельно от финального content в поле reasoning_content.
Если разговор продолжается либо модель выполняет tool calls, Moonshot рекомендует помещать в следующий запрос полный assistant message, а не сохранять только финальный текст.
Это особенно важно для K3 и K2.7 Code. Если убрать reasoning state и вернуть модели только обычный content, следующий шаг может потерять важную часть контекста или завершиться ошибкой в tool workflow.
Поэтому persistence layer Kimi-диалога лучше хранить не как простую пару role + text, а как оригинальную структуру response message.
Vision: изображения и видео
K3, K2.7 Code и K2.6 поддерживают text, image и video input.
Изображение можно передать как base64. Для K3 публичные image URLs сейчас не поддерживаются, поэтому варианты — base64 или загруженный файл через ms://<file-id>.
Moonshot рекомендует не превышать 4K для изображений и Full HD для видео: большее разрешение увеличивает token usage и время обработки, но не улучшает понимание модели.
Для крупных видео и файлов, которые используются повторно, лучше Files API.
Structured Outputs
K3 умеет возвращать результат строго по JSON Schema.
Например:
{
"response_format": {
"type": "json_schema",
"json_schema": {
"name": "person",
"strict": true,
"schema": {
"type": "object",
"properties": {
"name": {
"type": "string"
},
"age": {
"type": "integer"
}
},
"required": ["name", "age"],
"additionalProperties": false
}
}
}
}
Это полезно для extraction, классификации, создания DTO, обработки документов и любого сценария, где ответ дальше использует backend.
Важно парсить именно финальный message.content, а не reasoning.
Есть и более простой JSON Mode для ситуаций, где точная schema не нужна.
Function calling и Tool Calls
Kimi поддерживает OpenAI-style function calling.
Приложение описывает функции:
{
"type": "function",
"function": {
"name": "get_order",
"description": "Получить информацию о заказе",
"parameters": {
"type": "object",
"properties": {
"order_id": {
"type": "string"
}
},
"required": ["order_id"]
}
}
}
Модель возвращает tool_calls, backend выполняет реальные функции, затем результаты передаются обратно в messages.
У K3 также есть tool_choice, включая возможность потребовать хотя бы один tool call.
При многошаговой работе снова действует ключевое правило: полный assistant message нужно сохранить без потери reasoning и tool metadata.
Dynamic Tool Loading
У K3 есть интересная функция Dynamic Tool Loading.
Вместо передачи всех tool definitions в самом начале разговора можно добавить отдельное system-сообщение с определением инструмента в тот момент, когда он становится нужен.
Это полезно для больших агентов с десятками и сотнями потенциальных функций. Если передавать все schemas в каждом запросе, они занимают контекст и увеличивают token bill.
Dynamic loading позволяет постепенно подключать нужные tools и сохранять их definition в дальнейшей истории только с момента появления.
Официальные инструменты Kimi
У Kimi API есть отдельная экосистема официальных tools, работающая через Formula.
Среди инструментов, которые платформа перечисляет сейчас:
- Web Search;
- Rethink;
- Random Choice;
- Memory;
- Excel;
- Code Runner;
- QuickJS;
- Date;
- Fetch;
- Convert;
- Base64.
Схема отличается от built-in tool OpenAI. Разработчик сначала получает definitions через Formula /tools, передает их в обычный Chat Completions tools, затем выполняет returned tool call через Formula /fibers и возвращает результат модели.
То есть это готовая tool-инфраструктура, но она все равно строится поверх обычного tool-calling цикла.
С Web Search сейчас есть важная оговорка
Главная страница Kimi API активно показывает Web Search как официальный инструмент, а Help Center указывает отдельную стоимость — $0,004 за вызов.
Но текущая страница Kimi K3 одновременно содержит предупреждение: web_search сейчас обновляется и не рекомендуется для production workflows в ближайшее время.
То же предупреждение есть и в документации K2.6.
Поэтому в конце сентября 2026 года правильно описывать Kimi Web Search как существующую функцию платформы, но не как полностью стабильную замену production web search OpenAI, Google или Perplexity. Перед использованием нужно проверить актуальный статус именно на момент интеграции.
File API и вопросы по документам
Kimi API умеет загружать документы и извлекать из них содержимое.
Типичный процесс такой:
- Загрузить файл через
/v1/filesсpurpose="file-extract". - Получить extracted content.
- Поместить само извлеченное содержимое, а не
file_id, в system message. - Задать вопрос модели.
Для изображений и PDF extraction включает OCR.
Документация прямо подчеркивает, что file ID сам по себе не превращается в автоматический retrieval-инструмент. В text Q&A модель получает именно извлеченный текст в prompt.
Поддерживается работа с несколькими файлами: каждый extracted document можно добавить отдельным system message.
На пользователя действует лимит до 1000 загруженных файлов, поэтому Moonshot рекомендует удалять ненужные объекты после извлечения и при необходимости хранить extracted text у себя.
Kimi File Q&A — это не готовый vector RAG
Механизм file-based Q&A заметно проще OpenAI File Search или Gemini File Search.
Kimi извлекает документ, а затем весь нужный content отправляется в контекст модели. Для K3 с миллионным context это может быть очень удобно: сравнительно большой набор документов можно анализировать без отдельной vector database.
Но при десятках тысяч документов такой подход становится дорогим и технически неудобным.
Moonshot сама разделяет Context Caching и RAG: cache особенно хорош для частых вопросов к фиксированному большому контексту, а retrieval лучше подходит для очень больших коллекций, где каждый запрос использует лишь небольшую часть базы.
Context Caching
Автоматический cache — одна из наиболее важных экономических функций Kimi API.
Если несколько запросов имеют одинаковый длинный prefix — например:
- system prompt;
- документацию;
- codebase context;
- tool definitions;
- раннюю историю разговора,
платформа может повторно использовать закешированную часть вместо обычного input inference.
Для K3:
обычный input: $3,00 / 1M
cache hit: $0,30 / 1M
То есть повторный input стоит в десять раз дешевле.
Для K2.7 Code cache hit стоит $0,19 вместо $0,95, а для K2.6 — $0,16 вместо $0,95.
Cache работает автоматически
В обычном режиме Kimi самостоятельно определяет совпадающий prefix. Не нужно создавать cache ID или переписывать API request.
Чтобы запрос вообще мог попасть в prefix cache, предыдущий prompt должен содержать больше 256 токенов.
Самая важная практическая рекомендация проста: стабильный большой контекст нужно ставить в начало messages и не менять его без необходимости. Динамический вопрос пользователя располагается после него.
Moonshot указывает, что в подходящих long-context сценариях caching способен снизить стоимость до 90% и заметно сократить time-to-first-token.
В конце сентября 2026 года платформа также начала разворачивать отдельные варианты TTL на 5 минут и 1 час, что делает расходы на cache write более явными для продолжительных agentic-сессий.
Batch API
Для большого количества фоновых запросов есть Batch API.
Он работает через JSONL:
upload file → create batch → wait → download results
Срок обработки задается через completion_window, типичный вариант — 24h.
Batch дает 40% экономии относительно realtime inference.
Но есть ограничение: текущая документация поддерживает в Batch API только kimi-k2.6 и kimi-k2.5. Kimi K3 и K2.7 Code пока не поддерживаются.
Поэтому для современной K3-задачи Batch не является способом просто получить те же возможности дешевле.
Сколько стоит большой запрос
Возьмем условную задачу с 100 тыс. обычных input-токенов и 10 тыс. output.
| Модель | Стоимость без cache |
|---|---|
| Kimi K3 | $0,45 |
| Kimi K2.7 Code | $0,135 |
| Kimi K2.6 | $0,135 |
Для K3 расчет простой:
100 000 × $3 / 1M = $0,30
10 000 × $15 / 1M = $0,15
Итого: $0,45
Если те же 100 тыс. input полностью попали в cache, input portion снизится до $0,03, а общий запрос будет стоить около $0,18 плюс возможная стоимость cache write.
Поэтому K3 может выглядеть довольно дорогой по headline price, но в coding agents и repeated-document workflows cache заметно меняет реальную экономику.
K3 не относится к самым дешевым китайским API
В этом месте Kimi сильно отличается от DeepSeek или Qwen Flash.
K3 стоит $3/$15 за миллион input/output, то есть по цене находится ближе к западным frontier-моделям, чем к ultra-cheap Chinese inference.
Сильная сторона K3 — не минимальная стоимость токена, а сочетание:
- 1M context;
- always-on reasoning;
- long-horizon coding;
- multimodal understanding;
- agentic tool use;
- open weights.
Если задача простая, K3 экономически может быть избыточен. Для массовой обработки внутри самой платформы есть K2.6, а за пределами Kimi API — множество еще более дешевых моделей.
Kimi K3 и coding agents
Moonshot активно позиционирует Kimi как backend для coding agents.
Документация содержит отдельные инструкции для:
- Claude Code;
- Codex;
- OpenCode;
- OpenClaw;
- Hermes Agent;
- других coding-инструментов.
Сам API OpenAI-compatible, поэтому agent, который умеет настраивать custom base URL, зачастую подключается без отдельного SDK.
Для K3 особенно важны длинный context, multimodal input и tool calling: модель может работать с большой codebase, терминальными инструментами и screenshots в одном agent loop.
Kimi Code и Kimi API — разные продукты
Kimi Code, Kimi Membership и Kimi API имеют отдельную тарификацию.
Это важно, потому что название «Kimi Code» может создавать впечатление, что платная подписка пользователя дает API allowance для coding tools. Это не так.
Если Claude Code, Codex, OpenClaw или другой инструмент работает через ваш API key с api.moonshot.ai, расход идет по pay-as-you-go Kimi API и его rate limits.
Регистрация и API key
Для разработчика используется:
https://platform.kimi.ai
Процесс:
- Зарегистрироваться или войти в Kimi account.
- Открыть API Platform.
- Пополнить API-баланс.
- Создать ключ в разделе API Keys.
- Скопировать ключ и сохранить его в secret storage.
Для K3 нужен хотя бы один успешный top-up. Минимальный cumulative top-up для разблокировки K3 сейчас составляет $1.
Новый API account сам по себе не гарантирует бесплатный inference-баланс, поэтому ключ без средств может быть создан, но реальные запросы потребуют пополнения.
Rate limits зависят от суммы пополнений
Kimi использует tier-систему.
По мере роста cumulative top-up аккаунт автоматически получает более высокие лимиты concurrency, RPM, TPM и TPD.
Это отличается от схемы, где rate limit определяется только выбранным платным планом. У Kimi история расходов сама становится частью account tier.
Для production-компаний есть organization verification, enterprise SLA, повышенные limits и возможность согласовать отдельные условия через sales.
Как оплачивается Kimi API
API работает по pay-as-you-go модели.
Здесь есть важный нюанс: опубликованные Kimi help pages сейчас показывают немного разные наборы методов в зависимости от локали и billing setup.
Platform Terms прямо предусматривают credit/debit card как платежный метод. Русскоязычный Help Center указывает Visa, Mastercard и другие основные карты; для подтвержденных организаций возможен банковский перевод через sales.
А англоязычная справка для individual top-up сейчас отдельно упоминает WeChat Pay и Alipay QR, а для business accounts — online payment или bank transfer в зависимости от региона и конфигурации аккаунта.
Поэтому при международной регистрации правильнее ориентироваться на фактические способы оплаты, показанные в вашей API Console, а не предполагать, что один и тот же набор методов доступен всем аккаунтам.
Счета и enterprise billing
В Kimi API Console можно запросить invoice по пополнениям. Для подтвержденных организаций доступны отдельные коммерческие соглашения, банковский перевод, volume discounts и enterprise SLA.
Это отличает API Platform от обычной подписки Kimi: developer product рассчитан не только на индивидуальное использование, но и на прямой B2B-контракт с Moonshot AI.
Юридической стороной международной Kimi OpenPlatform сейчас выступает Moonshot AI PTE. LTD., то есть сингапурская компания.
Можно ли использовать Kimi API из России
Здесь стоит быть осторожным с категоричными утверждениями.
В публичных Terms Kimi OpenPlatform я не нашел отдельного пункта «Russia is prohibited». Условия сформулированы шире: пользователю нельзя находиться под trade restrictions, sanctions или другими применимыми правовыми ограничениями.
Одновременно официальный Kimi Help Center пишет, что API прежде всего рассчитан на supported regions, а доступ из других регионов может зависеть от сетевой доступности и не гарантируется по стабильности. Публичного четкого country whitelist на платформе при этом нет.
Свежие сторонние руководства из РФ сообщают о двух практических проблемах: часть пользователей сталкивается с географическими ограничениями при регистрации, а российские банковские карты не проходят международный payment processing.
Поэтому Kimi API нельзя уверенно описывать как «официально полностью доступный в России». Правильнее сказать так: отдельного публичного запрета РФ в Terms нет, но регистрация и billing могут зависеть от региона и платежного инструмента.
Если прямой аккаунт недоступен, сама Moonshot указывает, что K3 предоставляется и через inference partners. Для open-weight K3 остается и отдельный путь самостоятельного deployment.
Нужно ли использовать VPN
Официальная документация не предлагает VPN как способ обхода региональных ограничений.
Если платформа не дает зарегистрироваться или пополнить account из конкретной юрисдикции, маскировать страну регистрации — плохая production-стратегия: это создает риск блокировки аккаунта и потери доступности API.
Для коммерческого проекта разумнее использовать поддерживаемый международный аккаунт, официальный inference partner либо self-host open weights в соответствии с лицензией K3.
Где хранятся данные
Международная Kimi OpenPlatform управляется Moonshot AI PTE. LTD. в Сингапуре.
Privacy Policy прямо говорит, что собранная информация хранится на защищенных серверах в Singapore. При необходимости данные могут передаваться через границы с применением соответствующих safeguards.
Это заметное отличие от DeepSeek official API, где основной data location связан с Китаем.
Для европейских пользователей в Privacy Policy есть отдельный раздел, описывающий GDPR-подобные права и legal bases processing.
Использует ли Kimi API данные для обучения моделей
Здесь нельзя автоматически применять правило «commercial API data is never used for training».
Platform Terms прямо разрешают Moonshot использовать Customer Content для предоставления, поддержки, развития и улучшения Services.
Privacy Policy также указывает, что user content может использоваться для улучшения и развития платформы, включая training и refinement underlying machine learning models.
Если организации нужны ограничения на использование customer content для training или model improvement, Terms предлагают согласовать enterprise arrangement или отдельное письменное соглашение с Moonshot AI.
Для confidential code, юридических документов, внутренних корпоративных данных и другой чувствительной информации это нужно учитывать до интеграции.
Это особенно важно для coding agents
К K3 очень естественно подключить Claude Code, Codex или другой agent и дать ему большую часть репозитория.
Но если codebase содержит закрытый исходный код, customer data, secrets или proprietary business logic, вопрос processing terms важнее benchmark модели.
API key, пароли и production credentials вообще не следует помещать в prompt. А перед передачей конфиденциального repository в managed Kimi API компании стоит проверить контрактные ограничения на use of Customer Content и при необходимости перейти на enterprise agreement либо self-hosted K3.
Ограничения по персональным данным
Terms требуют от разработчика самостоятельно иметь законное основание для обработки personal data и предоставлять пользователям необходимые privacy notices.
Отдельно Moonshot запрещает использовать OpenPlatform для обработки Protected Health Information в смысле HIPAA.
То есть Kimi API не стоит выбирать как медицинский data processor только на основании того, что модель хорошо анализирует документы.
Для приложений с user data нужно самостоятельно учитывать трансграничную передачу в Singapore и применимое локальное законодательство.
Kimi API в PHP
Отдельный официальный PHP SDK не нужен: OpenAI-compatible API вызывается обычным HTTP.
Пример:
<?php
$apiKey = $_ENV['MOONSHOT_API_KEY'];
$payload = [
'model' => 'kimi-k3',
'messages' => [
[
'role' => 'user',
'content' => 'Кратко объясни, что такое dependency injection.',
],
],
];
$ch = curl_init('https://api.moonshot.ai/v1/chat/completions');
curl_setopt_array($ch, [
CURLOPT_POST => true,
CURLOPT_RETURNTRANSFER => true,
CURLOPT_HTTPHEADER => [
'Authorization: Bearer ' . $apiKey,
'Content-Type: application/json',
],
CURLOPT_POSTFIELDS => json_encode(
$payload,
JSON_UNESCAPED_UNICODE
),
]);
$response = curl_exec($ch);
if ($response === false) {
throw new RuntimeException(curl_error($ch));
}
$data = json_decode(
$response,
true,
flags: JSON_THROW_ON_ERROR
);
echo $data['choices'][0]['message']['content'] ?? '';
В Laravel удобнее использовать HTTP Client:
$response = Http::withToken(config('services.kimi.key'))
->post('https://api.moonshot.ai/v1/chat/completions', [
'model' => 'kimi-k3',
'messages' => [
[
'role' => 'user',
'content' => 'Кратко объясни dependency injection.',
],
],
]);
$text = $response->throw()->json('choices.0.message.content');
API key лучше хранить в .env, а получать через config/services.php.
Во frontend ключ передавать нельзя: backend должен контролировать пользователей, rate limits, tool calls и расходы.
Чего в Kimi API сейчас нет
По ширине платформы Kimi пока заметно уступает OpenAI, Gemini и Alibaba Model Studio.
В публичной developer-платформе сейчас нет сопоставимого набора собственных endpoint для:
- генерации изображений;
- генерации видео;
- realtime speech-to-speech;
- TTS;
- STT;
- embeddings;
- fully managed vector File Search;
- managed agent runtime уровня OpenAI Agents API или Google Managed Agents.
Потребительский Kimi может иметь функции, которых нет в API. В частности, Help Center прямо говорит, что API для PPT generation и Deep Research сейчас отсутствует, хотя эти возможности доступны в пользовательском продукте.
Поэтому Kimi API стоит оценивать прежде всего как сильный multimodal LLM backend для reasoning, coding, long-context и tool-driven agents, а не как универсальную media AI platform.
Облачный Kimi API и self-hosted K3 — разные варианты
Официальный Kimi API не предлагает стандартный on-premises deployment через API Platform.
Но K3 имеет открытые веса, поэтому технически модель можно развернуть самостоятельно либо использовать у стороннего inference provider.
Это два разных варианта.
Moonshot API дает managed inference, cache, billing, Files, Formula tools и готовую инфраструктуру.
Self-host K3 дает контроль над данными и моделью, но 2,8 трлн параметров делают собственное развертывание чрезвычайно тяжелым по инфраструктуре. Даже при высокой sparsity это не модель уровня «скачать на один обычный VPS».
Практически для большинства небольших компаний более реалистичен либо официальный API, либо внешний inference partner, а не полноценный самостоятельный K3 cluster.
Когда Kimi API особенно интересен
K3 имеет смысл тестировать, если продукту нужен действительно длинный контекст и сложное агентное поведение:
- coding agents;
- анализ крупной codebase;
- работа с большим пакетом документов;
- юридический и патентный анализ;
- long-horizon research workflow;
- мультимодальный анализ screenshots и видео;
- сложные tool-calling агенты;
- задачи, где важно иметь путь к open weights.
Для простого чат-бота или классификатора K3 часто будет избыточным по цене и reasoning budget.
Какую модель выбрать
Если задача действительно сложная и нужна максимальная текущая capability, начинать стоит с Kimi K3.
Для coding workload, где важны скорость и более низкая цена, стоит отдельно проверить Kimi K2.7 Code и особенно его HighSpeed-вариант.
Для универсального backend, где часть запросов простая, полезен Kimi K2.6: он дешевле K3 и позволяет отключать thinking.
Рациональная production-схема может использовать сразу несколько моделей. Например, K2.6 без thinking выполняет extraction и routing, K2.7 Code обрабатывает типовые coding-задачи, а K3 включается только для действительно сложного long-context reasoning.
Итог
Moonshot Kimi API в 2026 году — довольно необычная альтернатива OpenAI, Claude, Gemini и другим крупным AI API.
Главная ставка платформы сделана не на максимально широкий набор сервисов, а на саму модель: Kimi K3 дает миллионный контекст, нативную мультимодальность, always-on reasoning, сильный tool use и long-horizon coding. При этом модель имеет открытые веса, что оставляет путь к независимому inference.
Интеграция технически простая благодаря OpenAI-compatible Chat Completions. Есть Structured Outputs, Files, Batch для K2.6, automatic context caching и официальный tool ecosystem. Но Responses API уровня OpenAI здесь пока нет, Web Search сейчас проходит обновление, а media/audio API заметно меньше, чем у универсальных платформ.
Отдельного внимания требуют организационные вопросы. Международная OpenPlatform работает через сингапурскую Moonshot AI PTE. LTD., данные хранятся в Singapore, а стандартные условия допускают использование customer content для развития и улучшения моделей, если ограничения не согласованы отдельно.
По цене K3 тоже не пытается быть вторым DeepSeek: $3/$15 за миллион токенов — это уже frontier-сегмент. Поэтому главный вопрос при выборе Kimi должен звучать не «дешевле ли он GPT», а «дает ли именно K3 заметное преимущество на нашей длинной и сложной задаче».
Если ответ подтверждается собственными evals, миллионный контекст, automatic caching, сильный agentic coding и open weights делают Kimi одной из наиболее интересных платформ своего класса.
Официальные источники
- Kimi API Platform: https://platform.kimi.ai/
- Quickstart: https://platform.kimi.ai/docs/overview
- Model list: https://platform.kimi.ai/docs/guide/model-list
- Kimi K3: https://platform.kimi.ai/docs/guide/kimi-k3-quickstart
- Kimi K3 pricing: https://platform.kimi.ai/docs/pricing/chat-k3
- Kimi K2.7 Code: https://platform.kimi.ai/docs/guide/kimi-k2-7-code-quickstart
- Kimi K2.6: https://platform.kimi.ai/docs/guide/kimi-k2-6-quickstart
- Thinking models: https://platform.kimi.ai/docs/guide/use-kimi-api-to-complete-chat
- Reasoning effort: https://platform.kimi.ai/docs/guide/reasoning-effort
- Structured output: https://platform.kimi.ai/docs/guide/use-json-mode
- Tool calls: https://platform.kimi.ai/docs/guide/use-kimi-api-to-complete-tool-calls
- Web Search: https://platform.kimi.ai/docs/guide/use-web-search
- Official Tools: https://platform.kimi.ai/docs/guide/official-tools
- File-Based Q&A: https://platform.kimi.ai/docs/guide/use-kimi-api-for-file-based-qa
- Context Caching: https://platform.kimi.ai/docs/guide/use-context-caching-feature-of-kimi-api
- Batch API: https://platform.kimi.ai/docs/guide/use-batch-api
- Billing & Finance: https://www.kimi.ai/help/kimi-api/api-billing-and-finance
- API overview: https://www.kimi.ai/help/kimi-api/api-overview
- API troubleshooting: https://www.kimi.ai/help/kimi-api/api-troubleshooting
- Business cooperation: https://www.kimi.ai/help/kimi-api/api-business-cooperation
- Platform Terms: https://platform.kimi.ai/docs/agreement/modeluse
- Privacy Policy: https://platform.kimi.ai/docs/agreement/userprivacy
- Kimi K3 open-source release: https://www.kimi.com/news/kimi-k3-open-source
- Kimi K3 model weights: https://huggingface.co/moonshotai/Kimi-K3
- Kimi K3 license: https://huggingface.co/moonshotai/Kimi-K3/blob/main/LICENSE
Наши проекты
- Anilau
Веб-разработка и запуск цифровых продуктов. - Botmarketing
Telegram-бот, mini-app, витрина и CRM для малого бизнеса. - vietnam.anilau.com
Объявления, местные услуги и практичные гиды по Вьетнаму. - bali.anilau.com
Объявления о товарах и услугах на Бали. - ceylon.anilau.com
Объявления, услуги и полезная информация о Шри-Ланке. - mauricetop.anilau.com
Платформа объявлений и материалов о жизни на Маврикии. - funlab
Платформа для создания и запуска игр с помощью ИИ. - aura
AI-дневник настроения и пространство для творчества. - drained
Telegram Mini App для дневных отметок усталости и восстановления. - vietinfodesk
Практичные гиды, сервисы и помощь для жизни во Вьетнаме. - frau
Визитка уютного кафе в Нячанге с вафлями, завтраками и напитками.
Работаем в партнерстве с креативным агентством Deep.