Обзор Mistral AI API: модели, агенты, OCR, Voice, цены и open-weight в 2026 году

Актуальность информации: 29 сентября 2026 года.

Mistral AI занимает на рынке AI API довольно необычное место. С одной стороны, это полноценная облачная платформа с Chat Completions, агентами, web search, code interpreter, RAG, OCR, embeddings, транскрипцией и синтезом речи. С другой — значительная часть ключевых моделей Mistral публикуется с открытыми весами, поэтому тот же стек можно использовать не только через облачный API компании, но и на собственной инфраструктуре.

В 2026 году это особенно заметно. Mistral Medium 3.5 позиционируется как frontier-class мультимодальная модель для agentic- и coding-задач, Mistral Small 4 объединяет обычный instruct-режим, reasoning и coding в одной сравнительно дешевой модели, а Mistral Large 3 остается мощной открытой general-purpose моделью. Одновременно платформа получила persistent Conversations, Agents, MCP Connectors, встроенный web search, Code Interpreter, Document Library, OCR 4.1 и семейство голосовых моделей Voxtral.

В этой статье разберем, как устроен Mistral AI API в 2026 году, какие модели имеет смысл использовать, сколько они стоят, чем отличаются Chat Completions и Conversations, как работают reasoning, function calling и агенты, какие возможности есть для документов и голоса и почему open-weight стратегия Mistral может быть важнее небольшой разницы в цене токена.

Что такое Mistral AI Studio

Developer-платформа Mistral сейчас называется Studio. Через нее можно создавать API keys, тестировать модели в Playground, управлять Prompts, Agents, Libraries, Connectors, usage и другими компонентами AI-приложения.

Основной API endpoint:

https://api.mistral.ai/v1

Для обычной stateless-генерации используется:

POST /v1/chat/completions

Для persistent-разговоров и более сложных agentic-сценариев есть:

/v1/conversations
/v1/agents

Кроме них Mistral предоставляет отдельные endpoint для embeddings, OCR, аудио, moderation, batch processing и других задач.

В отличие от OpenAI, который все больше концентрирует новые сценарии вокруг Responses API, Mistral пока сохраняет довольно понятное разделение: Chat Completions для обычных запросов, Conversations и Agents для stateful и tool-based workflow, специализированные API для OCR, аудио и embeddings.

Основные модели Mistral в 2026 году

Названия Mistral могут немного сбивать с толку. Более новое слово Medium не означает, что модель обязательно слабее Large: сейчас именно Mistral Medium 3.5 компания рекомендует как flagship reasoning- и coding-модель, тогда как Large 3 — более ранняя, значительно более дешевая general-purpose модель с открытыми весами.

Основные модели выглядят так:

Модель Контекст Input / Cached / Output за 1 млн токенов Лицензия весов Основной сценарий
Mistral Medium 3.5 256 тыс. $1,50 / $0,15 / $7,50 Modified MIT сложные agentic-, coding- и multimodal-задачи
Mistral Large 3 256 тыс. $0,50 / $0,05 / $1,50 Apache 2.0 мощная универсальная open-weight модель
Mistral Small 4 256 тыс. $0,15 / $0,015 / $0,60 Apache 2.0 дешевые general-purpose, reasoning и coding-задачи
Ministral 3 14B 256 тыс. $0,20 / $0,02 / $0,20 Apache 2.0 сравнительно компактное развертывание
Ministral 3 8B 256 тыс. $0,15 / $0,015 / $0,15 Apache 2.0 легкие и edge-сценарии
Ministral 3 3B 256 тыс. $0,10 / $0,01 / $0,10 Apache 2.0 минимальная стоимость и локальные сценарии

Для большинства новых облачных интеграций логично сначала сравнить Medium 3.5 и Small 4. Large 3 имеет смысл отдельно тестировать там, где важны цена и возможность использовать ту же открытую модель на собственной инфраструктуре.

Mistral Medium 3.5

Mistral Medium 3.5 вышел в апреле 2026 года и сейчас позиционируется как frontier-class мультимодальная модель для agentic- и coding-задач.

Контекст составляет 256 тыс. токенов. Модель поддерживает Structured Outputs, function calling, Document QnA, predicted outputs, reasoning, Agents & Conversations и встроенные tools.

Цена заметно выше других собственных Mistral-моделей:

input:         $1,50 / 1M tokens
cached input:  $0,15 / 1M tokens
output:        $7,50 / 1M tokens

При этом Medium 3.5 опубликован с открытыми весами под Modified MIT license. Это важное отличие от большинства прямых конкурентов уровня Claude или закрытых GPT: если облачный API перестает устраивать по стоимости, latency или требованиям к данным, существует путь к собственному deployment той же модельной семьи.

Mistral Small 4

Mistral Small 4 — одна из самых интересных моделей платформы именно с практической точки зрения. Это Mixture-of-Experts модель с 119 млрд параметров, из которых для одного токена активно около 6,5 млрд.

Главное изменение по сравнению со старой линейкой — объединение нескольких ролей в одной модели. Раньше Mistral развивал отдельные Magistral для reasoning и Devstral для coding. Теперь Small 4 совмещает instruct, reasoning и coding и является рекомендуемой заменой для ряда предыдущих моделей.

Контекст — 256 тыс. токенов, стоимость:

input:         $0,15 / 1M
cached input:  $0,015 / 1M
output:        $0,60 / 1M

Модель поддерживает Chat Completions, Structured Outputs, function calling, Agents & Conversations, built-in tools, Document QnA и Batch API. Веса опубликованы под Apache 2.0.

Для классификации, извлечения данных, внутреннего помощника, недорогого агента и многих обычных backend-функций Small 4 выглядит особенно интересным стартовым вариантом. При цене DeepSeek-класса он одновременно остается частью довольно богатой европейской AI-платформы.

Mistral Large 3

Mistral Large 3 — general-purpose мультимодальная MoE-модель с 675 млрд параметров и примерно 41 млрд активных параметров.

У нее тот же 256-тысячный контекст, Structured Outputs, function calling, Document QnA и Chat Completions. Цена значительно ниже Medium 3.5:

input:         $0,50 / 1M
cached input:  $0,05 / 1M
output:        $1,50 / 1M

Модель опубликована под Apache 2.0, поэтому ее можно рассматривать как компромисс между managed API и самостоятельным размещением.

Само название Large не означает, что сегодня это обязательно главный flagship Mistral. Для нового проекта Medium 3.5 стоит проверять на самых сложных задачах, а Large 3 — как более дешевую и открытую альтернативу.

Ministral 3

Ministral — семейство относительно компактных моделей 3B, 8B и 14B. Все актуальные варианты имеют до 256 тыс. токенов контекста и поддерживают text/vision-сценарии.

Их главная особенность — возможность применять модели там, где большой cloud model избыточен: edge-инфраструктура, локальные сервисы, частные deployment или большое количество простых вызовов.

При API-использовании 3B стоит $0,10/$0,10 за миллион input/output, 8B — $0,15/$0,15, а 14B — $0,20/$0,20.

Если задача хорошо формализована, выбирать Medium 3.5 только потому, что она считается более сильной, экономически не всегда разумно. Маленькая модель может стабильно закрывать extraction, классификацию или routing за долю стоимости.

Как выглядит обычный запрос

Базовый Mistral API использует familiar Chat Completions structure:

curl https://api.mistral.ai/v1/chat/completions \
  -H "Authorization: Bearer $MISTRAL_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "mistral-small-latest",
    "messages": [
      {
        "role": "user",
        "content": "Кратко объясни разницу между REST и GraphQL."
      }
    ]
  }'

Массив messages использует обычные system, user, assistant и tool roles. Для стандартного chatbot или одной AI-функции этого API зачастую достаточно.

Если приложение должно сохранять conversation state на стороне Mistral, использовать server-side tools или поддерживать более сложный agent workflow, стоит переходить к Conversations API.

Совместимость с OpenAI API

Mistral Chat Completions следует той же базовой структуре, что OpenAI Chat Completions. Поэтому многие библиотеки с OpenAI-compatible provider можно переключить на Mistral простой заменой base URL и model ID.

Например, через OpenAI Python client:

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_MISTRAL_API_KEY",
    base_url="https://api.mistral.ai/v1",
)

response = client.chat.completions.create(
    model="mistral-small-latest",
    messages=[
        {
            "role": "user",
            "content": "Объясни dependency injection."
        }
    ],
)

print(response.choices[0].message.content)

Это особенно удобно для LangChain, LlamaIndex и собственных abstraction layers.

Но совместимость здесь относится прежде всего к Chat Completions. Mistral Conversations, Agents, Libraries, Connectors и built-in tools имеют собственную API-модель, поэтому сложный OpenAI Responses workflow нельзя считать автоматически переносимым одной заменой URL.

Reasoning без отдельной Magistral-модели

Старые отдельные reasoning-модели Magistral уже deprecated. В новых интеграциях Mistral предлагает использовать mistral-small-latest или mistral-medium-3-5 с параметром reasoning_effort.

У Medium 3.5 для сложных agentic- и coding-задач Mistral рекомендует reasoning_effort="high". Если дополнительный reasoning не нужен, его можно отключить.

Пример:

{
  "model": "mistral-medium-3-5",
  "messages": [
    {
      "role": "user",
      "content": "Проанализируй архитектуру этого приложения."
    }
  ],
  "reasoning_effort": "high"
}

Reasoning возвращается отдельным thinking chunk перед финальным ответом. Для multi-turn conversation Mistral рекомендует передавать обратно полный assistant message вместе с ThinkChunk. Если удалить reasoning trace и оставить только final answer, качество продолжения может снизиться.

Это отличается от провайдеров, которые специально скрывают внутренний reasoning и возвращают лишь encrypted state или summary. В Mistral reasoning является частью структуры ответа.

Structured Outputs

Mistral поддерживает как обычный JSON mode, так и JSON Schema.

Для backend-задач предпочтителен schema mode: модель получает точное описание ожидаемого объекта и возвращает структурированный JSON, который можно безопаснее передавать в следующий программный шаг.

Типичные сценарии:

  • разбор документов и писем;
  • извлечение данных из форм;
  • классификация обращений;
  • генерация DTO;
  • подготовка аргументов для business logic;
  • agentic-workflows, где следующий этап ожидает определенную структуру.

Как и с любым LLM API, schema validation не отменяет проверку бизнес-ограничений. Даже формально корректный JSON может содержать логически недопустимое значение.

Function calling

Mistral поддерживает обычный function calling через JSON Schema.

Можно, например, описать:

{
  "type": "function",
  "function": {
    "name": "get_order",
    "description": "Получить данные заказа",
    "parameters": {
      "type": "object",
      "properties": {
        "order_id": {
          "type": "string"
        }
      },
      "required": ["order_id"]
    }
  }
}

Модель решит, когда нужен tool, вернет его название и аргументы, а ваше приложение выполнит реальный запрос.

Function calling работает и в обычном Chat Completions, и в Conversations/Agents. Последние становятся удобнее, если инструментов много, нужно сохранять состояние либо смешивать собственные функции со встроенными tools Mistral.

Conversations API

Conversations — stateful-уровень платформы. Conversation хранит историю взаимодействия с моделью или Agent и позволяет продолжать работу без ручной пересылки всей последовательности сообщений как в stateless Chat Completions.

Внутри Conversation используются entries: сообщения пользователя и модели, tool executions и другие события. Conversation может быть создана непосредственно с model ID или на основе заранее настроенного Agent.

Это делает Conversations более похожим по роли на stateful Responses/threads-подходы других провайдеров. Для обычного одиночного completion дополнительный слой не нужен, но для AI-ассистента с инструментами он значительно упрощает оркестрацию.

Agents API

Agent в Mistral — сохраненная конфигурация, объединяющая:

  • model;
  • system instructions;
  • tools;
  • completion parameters;
  • дополнительные настройки поведения.

После создания Agent получает ID, который можно использовать для новых conversations.

Смысл не только в том, чтобы не передавать system prompt каждый раз. Agent становится reusable сущностью, к которой можно привязать web search, Code Interpreter, Document Library, image generation, functions и MCP Connectors.

Mistral также поддерживает handoffs между агентами: один agent может передать задачу другому в рамках workflow. Это позволяет строить, например, исследовательского агента, аналитика и отдельного агента для финальной подготовки результата.

Built-in tools

Через Agents и Conversations доступны встроенные инструменты Mistral:

  • web_search;
  • web_search_premium;
  • code_interpreter;
  • image_generation;
  • document_library;
  • собственные function tools;
  • Connectors на основе MCP.

Есть важная техническая деталь: web search и Code Interpreter не работают через обычный /v1/chat/completions. Для них нужны Conversations или Agents.

Image Generation — исключение: этот built-in tool можно использовать и через Chat Completions.

Поэтому при выборе API endpoint нужно сначала определить, какие tools потребуются приложению, а уже затем строить client layer.

Web Search

Mistral предоставляет два варианта встроенного поиска.

web_search — обычный поиск по вебу.

web_search_premium дополнительно использует проверенный news provider и рассчитан на сценарии, где важны актуальные новости и дополнительная проверка источников.

Модель сама решает, когда вызвать search, и Conversations API возвращает references, связанные с результатами поиска.

Для приложения это удобнее самостоятельной схемы «вызвать search API → вручную сложить snippets → отправить модели». Но для чувствительных по цене workloads нужно учитывать, что agent может сделать несколько поисковых операций в рамках одного пользовательского запроса.

Code Interpreter

Code Interpreter выполняет код в изолированном sandbox и подходит для:

  • математических вычислений;
  • анализа таблиц;
  • построения графиков;
  • проверки кода;
  • обработки данных.

Модель сама решает, когда ей нужен execution, получает результат и продолжает ответ.

Встроенный Code Interpreter особенно полезен в сочетании с Document Library или Web Search: агент может сначала получить данные, затем реально обработать их программно, а не пытаться вычислять все языковой моделью.

MCP Connectors

В 2026 году Mistral заметно расширил поддержку Model Context Protocol.

Connectors — зарегистрированные MCP-серверы, которые можно подключить к Conversations и Agents. Mistral сам занимается MCP transport, модель видит доступные server tools и может вызывать подходящий инструмент.

Особенно полезна встроенная схема human-in-the-loop. Для отдельных tool calls можно задать requires_confirmation, чтобы операция остановилась до явного подтверждения пользователя.

Это важно для действий вроде:

  • отправки сообщения;
  • изменения данных;
  • создания заказа;
  • удаления объекта;
  • операций с внешней системой.

Mistral также предоставляет собственный MCP endpoint для доступа к ресурсам Studio из совместимых клиентов, включая coding CLI и IDE.

Document Library и RAG

Для работы с собственной базой документов в Agents доступен built-in document_library.

Вы загружаете документы в Library, а затем Agent может выполнять retrieval и использовать найденные фрагменты при ответе. Это позволяет построить RAG без обязательного внешнего vector database.

Libraries поддерживают широкий набор форматов: PDF, Word, PowerPoint, Excel, CSV, изображения, Markdown, JSON, XML, исходный код, email-файлы и другие форматы.

Для простого корпоративного knowledge assistant этого может быть достаточно. Если же retrieval является ключевой частью продукта и нужны собственные ranking, chunking, metadata rules или гибридный поиск, отдельная vector infrastructure все еще дает больше контроля.

Document QnA

General-purpose модели Mistral поддерживают Document QnA непосредственно через Chat Completions и Conversations.

Это удобный вариант, когда нужно передать конкретный документ и задать вопросы по нему, но нет необходимости создавать постоянную Library.

В сочетании с vision модель может учитывать не только plain text документа, но и визуальную структуру, изображения и таблицы.

Для больших document-processing pipeline лучше отдельно рассмотреть OCR 4.1.

OCR 4.1

Mistral OCR 4.1 — отдельный Document AI API и одна из самых заметных специализированных частей платформы.

Он умеет извлекать текст и структуру страницы, paragraph-level bounding boxes, structural block labels и confidence scores. Для annotated OCR можно получать структурированные блоки вроде:

  • title;
  • text;
  • list;
  • table;
  • image;
  • equation;
  • code;
  • caption;
  • header;
  • footer;
  • signature.

Тариф:

обычный OCR:     $4 / 1000 страниц
annotated OCR:   $5 / 1000 страниц

Это делает Mistral интересным не только для чат-ботов, но и для invoice processing, договоров, архивов, форм, сканов и других document-intelligence задач.

Embeddings

Для semantic search и собственного RAG есть Mistral Embed.

Текущая модель mistral-embed имеет контекст 8 тыс. токенов и стоит:

$0,10 / 1M tokens

API возвращает векторное представление текста, которое можно хранить в собственной vector database и использовать для similarity search.

Для программного кода есть отдельный Codestral Embed по $0,15 за миллион input-токенов.

Если нужен полный контроль над retrieval, связка Mistral Embed + PostgreSQL pgvector, Qdrant, Weaviate или другой vector store остается альтернативой встроенным Libraries.

Voxtral: распознавание речи

Mistral развивает отдельное аудиосемейство Voxtral.

Для обычной offline-транскрипции используется Voxtral Mini Transcribe 2. Стоимость:

$0,003 / минута аудио

Модель поддерживает speaker diarization, context biasing, word-level timestamps и 13 языков, включая русский, английский, китайский, испанский, французский, немецкий, японский и другие.

Для live transcription есть Voxtral Mini Transcribe Realtime примерно по:

$0,006 / минута

Realtime-модель рассчитана на streaming и низкую задержку.

Voxtral TTS

Для синтеза речи есть Voxtral TTS.

Цена:

$16 / 1 млн символов

Модель поддерживает 9 языков, streaming с низким time-to-first-audio и zero-shot voice cloning: в запрос можно передать reference audio и получить речь с похожим голосом.

API умеет возвращать PCM, WAV, MP3, FLAC и Opus.

Таким образом, Mistral уже закрывает как STT, так и TTS. Для полноценного разговорного агента сама документация предлагает pipeline из realtime transcription, LLM и Voxtral TTS, а не одну монолитную speech-to-speech модель.

Moderation API

Актуальная moderation-модель — mistral-moderation-2603.

Она имеет контекст 128 тыс. токенов, умеет классифицировать мультиязычный текст и определять jailbreak-попытки. Сам moderation endpoint сейчас бесплатен.

Кроме отдельного Moderation API Mistral предлагает Custom Guardrails, которые можно прикладывать непосредственно к Chat Completions, Conversations или Agent configuration.

Для production-сервиса это часто удобнее отдельной цепочки «вызвать moderation → проверить threshold → только потом вызвать основную модель», если нужна относительно стандартная policy.

Image Generation

В Agents и Conversations есть встроенный tool image_generation. Модель может сама решить, что для ответа нужно создать изображение, после чего результат возвращается как файл.

Это отличается от OpenAI GPT Image или Google Nano Banana: документация Mistral не позиционирует этот инструмент как отдельную first-party Mistral image model. Это platform tool внутри агентного стека.

Поэтому если генерация изображений является центральной частью продукта и требуется выбирать конкретную модель, quality tier или детально считать стоимость каждого изображения, специализированный image API может быть прозрачнее. Если изображение нужно как один из инструментов универсального Agent, встроенный tool удобнее.

Prompt caching

Prompt caching у Mistral работает для повторяющегося prefix. Если несколько запросов начинаются с одинакового system prompt, tool schemas или истории, часть input может обслуживаться из cache.

Cached input стоит 10% обычной стоимости input.

Например, у Mistral Medium 3.5:

обычный input:  $1,50 / 1M
cached input:   $0,15 / 1M

У Small 4:

обычный input:  $0,15 / 1M
cached input:   $0,015 / 1M

Для увеличения вероятности cache hit можно использовать prompt_cache_key, например стабильный conversation ID или workflow ID.

Cache особенно полезен для agentic-циклов, где tool definitions и system instructions занимают значительную часть контекста и повторяются почти без изменений.

Batch API

Для задач, которым не нужен мгновенный результат, Mistral поддерживает Batch Processing со скидкой 50% относительно обычного inference.

Batch подходит для:

  • массовой классификации;
  • генерации описаний;
  • обработки каталога;
  • embeddings;
  • OCR;
  • больших наборов документов;
  • offline-evals.

Запросы формируются как набор API request bodies и обрабатываются асинхронно.

Для большого фонового workload использование Batch может оказаться эффективнее выбора более дешевой модели только ради цены.

Priority Tier

Для latency-sensitive production Mistral предлагает Priority Tier.

Он тарифицируется с коэффициентом:

1,75 × Standard price

То есть premium составляет 75%. Если запрос не может быть обслужен как priority и используется fallback в Standard, применяется обычная Standard-тарификация.

Prompt caching продолжает работать и в Priority Tier: сначала применяется скидка cached input, затем priority multiplier.

Такой режим имеет смысл там, где задержка ответа непосредственно влияет на пользовательский опыт или SLA, но для фоновой обработки обычно экономически неоправдан.

Сколько стоит один большой запрос

Возьмем 100 тыс. входных и 10 тыс. выходных токенов без cache.

Модель Стоимость Standard
Mistral Medium 3.5 $0,225
Mistral Large 3 $0,065
Mistral Small 4 $0,021
Ministral 3 14B $0,022
Ministral 3 8B $0,0165
Ministral 3 3B $0,011

Через Batch те же token costs будут примерно вдвое ниже.

Эта таблица хорошо показывает, почему внутри Mistral нельзя просто выбирать самую новую и дорогую модель для каждого запроса. Medium 3.5 может быть нужна для сложной агентной задачи, но для extraction или классификации Small 4 обходится более чем в десять раз дешевле.

Как всегда, цена токена не равна цене решенной задачи. Более слабой модели иногда требуется больше retries или более сложный prompt, поэтому окончательный выбор стоит делать по собственным evals.

Open weights — одно из главных преимуществ Mistral

Mistral остается одним из немногих крупных западных AI-провайдеров, где open-weight стратегия является частью основной продуктовой линейки, а не отдельным экспериментом.

Mistral Large 3 и Small 4 опубликованы под Apache 2.0. Medium 3.5 также имеет открытые веса, но использует Modified MIT license.

Это дает несколько вариантов deployment:

  • официальный Mistral API;
  • сторонний inference provider;
  • собственный сервер с vLLM;
  • локальный запуск через LM Studio или Ollama для подходящих моделей;
  • private cloud или on-premise infrastructure.

Для небольшого проекта API почти всегда проще. Но для компании с большим постоянным throughput, жесткими требованиями к data residency или внутренним кодом возможность self-hosting может стать ключевым аргументом.

Например, Mistral отдельно документирует локальный запуск Small 4 и рекомендует учитывать, что при FP8 веса уже требуют серьезного объема VRAM. Open-weight не означает «легко запустить на ноутбуке»: крупная модель все равно остается крупной.

Региональный inference: EU и US

Mistral — французская компания, и по умолчанию данные платформы размещаются в Европейском союзе. Для inference дополнительно доступны региональные API endpoint.

Global: https://api.mistral.ai
EU:     https://api.eu.mistral.ai
US:     https://api.us.mistral.ai

Regional inference стоит на 10% дороже Standard list price.

EU endpoint гарантирует, что eligible inference будет обрабатываться в EU/EFTA, US endpoint — в США. Это может быть важно для корпоративных требований к data location.

Есть ограничения. Regional inference не делает весь control plane региональным, а Agents, Batch и Files API сейчас не поддерживаются на региональных endpoint. Из tool calling регионально гарантируется только function calling; доступность конкретных моделей тоже нужно проверять отдельно.

Поэтому regional endpoint — не то же самое, что полностью изолированная европейская или американская копия всей Mistral platform.

Хранение данных и Zero Data Retention

Для обычных API Mistral по умолчанию может хранить input и output до 30 дней для abuse monitoring.

На платных планах можно запросить Zero Data Retention. При активном ZDR для поддерживаемых stateless endpoint вход и выход не сохраняются дольше, чем требуется для выполнения запроса.

ZDR распространяется, например, на:

  • Chat Completions;
  • FIM;
  • embeddings;
  • moderation;
  • OCR;
  • TTS;
  • transcription.

Но не распространяется на stateful продукты, которым хранение необходимо для работы:

  • Agents;
  • Conversations;
  • Libraries;
  • Files;
  • Batch.

Это логичное ограничение: persistent conversation физически не может одновременно существовать и ничего не хранить.

Используются ли API-данные для обучения

Здесь есть несколько режимов, и их важно не смешивать.

Для commercial use Mistral позволяет управлять training preference. Pay-as-you-go клиенты могут opt out, а данные Enterprise по умолчанию имеют более строгие настройки.

Но Free mode может использовать input/output для обучения, если пользователь не отключил соответствующую настройку.

Есть отдельное существенное исключение — Labs и Preview models. Текущие коммерческие условия Mistral прямо допускают использование Customer Data и Outputs таких экспериментальных моделей для обучения, и обычный opt-out/ZDR на них не распространяется.

Поэтому для production с конфиденциальными данными рациональнее использовать stable GA models на paid plan, проверить training opt-out и при необходимости запросить ZDR.

Регистрация и получение API key

Процесс проще, чем у многих корпоративных AI-платформ.

  1. Создать аккаунт Mistral.
  2. Открыть Studio.
  3. Перейти в API Keys.
  4. Нажать Create new key.
  5. Сохранить ключ — после создания он показывается один раз.
  6. Использовать Free mode либо настроить billing и pay-as-you-go.

Новый аккаунт получает Free mode по умолчанию. Для создания первого API key кредитная карта не обязательна.

Free mode предназначен прежде всего для тестирования и прототипирования и имеет самые низкие rate limits. Если нужен нормальный production throughput, подключается payment method и pay-as-you-go либо платный план.

Важный юридический нюанс: API рассчитан на business use

В актуальных Terms Mistral есть необычный момент: Consumer Terms прямо исключают Mistral AI Studio и API и указывают, что они ограничены business customers.

То есть бесплатный API key действительно можно получить для разработки и оценки, но юридически Studio/API рассматриваются Mistral как commercial/business product, а не как обычный consumer service наподобие Vibe Chat.

Для независимого разработчика, который делает свой проект или SaaS, это обычно соответствует бизнес-использованию. Но использовать API как чисто личный consumer-сервис и предполагать, что к нему применяются обычные consumer terms, неправильно.

Оплата и billing

Billing управляется на уровне Organization.

В Admin Panel можно:

  • добавить payment method;
  • указать billing information;
  • включить pay-as-you-go;
  • посмотреть usage;
  • задать monthly spending limit;
  • скачать invoices;
  • отслеживать credits и их expiration.

Каждый Workspace может иметь свой usage limit, но он не может превышать общий organization cap.

API key сам по себе не относится к «Free» или «Paid»: он использует plan и pay-as-you-go настройки Organization.

Если платеж не проходит или отсутствует payment method, API может возвращать 402 Payment Required.

Можно ли пользоваться Mistral API из России

В действующих на конец сентября 2026 года Commercial Terms Россия сама по себе не указана среди территорий с комплексным запретом. В качестве comprehensively sanctioned/embargoed Mistral перечисляет, в частности, Кубу, Иран, КНДР, Сирию, а также Крым, Донецкую и Луганскую области Украины.

Но это не означает безусловную доступность для любого российского пользователя или компании. Условия Mistral требуют соблюдать санкционные и export-control нормы ЕС, США, Сингапура и других применимых юрисдикций, а лица и организации из санкционных списков пользоваться сервисом не могут.

Практический отдельный вопрос — оплата. Публичная документация Mistral не обещает прием карт конкретных российских банков или российских платежных систем. Даже при отсутствии общего запрета на страну международный acquiring и ограничения конкретного банка могут сделать прямую оплату невозможной.

Free mode при этом не требует кредитной карты, поэтому технически проверить доступность API для своего аккаунта можно до подключения billing.

Для коммерческого проекта из РФ перед production-запуском имеет смысл отдельно проверить три вещи: проходит ли ваш аккаунт Terms, принимается ли доступный payment method и устраивают ли компанию правила трансграничной обработки данных.

Rate limits

Rate limits действуют на уровне Organization и зависят от plan и usage tier.

Mistral считает, в частности:

  • requests per second;
  • tokens per minute;
  • tokens per month;
  • отдельные audio limits;
  • OCR pages per minute.

Free mode имеет минимальные limits и рассчитан на evaluation/prototyping.

Если production-приложению нужен больший throughput, лимиты можно запросить через support, указав модели, ожидаемый RPS, TPM и месячный объем.

Mistral API в PHP

Официальные Mistral SDK сейчас есть для Python и TypeScript. Официального PHP SDK нет, но API обычный REST и вдобавок совместим с OpenAI Chat Completions structure.

Простейший вариант на PHP:

<?php

$apiKey = $_ENV['MISTRAL_API_KEY'];

$payload = [
    'model' => 'mistral-small-latest',
    'messages' => [
        [
            'role' => 'user',
            'content' => 'Кратко объясни, что такое dependency injection.',
        ],
    ],
];

$ch = curl_init('https://api.mistral.ai/v1/chat/completions');

curl_setopt_array($ch, [
    CURLOPT_POST => true,
    CURLOPT_RETURNTRANSFER => true,
    CURLOPT_HTTPHEADER => [
        'Authorization: Bearer ' . $apiKey,
        'Content-Type: application/json',
    ],
    CURLOPT_POSTFIELDS => json_encode(
        $payload,
        JSON_UNESCAPED_UNICODE
    ),
]);

$response = curl_exec($ch);

if ($response === false) {
    throw new RuntimeException(curl_error($ch));
}

$data = json_decode(
    $response,
    true,
    flags: JSON_THROW_ON_ERROR
);

echo $data['choices'][0]['message']['content'] ?? '';

В Laravel интеграцию проще сделать через встроенный HTTP Client:

$response = Http::withToken(config('services.mistral.key'))
    ->post('https://api.mistral.ai/v1/chat/completions', [
        'model' => 'mistral-small-latest',
        'messages' => [
            [
                'role' => 'user',
                'content' => 'Кратко объясни dependency injection.',
            ],
        ],
    ]);

$text = $response->throw()->json('choices.0.message.content');

API key лучше хранить в .env, а в прикладном коде получать через конфигурацию. Передавать ключ напрямую в browser JavaScript нельзя: backend должен контролировать пользователей, лимиты, tools и расходы.

Fine-tuning больше не основное направление

В старых руководствах Mistral можно встретить Fine-Tuning API, однако текущая документация помечает старый fine-tuning flow как deprecated и больше не рекомендует его как основной путь кастомизации.

Для большинства современных приложений Mistral делает больший акцент на system instructions, structured outputs, Libraries/RAG, tools, Agents и open-weight deployment.

Если требуется действительно глубоко адаптированная модель, открытые веса также дают возможность обучать или дообучать модель вне managed API, но это уже отдельная ML-инфраструктурная задача.

Чем Mistral отличается от OpenAI, Claude и Gemini

Главное отличие Mistral — не конкретный benchmark.

OpenAI предлагает наиболее цельный закрытый proprietary stack с большим количеством собственных tool и media API.

Claude особенно силен в сложном reasoning, coding и long-horizon agent workflows.

Gemini глубоко связывает AI API с Search, Maps, мультимодальностью и Google Cloud.

Mistral занимает промежуточную позицию: дает современную managed platform, но при этом значительная часть основной линейки доступна как open weights и может быть перенесена на собственную инфраструктуру.

Именно эта комбинация делает Mistral интересным для компаний, которые хотят начать с serverless API, но не хотят архитектурно привязываться к закрытой модели навсегда.

Какую модель выбрать

Для сложных agentic-, reasoning- и coding-задач первая модель для теста — Mistral Medium 3.5.

Для большинства массовых задач, где важна стоимость, стоит сразу проверить Mistral Small 4. При $0,15/$0,60 за миллион input/output она настолько дешевле Medium, что при приемлемом качестве экономия может быть очень существенной.

Mistral Large 3 стоит рассматривать как мощную и сравнительно дешевую open-weight general-purpose модель, особенно если потенциально важен собственный deployment.

Ministral 3 подходит для edge, локального inference и хорошо формализованных задач, где большая модель не нужна.

Для документов, аудио и поиска лучше не заставлять general-purpose LLM решать специализированную задачу: OCR 4.1, Voxtral и Mistral Embed обычно дают более предсказуемую архитектуру и понятную стоимость.

Итог

Mistral AI API в 2026 году уже нельзя описать как просто «европейский аналог OpenAI». Это полноценная платформа с general-purpose моделями, reasoning, stateful Conversations, Agents, web search, Code Interpreter, MCP Connectors, RAG, OCR, embeddings, STT, TTS и moderation.

При этом ее самая интересная особенность остается прежней: значительная часть сильных моделей Mistral имеет открытые веса. Проект может начать с обычного api.mistral.ai, а затем при необходимости перенести модель на собственную инфраструктуру или другого inference-провайдера.

Для нового проекта практичная отправная точка выглядит так: Mistral Small 4 для дешевых массовых задач, Medium 3.5 для сложного reasoning и agents, Chat Completions для простого stateless API и Conversations/Agents только там, где действительно нужны persistent state и built-in tools.

Если добавить к этому 90-процентную скидку на cached input, 50-процентный Batch discount, европейское размещение данных по умолчанию и возможность self-hosting, Mistral выглядит не как универсальный победитель рынка, а как один из наиболее гибких API-вариантов для продукта, который хочет оставить себе путь от облачного сервиса к собственной инфраструктуре.


Официальные источники

Дата публикации:

Обзор Mistral AI API: модели, агенты, OCR, Voice, цены и open-weight в 2026 году

Наши проекты

  • Anilau
    Веб-разработка и запуск цифровых продуктов.
  • Botmarketing
    Telegram-бот, mini-app, витрина и CRM для малого бизнеса.
  • vietnam.anilau.com
    Объявления, местные услуги и практичные гиды по Вьетнаму.
  • bali.anilau.com
    Объявления о товарах и услугах на Бали.
  • ceylon.anilau.com
    Объявления, услуги и полезная информация о Шри-Ланке.
  • mauricetop.anilau.com
    Платформа объявлений и материалов о жизни на Маврикии.
  • funlab
    Платформа для создания и запуска игр с помощью ИИ.
  • aura
    AI-дневник настроения и пространство для творчества.
  • drained
    Telegram Mini App для дневных отметок усталости и восстановления.
  • vietinfodesk
    Практичные гиды, сервисы и помощь для жизни во Вьетнаме.
  • frau
    Визитка уютного кафе в Нячанге с вафлями, завтраками и напитками.

Работаем в партнерстве с креативным агентством Deep.

Попробуйте наши плагины для Codex и Claude