Обзор Alibaba Qwen API и Model Studio: модели, возможности, цены и подключение в 2026 году

Актуальность информации: 29 сентября 2026 года.

Qwen часто воспринимают просто как семейство китайских моделей, которое можно скачать с Hugging Face или подключить у стороннего inference-провайдера. Но у Alibaba есть и собственная полноценная облачная платформа — Alibaba Cloud Model Studio. Через нее можно использовать коммерческие и открытые модели Qwen, изображения и видео, realtime-аудио, embeddings, OCR и специализированные модели, а также сторонние DeepSeek, Kimi, GLM и MiniMax.

В 2026 году Model Studio особенно интересен тем, что пытается быть совместимым сразу с двумя крупнейшими API-экосистемами. Qwen можно вызывать через OpenAI Chat Completions, OpenAI Responses API и Anthropic Messages API. Для возможностей, которые не укладываются в эти форматы, остается собственный DashScope API.

Актуальные Qwen3.8 Max и Qwen3.8 Flash уже имеют миллионный контекст, работают с текстом, изображениями и видео, поддерживают reasoning, function calling и Structured Outputs. При этом Flash в международном регионе стоит всего $0,15 за миллион входных и $0,47 за миллион выходных токенов.

Разберем, чем Qwen отличается от Model Studio, какие модели имеет смысл использовать, как устроены регионы и хранение данных, сколько стоит API, как зарегистрироваться и получить ключ, какие есть нюансы оплаты и доступа из разных стран и как подключить Qwen из PHP.

Qwen и Alibaba Cloud Model Studio — не одно и то же

Для начала полезно разделить два понятия.

Qwen — семейство моделей Alibaba. В него входят большие multimodal-модели Qwen3.8, Qwen Image, Qwen Omni, Qwen Audio, Qwen ASR, Qwen TTS, Qwen Coder, embedding- и reranking-модели и множество более ранних вариантов. Часть моделей коммерческая, часть публикуется с открытыми весами.

Alibaba Cloud Model Studio — облачная платформа, через которую эти модели предоставляются как API. Кроме Qwen в ней доступны сторонние DeepSeek, Kimi, GLM, MiniMax и другие модели. У платформы есть API keys, billing, workspaces, regional endpoints, monitoring, batch inference, context caching и дополнительные AI-инструменты.

Поэтому выражение «Qwen API» обычно означает вызов Qwen через Model Studio, но сама Model Studio значительно шире одной модельной семьи.

Какие API предлагает Model Studio

Для text generation сейчас доступны четыре основных интерфейса:

  • OpenAI-compatible Chat Completions — наиболее простой вариант для обычной генерации и миграции существующего OpenAI-кода;
  • OpenAI-compatible Responses API — более современный интерфейс со stateful-диалогами и встроенными tools;
  • Anthropic-compatible Messages API — для приложений и инструментов, уже работающих с Claude API;
  • DashScope API — собственный интерфейс Alibaba с наиболее полным доступом к специфическим возможностям платформы.

Это одна из самых сильных сторон Model Studio. Если приложение уже построено вокруг OpenAI SDK, Qwen часто можно проверить, поменяв API key, base URL и model name. Аналогично можно подключить некоторые модели через Anthropic SDK.

При этом compatibility layer не означает, что вся платформа является точной копией OpenAI или Anthropic. Специализированные image, video, realtime-audio и некоторые Model Studio features используют собственные endpoint и параметры.

Актуальные Qwen3.8 Max и Flash

Для нового универсального приложения в конце сентября 2026 года прежде всего стоит смотреть на две модели:

Модель Контекст Максимальный output International input International output Основной сценарий
qwen3.8-max 1 млн 131 072 $2 / 1 млн $6 / 1 млн сложные agentic-, coding- и multimodal-задачи
qwen3.8-flash 1 млн 131 072 $0,15 / 1 млн $0,47 / 1 млн массовый inference, агенты, coding, vision

Обе модели принимают текст, изображения и видео и возвращают текст. Они поддерживают hybrid thinking, function calling, Structured Outputs, context caching и работу через OpenAI- и Anthropic-compatible API.

Цены в таблице относятся к Singapore / International deployment scope. Это важно: Model Studio использует региональную тарификацию. Например, для Global scope в Frankfurt, Virginia, Tokyo и некоторых других регионах текущая базовая цена qwen3.8-max составляет около $1,65/$4,951, а qwen3.8-flash — $0,113/$0,382 за миллион input/output токенов.

Qwen3.8 Max

qwen3.8-max — текущая верхняя коммерческая модель Qwen для сложных многошаговых задач. У нее миллионный context window, максимальный input около 992 тыс. токенов и output до 131 072 токенов.

В thinking mode модель может использовать до 262 144 токенов chain-of-thought budget. Reasoning можно регулировать через reasoning_effort.

Поддерживаются text, image и video input, function calling, Structured Outputs, hybrid thinking, context caching, web search в поддерживаемых регионах и API, Responses API и Anthropic Messages compatibility.

В международном Singapore scope цена составляет $2 за миллион обычных input-токенов и $6 за миллион output. Implicit cached input стоит $0,25 за миллион, explicit cache read — $0,17.

Max имеет смысл проверять для сложного программирования, больших codebase, исследования документов, визуального анализа и agentic-задач, где более дешевый Flash дает недостаточно надежный результат.

Qwen3.8 Flash

qwen3.8-flash — более дешевый вариант той же новой генерации Qwen. При этом слово Flash здесь не означает простую небольшую модель для классификации: Alibaba позиционирует ее и для coding assistance, agentic workflows, visual understanding и работы с длинным контекстом.

Context window также составляет 1 млн токенов, максимальный output — 131 072. Модель может анализировать изображения и видео длительностью до двух часов при соблюдении ограничений API.

В Singapore International pricing:

input:                  $0,15 / 1M
output:                 $0,47 / 1M
implicit cached input:  $0,016 / 1M
explicit cache read:    $0,016 / 1M

Для большого количества запросов разница с Max очень существенная. Поэтому для нового продукта Flash логично тестировать первым, а Max использовать как более сильный tier или fallback для сложных случаев.

Сколько стоит один большой запрос

Возьмем условный запрос с 100 тыс. входных и 10 тыс. выходных токенов в Singapore International scope, без cache.

Модель Стоимость
Qwen3.8 Flash $0,0197
Qwen3.8 Max $0,26

Разница — более чем в десять раз.

Это не означает, что Flash всегда экономически выгоднее. Если сложную задачу приходится несколько раз исправлять или повторно отправлять в Max, реальная стоимость успешного сценария может оказаться другой. Но для extraction, классификации, анализа изображений, массовой генерации и части agentic workload такая разница определенно заслуживает отдельного теста.

В Global scope стоимость может быть еще ниже. Например, 100 тыс. input + 10 тыс. output на qwen3.8-flash при текущей цене $0,113/$0,382 обойдутся примерно в $0,0151.

Другие Qwen и open-weight версии

Model Studio содержит гораздо больше Qwen-моделей, чем Max и Flash. В актуальном каталоге остаются Qwen3.7 Plus, Qwen3.7 Flash, Qwen3.6, Qwen3.5, Qwen Coder, Qwen VL, Qwen Omni и специализированные варианты.

Для production важно понимать модель жизненного цикла. Алиасы вроде qwen3.8-max или qwen3.8-flash указывают на актуальную версию соответствующей ветки, а snapshot model ID фиксирует конкретный релиз.

Отдельно доступны open-weight Qwen3.8, например qwen3.8-2.4t-a95b и qwen3.8-27b. Обе имеют миллионный контекст. В Singapore первая стоит $2/$6 за миллион input/output, вторая — $0,50/$3.

При этом слово «open» не означает одинаковую лицензию. Qwen3.8-27B опубликован под Apache 2.0, а 2.4T-A95B использует отдельную лицензию Qwen3.8-Max с дополнительными условиями для очень крупных коммерческих продуктов и Model-as-a-Service бизнеса. Перед self-hosting нужно смотреть лицензию именно конкретного repository.

Thinking и reasoning

Qwen3.8 Max и Flash относятся к hybrid-thinking моделям. Thinking включен по умолчанию, но его интенсивность можно менять или полностью отключать для простых задач.

В OpenAI-compatible API используется reasoning_effort. Для Qwen3.8 основные уровни:

low
medium
xhigh

Значение xhigh используется по умолчанию. Для совместимости некоторые стандартные OpenAI values автоматически отображаются на эти уровни.

Например:

{
  "model": "qwen3.8-flash",
  "messages": [
    {
      "role": "user",
      "content": "Проанализируй архитектуру приложения и найди потенциальные точки отказа."
    }
  ],
  "reasoning_effort": "medium"
}

Чем выше reasoning effort, тем больше токенов модель может потратить на анализ. Для простого extraction максимальный reasoning обычно не нужен, поэтому управление effort может уменьшить и latency, и расход output-токенов.

Мультимодальность: изображения и длинные видео

Qwen3.8 Max и Flash являются нативно мультимодальными. В один запрос можно передавать текст, изображения и видео.

Для изображений большинство актуальных visual-моделей поддерживают до 16 млн пикселей. Чем выше разрешение, тем больше visual tokens уходит на обработку.

Qwen3.8 Max и Flash могут обрабатывать видео длительностью до двух часов и размером до 2 GB при использовании поддерживаемого способа передачи файла. Это позволяет анализировать лекции, записи встреч, демонстрации интерфейса, длинные ролики и другие последовательности без предварительного ручного разбиения на кадры.

Если нужен еще и звук внутри видео либо отдельный audio input, логичнее смотреть на Qwen Omni.

Qwen3.8 Omni

qwen3.8-omni-flash объединяет несколько модальностей: текст, изображения, видео и аудио. Модель может анализировать звук одновременно с видеорядом, поэтому подходит для задач, где визуальный контекст нельзя отделить от речи или окружающих звуков.

Для realtime-сценариев есть qwen3.8-omni-flash-realtime. Она принимает text, image, video и audio и возвращает text и audio. Поддерживаются WebSocket, WebRTC и AOQ.

Контекст realtime-модели составляет около 196 тыс. токенов. В Singapore International scope текущие ставки:

input audio:             $0,93 / 1M tokens
output audio:            $1,87 / 1M tokens
input text/image/video:  $0,23 / 1M tokens
output text:             $0,70 / 1M tokens

Это уже основа для голосовых ассистентов и realtime-мультимодальных интерфейсов, а не только обычного чат-бота.

OpenAI-compatible Chat Completions

Наиболее простой способ миграции существующего OpenAI-приложения — Chat Completions.

Для Singapore используется региональный base URL вида:

https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/compatible-mode/v1

Дальше можно использовать стандартный OpenAI client:

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_MODEL_STUDIO_API_KEY",
    base_url="https://YOUR_WORKSPACE.ap-southeast-1.maas.aliyuncs.com/compatible-mode/v1",
)

response = client.chat.completions.create(
    model="qwen3.8-flash",
    messages=[
        {
            "role": "user",
            "content": "Объясни dependency injection."
        }
    ],
)

print(response.choices[0].message.content)

Для простого текста, Structured Outputs и function calling этого интерфейса достаточно. Если нужны stateful sessions и server-side tools, интереснее Responses API.

OpenAI-compatible Responses API

Model Studio поддерживает OpenAI-compatible Responses API и добавляет в него собственные agentic-возможности.

Основные преимущества по сравнению с обычным Chat Completions:

  • можно передавать обычную строку или message array;
  • следующий turn можно связать через previous_response_id;
  • доступны встроенные web search и web extractor;
  • поддерживается Code Interpreter;
  • есть text-to-image и image-to-image tools для совместимых моделей;
  • conversation history может управляться сервером.

То есть архитектура уже близка к OpenAI Responses API, а не просто к старому /chat/completions.

При этом конкретная доступность built-in tools зависит от модели, региона и deployment scope. Нельзя предполагать, что любой Qwen model ID во Frankfurt или Singapore автоматически имеет тот же набор tools.

Anthropic-compatible Messages API

Model Studio поддерживает и Anthropic Messages API.

Для миграции Claude-приложения меняются три вещи:

  • API key;
  • base_url;
  • model name.

Например, Singapore base URL имеет вид:

https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/apps/anthropic

Далее можно использовать /v1/messages.

Совместимый интерфейс поддерживает thinking и tool calling. Среди доступных моделей есть Qwen3.8 Max, Qwen3.8 Flash, Qwen Coder и ряд сторонних DeepSeek, Kimi и GLM.

Это особенно удобно для Claude Code и других приложений, ориентированных на Anthropic Messages API.

DashScope API

DashScope — собственный API Alibaba Cloud. Он исторически был основным способом вызова Qwen и по-прежнему предоставляет наиболее полный набор специфических параметров Model Studio.

Если задача укладывается в стандартную OpenAI/Anthropic schema, compatibility layer обычно проще. DashScope имеет смысл использовать там, где нужна функция, которой нет в совместимом endpoint, либо специализированная модель с собственным API.

Официальные SDK DashScope доступны как минимум для Python и Java. Для OpenAI-compatible вызовов Alibaba также документирует OpenAI SDK для Python, Node.js, Java и Go.

Function calling

Qwen3.8 Max и Flash поддерживают function calling.

Приложение описывает function и JSON Schema, модель решает, когда ее вызвать, и возвращает структурированные аргументы. Реальное действие выполняет backend.

Например, можно дать модели функции findCustomer, getOrder и createSupportTicket. Пользователь пишет: «Проверь заказ 54821 и создай обращение, если он задерживается». Модель определяет нужную последовательность, но сама не получает прямой доступ к базе.

Как и с другими LLM API, function calling не заменяет backend-авторизацию. Приложение должно отдельно проверять пользователя, параметры, финансовые ограничения и допустимость изменения данных.

Structured Outputs

Qwen3.8 поддерживает Structured Outputs. Это позволяет задавать ожидаемую JSON Schema вместо попытки извлекать данные из произвольного текста.

Типичные сценарии:

  • разбор писем и документов;
  • классификация заявок;
  • извлечение данных из изображений;
  • подготовка DTO;
  • преобразование пользовательского текста в параметры backend-функции;
  • agentic-workflows, где следующий шаг ожидает конкретную структуру.

Для визуальных input это особенно полезно: можно, например, передать фотографию товара и получить валидный JSON с названием, брендом, характеристиками и другими полями.

Web Search

У Model Studio есть встроенный web search. В Responses API он подключается как tool:

{
  "model": "qwen3.8-max",
  "input": "Найди актуальную информацию о новой версии PHP.",
  "tools": [
    {
      "type": "web_search"
    }
  ]
}

Для Responses API также доступен web_extractor, который позволяет извлекать содержимое найденных или явно заданных страниц.

Это уменьшает необходимость отдельно подключать поисковый API и вручную собирать snippets. Но модель и регион должны поддерживать конкретный tool.

Для production стоит отдельно учитывать tool billing: итоговая стоимость agentic-запроса может включать не только токены основной модели, но и обращения к поисковой инфраструктуре.

Code Interpreter

Responses API поддерживает встроенный Code Interpreter для моделей и регионов, где он доступен.

Модель может писать и выполнять код, использовать результат вычислений и продолжать анализ. Это полезно для математических задач, CSV, статистики, отчетов и других сценариев, где реальное выполнение программы надежнее простого текстового reasoning.

При использовании в агенте Code Interpreter можно комбинировать с web search и пользовательскими functions.

Context Cache

У Model Studio есть два режима кеширования повторяющегося prompt prefix.

Implicit cache работает автоматически. Система пытается определить совпадающую начальную часть prompt; отдельное создание cache object не требуется, но hit не гарантирован.

Explicit cache создается разработчиком. Он требует отдельной записи cache, зато дает более предсказуемый hit.

Для большинства моделей общая схема примерно такая: создание explicit cache стоит около 125% обычного input, чтение — около 10%, implicit hit — около 20%. Но Qwen3.8 имеет собственные тарифы.

Для qwen3.8-flash в Singapore:

обычный input:          $0,15 / 1M
implicit cache:         $0,016 / 1M
explicit cache create:  $0,20 / 1M
explicit cache read:    $0,016 / 1M

Для qwen3.8-max:

обычный input:          $2 / 1M
implicit cache:         $0,25 / 1M
explicit cache create:  $2,50 / 1M
explicit cache read:    $0,17 / 1M

При длинном system prompt, большой tool schema или многократной работе с одним документом cache заметно меняет unit economics.

Batch API

Model Studio поддерживает асинхронный Batch API для части моделей и регионов.

Для поддерживаемых text-моделей Batch обычно стоит 50% от realtime inference. Запросы передаются JSONL-файлом, обрабатываются в фоновой очереди, а после завершения можно скачать результат и отдельный файл с ошибками.

Batch подходит для массовой классификации, генерации описаний, data labeling, обработки каталогов, evals и фоновой аналитики.

Поддержка зависит от model ID и региона. Поэтому перед расчетом экономии нужно проверить именно текущую модель, а не считать, что любой Qwen automatically поддерживает 50-процентный Batch.

Qwen Image 3.0

В Model Studio есть отдельное семейство генерации и редактирования изображений.

Текущая рекомендация — qwen-image-3.0-pro. Она особенно ориентирована на сложные layouts и корректный text rendering: меню, газеты, интерфейсы, инфографику и другие изображения, где модель должна не просто нарисовать сцену, но и точно разместить текст.

Есть два основных варианта:

  • qwen-image-3.0-pro — максимальное качество;
  • qwen-image-3.0 — более быстрый и дешевый.

Обе поддерживают генерацию и редактирование, до трех input images и до шести вариантов output.

В Singapore International:

Модель 1K output 2K output Input image
Qwen Image 3.0 Pro $0,04 $0,075 $0,003
Qwen Image 3.0 $0,03 $0,03 $0,003

Для более высокого разрешения и сложной character-consistent генерации в Model Studio также есть семейство Wan Image.

Wan для генерации видео

Alibaba развивает отдельное семейство Wan для видео.

Актуальный Wan 3.0 поддерживает text-to-video, image-to-video, reference-based generation, editing и работу с мультимодальными reference materials. Модель генерирует не только видеоряд, но и диалоги, музыку и звуковые эффекты.

В Singapore базовый Wan 3.0 стоит:

480p:   $0,05 / секунда
720p:   $0,10 / секунда
1080p:  $0,20 / секунда

Поддерживаются ролики до 30 секунд в зависимости от выбранного режима и model version.

Таким образом, Model Studio — уже не только Qwen LLM API. В одном billing/account stack можно закрыть текст, изображения, видео и аудио.

Speech-to-Text

Для распознавания речи есть Qwen ASR.

qwen3-asr-flash в Singapore стоит:

$0,000035 / секунду

Это примерно $0,0021 за минуту или $0,126 за час аудио.

Для realtime-transcription есть qwen3-asr-flash-realtime по $0,000090 за секунду, то есть около $0,0054 за минуту.

Новые аккаунты в Singapore также получают ограниченный free quota для ряда audio-моделей.

Text-to-Speech

В Model Studio есть несколько поколений Qwen TTS и CosyVoice.

Например, актуальный qwen-audio-3.0-tts-flash в Singapore стоит:

$0,15 / 10 000 символов

qwen-audio-3.0-tts-plus — $0,20 за 10 000 символов.

Есть отдельные модели для realtime synthesis, voice design и voice cloning. Поэтому speech-функциональность платформы уже значительно шире обычного «перевести текст в mp3».

Embeddings и reranking

Для собственного RAG Alibaba предлагает отдельные embedding- и rerank-модели.

Для обычного текста рекомендуемый вариант — text-embedding-v4. В Singapore он стоит:

$0,07 / 1M input tokens

Размер embedding можно выбирать от 64 до 2048 dimensions.

Для мультимодального retrieval есть модели, переводящие text, image и video в общее semantic space. Для финального переупорядочивания результатов есть qwen3-rerank, поддерживающий более 100 языков и до 500 документов на один запрос.

То есть Model Studio позволяет построить RAG как с собственной vector database, так и через более высокоуровневые platform-компоненты.

OCR и перевод

В каталоге есть и специализированные модели.

Для OCR в International scope доступен qwen-vl-ocr, способный извлекать текст и визуальную информацию из документов и изображений.

Для перевода есть Qwen MT: qwen-mt-plus, qwen-mt-flash и qwen-mt-lite. Например, qwen-mt-lite в Singapore стоит $0,12 за миллион input и $0,36 за миллион output.

Если задача узкая и массовая, такая специализированная модель может оказаться выгоднее использования Qwen3.8 Max только потому, что она является флагманом.

Model Studio — это еще и сторонние модели

Alibaba Cloud Model Studio не ограничивается Qwen.

Через ту же platform доступны, в зависимости от региона, DeepSeek, Kimi, GLM, MiniMax и другие модели из Model Plaza.

Для приложения это превращает Model Studio в небольшой multi-model gateway. Можно сохранить один Alibaba Cloud account и инфраструктуру, но выбирать разные модели для разных задач.

При этом цены, функции и доступность сторонних моделей зависят от региона. Не все модели имеют те же built-in tools, что Qwen.

Agents и Workflow

Model Studio имеет no-code/low-code уровень для построения Agent и Workflow applications. Agent сам планирует действия и обращается к tools/knowledge base, а Workflow задает более детерминированную цепочку шагов.

Однако здесь есть важное ограничение для новых международных пользователей: старый Application Development tab в Singapore является preview-функцией и доступ к нему ограничен аккаунтами, которые создали такие приложения до 21 апреля 2025 года.

Поэтому в новом production-проекте не стоит строить архитектуру, предполагая доступность старого визуального Agent Builder для любого нового Singapore account. Современный более переносимый путь — Responses API, tool calling и собственная orchestration либо другие актуальные Model Studio components.

Coding и интеграция с Claude Code/Codex

Qwen3.8 Flash прямо позиционируется как модель, совместимая с OpenAI и Anthropic API protocols и пригодная для Claude Code и Codex.

Это позволяет использовать Model Studio как inference backend для coding-agent tool, не меняя сам пользовательский workflow.

В Model Studio есть и отдельный Coding Plan с фиксированной ежемесячной оплатой, но это отдельный продукт со своим API key и собственным списком разрешенных моделей. Нельзя автоматически считать, что любая модель из обычного pay-as-you-go Model Studio доступна в Coding Plan.

Если нужен конкретно Qwen3.8, перед покупкой subscription стоит проверить текущий список plan models.

Регионы — одна из самых важных особенностей Model Studio

Alibaba Cloud Model Studio доступен как минимум в:

  • China (Beijing);
  • Singapore;
  • Germany (Frankfurt);
  • Japan (Tokyo);
  • China (Hong Kong);
  • US (Virginia).

Регион определяет endpoint, API key, список доступных моделей, static data location и часть platform features.

Ключ из Singapore нельзя использовать с Frankfurt endpoint. Для каждого региона API key создается отдельно.

Alibaba сейчас рекомендует workspace-dedicated endpoint, например:

Singapore:
https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com

Germany:
https://{WorkspaceId}.eu-central-1.maas.aliyuncs.com

US:
https://{WorkspaceId}.us-east-1.maas.aliyuncs.com

Старые общие DashScope domains пока существуют не во всех регионах и уже не являются предпочтительным вариантом для новых production-интеграций.

Region и deployment scope — разные вещи

Это важный нюанс, который легко пропустить.

Region определяет точку входа и место хранения static data.

Service deployment scope определяет, где Alibaba может выполнять непосредственно model inference.

Например, Frankfurt поддерживает как Global, так и EU scope. Если выбран Global, статические данные остаются во Frankfurt, но вычисления могут планироваться в глобальном inference pool. Чтобы ограничить processing географией ЕС, нужна модель и deployment scope с поддержкой EU.

Аналогичная логика используется для US scope в Virginia.

Поэтому сам факт использования Frankfurt endpoint еще не означает, что вся inference-обработка гарантированно останется внутри ЕС. Перед production-запуском нужно проверить deployment scope конкретной модели.

Регистрация в Alibaba Cloud

Для международного Model Studio используется Alibaba Cloud International:

https://www.alibabacloud.com

Регистрация состоит из нескольких уровней.

Сначала создается account: указывается email, тип аккаунта и Country/Region. Затем для полноценного использования платных cloud services добавляются security, mobile и billing information.

Country/Region нужно выбирать внимательно: оно определяет billing currency и налоги и после регистрации не меняется. Если страна была выбрана неверно, Alibaba рекомендует создать новый account.

Мобильный номер должен соответствовать выбранному Country/Region. Международный сайт предназначен для пользователей и организаций за пределами материкового Китая.

Для покупки ресурсов в Mainland China и некоторых корпоративных функций требуется дополнительная identity verification. Для обычного Model Studio в международном регионе часто достаточно корректно завершенного international account и billing.

Как активировать Model Studio и получить API key

После регистрации Alibaba Cloud account:

  1. Откройте Model Studio.
  2. Выберите нужный регион — например, Singapore.
  3. Активируйте Model Studio и Large Model Inference.
  4. Примите service agreement.
  5. Создайте Workspace, если выбранный регион использует workspace model.
  6. Откройте API Key page.
  7. Создайте API key именно для этого региона.
  8. Скопируйте Workspace ID и региональный endpoint.

API key не привязан к одной модели. Один pay-as-you-go key может использовать модели, доступные в его region/workspace.

Для Token Plan и Coding Plan используются отдельные ключи формата sk-sp-, поэтому их не следует путать с обычным pay-as-you-go API key.

Free quota

Для многих моделей Model Studio предоставляет free quota, но сейчас она в основном относится к Singapore / International scope.

Например, Qwen3.8 Max и Flash имеют по 1 млн бесплатных токенов. Quota обычно действует 90 дней от даты активации Model Studio, релиза модели или approval — в зависимости от конкретного правила.

В других регионах такой же free quota может отсутствовать.

Это делает Singapore наиболее простым регионом для первого теста международного пользователя, но не обязательно лучшим для production с требованиями к data location.

Оплата

Alibaba Cloud Model Studio поддерживает pay-as-you-go и отдельные subscription-механизмы.

Payment methods зависят от Country/Region и contracting entity аккаунта. Международная документация Alibaba перечисляет банковские карты, PayPal/Alipay и в отдельных корпоративных сценариях банковский перевод.

Текущий Payment FAQ отдельно указывает, что стандартное добавление карты поддерживает международные Visa, Mastercard, American Express и JCB; prepaid, gift, virtual и UnionPay-only cards в этом flow не поддерживаются.

При регистрации payment method может использоваться и для небольшой temporary authorization verification.

Для компании доступны billing history, invoices, tax information и другие обычные инструменты Alibaba Cloud Expenses and Costs.

Можно ли пользоваться из России

В опубликованной документации Alibaba Cloud и Model Studio я не нашел отдельного правила, которое прямо запрещало бы регистрацию Model Studio только по факту нахождения пользователя в России. При этом Alibaba Cloud требует соблюдать применимые экспортные ограничения и экономические санкции, включая ограничения ООН, Китая, ЕС, США, Сингапура и других применимых юрисдикций.

Практическая доступность состоит из нескольких независимых частей:

  • можно ли выбрать нужную страну при регистрации international account;
  • проходит ли verification телефона;
  • принимает ли Alibaba доступный платежный инструмент;
  • не подпадает ли конкретное физлицо или компания под применимые санкционные ограничения.

Отдельной гарантии приема карт российских банков Alibaba Cloud не дает. Платежная документация лишь требует поддерживаемую международную карту и успешное прохождение проверки банком-эмитентом. Поэтому для проекта из РФ billing нужно проверить заранее, до того как Model Studio станет критичной production-зависимостью.

Если прямая оплата неудобна, Qwen можно использовать и у сторонних inference-провайдеров либо развернуть open-weight модель самостоятельно. Но это уже другой backend: цены, data location, tools и доступные версии модели могут отличаться от Alibaba Cloud Model Studio.

Безопасность и использование данных для обучения

В официальном FAQ Alibaba Cloud прямо заявляет, что Model Studio не использует customer business data для обучения моделей без явного согласия.

Передаваемые данные шифруются, а документация указывает AES-256 для данных в рамках платформы.

Это существенное отличие от некоторых consumer AI-сервисов: API-вызов Model Studio не означает автоматического использования бизнес-данных для последующего обучения Qwen.

Однако data privacy нельзя свести только к training policy. Нужно отдельно учитывать выбранный region, deployment scope, используемые external tools и сторонние модели. Например, Global inference scope отличается от географически ограниченного EU scope.

Workspaces и изоляция проектов

Model Studio использует Workspaces для разделения ресурсов, permissions и business data.

RAM-пользователям можно выдавать разные workspace permissions, чтобы команды и проекты не имели автоматического доступа к данным друг друга.

Для production это удобнее одного общего API key, который используется во всех средах. Логичнее разделять development, staging, production и разные business units на уровне workspace/credentials.

API в PHP

Официального DashScope SDK для PHP нет, но для PHP это не проблема: OpenAI-compatible API — обычный HTTP.

Пример для Singapore:

<?php

$apiKey = $_ENV['DASHSCOPE_API_KEY'];
$workspaceId = $_ENV['MODEL_STUDIO_WORKSPACE_ID'];

$url = sprintf(
    'https://%s.ap-southeast-1.maas.aliyuncs.com/compatible-mode/v1/chat/completions',
    $workspaceId
);

$payload = [
    'model' => 'qwen3.8-flash',
    'messages' => [
        [
            'role' => 'user',
            'content' => 'Кратко объясни, что такое dependency injection.',
        ],
    ],
];

$ch = curl_init($url);

curl_setopt_array($ch, [
    CURLOPT_POST => true,
    CURLOPT_RETURNTRANSFER => true,
    CURLOPT_HTTPHEADER => [
        'Authorization: Bearer ' . $apiKey,
        'Content-Type: application/json',
    ],
    CURLOPT_POSTFIELDS => json_encode(
        $payload,
        JSON_UNESCAPED_UNICODE
    ),
]);

$response = curl_exec($ch);

if ($response === false) {
    throw new RuntimeException(curl_error($ch));
}

$data = json_decode(
    $response,
    true,
    flags: JSON_THROW_ON_ERROR
);

echo $data['choices'][0]['message']['content'] ?? '';

В Laravel удобнее использовать HTTP Client:

$url = sprintf(
    'https://%s.ap-southeast-1.maas.aliyuncs.com/compatible-mode/v1/chat/completions',
    config('services.model_studio.workspace_id')
);

$response = Http::withToken(config('services.model_studio.key'))
    ->post($url, [
        'model' => 'qwen3.8-flash',
        'messages' => [
            [
                'role' => 'user',
                'content' => 'Кратко объясни dependency injection.',
            ],
        ],
    ]);

$text = $response->throw()->json('choices.0.message.content');

API key и Workspace ID лучше хранить в .env, а прикладной код должен получать их через конфигурацию. Ключ нельзя отдавать непосредственно во frontend.

Rate limits и Provisioned Throughput

У каждой модели есть собственные RPM/TPM limits. Для небольшого приложения стандартного pay-as-you-go обычно достаточно.

Для предсказуемой высокой нагрузки Model Studio также предлагает Provisioned Throughput Unit (PTU). В отличие от обычного pay-as-you-go, где вы платите за фактически использованные токены в shared capacity, PTU резервирует определенный throughput.

Это полезно для крупного production с постоянным трафиком и SLA-требованиями. Для небольшого SaaS PTU обычно избыточен: pay-as-you-go проще.

Почему региональная цена может различаться

У Model Studio нет одной глобальной цены Qwen API.

Например, qwen3.8-max:

Singapore / International:  $2 / $6
Global в ряде регионов:     $1,65 / $4,951

qwen3.8-flash:

Singapore / International:  $0,15 / $0,47
Global в ряде регионов:     $0,113 / $0,382

Это связано с тем, что Alibaba разделяет region, deployment scope и inference resource pools.

Поэтому при сравнении Qwen с OpenAI или Claude недостаточно скопировать одну строку из pricing table. Нужно определить, в каком регионе будет работать проект и какой deployment scope ему нужен.

Что особенно выделяет Model Studio

Главное преимущество платформы — не одна конкретная модель.

Во-первых, Qwen3.8 сочетает очень большой context window, мультимодальность, reasoning и низкую стоимость Flash.

Во-вторых, у Model Studio сразу три удобных API-пути: OpenAI Chat/Responses, Anthropic Messages и собственный DashScope.

В-третьих, платформа закрывает значительно больше LLM: Qwen Image, Wan Video, Qwen Omni, ASR, TTS, embeddings, reranking, OCR и translation доступны внутри одного Alibaba Cloud account.

В-четвертых, часть Qwen можно self-host. Это снижает долгосрочную зависимость от одного cloud API, хотя лицензии разных open-weight моделей необходимо проверять отдельно.

Наконец, Alibaba Cloud дает довольно детальную региональную модель deployment. Для международного бизнеса это полезнее абстрактного обещания «данные в облаке», хотя выбирать region и service scope нужно внимательно.

Какие есть ограничения

Ширина Model Studio одновременно делает платформу сложнее single-endpoint API.

Регионов много, и у каждого собственные API keys, endpoints, список моделей и pricing. Модель, доступная в Singapore, может отсутствовать в EU scope Frankfurt.

Часть функций работает только через DashScope, часть — через OpenAI Responses, часть использует отдельный realtime protocol. Поэтому «OpenAI-compatible» не означает, что вся Model Studio полностью заменяется одним OpenAI SDK.

Model lifecycle также достаточно быстрый: Alibaba регулярно выпускает snapshots, переводит старые модели в legacy и меняет рекомендации.

Наконец, старые no-code Agent/Workflow components имеют серьезные ограничения доступности для новых Singapore accounts, поэтому на них не стоит без проверки строить архитектуру нового международного продукта.

Какую модель выбрать

Для большинства новых проектов логично начать с Qwen3.8 Flash. При миллионном контексте, multimodal input и цене $0,15/$0,47 в International scope она достаточно дешевая, чтобы использовать ее как основной backend.

Qwen3.8 Max стоит подключать для сложных запросов, где evals показывают заметное преимущество. Использовать Max для простой классификации или extraction экономически трудно оправдать, когда Flash стоит более чем в десять раз дешевле на типичном большом запросе.

Для realtime audio/video нужен Qwen3.8 Omni Flash Realtime.

Для изображений — Qwen Image 3.0 или 3.0 Pro.

Для видео — Wan.

Для transcription, TTS, embeddings, reranking и перевода лучше выбирать специализированную модель вместо универсального Max.

Если важен self-hosting, отдельно нужно смотреть open-weight Qwen3.8 и проверять лицензию конкретного repository.

Итог

Alibaba Qwen API в 2026 году — это уже не просто недорогая китайская альтернатива GPT. В Qwen3.8 есть миллионный мультимодальный контекст, регулируемый reasoning, function calling и Structured Outputs, а Model Studio добавляет Responses API, web search, Code Interpreter, image/video/audio-модели, embeddings, OCR и мультимодельный каталог.

Особенно интересна API-совместимость. Один и тот же Qwen можно подключать через OpenAI Chat Completions, Responses API или Anthropic Messages, а при необходимости перейти на native DashScope. Для продукта, который не хочет жестко привязываться к одному client protocol, это практическое преимущество.

Но Model Studio требует больше внимания к инфраструктуре, чем простой single-endpoint API. Region, deployment scope, API key, model availability и цена связаны между собой. Выбор Frankfurt не гарантирует EU-only inference без соответствующего service scope, а ключ Singapore не работает с Virginia.

Практичная отправная точка для международного проекта выглядит так: Singapore для первого теста и free quota, Qwen3.8 Flash как базовая модель, Max как escalation tier, OpenAI-compatible API для быстрой интеграции и отдельная проверка нужного региона перед production.

Если добавить возможность использовать open-weight Qwen вне Alibaba Cloud, Model Studio становится интересен не только низкой стоимостью, но и тем, что дает несколько путей развития одного продукта: от дешевого managed API до мультимодельной облачной платформы или собственного inference.


Официальные источники

Дата публикации:

Обзор Alibaba Qwen API и Model Studio: модели, возможности, цены и подключение в 2026 году

Наши проекты

  • Anilau
    Веб-разработка и запуск цифровых продуктов.
  • Botmarketing
    Telegram-бот, mini-app, витрина и CRM для малого бизнеса.
  • vietnam.anilau.com
    Объявления, местные услуги и практичные гиды по Вьетнаму.
  • bali.anilau.com
    Объявления о товарах и услугах на Бали.
  • ceylon.anilau.com
    Объявления, услуги и полезная информация о Шри-Ланке.
  • mauricetop.anilau.com
    Платформа объявлений и материалов о жизни на Маврикии.
  • funlab
    Платформа для создания и запуска игр с помощью ИИ.
  • aura
    AI-дневник настроения и пространство для творчества.
  • drained
    Telegram Mini App для дневных отметок усталости и восстановления.
  • vietinfodesk
    Практичные гиды, сервисы и помощь для жизни во Вьетнаме.
  • frau
    Визитка уютного кафе в Нячанге с вафлями, завтраками и напитками.

Работаем в партнерстве с креативным агентством Deep.

Попробуйте наши плагины для Codex и Claude