Что есть в сервисе
Всё нужное для старта без лишних слоёв
Выделенные инстансы
Личный endpoint на выделенной GPU
Для задач, где нужен предсказуемый рантайм: отдельный проверенный каталог, Tesla V100 16GB, свой ID инстанса и тот же OpenAI-compatible API.
Целая GPU под инстанс, без шаринга между пользователями.
В SDK меняется только ID модели вида dedicated/ep_xxx.
Оплата по времени работы отдельно от serverless-тарификации токенов.
Оплата по факту использования
Стоимость считается по input и output токенам выбранной модели.
Один публичный контракт
Один и тот же model ID работает и в чате, и в API.
Быстрый старт
Сначала каталог и API-ключи. Подробности остаются в документации.
Цена и биллинг
Понятная модель оплаты
Пополняете баланс и платите только за реально использованные токены. Полные детали по расчёту цены остаются в каталоге моделей и документации.
Цена указывается на модели
Смотрите стоимость входных и выходных токенов прямо в каталоге.
Варианты публикуются отдельно
Бесплатные и другие serving-варианты имеют собственный public model ID.
Списание идёт после ответа
Если запрос завершился ошибкой, баланс не должен уменьшаться.