Баланс и использование

Как работает оплата

AI Cloud считает стоимость по фактическим input/output токенам. У каждой модели есть собственная цена за 1M токенов, контекстное окно и serving-вариант.

Цена живёт на модели

Используйте точный ID из каталога моделей. Базовый вариант модели публикуется без суффикса, а дешёвые shared-endpoint варианты могут иметь отдельный id вроде :flex.

  • цена входа применяется к prompt/input-токенам;
  • если upstream прислал cached input tokens и у модели задана цена кэш-входа, эта часть входа считается отдельно;
  • цена выхода применяется к сгенерированным output-токенам;
  • если обе цены равны 0, запрос не списывает баланс;
  • контекст задаётся моделью и конфигурацией inference endpoint.

Как считается usage

Gateway принимает OpenAI-совместимый ответ от inference engine, нормализует его и записывает prompt_tokens, completion_tokens, при наличии cached_input_tokens и стоимость в usage_logs. Для streaming-запросов gateway сам требует у upstream финальный usage chunk.

Списание происходит после успешного ответа модели. Если inference engine вернул ошибку, запрос не тарифицируется.

Баланс

Для платных моделей нужен положительный баланс. После успешной генерации стоимость списывается с баланса аккаунта. Если несколько запросов уже находятся в работе, баланс может уйти слегка ниже нуля; новые платные запросы будут заблокированы до пополнения.

До подключения платёжного провайдера баланс можно пополнять вручную для закрытого теста. Текущее состояние видно на странице Панель управления → Баланс.

Профиль лимитов

Профиль лимитов управляет anti-abuse ограничениями: RPM и числом API-ключей. Это не подписка и не источник цены модели.