Баланс и использование
Как работает оплата
AI Cloud считает стоимость по фактическим input/output токенам. У каждой модели есть собственная цена за 1M токенов, контекстное окно и serving-вариант.
Цена живёт на модели
Используйте точный ID из каталога моделей. Базовый вариант модели публикуется без суффикса, а дешёвые shared-endpoint варианты могут иметь отдельный id вроде :flex.
- цена входа применяется к prompt/input-токенам;
- если upstream прислал cached input tokens и у модели задана цена кэш-входа, эта часть входа считается отдельно;
- цена выхода применяется к сгенерированным output-токенам;
- если обе цены равны 0, запрос не списывает баланс;
- контекст задаётся моделью и конфигурацией inference endpoint.
Как считается usage
Gateway принимает OpenAI-совместимый ответ от inference engine, нормализует его и записывает prompt_tokens, completion_tokens, при наличии cached_input_tokens и стоимость в usage_logs. Для streaming-запросов gateway сам требует у upstream финальный usage chunk.
Списание происходит после успешного ответа модели. Если inference engine вернул ошибку, запрос не тарифицируется.
Баланс
Для платных моделей нужен положительный баланс. После успешной генерации стоимость списывается с баланса аккаунта. Если несколько запросов уже находятся в работе, баланс может уйти слегка ниже нуля; новые платные запросы будут заблокированы до пополнения.
До подключения платёжного провайдера баланс можно пополнять вручную для закрытого теста. Текущее состояние видно на странице Панель управления → Баланс.
Профиль лимитов
Профиль лимитов управляет anti-abuse ограничениями: RPM и числом API-ключей. Это не подписка и не источник цены модели.