Skip to main content

Каталог моделей

GET /v1/models — живой каталог. Каждая запись содержит имя модели, контекстное окно, принимаемые входные данные и вашу цену. GET /v1/models/{model} возвращает одну запись.
Каталог меняется: модели добавляются и выводятся из эксплуатации. Читайте его из API, а не храните список в коде.
Имя модели имеет вид vendor/model, например openai/gpt-4o-mini. Регистр и разделители не важны: anthropic/claude-haiku-4.5 и anthropic/claude-haiku-4-5 — одна и та же модель.
string
обязательно
Значение для поля model.
string
Отображаемое имя.
string
обязательно
Производитель модели.
string
text — обслуживается /v1/chat/completions и /v1/responses; image, video, music, audio — соответствующим /v1/{kind}/jobs.
integer
Контекстное окно в токенах (промпт плюс ответ).
integer
Максимальная длина ответа, если известна.
string[]
text, image, audio, video, file.
object
обязательно
Ваша цена в USD. Для текста — input_per_mtok, output_per_mtok и cached_input_per_mtok (за миллион токенов). Для медиа — unit (image, video, second, request, 1k_characters) и per_unit для самой дешёвой конфигурации.
Поля без данных не передаются, а не заполняются нулями.

Стоимость

Запросы оплачиваются в долларах США и учитываются в микродолларах: 1 µ==0,000001. Текст:
  • Цена за миллион токенов численно равна цене одного токена в µ$.
  • Токены берутся из отчёта usage модели и возвращаются вам без изменений.
  • Минимум 1 µ$ за запрос с токенами; итог округляется вверх.
  • Скрытые токены рассуждений оплачиваются как выходные.
Медиа: задача оплачивается один раз при завершении — сумма в поле cost. estimated_cost — прогноз на момент запуска. Длительность, разрешение, звук и уровень качества повышают цену. Неудачная задача ничего не стоит.

Резервирование средств

Перед запуском максимальная возможная стоимость резервируется на балансе, чтобы параллельные запросы не потратили больше, чем есть на счёте.
  • Текст — промпт плюс max_tokens ответа (4096, если не задан). После завершения резерв заменяется фактической стоимостью.
  • Медиа — стоимость задачи. При первом использовании конфигурации (новая модель, первый 4K-клип) резерв берётся с запасом. Резерв неудачной задачи освобождается сразу.
Если резерв не помещается в свободный баланс, запрос отклоняется с 402 insufficient_balance до начала работы. В meta — required_micro_usd, balance_micro_usd, held_micro_usd.
При небольшом балансе всегда задавайте max_tokens.

Модели с рассуждениями

o-серия, DeepSeek R1 и thinking-варианты, Gemini Pro и Claude в режиме thinking тратят часть max_tokens на скрытые рассуждения. Задавайте им max_tokens от 2000, иначе ответ может оборваться с finish_reason: "length".