Каталог моделей
GET /v1/models — живой каталог. Каждая запись содержит имя модели, контекстное окно, принимаемые входные данные и вашу цену. GET /v1/models/{model} возвращает одну запись.
Имя модели имеет вид vendor/model, например openai/gpt-4o-mini. Регистр и разделители не важны: anthropic/claude-haiku-4.5 и anthropic/claude-haiku-4-5 — одна и та же модель.
string
обязательно
Значение для поля
model.string
Отображаемое имя.
string
обязательно
Производитель модели.
string
text — обслуживается /v1/chat/completions и /v1/responses; image, video, music, audio — соответствующим /v1/{kind}/jobs.integer
Контекстное окно в токенах (промпт плюс ответ).
integer
Максимальная длина ответа, если известна.
string[]
text, image, audio, video, file.object
обязательно
Ваша цена в USD. Для текста —
input_per_mtok, output_per_mtok и cached_input_per_mtok (за миллион токенов). Для медиа — unit (image, video, second, request, 1k_characters) и per_unit для самой дешёвой конфигурации.Стоимость
Запросы оплачиваются в долларах США и учитываются в микродолларах: 1 µ0,000001. Текст:- Цена за миллион токенов численно равна цене одного токена в µ$.
- Токены берутся из отчёта
usageмодели и возвращаются вам без изменений. - Минимум 1 µ$ за запрос с токенами; итог округляется вверх.
- Скрытые токены рассуждений оплачиваются как выходные.
cost. estimated_cost — прогноз на момент запуска. Длительность, разрешение, звук и уровень качества повышают цену. Неудачная задача ничего не стоит.
Резервирование средств
Перед запуском максимальная возможная стоимость резервируется на балансе, чтобы параллельные запросы не потратили больше, чем есть на счёте.- Текст — промпт плюс
max_tokensответа (4096, если не задан). После завершения резерв заменяется фактической стоимостью. - Медиа — стоимость задачи. При первом использовании конфигурации (новая модель, первый 4K-клип) резерв берётся с запасом. Резерв неудачной задачи освобождается сразу.
402 insufficient_balance до начала работы. В meta — required_micro_usd, balance_micro_usd, held_micro_usd.
Модели с рассуждениями
o-серия, DeepSeek R1 и thinking-варианты, Gemini Pro и Claude в режиме thinking тратят частьmax_tokens на скрытые рассуждения. Задавайте им max_tokens от 2000, иначе ответ может оборваться с finish_reason: "length".
