Первое число, которое вы видите на странице модели, — это контекстное окно: 200 КБ, 400 КБ, миллион. Это читается как емкость: «Я могу передать ему весь свой репозиторий». Правда, и не по делу. Число, которое определяет ваш счет, - это другое число, напечатанное меньшим размером: ...
Первое число, которое вы видите на странице модели, — это контекстное окно: 200 КБ, 400 КБ, миллион. Это читается как емкость: «Я могу передать ему весь свой репозиторий». Правда, и не по делу.
Число, которое определяет ваш счет, — это другое число, напечатанное меньшим размером: сколько модели разрешено написать в одном ответе. Обычно оно в 10–30 раз меньше контекстного окна и незаметно превращает одно задание в цикл.
Сначала три слова, потому что в них живет весь аргумент. Токен составляет примерно ¾ слова — модели выставляют счет за миллион из них по одной цене за ввод (то, что вы отправляете) и более высокой за вывод (то, что пишет модель). Окно контекста — это то, сколько токенов может содержать один запрос. А максимальное количество токенов вывода — max_tokens в большинстве API — это потолок для одного ответа. Когда ответ попадает на него, API не аварийно завершает работу: он останавливается на середине предложения и устанавливает Finish_reason: «длина». Вам выставляется полный счет за усеченную половину.
Разрыв реален, и он меняется в зависимости от маршрута.
Вот одно и то же семейство моделей, видно из двух мест: цифры слева — это то, что предоставляет один OpenAI-совместимый шлюз, цифры справа — собственные опубликованные ограничения Anthropic:
Модель/маршрут
Контекстное окно
Максимальная мощность