На прошлой неделе команда, которую я консультировал, показала мне показатель, которым они гордились: сорок токенов в секунду на новой модели, измеренные в чистом блокноте. Затем они внедрили ту же функцию и увидели, что один пользовательский запрос занимает одиннадцать секунд...
На прошлой неделе команда, которую я консультировал, показала мне показатель, которым они гордились: сорок токенов в секунду на новой модели, измеренные в чистом блокноте. Затем они внедрили ту же функцию и наблюдали, как на один пользовательский запрос от клика до получения ответа уходит одиннадцать секунд. Модель была быстрой, и поездка туда и обратно оказалась катастрофой. Этот разрыв не является проблемой настройки; это проблема измерения, и она будет вас раздражать, пока вы не измените то, что измеряете.
Каждая функция ИИ представляет собой цепочку передач: браузер, периферия, ваш уровень аутентификации, ваш API, очередь, сервер, поставщик модели, уровень персистентности и обратный путь. Число токенов в секунду измеряет ровно одно звено в этой цепочке, и обычно это самое быстрое звено. Остальная часть цепочки — это то, где на самом деле живут задержки, затраты и сбои. Так почему же мы продолжаем публиковать тесты для единственного звена, которое никогда не ломается?
Сейчас в DEV ведутся здоровые споры о том, что на самом деле измеряет значок ИИ, и то же сомнение справедливо и в отношении эталонных моделей: они с большой точностью измеряют неправильные вещи. По мнению пользователей, число — это круговой путь, и единственный честный способ его измерить — запустить всю цепочку на самой слабой легитимной среде.