Первый запрос всегда терпел неудачу: отладка холодного запуска на AI-сервере бесплатного уровня На прошлой неделе я переместил виджет демонстрационного чата на бесплатный сервер MonkeyCode, подключил его к бесплатному доступу к модели платформы и сразу же столкнулся с ошибкой, которая разозлила...
Первый запрос всегда терпел неудачу: отладка холодного запуска на AI-сервере бесплатного уровня
На прошлой неделе я переместил виджет демонстрационного чата на бесплатный сервер MonkeyCode, подключил его к бесплатной модели платформы и сразу же столкнулся с ошибкой, которая не имела смысла. Локальный хост ответил через 300 миллисекунд, производство ответило «тайм-аут», и шаблон был настолько последовательным, что я мог установить часы по нему: первый запрос после любой паузы умер, а второй прошел. Раскрытие информации: эта статья была подготовлена в рамках информационно-пропагандистской программы MonkeyCode.
Я провел день, обвиняя неправильные слои — сначала CORS, затем мой код выборки, затем формат потоковой передачи модели — прежде чем я понял, что сам сервер спит. Это ретроспектива отладки, а не обзор продукта, поэтому вот симптом, основная причина и пользовательский интерфейс повтора, которые наконец-то сделали виджет честным. Все расследование заняло около часа, после того как я перестал гадать и начал измерять, а эти методы применимы к любой размещенной конечной точке ИИ.
Симптом, который не имел смысла
Воспроизведение было скучно надежным: подожди пятнадцать минут, отправь сообщение, смотри, как запрос висит десять секунд, а потом проваливается из-за сетевой ошибки. Отправить то же самое