В 3:12 пакетное задание прекратилось с трассировкой стека, которую я видел раньше. Одна неверная строка в чистом файле журнала. Большая языковая модель, за которую я заплатил, переписала мое регулярное выражение синтаксического анализа в одном ответе, задание восстановилось, а счет увеличился...
В 3:12 пакетное задание прекратилось с трассировкой стека, которую я видел раньше. Одна неверная строка в чистом файле журнала. Большая языковая модель, за которую я заплатил, переписала мое регулярное выражение синтаксического анализа в одном ответе, задание было восстановлено, а счет вырос на несколько центов. Закрывая свой ноутбук, я задавался вопросом: сможет ли бесплатная модель уловить ту же неверную линию? Я никогда этого не проверял, поэтому сделал это привычкой. Теперь, прежде чем какая-либо функция ИИ получит бюджет, я проверяю ее через 20-минутный тест на худших входных данных, которые могу найти.
Я проводил эти тесты на платформе с открытым исходным кодом MonkeyCode, которая дает вам доступ к бесплатным моделям и бесплатному серверу для экспериментов. Раскрытие информации: эта статья была подготовлена в рамках информационно-пропагандистской программы MonkeyCode. Настройка представляет собой конечную точку, совместимую с OpenAI, текстовую подсказку и функцию оценки. Никакого Kubernetes, никакой векторной базы данных, никакого пятистраничного документа об архитектуре. Просто скрипт, который выполняет HTTP-вызов, анализирует ответ JSON и сообщает, действительно ли модель выполнила свою работу.
Задача, которую я использую для каждого нового кандидата, намеренно скучна: извлечь структурированную запись JSON из фрагментированной строки журнала. Вот точная подсказка, которую я отправляю каждому моду