⚡ TL;DR: Относитесь к оценкам как к модульным тестам для недетерминированных результатов. Создавайте «золотые наборы данных», детерминированные проверки и выставляйте оценки LLM в качестве судьи, а затем добавляйте элементы регрессии, чтобы вы могли отправлять доказательства, а не вибрации. Запускайте как офлайн, так и онлайн. Ты ча...
⚡ TL;DR: Относитесь к оценкам как к модульным тестам для недетерминированных результатов. Создавайте «золотые наборы данных», детерминированные проверки и выставляйте оценки LLM в качестве судьи, а затем добавляйте элементы регрессии, чтобы вы могли отправлять доказательства, а не вибрации. Запускайте как офлайн, так и онлайн.
Содержание
Вы изменили подсказку и понятия не имеете, стало ли она лучше.
Принцип: оценки — это модульные тесты для недетерминированного вывода.
Форма конвейера оценки
Выбор метода оценки
Крошечная оценочная подвеска
Оффлайн или онлайн: вам нужно и то, и другое
Распространенные ошибки, которые стоят часов
Вынос
Куда идти дальше
Вы изменили подсказку и понятия не имеете, стало ли она лучше.
Вот самый распространенный момент в развитии LLM. Вы настраиваете системную подсказку, добавляете строку, переписываете инструкцию, меняете модель. Вы запускаете его на единственном открытом примере, результат выглядит лучше, и вы его отправляете. Затем, через неделю, пользователь жалуется, что бот стал хуже выполнять то, что вы никогда не думали тестировать, и у вас нет возможности доказать, помогло ли ваше изменение, навредило или вообще ничего не сделало.
Это доставка, основанная на вибрации, и поначалу почти все так делают. Причина проста: с обычным кодом вы пишете тест, он проходит или не проходит, готово. При использовании LLM результат при каждом прогоне разный.