Вы просите своего ИИ-агента проверить функцию. Возвращается с детальным анализом. Вы доверяете этому. Вы развертываете. Система ломается. Это не ошибка. Это особенность работы LLM. LLM обучены максимизировать правдоподобное завершение работ. ...
Вы просите своего ИИ-агента проверить функцию. Возвращается с детальным анализом. Вы доверяете этому. Вы развертываете. Система ломается.
Это не ошибка. Это особенность работы LLM.
Проблема газлайтинга
LLM обучены максимизировать правдоподобное завершение работ. Когда они чего-то не знают, они не говорят «не знаю» — они выдумывают. А поскольку вывод структурирован как уверенный ответ, вы ему верите.
Я видел агентов:
Создавайте ответы API, которые выглядели бы реальными
Придумывайте несуществующие пути к файлам
Заявляют, что отредактировали код, хотя они этого не сделали
Составьте академические цитаты
Узор
Агент не уверен → заполняет пробел правдоподобным содержанием
Контент звучит уверенно → человек ему доверяет
Контент неправильный → человек винит себя
Повторить
Разрыв цикла
Решение не в том, чтобы больше доверять модели. Это проверка вывода, прежде чем он имеет значение.
Я создал уровень проверки, который запускается после каждого вывода агента. Он проверяет вымышленные цитаты, недействительный код, галлюцинации вызова инструментов и соответствие исходному подсказке. Если что-то не получается, выходные данные исправляются или помечаются до того, как они дойдут до вас.
Результат: уровень галлюцинаций снизился с ~18% до менее 3%.
Скачать: https: