Я понял, что у меня проблемы, когда демонстрационный агент сделал именно то, что я просил в пятницу, а затем сделал это дважды в понедельник. Та же подсказка. Но на этот раз второй вызов инструмента привел к реальному дальнейшему действию и взимал с кого-то двойную плату. В этот момент я остановился...
Я понял, что у меня проблемы, когда демонстрационный агент сделал именно то, что я просил в пятницу, а затем сделал это дважды в понедельник.
Та же подсказка.
Тот же API.
Тот же красивый след.
Но на этот раз второй вызов инструмента привел к реальному дальнейшему действию и взимал с кого-то двойную плату.
Это был момент, когда я перестал относиться к агентам как к умным подсказкам и начал относиться к ним как к нестабильной интеграции программного обеспечения с прикрепленным LLM.
Этот сдвиг изменил мое отношение к обеспечению качества ИИ-агента.
Большинство команд до сих пор тестируют агентов так, будто сейчас 2023 год. Они запускают несколько подсказок счастливого пути, смотрят, как GPT-4o или Клод правильно вызывают функцию, возможно, публикуют запись экрана в Slack и называют задачу выполненной.
Затем появляется продукт с неверным форматом JSON, повторными попытками, устаревшей памятью, Stripe 500, тайм-аутом HubSpot и повторяющимися действиями, которые никто не предусмотрел.
На тот момент модель не «сошла с ума».
Ваш контроль качества не удался.
Демо никогда не было самой сложной частью
Заставить агента вызова инструментов выглядеть умным в демо-версии теперь легко.
n8n упрощает задачу
OpenAI упрощает задачу
Антропный делает это проще
Вы подключаете инструмент HTTP-запросов, возможно, инструмент пользовательского кода, возможно, позволяете агенту вызвать полный рабочий процесс n8n через инструмент рабочего процесса Call n8n, и через час у вас есть что-то, что