AgentSelfEdit — это дополнительная программа с открытым исходным кодом, которая переписывает собственную системную подсказку на основе обратной связи о выполнении. Он проводит A/B-тестирование редакций и продвигает только статистически проверенных победителей. Код: github.com/deghosal-2026/agent-self-edit. 15 итераций. 4150 LLM ...
AgentSelfEdit — это дополнительная программа с открытым исходным кодом, которая переписывает собственную системную подсказку на основе обратной связи о выполнении. Он проводит A/B-тестирование редакций и продвигает только статистически проверенных победителей. Код: github.com/deghosal-2026/agent-self-edit.
15 итераций. 4150 звонков LLM. Ноль промоакций. Ворота сказали «нет» — 15 раз подряд.
И это было правильно каждый раз.
Я потратил полную сессию на создание и тестирование этой системы. Думал, получу повышение — правку одобрит ворота, подсказка улучшится, точность повысится. Вместо этого я получил максимально честный результат: ворота отвергли все, и отклонения были правильными.
Вот что произошло, как я нашел двухстрочную ошибку, которая пропускала шум как «улучшение», и почему ворота, которые никогда не продвигаются, — самое ценное, что я создал.
Проблема: как узнать, что редактирование на самом деле лучше?
Самая оперативная оптимизация — это флюиды. Вы меняете приглашение, запускаете его на нескольких примерах и, если оно «выглядит лучше», отправляете его. Нет никакой статистики. Нет контрольной группы. Никакого теста значимости. Просто интуиция.
Это отлично работает, если человек настраивает подсказку вручную. Но когда вы создаете систему, которая самостоятельно переписывает свои собственные подсказки — LLM, предлагающий правки, система