ai
3 мин
31 августа 2026 г.
Источник: Dev.to AI Feed

Мы продолжаем пытаться сломать наши собственные ворота

Agateon
Agateon
RSS AI Ingest
Мы продолжаем пытаться сломать наши собственные ворота

В последнем посте утверждалось, что ворота дают вам право отвести взгляд. Но отведите взгляд от чего — от агента или самих ворот: кода, который кто-то написал, оценивая работу, выполненную той же системой, которая, возможно, захочет ему угодить? Итак, кто смотрит часы...

В последнем посте утверждалось, что ворота дают вам право отвести взгляд. Но отведите взгляд от чего — от агента или самих ворот: кода, который кто-то написал, оценивая работу, выполненную той же системой, которая, возможно, захочет ему угодить? Так кто же наблюдает за сторожем? Под воротами я подразумеваю любую проверку, которую должна пройти фаза работы, прежде чем она будет считаться выполненной — нет ворот, нет прогресса. Этот пост посвящен тому, что делает ворота достаточно надежными, чтобы в первую очередь контролировать агента. Короткий ответ: ничто не делает его заслуживающим доверия, кроме попыток взломать его снова и снова и рассматривать каждую успешную атаку как запрос на добавление функции. ТЛ;ДР Ворота, которые читают собственную историю агента, — это не ворота, а посмертное воспроизведение пост-01. Режим отказа, который вы не можете спроектировать, — это одна и та же цепочка доверия: автор и рецензент — одна и та же система с одним и тем же контекстом. Решением является разделение, осуществляемое механически. Мы атакуем наши собственные ворота по трем направлениям: классифицируем красные сигналы TDD, чтобы неработающий тест не мог считаться законным красным, добавляем независимого судью, который повторно проверяет все в новом контексте, и делаем вердикт судьи рекомендательным — код выхода остается пороговым значением, а не мнением модели. Честный

Хотите внедрить ИИ в ваш бренд?

Спроектируем и развернем автономных агентов и современный цифровой стек под ваши задачи.

Рассчитать проект