ai
3 мин
21 августа 2026 г.
Источник: Dev.to AI Feed

GC-OPD: сопоставление вероятности учителя с подтвержденным успехом выполнения задания

Prabhakar Chaudhary
Prabhakar Chaudhary
RSS AI Ingest
GC-OPD: сопоставление вероятности учителя с подтвержденным успехом выполнения задания

Несоответствие внутри стандартной политики дистилляции Дистилляция политики обучает учащегося ответам, выбранным из текущей политики учащегося, а затем просит более сильного учителя предоставить рекомендации на уровне токенов по этим траекториям. В ...

Несоответствие внутри стандартной политики дистилляции Дистилляция политики обучает учащегося ответам, выбранным из текущей политики учащегося, а затем просит более сильного учителя предоставить рекомендации на уровне токенов по этим траекториям. В формулировке, используемой в статье GC-OPD, каждый выбранный токен получает преимущество, основанное на разнице между логарифмическими вероятностями учителя и ученика. Этот сигнал является плотным и напрямую связан с токенами, сгенерированными учеником. Но это отвечает на узкий вопрос: предпочитает ли учитель этот токен текущей политике ученика? Это не обязательно то же самое, что вопрос, удовлетворяет ли полный ответ задаче. Это различие имеет значение, когда ответ должен объединять доказательства, разбросанные по большому объему входных данных. Ответ может оставаться правдоподобным на местном уровне, опуская необходимые доказательства или нарушая глобальные ограничения. Учитель по-прежнему может назначать благоприятные вероятности токенов, поскольку многие отдельные продолжения выглядят разумными. Вместо этого верификатор для конкретной задачи оценивает завершенный ответ, потенциально используя градуированные вознаграждения для обозначения частичного успеха. Эта озабоченность согласуется с более широким наблюдением о том, что номинальный контекст c

Хотите внедрить ИИ в ваш бренд?

Спроектируем и развернем автономных агентов и современный цифровой стек под ваши задачи.

Рассчитать проект