Большие языковые модели не становятся согласованными просто потому, что они становятся больше. Они становятся полезными, когда их возможности формируются в соответствии с тем, что на самом деле предпочитают люди. Языковая модель может генерировать грамматически правильный текст, писать код и т. д.
Большие языковые модели не становятся согласованными просто потому, что они становятся больше. Они становятся полезными, когда их возможности формируются в соответствии с тем, что на самом деле предпочитают люди.
Языковая модель может генерировать грамматически правильный текст, писать код, обобщать документы, отвечать на вопросы и рассуждать над сложными инструкциями.
Но есть более глубокая проблема:
Как модель узнает, какой из множества возможных ответов на самом деле лучше?
Рассмотрим эту простую подсказку:
«Объясните Kubernetes новичку».
LLM может производить:
очень техническое объяснение,
пятистрочное упрощенное объяснение,
подробный мастер-класс,
аналогия с транспортными контейнерами,
ответ, содержащий ненужный жаргон,
или ответ, впечатляющий технически, но совершенно не соответствующий уровню пользователя.
Многие из этих ответов могут быть лингвистически обоснованными.
Лишь некоторые из них предпочтительнее.
Это различие лежит в основе обучения с подкреплением на основе обратной связи с человеком (RLHF).
RLHF предоставляет механизм, позволяющий взять что-то, что сложно выразить как традиционную функцию потерь — человеческие предпочтения — и преобразовать это в обучаемый сигнал.
Важное понимание:
Предварительное обучение учит LLM тому, как выглядит язык. По