ННейроАссистент

RLHF

Обучение модели на оценках людей, чтобы ответы стали полезнее и безопаснее.

Reinforcement Learning from Human Feedback — этап, на котором люди сравнивают варианты ответов модели, а на их оценках обучается функция вознаграждения. Дальше модель оптимизируется под неё. Благодаря RLHF модели следуют инструкциям и придерживаются правил безопасности.

Связанные термины

Хотите не только понять термин, но и выбрать инструмент? Откройте каталог нейросетей с фильтрами по доступу и цене.