← 术语表

RLHF(人类反馈强化学习) Reinforcement Learning from Human Feedback

让人类对模型的多个回答排序,用这些偏好数据训练奖励模型,再强化学习优化——是让 LLM“听话、有帮助、无害”的关键对齐技术。

相关术语