探索索引返回术语

RLHF

基于人类反馈的强化学习(Reinforcement Learning from Human Feedback,RLHF)通过收集人类对模型输出的偏好对比数据训练奖励模型(Reward Model),并利用 PPO 等强化学习算法优化策略网络,以最大化生成奖励同时惩罚与基线模型的 KL 散度。它广泛用于提升前沿模型的通用推理、多轮对话与安全对齐能力。

暂时没有与该实体关联的公开内容。