Reinforcement Learning from Human Feedback
中文摘要
RLHF 通过人类反馈强化学习,使大语言模型更好地符合人类的偏好。
English Summary
RLHF aligns large language models with human preferences to ensure better outputs.
Original Excerpt
How RLHF aligns LLMs with human preferences Continue reading on AI Evergreen »