Learning to Summarize from Human Feedback¶
Authors: Zellers et al. Year: 2020 ArXiv/Link: https://arxiv.org/abs/2009.06032
Summary¶
Demonstrated that learning from human feedback signals enables models to generate higher-quality summaries aligned with human preferences.
Key Concepts¶
- Human feedback
- Reward modeling
- Preference learning
- RLHF foundations
- Alignment
Impact¶
Pioneered using human feedback to improve language model outputs
Category¶
Alignment & RLHF