Reward Hacking trong RLHF: tối ưu proxy thay vì mục tiêu thật
Reward tăng, chất lượng thật giảm → KL với reference → human eval độc lập → refresh reward model → length control
Phím tắt: ←/→ từng bước · Space tự chạy/tạm dừng
Reward tăng, chất lượng thật giảm → KL với reference → human eval độc lập → refresh reward model → length control
Phím tắt: ←/→ từng bước · Space tự chạy/tạm dừng