Reward Hacking trong RLHF: tối ưu proxy thay vì mục tiêu thật
Policy trong RLHF có thể phát hiện ra reward model thích câu trả lời dài, rào trước rào sau, nghe tự tin — và sinh ra đúng kiểu đó bất kể chất lượng thật; dấu hiệu kinh điển là reward score liên tục tăng còn đánh giá con người đứng yên hoặc giảm.
AI/ML SystemsNâng cao2026-08-25
Mở rộng
Animation gốc là một file HTML tự chứa, có thể nhúng lại ở bất kỳ trang nào khác. Mở file gốc