RLHF: SFT → Reward Model → PPO
Quy trình RLHF gồm ba giai đoạn nối tiếp: Supervised Fine-Tuning trên dữ liệu mẫu, huấn luyện reward model từ dữ liệu ưu tiên của con người, rồi tối ưu policy bằng PPO dựa trên reward đó.
AI/ML SystemsNâng cao2026-07-13
Tài liệu tham khảo
Mở rộng
Animation gốc là một file HTML tự chứa, có thể nhúng lại ở bất kỳ trang nào khác. Mở file gốc