proto.lib

RLHF: SFT → Reward Model → PPO

Quy trình RLHF gồm ba giai đoạn nối tiếp: Supervised Fine-Tuning trên dữ liệu mẫu, huấn luyện reward model từ dữ liệu ưu tiên của con người, rồi tối ưu policy bằng PPO dựa trên reward đó.

AI/ML SystemsNâng cao2026-07-13
RLHF: SFT → Reward Model → PPO

Liên quan