RLHF: SFT → Reward Model → PPO
Ba giai đoạn nối tiếp để căn chỉnh model theo sở thích con người
Phím tắt: ←/→ từng bước · Space tự chạy/tạm dừng
Ba giai đoạn nối tiếp để căn chỉnh model theo sở thích con người
Phím tắt: ←/→ từng bước · Space tự chạy/tạm dừng