RLHF: SFT → Reward Model → PPO

Ba giai đoạn nối tiếp để căn chỉnh model theo sở thích con người

Phím tắt: ←/→ từng bước · Space tự chạy/tạm dừng