DPO - Direct Preference Optimization

Học từ cặp chosen/rejected, so sánh log-prob với reference model

Phím tắt: ←/→ từng bước · Space tự chạy/tạm dừng