proto.lib

DPO - Direct Preference Optimization

DPO huấn luyện trực tiếp từ cặp phản hồi chosen/rejected bằng cách so sánh log-probability với reference model, không cần reward model riêng.

AI/ML SystemsNâng cao2026-07-15
DPO - Direct Preference Optimization

Tài liệu tham khảo

Mở rộng

Animation gốc là một file HTML tự chứa, có thể nhúng lại ở bất kỳ trang nào khác. Mở file gốc

Liên quan