PPO - Vòng lặp cập nhật policy
PPO tính advantage từ reward và value head, sau đó clip tỉ lệ xác suất để cập nhật policy an toàn, tránh lệch quá xa mô hình gốc.
AI/ML SystemsNâng cao2026-07-15
Tài liệu tham khảo
Mở rộng
Animation gốc là một file HTML tự chứa, có thể nhúng lại ở bất kỳ trang nào khác. Mở file gốc