Contextual Bandit cho Ranking: Explore rồi Update
Một recommender chỉ dùng lịch sử click sẽ mãi lặp lại niềm tin cũ và không bao giờ phát hiện item tốt bị đánh giá thấp; contextual bandit dành một phần traffic để explore các item còn nhiều uncertainty (epsilon-greedy hoặc Thompson sampling dựa trên độ bất định của ước lượng), quan sát reward thực tế rồi cập nhật model ngay, biến ranking thành online learning loop thay vì batch training qua đêm.
AI/ML SystemsNâng cao2026-08-25
Tags
Tài liệu tham khảo
Mở rộng
Animation gốc là một file HTML tự chứa, có thể nhúng lại ở bất kỳ trang nào khác. Mở file gốc