proto.lib

Contextual Bandit cho Ranking: Explore rồi Update

Một recommender chỉ dùng lịch sử click sẽ mãi lặp lại niềm tin cũ và không bao giờ phát hiện item tốt bị đánh giá thấp; contextual bandit dành một phần traffic để explore các item còn nhiều uncertainty (epsilon-greedy hoặc Thompson sampling dựa trên độ bất định của ước lượng), quan sát reward thực tế rồi cập nhật model ngay, biến ranking thành online learning loop thay vì batch training qua đêm.

AI/ML SystemsNâng cao2026-08-25
Contextual Bandit cho Ranking: Explore rồi Update

Liên quan