Reranker Cascade: phân bổ latency budget theo tầng
Một retriever rẻ trả về vài trăm ứng viên, một model tầm trung cắt xuống vài chục, rồi cross-encoder hoặc LLM judge đắt tiền chỉ chấm điểm nhóm cuối cùng — mỗi tầng phải nằm trong ngân sách latency vì cost mỗi item nhân với số lượng đầu vào, và recall của tầng trước giới hạn chất lượng tối đa của toàn bộ pipeline.
AI/ML SystemsNâng cao2026-08-24
Tài liệu tham khảo
Mở rộng
Animation gốc là một file HTML tự chứa, có thể nhúng lại ở bất kỳ trang nào khác. Mở file gốc