proto.lib

Reranker Cascade: phân bổ latency budget theo tầng

Một retriever rẻ trả về vài trăm ứng viên, một model tầm trung cắt xuống vài chục, rồi cross-encoder hoặc LLM judge đắt tiền chỉ chấm điểm nhóm cuối cùng — mỗi tầng phải nằm trong ngân sách latency vì cost mỗi item nhân với số lượng đầu vào, và recall của tầng trước giới hạn chất lượng tối đa của toàn bộ pipeline.

AI/ML SystemsNâng cao2026-08-24
Reranker Cascade: phân bổ latency budget theo tầng

Mở rộng

Animation gốc là một file HTML tự chứa, có thể nhúng lại ở bất kỳ trang nào khác. Mở file gốc

Liên quan