Model nhỏ cho Classification, Escalate khi tin cậy thấp
Thay vì gọi LLM lớn cho mọi bước phân loại–routing–trích xuất, hệ thống dùng model nhỏ/rẻ (hoặc classifier fine-tune) trước, chỉ escalate lên model lớn khi độ tin cậy dưới ngưỡng; cascade này đánh đổi một phần độ chính xác biên để giảm mạnh chi phí và độ trễ trung bình.
AI/ML SystemsTrung bình2026-08-27
Tài liệu tham khảo
Mở rộng
Animation gốc là một file HTML tự chứa, có thể nhúng lại ở bất kỳ trang nào khác. Mở file gốc