Batch Inference vs Online Serving
Batch (offline) inference tối đa hoá throughput trên cả tập dữ liệu không có ràng buộc độ trễ, trong khi online serving tối ưu độ trễ từng request với batching và autoscaling khác nhau.
AI/ML SystemsTrung bình2026-07-10
Tài liệu tham khảo
Mở rộng
Animation gốc là một file HTML tự chứa, có thể nhúng lại ở bất kỳ trang nào khác. Mở file gốc