Cold start GPU: nạp model & warm-up trước khi nhận traffic
Request đầu tiên sau khi scale-up một pod GPU chậm tới vài giây: kéo image/weights nhiều GB, load lên RAM, copy sang VRAM, rồi lần suy luận đầu phải trả giá khởi tạo CUDA context và JIT/autotune kernel; giải pháp là cache weights sẵn, warm pool và readiness gate bằng inference giả lập.
AI/ML SystemsTrung bình2026-08-20
Tài liệu tham khảo
Mở rộng
Animation gốc là một file HTML tự chứa, có thể nhúng lại ở bất kỳ trang nào khác. Mở file gốc