GPU MPS: chia sẻ phân đoạn (fractional sharing) nhiều tiến trình trên một GPU
Với NVIDIA Multi-Process Service (MPS), kernel của nhiều tiến trình chạy ĐỒNG THỜI trên cùng GPU, chia sẻ SM thay vì context-switch time-slicing — giúp một lô model nhỏ, utilization thấp giữ GPU luôn bận, nhưng đổi lại không có cách ly cứng về bộ nhớ hay fault giữa các tiến trình.
AI/ML SystemsNâng cao2026-08-25
Tài liệu tham khảo
Mở rộng
Animation gốc là một file HTML tự chứa, có thể nhúng lại ở bất kỳ trang nào khác. Mở file gốc