proto.lib

Ngân sách VRAM & batch size: vì sao OOM ở request thứ 40

VRAM chứa weights cố định cộng activation tỉ lệ với batch size nhân sequence length; một batch vừa vặn ở input ngắn có thể nổ VRAM ở input dài, và một CUDA OOM thường giết chết cả process (mọi request đang chạy dở), nên cần tính ngân sách trước và chặn bằng admission limit thay vì để crash.

AI/ML SystemsNâng cao2026-08-20
Ngân sách VRAM & batch size: vì sao OOM ở request thứ 40

Mở rộng

Animation gốc là một file HTML tự chứa, có thể nhúng lại ở bất kỳ trang nào khác. Mở file gốc

Liên quan