proto.lib

LLM Inference - Prefill và Decode

Suy luận LLM chia làm hai pha: prefill xử lý song song toàn bộ prompt (compute-bound), sau đó decode sinh từng token một cách tuần tự (memory-bound).

AI/ML SystemsTrung bình2026-07-10
LLM Inference - Prefill và Decode

Mở rộng

Animation gốc là một file HTML tự chứa, có thể nhúng lại ở bất kỳ trang nào khác. Mở file gốc

Liên quan