proto.lib

MLA - Multi-Head Latent Attention

MLA nén key/value thành một vector latent chung có chiều thấp trước khi lưu KV cache, giảm mạnh dung lượng bộ nhớ so với multi-head attention chuẩn.

AI/ML SystemsNâng cao2026-07-17
MLA - Multi-Head Latent Attention

Tài liệu tham khảo

Mở rộng

Animation gốc là một file HTML tự chứa, có thể nhúng lại ở bất kỳ trang nào khác. Mở file gốc

Liên quan