MLA - Multi-Head Latent Attention

Nén KV thành latent chung, giảm cache nhiều lần

Phím tắt: ←/→ từng bước · Space tự chạy/tạm dừng