MLA - Multi-Head Latent Attention
Nén KV thành latent chung, giảm cache nhiều lần
0.6×
1×
1.6×
2.4×
Phím tắt: ←/→ từng bước · Space tự chạy/tạm dừng