LLM inference & RAG
Hạ tầng phục vụ mô hình ngôn ngữ lớn: giải mã, KV cache, batching, lượng tử hóa và RAG.
0/9 đã học0%
- 1LLM Inference - Prefill và DecodeHệ thống AI/MLTrung bình
- 2KV Cache trong AttentionHệ thống AI/MLNâng cao
- 3Continuous Batching cho LLMHệ thống AI/MLNâng cao
- 4PagedAttention - KV Cache theo BlockHệ thống AI/MLNâng cao
- 5Lượng tử hóa mô hình INT8Hệ thống AI/MLTrung bình
- 6Embeddings và ANN Vector SearchHệ thống AI/MLTrung bình
- 7RAG - Retrieval-Augmented GenerationHệ thống AI/MLTrung bình
- 8Retrieval hai giai đoạn với Cross-Encoder RerankerHệ thống AI/MLTrung bình
- 9Speculative DecodingHệ thống AI/MLNâng cao