proto.lib

LLM inference & RAG

Hạ tầng phục vụ mô hình ngôn ngữ lớn: giải mã, KV cache, batching, lượng tử hóa và RAG.

0/9 đã học0%
  1. 1
    LLM Inference - Prefill và Decode
    Hệ thống AI/ML
    Trung bình
  2. 2
    KV Cache trong Attention
    Hệ thống AI/ML
    Nâng cao
  3. 3
    Continuous Batching cho LLM
    Hệ thống AI/ML
    Nâng cao
  4. 4
    PagedAttention - KV Cache theo Block
    Hệ thống AI/ML
    Nâng cao
  5. 5
    Lượng tử hóa mô hình INT8
    Hệ thống AI/ML
    Trung bình
  6. 6
    Embeddings và ANN Vector Search
    Hệ thống AI/ML
    Trung bình
  7. 7
    RAG - Retrieval-Augmented Generation
    Hệ thống AI/ML
    Trung bình
  8. 8
    Retrieval hai giai đoạn với Cross-Encoder Reranker
    Hệ thống AI/ML
    Trung bình
  9. 9
    Speculative Decoding
    Hệ thống AI/ML
    Nâng cao