Observability cho ứng dụng AI: chất lượng đầu ra dạng văn bản
Bên cạnh latency và error rate, một ứng dụng dùng LLM cần theo dõi token vào/ra và cost mỗi request, tỉ lệ retrieval hit, tỉ lệ refusal/fallback, và một chỉ số CHẤT LƯỢNG được lấy mẫu (LLM-as-judge kết hợp review của con người) — vì một response 200 OK nhưng vô nghĩa là một kiểu outage mà không HTTP metric nào bắt được.
ObservabilityTrung bình2026-08-25
Tài liệu tham khảo
Mở rộng
Animation gốc là một file HTML tự chứa, có thể nhúng lại ở bất kỳ trang nào khác. Mở file gốc