Speaker Diarization streaming (ai đang nói)
Audio được cắt theo hoạt động giọng nói (VAD), mỗi đoạn chuyển thành speaker embedding, rồi các embedding được cluster online — giọng mới tạo speaker mới, giọng quay lại được khớp với speaker cũ — để gán nhãn người nói cho từng đoạn transcript theo thời gian thực.
AI/ML SystemsNâng cao2026-08-24
Tài liệu tham khảo
Mở rộng
Animation gốc là một file HTML tự chứa, có thể nhúng lại ở bất kỳ trang nào khác. Mở file gốc