Frame Sampling cho VLM: nén 40 phút video vào token budget
Vision-language model chỉ xử lý ảnh tĩnh, nên video dài được rút gọn bằng frame sampling (uniform hoặc theo scene-change/keyframe) tới một token budget cố định, tuỳ chọn caption từng frame thành text để retrieval, và transcript audio được mang kèm song song vì gửi mọi frame là bất khả thi.
AI/ML SystemsTrung bình2026-08-25
Tài liệu tham khảo
Mở rộng
Animation gốc là một file HTML tự chứa, có thể nhúng lại ở bất kỳ trang nào khác. Mở file gốc