VLM Image Tiling: Đọc Ảnh Độ Phân Giải Cao
Một vision-language model với input cố định 336px không đọc được chữ nhỏ trong screenshot dày đặc; ảnh được chia thành các tile ở độ phân giải gốc cộng một global view thu nhỏ, mỗi tile được encode riêng rồi nối token lại — chữ trở nên rõ nét nhưng số token tăng theo diện tích ảnh, đó là lý do một screenshot cả trang tốn token hơn một tấm ảnh chụp thường.
AI/ML SystemsTrung bình2026-08-25
Tài liệu tham khảo
Mở rộng
Animation gốc là một file HTML tự chứa, có thể nhúng lại ở bất kỳ trang nào khác. Mở file gốc