Lựa chọn khung hình quyết định LLM hiểu video: bài học từ Claude‑real‑video

Video là nguồn thông tin phong phú nhưng chi phí token cao – một LLM chỉ có thể chấp nhận khoảng 150 hình ảnh cho mỗi video. Việc quyết định khung nào được đưa vào mô hình sẽ quyết định liệu LLM thực sự “xem” video hay chỉ nhận được một bản tóm tắt dạng slideshow.

Để tránh việc chỉ dùng một khung hình mỗi giây hoặc mỗi mười giây, tác giả đề xuất dùng ffmpeg scene score để phát hiện các thay đổi cảnh. Khi phát hiện cảnh mới, một khung hình sẽ được lưu lại, đồng thời duy trì một mức độ “độ dày” tối thiểu để các đoạn quay dài không cắt mất hoàn toàn.

Đối với nội dung như hoạt hình hoặc quay chậm, điểm số cảnh thường không vượt ngưỡng. Giải pháp là tính điểm trung bình trượt và chỉ giữ khung khi điểm hiện tại vượt một bội số của trung bình này. Điều này tự động nâng mức ngưỡng cho video chuyển động mạnh, giảm cho video tĩnh.

Quá trình loại bỏ trùng lặp được thực hiện bằng chữ ký RGB 16×16, so sánh mức thay đổi pixel (>25/255) và chỉ giữ khung nếu ít nhất 8% pixel thay đổi. So sánh được thực hiện với bốn khung gần nhất, tránh việc khung A‑B‑A bị đưa lại.

Những kỹ thuật này giúp tối ưu hóa chi phí token, cho phép LLM “xem” video một cách hiệu quả hơn. Đối với cộng đồng AI Việt Nam, việc chia sẻ pipeline MIT‑licensed này mở ra cơ hội nghiên cứu và ứng dụng video AI mà không cần phụ thuộc vào dịch vụ đám mây đắt đỏ.

Nguồn: Hacker News — Biên dịch & tổng hợp: danhbaai.com

Danh Bạ AI
Logo
Register New Account