
DeepSeek đang cung cấp model thử nghiệm deepseek-v4-flash-vision-exp, cho phép người dùng đưa hình ảnh cùng văn bản vào prompt. Model có thể phục vụ nhiều tác vụ như mô tả nội dung ảnh, đọc chữ từ ảnh chụp màn hình và phân tích biểu đồ. Các định dạng được hỗ trợ gồm JPEG, PNG, GIF và WebP; hệ thống nhận diện định dạng dựa trên nội dung thực tế của tệp thay vì tên tệp hay MIME type được khai báo.
Nhà phát triển có thể gửi ảnh theo ba cách thông qua Chat Completions theo chuẩn tương thích OpenAI, trong đó trường content được tổ chức thành một mảng các block. Cách đầu tiên là mã hóa ảnh bằng base64 rồi nhúng trực tiếp dưới dạng data URL, phù hợp với tệp cục bộ và thao tác thử nghiệm nhanh. Tuy nhiên, dữ liệu đã mã hóa vẫn được tính vào giới hạn 48 MiB của toàn bộ request body.
Cách thứ hai là cung cấp URL HTTP hoặc HTTPS công khai để model tự tải ảnh. URL không được dài quá 8.192 ký tự, tệp ảnh tối đa 32 MiB và quá trình tải phải hoàn tất trong 60 giây. Với ảnh cần dùng lại nhiều lần, DeepSeek khuyến nghị tải lên qua Files API rồi tham chiếu bằng file_id. Phương thức này hỗ trợ tệp tối đa 64 MiB, không chịu giới hạn kiểm tra 32 MiB cho từng ảnh như ảnh nhúng trực tiếp.
Ba phương thức trên cũng hiện diện trong Responses API thông qua các phần nội dung input_image. Việc duy trì cấu trúc API tương thích OpenAI giúp đội ngũ phát triển dễ tích hợp khả năng thị giác vào ứng dụng hiện có; với cộng đồng AI Việt Nam, model này mở thêm lựa chọn cho OCR, xử lý tài liệu và phân tích dữ liệu trực quan.
Nguồn: Hacker News — Biên dịch & tổng hợp: danhbaai.com