
OpenAI công bố bộ mô hình GPT‑5.6 (Sol, Terra, Luna) với trọng tâm mạnh vào khả năng làm việc trên máy tính và hiểu hình ảnh. Trong buổi livestream, đội ngũ nhấn mạnh các tính năng UI agents và khả năng tạo hình 3D, đòi hỏi nền tảng thị giác mạnh mẽ.
Đánh giá benchmark VLM cho thấy Sol đạt 46.2 mAP@50, gấp ba lần so với GPT‑5.5 (13.8) và gần bằng các mô hình VLM hàng đầu. Terra và Luna cũng đạt 44.7 và 43.3 mAP@50. Trong nhận dạng bố cục tài liệu, Sol xử lý tiêu đề, đoạn văn, bảng và chữ ký một cách chính xác, hỗ trợ quy trình OCR và trích xuất dữ liệu. Độ chính xác đếm đối tượng của Sol đạt 73.0%, cải thiện so với 64.9% của GPT‑5.5.
- Phân loại đối tượng: Sol 46.2 mAP@50
- Đếm đối tượng: Sol 73.0%
- Document layout: phát hiện tiêu đề, bảng, chữ ký
Để đạt kết quả tốt nhất, người dùng nên yêu cầu Sol trả về tọa độ XYXY tính bằng pixel; khi dùng định dạng chuẩn hoá 0‑1000 như Gemini, hiệu năng giảm khoảng 15 điểm mAP. Sol gặp khó khăn với ảnh lớn (>2000×2000) nếu không tăng mức reasoning, dẫn đến tiêu tốn token và chi phí cao. Cắt hoặc thu nhỏ ảnh trước khi gửi API là giải pháp thực tế.
Với Sol, cộng đồng AI Việt Nam có cơ hội triển khai các ứng dụng thị giác thực tế như tự động hoá công việc văn phòng, phân tích tài liệu và giám sát hình ảnh, đồng thời cần cân nhắc chi phí token và độ ổn định khi xử lý ảnh lớn.
Nguồn: Hacker News — Biên dịch & tổng hợp: danhbaai.com