
Needle 2 là mô hình ngôn ngữ mở mới do Cactus Compute phát triển, chỉ có kích thước 14 MB nhưng chứa 45 triệu tham số, đủ để chạy trên điện thoại, thiết bị đeo, robot và các hệ thống IoT. Toàn bộ mô hình được nén thành định dạng CQ2‑bit bằng Cactus Quants và được tích hợp trong một engine riêng, cho phép một phiên làm việc tiêu tốn khoảng 28 MB RAM.
So với các mô hình nhỏ khác như FunctionGemma 270M, LFM2.5 230M hay Apple FM, Needle 2 đạt độ chính xác tương đương nhưng kích thước nhỏ hơn 5‑70 lần và sử dụng 2 bit thay cho f16. Kiến trúc Simple Attention Network của nó thay thế FFN bằng Hadamard MLP, sử dụng GQA attention, bộ nhớ engram key‑value và kết nối đa‑lane, đồng thời áp dụng chuẩn hoá Sinkhorn cho logits routing.
Repo trên GitHub cung cấp gói Python cactus‑needle để inference, LoRA fine‑tuning và export. Người dùng chỉ cần pip install cactus‑needle, mô tả công cụ bằng decorator và gọi run() để mô hình tự động lựa chọn và thực thi công cụ. Ví dụ, một hàm get_weather được đánh dấu @needle.tool sẽ trả về thời tiết cho thành phố yêu cầu.
Với kích thước siêu nhẹ và khả năng chạy trực tiếp trên thiết bị, Needle 2 mở ra cơ hội cho các nhà phát triển Việt Nam triển khai AI trên các sản phẩm nhúng mà không cần phụ thuộc vào đám mây, giảm chi phí và tăng tính bảo mật.
Nguồn: GitHub Trending — Biên dịch & tổng hợp: danhbaai.com