
Heretic được thiết kế để tự động gỡ bỏ các lớp kiểm duyệt (censorship) khỏi các mô hình ngôn ngữ transformer, nhờ vào việc áp dụng directional ablation – còn gọi là “abliteration” – kết hợp với tối ưu hoá tham số dựa trên TPE của Optuna. Quá trình này đồng thời giảm số lần từ chối (refusals) và duy trì độ tương đồng KL thấp với mô hình gốc, giúp giữ lại càng nhiều khả năng trí tuệ của mô hình càng tốt.
Công cụ hỗ trợ hầu hết các mô hình dense, bao gồm cả các mô hình đa‑modal, kiến trúc MoE và một số mô hình hybrid như Qwen3.5. Khi chạy với cấu hình mặc định, Heretic có thể tạo ra các mô hình decensored đạt chất lượng tương đương với các phiên bản được chỉnh sửa thủ công bởi chuyên gia, nhưng thời gian và chi phí giảm đáng kể.
Để sử dụng, người dùng chỉ cần chuẩn bị môi trường Python 3.10+ với PyTorch 2.2+ (hoặc mới hơn), cài đặt heretic-llm và chạy lệnh đơn giản như heretic Qwen/Qwen3-4B-Instruct-2507. Các mô hình đã được gỡ bỏ kiểm duyệt bằng Heretic đã nhận được phản hồi tích cực từ cộng đồng, với các bình luận khen ngợi độ chính xác, khả năng trả lời các chủ đề nhạy cảm và mức độ hủy hoại kiến thức thấp.
Với việc giảm rào cản kỹ thuật và cung cấp một giải pháp mở, Heretic mở ra cơ hội cho các nhà nghiên cứu và nhà phát triển AI Việt Nam khám phá và tùy biến mô hình ngôn ngữ mà không bị giới hạn bởi các lớp kiểm duyệt mặc định.
Nguồn: GitHub Trending — Biên dịch & tổng hợp: danhbaai.com