
Crawl4AI là một web crawler và scraper mã nguồn mở được thiết kế đặc biệt cho các mô hình ngôn ngữ lớn (LLM). Nó cho phép chuyển đổi nội dung web thành Markdown sạch, giúp giảm chi phí tiền xử lý dữ liệu cho các dự án RAG, agent và pipelines AI.
Phiên bản mới nhất 0.9.2 mang đến bản vá bảo trì quan trọng: khắc phục lỗi rò rỉ bộ nhớ trong MemoryAdaptiveDispatcher khi đóng crawl streaming, cải thiện cấu hình Docker “Advanced Config” và xác thực WebSocket, đồng thời hỗ trợ xây dựng Docker có GPU qua biến ENABLE_GPU=true. Các bản cập nhật trước đó (0.9.0, 0.8.7, 0.8.0) đã nâng cao bảo mật API Docker, thêm chế độ Crash Recovery, Prefetch nhanh gấp 5‑10 lần và khắc phục nhiều lỗ hổng bảo mật nghiêm trọng.
Để cài đặt, chỉ cần pip install -U crawl4ai và chạy crawl4ai-setup. Sau đó, bạn có thể dùng Python async API hoặc CLI crwl để thu thập dữ liệu, ví dụ: crwl https://www.nbcnews.com/business -o markdown hoặc crwl https://example.com -q "Extract all product prices". Công cụ hỗ trợ Playwright để cài đặt trình duyệt Chromium khi cần.
Với khả năng chạy trên Docker và hỗ trợ GPU, Crawl4AI giúp các nhà phát triển và doanh nghiệp Việt Nam thực hiện thu thập dữ liệu quy mô lớn mà không tốn kém. Đây là một bước tiến quan trọng trong việc democratize công cụ khai thác web cho cộng đồng AI nội địa.
Nguồn: GitHub Trending — Biên dịch & tổng hợp: danhbaai.com