
Một nghiên cứu thú vị trên GitHub vừa chỉ ra rằng các mô hình LLM đang có xu hướng lạm dụng từ vựng “spine” trong mã nguồn và Pull Request (PR) một cách bất thường. Hiện tượng này được gọi là “LLMism” – những từ ngữ hoặc thói quen diễn đạt đặc trưng xuất hiện với tần suất vượt trội khi AI viết code hoặc tạo văn bản.
Bắt đầu từ việc nhận thấy từ “spine” xuất hiện liên tục trong các bản tả TLA+ do AI khởi tạo, tác giả đã phân tích dữ liệu PR trên GitHub để kiểm chứng. Kết quả cho thấy số lượng PR chứa từ “spine” trong 9 tháng đầu năm 2026 đã tăng gấp 20 lần so với toàn bộ năm 2025, trong khi tổng số PR công khai chỉ tăng khoảng 1,5 lần. Phân tích chi tiết theo tháng cho thấy sự gia tăng này xuất hiện ở nhiều công cụ và mô hình phổ biến như Claude, Cursor hay các phiên bản GPT mới.
Ngoài từ “spine”, khảo sát cũng mở rộng sang các từ ngữ kỹ thuật khác như “gate”, “seam”, “proof” và “truth”. Trong đó, từ “gate” xuất hiện trong 1 trên 26 PR, còn từ “seam” cũng ghi nhận tần suất tăng mạnh. Tác giả đã chia sẻ công cụ phân tích này dưới dạng GitHub Gist để cộng đồng có thể tự kiểm chứng và khám phá thêm các “LLMism” khác.
Phát hiện này mang lại góc nhìn thiết thực cho cộng đồng lập trình viên và nghiên cứu AI tại Việt Nam trong việc nhận diện mã nguồn do AI tạo ra. Việc hiểu rõ các đặc trưng ngôn ngữ của LLM sẽ giúp các kỹ sư tối ưu hóa prompt và kiểm soát chất lượng code hiệu quả hơn.
Nguồn: Hacker News — Biên dịch & tổng hợp: danhbaai.com