LLM làm giảm đa dạng ngôn ngữ: Nghiên cứu 880.000 văn bản cho thấy xu hướng đồng nhất

LLM đang làm mờ đi sự phong phú của ngôn ngữ – một nghiên cứu mới công bố trên Nature.com phân tích ba nghiên cứu, bảy bộ dữ liệu và hơn 880.000 văn bản trong các lĩnh vực khác nhau. Kết quả cho thấy khi người dùng để LLM (như GPT‑3.5) chỉnh sửa, làm đẹp hoặc viết lại nội dung, phong cách viết trở nên đồng nhất hơn, giảm độ phức tạp của văn bản từ 21 % đến 50 % so với bản gốc (P ≤ 0.05).

Những thay đổi này không chỉ là về mặt hình thức. Các mô hình LLM còn “đẩy mạnh” các mẫu ngôn ngữ liên quan tới những đặc điểm chiếm ưu thế, đồng thời làm giảm khả năng nhận diện các đặc tính thuộc nhóm thiểu số. Khi các thuộc tính tác giả (giới tính, tuổi, nền tảng văn hoá) được dự đoán trên văn bản gốc, tỷ lệ thay đổi sau khi LLM viết lại lên tới 30 % tùy hướng thay đổi, cho thấy LLM có thể làm sai lệch các phân tích tâm lý, tiếp thị và y tế.

Những phát hiện này có ý nghĩa sâu rộng đối với cộng đồng AI Việt Nam. Khi LLM ngày càng được tích hợp vào các công cụ viết và dịch, các nhà nghiên cứu, doanh nghiệp và nhà phát triển cần cân nhắc các biện pháp bảo vệ đa dạng ngôn ngữ, tránh việc mất đi những dấu ấn văn hoá và thông tin quan trọng cho các nhóm người dùng địa phương.

Nguồn: Hacker News — Biên dịch & tổng hợp: danhbaai.com

Danh Bạ AI
Logo
Register New Account