Kiến thức của AI đến từ đâu? Nguồn gốc dữ liệu huấn luyện, tranh cãi và những điều bạn cần biết
Tại sao AI lại biết mọi thứ? Nó đã đọc bài viết của ai? Bài đăng của tôi có bị dùng để huấn luyện không? Hiểu rõ nguồn gốc và tranh cãi về dữ liệu huấn luyện sẽ giúp bạn sử dụng AI thành thạo hơn.
AI am hiểu thiên văn tường địa lý, câu hỏi tự nhiên đầu tiên là: Kiến thức của nó rốt cuộc từ đâu ra? Ai đã cho nó đọc nhiều thứ đến vậy? Câu trả lời liên quan đến cuộc chiến giành tài nguyên lớn nhất trong toàn ngành công nghiệp AI, và cũng liên quan đến từng đoạn văn mà bạn hay tôi đăng lên mạng.
Nói kết quả trước
Kiến thức của các mô hình ngôn ngữ lớn (LLM) chủ yếu đến từ: việc thu thập quy mô lớn các trang web công khai, sách và luận văn, kho mã nguồn, nội dung mua bản quyền (tin nhắn, diễn đàn), cùng với quá trình gán nhãn và phản hồi từ con người ở giai đoạn sau. Nội dung bạn công khai đăng lên mạng rất có thể đã nằm trong dữ liệu huấn luyện của một mô hình nào đó. Vấn đề bản quyền và tranh cãi đạo đức này đang khiến toàn cầu phải kiện tụng và tìm kiếm quy tắc.
Tổng quan các nguồn chính
| Nguồn | Nội dung | Mức độ tranh cãi |
|---|---|---|
| Thu thập web (như Common Crawl) | Blog, diễn đàn, tin tức, Wikipedia | Cao —— Hầu hết chưa có sự đồng ý |
| Sách và luận văn học thuật | Nguồn kiến thức chiều sâu chính | Cao —— Nhiều vụ kiện vi phạm bản quyền đang diễn ra |
| Mã nguồn mở | Mã từ các nền tảng như GitHub | Trung bình —— Tranh chấp điều khoản cấp phép |
| Nội dung có bản quyền | News Corp, Reddit ký kết cung cấp | Thấp —— Có trả phí |
| Phản hồi của con người (RLHF) | Nhân viên gán nhãn đánh giá câu trả lời | Thấp —— Nhưng điều kiện lao động đang được quan tâm |
Tại sao lại cãi nhau dữ dội?
Tranh cãi cốt lõi gói gọn trong một câu: Các công ty AI dùng tác phẩm sáng tạo của toàn nhân loại để huấn luyện ra sản phẩm kiếm tiền, nhưng người sáng tạo lại không nhận được một xu. Tờ New York Times kiện OpenAI, các hãng thu âm kiện nền tảng âm nhạc AI, các nghệ sĩ kiện tập thể công ty tạo ảnh... Tòa án các nước đang quyết định việc "lấy nội dung công khai để huấn luyện AI" có phải là sử dụng hợp lý (fair use) hay không. Đồng thời, ngày càng nhiều đơn vị truyền thông chọn cách "không đánh lại thì thu phí", trực tiếp bán bản quyền nội dung cho các công ty AI. Kết quả của cuộc chiến này sẽ quyết định mô hình kinh doanh sáng tạo trong tương lai.
Dữ liệu của tôi có bị đem đi huấn luyện không?
Rất có thể: Blog công khai, phát biểu trên diễn đàn, bài đăng mạng xã hội công khai của bạn đều nằm trong phạm vi thu thập. Còn về cuộc trò chuyện của bạn với AI: Hầu hết các dịch vụ mặc định có thể dùng để cải thiện mô hình, nhưng đều cung cấp tùy chọn tắt (ví dụ ChatGPT có thể tắt mục đích huấn luyện, bản doanh nghiệp mặc định không dùng để huấn luyện). Đừng dán thông tin nhạy cảm cho AI, cài đặt nào cần tắt hãy tắt đi — chi tiết có thể xem tại Liệu đưa dữ liệu cho AI có an toàn không.
Ý nghĩa thực tế đối với người dùng
Hiểu rõ nguồn gốc dữ liệu sẽ giúp bạn hiểu rõ hơn về "tính cách" của AI: Nó giỏi những chủ đề được viết nhiều trên internet (công nghệ, nội dung tiếng Anh), nhưng yếu về kiến thức ít người biết, mang tính địa phương, mới cập nhật (nên mới có chuyện nói nhảm nhưng ra vẻ ta đây rất chuyên nghiệp); góc nhìn của nó phản ánh sự thiên vị của dữ liệu huấn luyện. Biết nó đọc gì mà lớn lên, thì sẽ biết khi nào nên hoài nghi nó.
Hiểu lầm phổ biến và sự thật
Nhiều người hiểu lầm về nguồn gốc dữ liệu huấn luyện của AI, cho rằng chúng đều được tự động tạo ra bằng một cách thần kỳ nào đó. Thực tế, kiến thức của AI đến từ một lượng lớn dữ liệu công khai, bao gồm trang web, sách, luận văn, kho mã nguồn, v.v. Những dữ liệu này đều do con người tạo ra và chia sẻ, AI chỉ đơn thuần chuyển hóa chúng thành kiến thức của riêng mình thông qua các thuật toán phức tạp và công nghệ học máy. Do đó, việc hiểu rõ nguồn gốc và tranh cãi về dữ liệu huấn luyện của AI có thể giúp chúng ta nắm bắt tốt hơn năng lực và hạn chế của AI.
Lựa chọn dịch vụ AI phù hợp
Khi chọn dịch vụ AI, người dùng nên cân nhắc nguồn gốc và chất lượng dữ liệu huấn luyện của dịch vụ đó. Một số dịch vụ AI có thể sử dụng lượng lớn dữ liệu công khai, nhưng những dữ liệu này có thể chứa sự thiên vị hoặc không chính xác. Các dịch vụ AI khác có thể sử dụng nội dung bản quyền chất lượng cao, nhưng điều này có thể đòi hỏi chi phí bổ sung. Người dùng nên chọn dịch vụ AI phù hợp dựa trên nhu cầu và ngân sách của mình, đồng thời chú ý đến nguồn gốc và tranh cãi xung quanh dữ liệu huấn luyện của dịch vụ đó.
Xu hướng và thách thức tương lai
Tranh cãi về dữ liệu huấn luyện AI sẽ tiếp tục tồn tại và phát triển. Khi công nghệ AI tiến bộ, sẽ có nhiều dữ liệu hơn được sử dụng để huấn luyện các mô hình AI. Điều này sẽ mang lại những thách thức và cơ hội mới, chẳng hạn như làm thế nào để đảm bảo chất lượng và tính bảo mật của dữ liệu, làm thế nào để bảo vệ quyền lợi của người sáng tạo, và làm thế nào để AI phục vụ con người tốt hơn. Trong tương lai, ngành công nghiệp AI có thể xuất hiện các mô hình kinh doanh và phương thức hợp tác mới, chẳng hạn như chia sẻ và cấp phép dữ liệu, để giải quyết những thách thức và tranh cãi này.
Các bước thực tế và gợi ý
Người dùng có thể thực hiện các bước thực tế và gợi ý sau để bảo vệ dữ liệu và quyền lợi của mình:
- Trước khi chia sẻ dữ liệu trên mạng công khai, nên cân nhắc rủi ro dữ liệu đó có thể bị sử dụng để huấn luyện AI.
- Khi sử dụng dịch vụ AI, nên chú ý đến nguồn gốc và tranh cãi của dữ liệu huấn luyện.
- Nếu cần sử dụng dịch vụ AI, nên chọn dịch vụ phù hợp và lưu ý các chi phí, điều khoản liên quan.
- Người sáng tạo nên chú ý đến quyền lợi và lợi ích của mình, chẳng hạn như quyền tác giả và phí bản quyền.
- Người dùng và người sáng tạo nên cùng nhau nỗ lực thúc đẩy sự phát triển và chuẩn hóa của ngành AI, đảm bảo AI phục vụ con người tốt hơn.
Bảng đối chiếu: Dữ liệu công khai và Nội dung có bản quyền
| Loại | Nguồn | Ưu điểm | Nhược điểm |
|---|---|---|---|
| Dữ liệu công khai | Trang web, sách, luận văn, kho mã nguồn | Miễn phí, phong phú | Chất lượng dữ liệu không đồng đều, có thể có sự thiên vị |
| Nội dung có bản quyền | News Corp, Reddit ký kết cung cấp | Chất lượng cao, đáng tin cậy | Cần trả phí, lượng dữ liệu có thể hạn chế |
Tình huống phổ biến: Cách bảo vệ dữ liệu của bạn
Khi sử dụng dịch vụ AI, người dùng nên lưu ý rằng dữ liệu của họ có thể được dùng để huấn luyện mô hình AI. Dưới đây là một số tình huống phổ biến và gợi ý:
- Nếu bạn là người sáng tạo, bạn nên chú ý đến quyền tác giả và phí bản quyền của mình.
- Nếu bạn là người dùng, bạn nên chú ý đến nguồn gốc dữ liệu huấn luyện và các tranh cãi của dịch vụ AI.
- Nếu bạn cần sử dụng dịch vụ AI, bạn nên chọn dịch vụ phù hợp và lưu ý các chi phí, điều khoản của dịch vụ đó.
Phát triển trong tương lai: Xu hướng mới của dữ liệu huấn luyện AI
Cùng với sự tiến bộ của công nghệ AI, xu hướng dữ liệu huấn luyện AI sẽ tiếp tục phát triển. Một số xu hướng mới có thể bao gồm:
- Chia sẻ và cấp phép dữ liệu: Ngành công nghiệp AI có thể xuất hiện các mô hình kinh doanh và phương thức hợp tác mới, chẳng hạn như chia sẻ và cấp phép dữ liệu.
- Chất lượng và tính bảo mật dữ liệu: Người dùng và nhà sáng tạo sẽ chú ý nhiều hơn đến chất lượng và tính an toàn của dữ liệu.
- Nguồn dữ liệu huấn luyện mới: Các nguồn dữ liệu huấn luyện mới có thể xuất hiện, chẳng hạn như mạng xã hội, dữ liệu cảm biến, v.v.
Gợi ý cho các nhóm đối tượng khác nhau
- Đối với người sáng tạo: Nên chú ý đến quyền tác giả và phí bản quyền của mình, lựa chọn phương thức cấp phép phù hợp.
- Đối với người dùng: Nên chú ý đến nguồn gốc dữ liệu huấn luyện và tranh cãi của dịch vụ AI, chọn dịch vụ phù hợp và lưu ý chi phí cũng như điều khoản.
- Đối với ngành công nghiệp AI: Nên thúc đẩy việc chia sẻ và cấp phép dữ liệu, chú trọng đến chất lượng và tính bảo mật của dữ liệu để đảm bảo AI phục vụ con người tốt hơn.
Câu hỏi thường gặp
AI có lấy cuộc trò chuyện giữa tôi và nó để huấn luyện không?
Hầu hết các dịch vụ dành cho người tiêu dùng có thể mặc định sử dụng các cuộc trò chuyện để cải thiện mô hình, nhưng tất cả đều cung cấp tùy chọn tắt; các phiên bản doanh nghiệp thường không sử dụng dữ liệu này cho việc huấn luyện theo mặc định. Đối với dữ liệu nhạy cảm, bạn không nên nhập vào và nhớ kiểm tra cài đặt quyền riêng tư.
Dùng nội dung công khai để huấn luyện AI có hợp pháp không?
Thế giới vẫn đang trong quá trình kiện tụng và lập pháp, chưa có kết luận cuối cùng: nhiều vụ án mang tính bước ngoặt đang diễn ra tại Mỹ, Liên minh Châu Âu yêu cầu công khai dữ liệu huấn luyện, trong khi Nhật Bản tương đối cởi mở. Xu hướng hiện tại đang chuyển dịch sang hình thức cấp phép trả phí.