Dari Mana Datangnya Pengetahuan AI? Sumber Data Latihan, Kontroversi, dan Perkara yang Perlu Anda Tahu

Mengapa AI tahu segalanya? Artikel siapakah yang telah dibacanya? Adakah hantaran saya turut digunakan untuk latihan AI? Fahami sumber dan kontroversi data latihan agar anda lebih cekap menggunakan AI.

AI Mahir Pengetahuan Astronomi dan Geografi, soalan pertama yang terlintas di fikiran tentunya: Sebenarnya dari manakah datangnya pengetahuan AI? Siapa yang membacakan begitu banyak bahan kepadanya? Jawapan kepada soalan ini melibatkan perebutan sumber terbesar dalam industri AI, dan ia juga berkaitan dengan setiap patah perkataan yang anda dan saya muat naik di internet.

Kesimpulan Awal

Pengetahuan model bahasa besar terutamanya berasal daripada: pengikisan web berskala besar, buku dan kertas kajian, pangkalan kod, kandungan berlesen yang dibeli (berita, forum), serta maklum balas dan anotasi manusia pada peringkat lewat. Kandungan yang anda siarkan secara terbuka di internet berkemungkinan besar telah dimasukkan ke dalam data latihan bagi sesetengah model. Mengenai isu hak cipta dan etika ini, seluruh dunia masih lagi melalui pertikaian undang-undang dan mencari peraturan yang bersesuaian.

Ringkasan Sumber Utama

Sumber Kandungan Tahap Pertikaian
Pengikisan Web (cth. Common Crawl) Blog, forum, berita, Wikipedia Tinggi — kebanyakan tanpa kebenaran
Buku dan Kertas Akademik Sumber utama pengetahuan mendalam Tinggi — pelbagai kes saman pelanggaran hak cipta sedang berlangsung
Kod Sumber Terbuka Kod dari platform seperti GitHub Sederhana — pertikaian terma lesen
Kandungan Berlesen Bekalan berskontrak daripada News Corp, Reddit, dll. Rendah — diperoleh secara berbayar
Maklum Balas Manusia (RLHF) Penilaian jawapan oleh pengkaji anotasi Rendah — tetapi keadaan buruh mendapat perhatian

Mengapakah Berlaku Begitu Banyak Pertikaian?

Satu ayat merumuskan kontroversi teras: Syarikat AI menggunakan hasil karya seluruh umat manusia untuk melatih produk yang menjana keuntungan, manakala pencipta tidak mendapat satu sen pun. The New York Times menyaman OpenAI, syarikat rakaman menyaman platform muzik AI, artis melancarkan tindakan undang-undang kelas terhadap syarikat penjanaan imej... Mahkamah di pelbagai negara sedang memutuskan sama ada "menggunakan kandungan awam untuk melatih AI" dikira sebagai penggunaan wajar (fair use). Pada masa yang sama, semakin banyak media memilih pendekatan "jika tidak dapat tewaskan mereka, sertai mereka", lalu menjual lesen kandungan secara terus kepada syarikat AI. Keputusan pertarungan ini akan menentukan model perniagaan penciptaan pada masa hadapan.

Adakah Data Saya Turut Digunakan untuk Latihan?

Kemungkinan besar ya: Blog awam anda, hantaran di forum, dan perkongsian media sosial awam berada dalam skop pengikisan. Mengenai perbualan anda dengan AI: Kebanyakan perkhidmatan mungkin menetapkan secara lalai bahawa ia digunakan untuk menambah baik model, tetapi kesemua mereka menyediakan pilihan untuk mematikannya (seperti ChatGPT yang membolehkan anda menutup fungsi latihan, manakala versi perniagaan tidak menggunakannya untuk latihan secara lalai). Jangan masukkan maklumat sensitif kepada AI, dan tutup tetapan yang patut ditutup — butiran lanjut boleh dibaca di Adakah selamat memberikan data saya kepada AI?.

Kepentingan Praktikal untuk Pengguna

Memahami sumber data akan membantu anda lebih memahami "ragam" AI: Ia mahir dalam topik yang banyak ditulis di internet (teknologi, kandungan berbahasa Inggeris), tetapi lemah dalam pengetahuan yang jarang ditemui, bersifat tempatan, atau terlalu baharu (sebab itulah ia boleh bercakap besar dengan penuh yakin walhal salah); pandangannya mencerminkan berat sebelah (bias) dalam data latihan. Mengetahui apa yang dibacanya semasa "membesar" membolehkan anda tahu bila masanya anda harus meraguinya.

Salah Faham Lazim dan Kebenaran

Ramai orang salah faham tentang sumber data latihan AI dan menganggap ia dijana secara automatik melalui sejenis cara ajaib. Hakikatnya, pengetahuan AI datang daripada sejumlah besar data awam, termasuk halaman web, buku, kertas kajian, pangkalan kod, dan sebagainya. Semua data ini dicipta dan dikongsi oleh manusia, manakala AI hanya mengubahnya menjadi pengetahuannya sendiri melalui algoritma kompleks dan teknologi pembelajaran mesin. Oleh itu, memahami sumber dan kontroversi data latihan AI dapat membantu kita memahami keupayaan dan keterbatasan AI dengan lebih baik.

Memilih Perkhidmatan AI yang Sesuai

Semasa memilih perkhidmatan AI, pengguna harus mempertimbangkan sumber dan kualiti data latihannya. Sesetengah perkhidmatan AI mungkin menggunakan data awam yang banyak, tetapi data tersebut mungkin mengandungi berat sebelah atau ketidaktepatan. Perkhidmatan AI yang lain mungkin menggunakan kandungan berlesen berkualiti tinggi, namun ia mungkin memerlukan kos tambahan. Pengguna harus memilih perkhidmatan AI yang sesuai berdasarkan keperluan dan bajet masing-masing, serta memberi perhatian kepada sumber dan kontroversi data latihannya.

Trend Masa Hadapan dan Cabaran

Kontroversi mengenai data latihan AI akan terus wujud dan berkembang. Dengan kemajuan teknologi AI, lebih banyak data akan digunakan untuk melatih model AI. Ini akan membawa cabaran dan peluang baharu, seperti cara memastikan kualiti dan keselamatan data, cara melindungi hak pencipta, serta cara membolehkan AI berkhidmat kepada umat manusia dengan lebih baik. Pada masa hadapan, industri AI mungkin menyaksikan model perniagaan dan cara kerjasama baharu, seperti perkongsian data dan pelesenan, bagi menyelesaikan cabaran dan pertikaian ini.

Langkah Praktikal dan Cadangan

Pengguna boleh mengambil langkah praktikal dan cadangan berikut untuk melindungi data dan hak mereka:

  • Sebelum berkongsi data di internet awam, pertimbangkan risiko bahawa ia mungkin digunakan untuk latihan AI.
  • Apabila menggunakan perkhidmatan AI, beri perhatian kepada sumber dan kontroversi data latihannya.
  • Jika anda perlu menggunakan perkhidmatan AI, pilih perkhidmatan yang sesuai serta ambil perhatian terhadap kos dan termanya.
  • Pencipta harus mengambil berat tentang hak dan kepentingan mereka, seperti hak cipta dan yuran pelesenan.
  • Pengguna dan pencipta harus bekerjasama untuk memacu pembangunan dan peraturan industri AI, bagi memastikan AI berkhidmat kepada manusia dengan lebih baik.

Jadual Perbandingan: Data Awam vs. Kandungan Berlesen

Jenis Sumber Kelebihan Kekurangan
Data Awam Laman web, buku, kertas kajian, pangkalan kod Percuma, kaya dengan maklumat Kualiti data tidak konsisten, mungkin ada unsur berat sebelah
Kandungan Berlesen Bekalan berskontrak daripada News Corp, Reddit, dll. Berkualiti tinggi, boleh dipercayai Perlu bayar, jumlah data mungkin terhad

Senario Lazim: Cara Melindungi Data Anda

Semasa menggunakan perkhidmatan AI, pengguna harus sedar bahawa data mereka mungkin digunakan untuk melatih model AI. Berikut adalah beberapa senario lazim dan cadangan:

  • Jika anda seorang pencipta, anda harus menjaga hak cipta dan yuran pelesenan anda.
  • Jika anda seorang pengguna, anda harus memberi perhatian kepada sumber data latihan dan kontroversi perkhidmatan AI tersebut.
  • Jika anda perlu menggunakan perkhidmatan AI, pilih perkhidmatan yang sesuai serta beri perhatian kepada kos dan termanya.

Perkembangan Masa Hadapan: Trend Baharu Data Latihan AI

Seiring dengan kemajuan teknologi AI, trend data latihan AI akan terus berkembang. Beberapa trend baharu yang mungkin berlaku termasuk:

  • Perkongsian data dan pelesenan: Industri AI mungkin melihat model perniagaan dan bentuk kerjasama baharu seperti perkongsian data dan pelesenan.
  • Kualiti dan keselamatan data: Pengguna dan pencipta akan lebih mementingkan kualiti dan keselamatan data.
  • Sumber data latihan baharu: Sumber data latihan baharu mungkin muncul, seperti media sosial, data penderia (sensor), dan lain-lain.

Cadangan untuk Golongan Berbeza

  • Bagi pencipta: Harus memberi perhatian kepada hak cipta dan yuran pelesenan sendiri, serta memilih cara pelesenan yang sesuai.
  • Bagi pengguna: Harus mengambil tahu tentang sumber data latihan dan kontroversi perkhidmatan AI, memilih perkhidmatan yang sesuai serta memahami kos dan terma yang terlibat.
  • Bagi industri AI: Harus mempromosikan perkongsian data dan pelesenan, mementingkan kualiti dan keselamatan data, serta memastikan AI berkhidmat kepada umat manusia dengan lebih baik.

Soalan Lazim

Adakah AI akan menggunakan perbualan saya untuk latihan?

Kebanyakan perkhidmatan pengguna mungkin menggunakan perbualan secara lalai untuk menambah baik model, tetapi semuanya menyediakan pilihan untuk menutup fungsi ini; versi perniagaan biasanya tidak menggunakannya untuk latihan secara lalai. Adalah disyorkan agar anda tidak memasukkan data sensitif dan sentiasa menyemak tetapan privasi anda.

Adakah sah menggunakan kandungan awam untuk melatih AI?

Isu ini masih di peringkat perundangan dan perbincangan global serta belum dimuktamadkan: beberapa kes penanda aras sedang berjalan di Amerika Syarikat, Kesatuan Eropah memerlukan pendedahan data latihan, manakala Jepun mengambil pendekatan yang lebih longgar. Trend semasa menuju ke arah pelesenan berbayar.

繁體中文版 →