Saan nagmula ang kaalaman ng AI? Pinagmulan ng training data, mga kontrobersya, at mga dapat mong malaman
Bakit alam ng AI ang lahat? Sino ang binasa nitong mga artikulo? Nakuha rin ba ang post ko para sa training? Alamin ang pinagmulan at kontrobersya ng training data para mas magamit nang maayos ang AI.
Ang AI ay parang dalubhasang nakakaalam ng lahat tungkol sa langit at lupa, kaya ang unang natural na tanong ay: Saan ba talaga nanggagaling ang kaalaman nito? Sino ang nagbasa sa kanya ng napakaraming impormasyon? Ang sagot dito ay may kinalaman sa pinakamalaking labanan sa resources sa industriya ng AI, pati na rin sa bawat tekstong nai-post mo at ko sa internet.
Una sa Lahat: Ang Buod
Ang kaalaman ng mga malalaking language models (LLMs) ay pangunahing nagmumula sa: malawakang pag-scrape ng mga pampublikong website, mga aklat at akademikong papel, mga codebase, nilalamang binili sa pamamagitan ng lisensya (mga balita, forum), at sa huli, ang pag-label at feedback mula sa tao. Ang mga nilalamang publiko mong ibinahagi sa internet ay napakalaking posibilidad na nasa training data na ng ilang modelo. Ang isyung ito ukol sa copyright at ethics ay pinagdedebatihan pa rin sa mga korte at hinahanapan ng mga patakaran sa buong mundo.
Tingnan ang mga Pangunahing Pinagmulan
| Pinagmulan | Nilalaman | Antas ng Kontrobersya |
|---|---|---|
| Pag-scrape ng Web (hal. Common Crawl) | Mga blog, forum, balita, Wikipedia | Mataas—Karamihan ay walang pahintulot |
| Mga Aklat at Akademikong Papel | Pangunahing pinagmulan ng malalim na kaalaman | Mataas—Maraming ongoing na kaso ng paglabag sa copyright |
| Open-source Code | Mga code mula sa mga platform tulad ng GitHub | Katamtaman—Isyu sa mga tuntunin ng lisensya |
| May Lisensyang Nilalaman | Kasunduan sa pag-supply mula sa News Corp, Reddit, atbp. | Mababa—Nakuha sa pamamagitan ng bayad |
| Feedback ng Tao (RLHF) | Pag-rate ng mga tagasuri sa mga sagot | Mababa—Pero binabantayan ang mga kondisyon sa paggawa |
Bakit May Matinding Alitan?
Ang buod ng kontrobersya: Ginagamit ng mga kumpanya ng AI ang mga likha ng buong sangkatauhan para magsanay ng mga produktong kumikita ng pera, habang ang mga creator ay walang nakukuhang kahit isang kusing. Ang New York Times ay kinasuhan ang OpenAI, mga record label ang nagdemanda sa mga AI music platform, at ang mga artista ay nagsagawa ng collective class-action lawsuits laban sa mga kumpanya ng AI image generation... Pinagpasyahan na ng mga korte sa iba't ibang bansa kung ang "paggamit ng pampublikong nilalaman para sa pagsasanay ng AI" ay maituturing na fair use. Kasabay nito, mas maraming media outlets ang pinipiling "kung hindi mo sila matatalo, makiisa ka na lang sa kanila," at direktang binebenta ang lisensya ng nilalaman sa mga kumpanya ng AI. Ang magiging resulta ng labanang ito ang magpapasya sa modelo ng negosyo ng paglikha sa hinaharap.
Nakuha ba ang Data Ko Para Gamitin sa Pagsasanay?
Malamang: Ang iyong mga pampublikong blog, komento sa forum, at pampublikong social media posts ay nasa saklaw ng web-scraping. Tungkol naman sa iyong mga pakikipag-usap sa AI: Maaaring default na ginagamit ng karamihan sa mga serbisyo ang mga ito para mapabuti ang mga modelo, ngunit nagbibigay sila ng opsyong i-off ito (halimbawa, pwedeng i-off ang layuning pag-training sa ChatGPT, at ang mga bersyon para sa enterprise ay default na hindi ginagamit sa pag-training). Huwag maglagay ng sensitibong impormasyon sa AI, at i-off ang mga setting na kailangang i-off—para sa mga detalye, tingnan ang Ligtas bang ibigay ang aking data sa AI?.
Ang Praktikal na Kahulugan Nito para sa mga Gumagamit
Sa pag-unawa sa pinagmulan ng data, mas mauunawaan mo ang "ugali" ng AI: Magaling ito sa mga paksang madalas isulat sa internet (teknolohiya, nilalamang Ingles), ngunit mahina sa mga bihirang paksa, lokal, at napapanahong kaalaman (kaya ito ay gumagawa ng kwento nang may seryosong mukha); ang mga pananaw nito ay sumasalamin sa pagkiling (bias) ng training data. Kapag alam mo kung ano ang binasa nito para lumaki, malalaman mo kung kailan dapat magduda.
Mga Karaniwang Maling Akala at Katotohanan
Maraming tao ang nagkakamali sa pag-unawa sa pinagmulan ng training data ng AI, sa paniniwalang awtomatiko itong nalilikha sa pamamagitan ng ilang mahiwagang paraan. Sa katotohanan, ang kaalaman ng AI ay nagmumula sa napakaraming pampublikong data, kabilang ang mga web page, aklat, papel, codebase, atbp. Ang mga datang ito ay nilikha at ibinahagi ng mga tao, at ang AI ay ginagamit lamang ang mga kumplikadong algorithm at teknolohiya ng machine learning upang gawing sarili nitong kaalaman ang mga ito. Samakatuwid, ang pag-unawa sa pinagmulan at kontrobersya ng training data ng AI ay makatutulong sa atin na mas maunawaan ang mga kakayahan at limitasyon ng AI.
Pagpili ng Angkop na Serbisyo ng AI
Sa pagpili ng serbisyo ng AI, dapat Isaalang-alang ng mga gumagamit ang pinagmulan at kalidad ng training data nito. Ang ilang serbisyo ng AI ay maaaring gumamit ng malaking halaga ng pampublikong data, ngunit ang mga datang ito ay maaaring may mga bias o hindi tumpak. Ang ibang serbisyo ng AI ay maaaring gumamit ng mataas na kalidad na lisensyadong nilalaman, ngunit maaaring mangailangan ito ng karagdagang bayad. Dapat piliin ng mga gumagamit ang tamang serbisyo ng AI batay sa kanilang mga pangangailangan at badyet, at mag-ingat sa pinagmulan at kontrobersya ng training data nito.
Mga Trend at Hamon sa Hinaharap
Ang kontrobersya sa training data ng AI ay patuloy na iiral at magbabago. Sa pagsulong ng teknolohiya ng AI, mas maraming data ang gagamitin para sa pag-train ng mga modelo ng AI. Magdadala ito ng mga bagong hamon at pagkakataon, tulad ng kung paano titiyakin ang kalidad at kaligtasan ng data, paano protektahan ang mga karapatan ng mga creator, at paano mas paglingkuran ng AI ang sangkatauhan. Sa hinaharap, maaaring lumitaw ang mga bagong modelo ng negosyo at paraan ng pakikipagtulungan sa industriya ng AI, tulad ng data sharing at licensing, upang malutas ang mga hamong ito at kontrobersya.
Mga Praktikal na Hakbang at Rekomendasyon
Maaaring sundin ng mga gumagamit ang mga sumusunod na praktikal na hakbang at rekomendasyon upang protektahan ang kanilang sariling data at mga karapatan:
- Bago magbahagi ng data sa pampublikong internet, dapat isaalang-alang ang panganib na maaari itong magamit sa pag-train ng AI.
- Kapag gumagamit ng mga serbisyo ng AI, dapat pansinin ang pinagmulan at kontrobersya ng training data nito.
- Kung kailangang gumamit ng serbisyo ng AI, dapat pumili ng angkop na serbisyo at pansinin ang mga bayarin at tuntunin nito.
- Dapat pansinin ng mga creator ang kanilang mga karapatan at interes, tulad ng copyright at mga bayad sa lisensya.
- Ang mga gumagamit at creator ay dapat magtulungan upang isulong ang pag-unlad at regulasyon ng industriya ng AI, tinitiyak na mas mapaglilingkuran ng AI ang sangkatauhan.
Talahanayan ng Paghahambing: Pampublikong Data kumpara sa Lisensyadong Nilalaman
| Uri | Pinagmulan | Mga Kalamangan | Mga Disbentaha |
|---|---|---|---|
| Pampublikong Data | Mga webpage, aklat, papel, codebase | Libre, sagana | Iba-iba ang kalidad ng data, maaaring may pagkiling (bias) |
| May Lisensyadong Nilalaman | Kasunduan sa pag-supply mula sa News Corp, Reddit, atbp. | Mataas ang kalidad, maaasahan | May bayad, maaaring limitado ang dami ng data |
Karaniwang Sitwasyon: Paano Protektahan ang Iyong Sariling Data
Sa paggamit ng mga serbisyo ng AI, dapat mag-ingat ang mga gumagamit na ang kanilang data ay maaaring ginagamit sa pag-train ng mga modelo ng AI. Narito ang ilang karaniwang sitwasyon at rekomendasyon:
- Kung ikaw ay isang creator, dapat mong pansinin ang iyong copyright at mga bayad sa lisensya.
- Kung ikaw ay isang gumagamit, dapat mong pansinin ang pinagmulan ng training data at mga kontrobersya ng serbisyo ng AI.
- Kung kailangan mong gumamit ng serbisyo ng AI, dapat kang pumili ng angkop na serbisyo at pansinin ang mga bayarin at tuntunin nito.
Pag-unlad sa Hinaharap: Mga Bagong Trend sa Training Data ng AI
Sa pagsulong ng teknolohiya ng AI, patuloy na magbabago ang mga trend sa training data ng AI. Ang ilang posibleng bagong trend ay kinabibilangan ng:
- Pagbabahagi ng data at paglilisensya: Maaaring lumitaw ang mga bagong modelo ng negosyo at paraan ng pakikipagtulungan sa industriya ng AI, tulad ng pagbabahagi ng data at paglilisensya.
- Kalidad at kaligtasan ng data: Mas bibigyang-pansin ng mga gumagamit at creator ang kalidad at kaligtasan ng data.
- Mga bagong pinagmulan ng training data: Maaaring lumitaw ang mga bagong pinagmulan ng training data, tulad ng social media, data ng sensor, atbp.
Mga Rekomendasyon para sa Iba't Ibang Grupo
- Para sa mga creator: Dapat pansinin ang sariling copyright at mga bayad sa lisensya, at pumili ng angkop na paraan ng paglilisensya.
- Para sa mga gumagamit: Dapat pansinin ang pinagmulan ng training data at mga kontrobersya ng serbisyo ng AI, pumili ng angkop na serbisyo at mag-ingat sa mga bayarin at tuntunin nito.
- Para sa industriya ng AI: Dapat isulong ang pagbabahagi ng data at paglilisensya, bigyang-diin ang kalidad at kaligtasan ng data, at tiyaking mas mapaglilingkuran ng AI ang sangkatauhan.
Mga Madalas Itanong
Ginagamit ba ng AI ang chat namin para sa training?
Ang karamihan sa consumer services ay posibleng gumamit ng mga usapan para i-improve ang modelo, pero may option itong i-off; kadalasang hindi ito ginagamit sa training para sa enterprise versions. Huwag mag-input ng sensitive data at i-check ang privacy settings.
Legal ba ang paggamit ng public content para i-train ang AI?
Patuloy pa rin ang mga kaso at batas sa buong mundo at wala pang pinal na desisyon: may mga ongoing na kaso sa US, hinihingi sa EU na i-disclose ang training data, at mas maluwag naman sa Japan. Ang kasalukuyang trend ay papunta sa paid licensing.