AI 的知识是哪来的?训练资料的来源、争议与你该知道的事

AI 为什么什么都知道?它读了谁的文章?我的贴文也被拿去训练了吗?看懂训练资料的来源与争议,你会更会用 AI。

AI 上知天文下知地理,第一个自然的疑问是:**它的知识到底哪来的?谁给它读了这么多东西?**答案牵涉到整个 AI 产业最大的资源争夺战,也跟你我发在网路上的每一段文字有关。

先说结论

大型语言模型的知识主要来自:公开网页的大规模抓取、书籍与论文、程式码库、授权购买的内容(新闻、论坛),以及后期的人类标注与回馈。你公开发在网路上的内容,很可能已经在某个模型的训练资料里。这件事的著作权与伦理争议,全球都还在打官司、找规则。

主要来源一次看

来源 内容 争议程度
网页抓取(如 Common Crawl) 部落格、论坛、新闻、维基 高——多数未经同意
书籍与学术论文 深度知识的主要来源 高——多起侵权诉讼进行中
开源程式码 GitHub 等平台的程式 中——授权条款之争
授权内容 新闻集团、Reddit 等签约供应 低——付费取得
人类回馈(RLHF) 标注员对回答评分 低——但劳动条件受关注

为什么吵成一团?

核心争议一句话:AI 公司用全人类的创作训练出赚钱的产品,创作者却没拿到一毛钱。《纽约时报》告 OpenAI、唱片公司告 AI 音乐平台、艺术家集体诉讼生图公司……各国法院正在决定「拿公开内容训练 AI」算不算合理使用。同时,越来越多媒体选择「打不赢就收费」,直接把内容授权卖给 AI 公司。这场仗的结果,会决定未来创作的商业模式。

我的资料也被拿去训练了吗?

很可能:你公开的部落格、论坛发言、公开社群贴文都在抓取范围内。至于你跟 AI 的对话:多数服务预设可能用于改进模型,但都提供关闭选项(例如 ChatGPT 可关闭训练用途、企业版预设不用于训练)。敏感资讯不要贴给 AI,该关的设定关起来——详细可看把资料交给 AI 安全吗

这对使用者的实际意义

理解资料来源,你会更懂 AI 的脾气:它擅长网路上写得多的主题(科技、英文内容),弱于冷门、在地、新近的知识(所以会一本正经地胡说);它的观点反映了训练资料的偏向。知道它读什么长大,就知道什么时候该怀疑它。

常见误解与真相

许多人误解 AI 训练资料的来源,认为它们都是透过某种神奇的方式自动生成的。事实上,AI 的知识来自于大量的公开资料,包括网页、书籍、论文、程式码库等。这些资料都是由人类创造和分享的,AI 只是透过复杂的演算法和机器学习技术将其转化为自己的知识。因此,了解 AI 训练资料的来源和争议,可以帮助我们更好地理解 AI 的能力和局限性。

选择合适的 AI 服务

在选择 AI 服务时,使用者应该考虑其训练资料的来源和质量。一些 AI 服务可能使用了大量的公开资料,但这些资料可能存在偏见或不准确。其他 AI 服务可能使用了高质量的授权内容,但这可能需要额外的费用。使用者应该根据自己的需求和预算选择合适的 AI 服务,并注意其训练资料的来源和争议。

未来趋势和挑战

AI 训练资料的争议将会继续存在和演变。随着 AI 技术的进步,更多的资料将会被用于训练 AI 模型。这将会带来新的挑战和机会,例如如何确保资料的质量和安全性,如何保护创作者的权利,如何让 AI 更好地服务于人类。未来,AI 产业可能会出现新的商业模式和合作方式,例如资料共享和授权,来解决这些挑战和争议。

实用步骤和建议

使用者可以采取以下实用步骤和建议来保护自己的资料和权利:

  • 在公开网路上分享资料前,应该考虑其可能被用于 AI 训练的风险。
  • 使用 AI 服务时,应该注意其训练资料的来源和争议。
  • 如果需要使用 AI 服务,应该选择合适的服务并注意其费用和条款。
  • 创作者应该注意自己的权利和利益,例如著作权和授权费。
  • 使用者和创作者应该共同努力,推动 AI 产业的发展和规范,确保 AI 更好地服务于人类。

对比表格:公开资料与授权内容

类型 来源 优点 缺点
公开资料 网页、书籍、论文、程式码库 免费、丰富 资料质量不一、可能存在偏见
授权内容 新闻集团、Reddit 等签约供应 高质量、可靠 需要付费、资料量可能有限

常见情境:如何保护自己的资料

在使用 AI 服务时,使用者应该注意自己的资料可能被用于训练 AI 模型。以下是一些常见情境和建议:

  • 如果您是创作者,应该注意自己的著作权和授权费。
  • 如果您是使用者,应该注意 AI 服务的训练资料来源和争议。
  • 如果您需要使用 AI 服务,应该选择合适的服务并注意其费用和条款。

未来发展:AI 训练资料的新趋势

随着 AI 技术的进步,AI 训练资料的趋势将会继续演变。一些可能的新趋势包括:

  • 资料共享和授权:AI 产业可能会出现新的商业模式和合作方式,例如资料共享和授权。
  • 资料质量和安全性:使用者和创作者将会更加注重资料的质量和安全性。
  • 新的训练资料来源:新的训练资料来源可能会出现,例如社交媒体、感测器资料等。

给不同族群的建议

  • 对于创作者:应该注意自己的著作权和授权费,选择合适的授权方式。
  • 对于使用者:应该注意 AI 服务的训练资料来源和争议,选择合适的服务并注意其费用和条款。
  • 对于 AI 产业:应该推动资料共享和授权,注重资料质量和安全性,确保 AI 更好地服务于人类。

常见问题

AI 会拿我跟它的对话去训练吗?

多数消费版服务预设可能使用对话改进模型,但都提供关闭选项;企业版通常预设不用于训练。敏感资料建议不要输入并检查隐私设定。

用公开内容训练 AI 合法吗?

全球仍在诉讼与立法中,尚无定论:美国多起指标案件进行中,欧盟要求揭露训练资料,日本相对宽松。目前趋势是走向授权付费。

繁體中文版 →