这是什么
Lightly 是一套来自瑞士的电脑视觉工具,专为机器学习团队处理资料而设计。它涵盖三大面向:资料策展(挑出最有价值、最具代表性的样本)、自监督预训练(在没有大量标注的情况下让模型先学到有用的表征),以及在边缘端进行智慧资料选取(在装置端就筛选出值得回收训练的资料)。
解决什么问题
训练电脑视觉模型时,真正的瓶颈往往不是缺资料,而是资料太多、太重复、标注成本太高。盲目标注与训练不仅浪费预算,还会让模型被大量冗余样本拖累。Lightly 帮团队从庞大的原始影像中挑出真正有讯息量的样本,减少标注量、提升训练效率,并透过自监督预训练善用未标注资料。它适合正在建构或迭代电脑视觉模型的 ML 团队、资料工程师与研究人员,尤其是资料量庞大、标注预算有限、或需要在边缘装置持续回收资料的情境。若你想把资源花在刀口上、而不是无差别地标注所有影像,这类资料策展工具会很有价值。
主要功能
- 资料策展,挑出最有代表性的样本
- 自监督预训练,善用未标注资料
- 边缘端智慧资料选取
- 为机器学习团队优化资料流程
- 减少冗余样本与标注成本
优点
- 用更少但更有价值的资料提升训练效率
- 自监督预训练能运用大量未标注影像
- 支援边缘端选资料,适合持续回收的场景
缺点
- 主要服务有一定规模的 ML 团队,导入需技术基础
- 偏资料工程层,对非技术使用者门槛较高
使用场景
- 从海量影像中挑出高价值样本再送标注
- 用自监督预训练善用未标注资料
- 在边缘装置端筛选值得回收训练的资料
编辑点评
把训练预算花在刀口上的资料策展套件,资料多、标注贵的视觉团队必看。
常见问题
Lightly 是给谁用的?
主要是建构或迭代电脑视觉模型的机器学习团队、资料工程师与研究人员。
它怎么帮忙省标注成本?
它透过资料策展挑出最有代表性、最有讯息量的样本,让你只标注真正需要的资料。
什么是自监督预训练?
那是在没有大量标注的情况下,让模型先从资料本身学到有用表征的训练方式。