美团的各个业务有着丰富的NLP场景,而这些场景中模型的构建需要很多的标注资源,成本很高。小样本学习致力于在数据资源稀少的情况下训练出比较好的模型。本文从主动学习、数据增强、半监督学习、领域迁移、集成学习&自训练几个方向介绍了现有的一些方法,并在美团场景进行了实验,效果上也取得了一定的提升。希望能对从事相关研究的同学有所帮助或者启发。
1 背景
美团的各个业务有着丰富的NLP场景,而这些场景中模型的构建需要很多的标注资源,成本很高。小样本学习致力于在数据资源稀少的情况下训练出比较好的模型,主要有以下两个评价标准:
-
提升算法效果:在标注资源一定的情况下,使用小样本学习能够尽可能多地提升相应的指标。
-
节省标注数据:在算法效果希望达到一定水平的情况下,希望尽可能减少标注数据。
在NLP领域少样本的场景下,主要存在以下三种场景,小样本学习针对这些问题采取了不同的措施:
-
样本空间稀缺 (图1左):样本数量较少时,分布稀缺,数据增强旨在更好利用样本/Embedding之间的关系,提高模型泛化性能。
-
样本分布在局部空间(图1中):某个领域往往只有少量标注数据,而有大量的未标注数据。根据对未标注数据的使用方式不同,我们将其划分为两种,第一种是半监督学习,是在模型Finetune过程中同时学习标注样本和未标注样本,利用了模型对未标注数据的预测一致性;第二种是集成学习+自训练,强调的是融合多个模型对未标注数据的预测结果作为伪标注数据加入训练。
-
不同领域之间的样本分布差异(图1右):在某个领域充分学习到标注信息之后,因样本空间有差异,无法直接用到其他领域,迁移学习旨在学习到一个领域的充分知识后,能够快速学习到其他领域的知识。

更多文章请关注《万象专栏》
转载请注明出处:https://www.wanxiangsucai.com/read/cv16064