
杨刚 等:一种基于视觉特征组合构造的零样本学习方法
17
results demonstrate the effectiveness and superiority of the proposed approach.
Key words: zero-shot learning; image classification; dissimilarity representation; data preprocessing
零样本学习(zero-shot learning)是图像语义理解领域的一类尤为重要的机器学习方法.随着图像标注成本
的不断增加,待识别类别愈加繁杂,利用大量训练数据通过监督学习构建图像分类模型的方法,已逐渐突显不足.
零样本学习能够利用类别关联等先验知识,实现对未见类别图像的识别,而无需依赖大量的目标类(未见类)训
练数据.零样本学习作为一种解决未见类图像分类问题的有效方法,近年来倍受关注
[1]
.
零样本学习方法通常利用可见类(存在训练样本的类)与未见类(不存在训练样本的类)之间的类别语义信
息,将从可见类样本学习到的知识转移到未见类,实现对未见类样本的分类识别
[210]
.零样本学习是一种特殊的
迁移学习.迁移学习是指对先前领域中学到的知识进行识别,并将其应用到一个全新的领域,其中先前领域称为
源领域(source domain),新领域称为目标领域(target domain)
[11]
,而零样本学习是利用从可见类中学到的知识去
识别未见类,其中可见类分布于源领域,未见类分布于目标领域且未见类样例无标签.此外,在一定条件下,零样
本学习可以转化成监督学习,例如在获取了有标签的未见类样例的前提下,可以通过学习这些样例去识别真实
的未见类样例.当前,零样本学习方法主要分为两大类:概率推理方法和特征映射方法.DAP(direct attribute
prediction)
[9]
方法利用了跨类别的属性预测和最大似然估计推导未见类的类别概率,是概率推理方法的基
础
[1,12]
.随后,语义属性(semantic attribute)和确定性属性(discriminative attribute)优化了概率推理方法
[13,14]
.然而,
概率推理方法过于依赖属性预测的正确性,并且,类别属性是类别层次上的描述,实例层次的语义描述上存在很
大的偏差
[1]
.这些缺点限制了概率推理方法的发展和应用.特征映射方法形成了一条在不同嵌入之间进行样例
特征比较的有效途径.利用特征映射方法,图像的低层次特征能够映射到高层次语义特征空间,直接与未见类的
语义特征比较,形成分类.而且,确定性嵌入(discriminative embedding)可以通过 Word2Vec
[15]
将类别文本转化为
高维词向量, 形成词向量空间中有效语义表示, 便于特征空间映射
[16]
. 另外, 一些中间嵌入(intermediate
embeddings)被引入到特征映射方法中
[17,18]
,用于在视觉流空间(visual manifold space)表示具体实例
[4]
,由此,视
觉特征和属性特征将被映射到该空间中用于比较并分类.大量的确定性嵌入使特征映射方法具有了更加丰富
的特征表示,实现了在不同特征空间下的未见类和可见类的样例分类.然而,特征映射方法仍然需要大量的标注
数据和耗时的运算来训练模型,并且此类方法在原理上与人类零样本学习的认知过程不一致.
零样本学习是人类拥有的基本认知能力
[19]
.人类能够利用已有知识,参考和组合已见类物体的视觉特征,想
象构造未见类物体的视觉特征,从而实现对未见类物体的识别.例如,当一个人学习了“老虎是生活在森林中的
具有斑纹毛皮的最大的猫科动物”的文字表述后,他会以自己见到的家猫为基本参考,通过想象替换掉家猫的毛
皮和周边环境,继而产生老虎图像;此人会乐观地认可并学习自己想象的老虎图像,形成对“老虎”的视觉认知.由
此,他具有了对未见类“老虎”的认知能力.此未见类图像的想象构造过程使得人类具有了零样本学习能力.模拟
此未见类图像的构造过程,将形成一种有效的零样本学习方法.
本文提出了一种基于视觉特征组合构造的零样本学习方法,简称为 ViFC 方法.ViFC 方法模拟了人类根据
语义描述联想出未见类物体视觉特征的过程.在参考最相似类样例特征的基础上,ViFC 方法通过不同特征维度
上的特征组合,构造未见类的样例特征;并在测试样例批量输入的假设条件下,通过类别间的空间结构匹配优化,
转换已构造的未见类样例特征,形成有效样例.ViFC 方法将零样本学习问题转化为标准的监督学习分类问题.
传统的监督学习分类算法可以直接学习 ViFC 方法产生的未见类样例,构建分类模型,实现对真实的未见类样例
的分类识别.
本文的贡献主要有以下 3 点:(1) 本文提出了一种模拟人类认知想象过程的零样本学习方法.此方法提取了
属性与特征维度之间的关联关系,通过不同维度的特征组合,在特征层次上产生未见类的样例,将零样本学习问
题转化为传统的监督学习分类问题,是一种从新角度解决零样本学习问题的方法.(
2) 在测试样例批量输入的
前提假设下,本文提出了类别间的空间结构匹配策略,有效地解决了特征域迁移问题.该策略借鉴非相似表示
(dissimilarity representation)的原理,利用已产生的未见类样例与测试样例的空间结构匹配关系,获得未见类的
评论