暂无图片
暂无图片
暂无图片
暂无图片
暂无图片
深度网络模型压缩综述-雷杰 , 高鑫 , 宋杰 , 王兴路 , 宋明黎.pdf
443
16页
0次
2022-05-19
免费下载
软件学报 ISSN 1000-9825, CODEN RUXUEW E-mail: jos@iscas.ac.cn
Journal of Software,2018,29(2):251266 [doi: 10.13328/j.cnki.jos.005428] http://www.jos.org.cn
©中国科学院软件研究所版权所有. Tel: +86-10-62562563
深度网络模型压缩综述
,
,
,
王兴路
,
宋明黎
(浙江大学 计算机科学与技术学院,浙江 杭州 310027)
通讯作者: 宋明黎, E-mail: brooksong@zju.edu.cn
: 深度网络近年来在计算机视觉任务上不断刷新传统模型的性能,已逐渐成为研究热点.深度模型尽管性
能强大,然而由于参数数量庞大、存储和计算代价高,依然难以部署在受限的硬件平台上(如移动设备).模型的参数
在一定程度上能够表达其复杂性,相关研究表明,并不是所有的参数都在模型中发挥作用,部分参数作用有限、表达
冗余,甚至会降低模型的性能.首先,对国内外学者在深度模型压缩上取得的成果进行了分类整理,依此归纳了基于
网络剪枝、网络精馏和网络分解的方;随后,总结了相关方法在多种公开深度模型上的压缩效;最后,对未来的
研究可能的方向和挑战进行了展望.
关键词: 深度神经网络;网络压缩;网络剪枝;网络精馏;网络分解
中图法分类号: TP301
中文引用格式: 雷杰,高鑫,宋杰,王兴路,宋明黎.深度网络模型压缩综述.软件学报,2018,29(2):251266. http://www.jos.org.cn/
1000-9825/5428.htm
英文引用格式: Lei J, Gao X, Song J, Wang XL, Song ML. Survey of deep neural network model compression. Ruan Jian Xue
Bao/Journal of Software, 2018,29(2):251266 (in Chinese). http://www.jos.org.cn/1000-9825/5428.htm
Survey of Deep Neural Networ k Model Compression
LEI Jie, GAO Xin, SONG Jie, WANG Xing-Lu, SONG Ming-Li
(School of Computer Science and Technology, Zhejiang University, Hangzhou 310027, China)
Abstra ct : Deep neural networks have continually surpassed traditional methods on a variety of computer vision tasks. Though deep
neural networks are very powerful, the large number of weights consumes considerable storage and calculation time, making it hard to
deploy on resource-constrained hardware platforms such as mobile system. The number of weights in deep neural networks represents the
complexity to an extent, but not all the weights contribute to the performance according to recent researches. Specifically, some weights
are redundant and even decrease the performance. This survey offers a systematic summarization of existing research achievements of the
domestic and foreign researchers in recent years in the aspects of network pruning, network distillation, and network decomposition.
Furthermore, comparisons of compression performance are provided on several public deep neural networks. Finally, a perspective of
future work and challenges in this research area are discussed.
Key words: deep neural network; network compression; network pruning; network distillation; network decomposition
深度网络压缩是指利用数据集对已经训练好的深度模型进行精简操作,进而得到一个轻量且准确率相当
的网络.压缩后的网络具有更小的结构和更少的参数,可以降低计算和存储开销,因而可以被部署在受限的硬
环境中(如移动设备等).
本文尽可能全面地整理了近年在深度网络压缩方面的研究工作,系统地评价和比较了它们在公开模型上
基金项目: 国家自然科学基金(61572428, U1509206)
Foundation item: National Natural Science Foundation of China (61572428, U1509206)
收稿时间: 2017-05-02; 修改时间: 2017-07-24; 采用时间: 2017-10-16; jos 在线出版时间: 2017-12-01
CNKI 网络优先出版: 2017-12-04 08:57:35, http://kns.cnki.net/kcms/detail/11.2560.TP.20171204.0857.018.html
252
Journal of Software 软件学报 Vol.29, No.2, February 2018
的压缩效用. 1 节介绍深度网络压缩提出的背景和合理性. 2 ~ 4 节分别从网络剪枝、网络精馏和网络
分解这 3 个角度归纳相关研究方法的演变和主要思想,并讨论各方法中的核心步骤. 5 节从多种压缩指标上
比较各类压缩方式在公开深度模型上的效用. 6 节探讨深度网络压缩的进一步发展方向. 7 节对全文进行
总结.
1 研究背景
深度学习
[1]
作为近年来机器学习领域最炙手可热的子领域,在许多领域取得了非常成功的应用.从最初的
手写数字识别
[2]
到近年来图像识别
[3]
、检
[4]
、追
[5]
以及智能问答系统
[6]
,深度网络模型都取得了传统方法无
法企及的成就.深度学习的成功一方面得益于其更多的参数和更大、更深的模型,另一方面得益于学术界、工
业界贡献的大规模标注或者未标注数据.具体来说,庞大的模型结构增强了其非线性拟合的能力,而大规模数据
增强了模型的泛化能力.
尽管深度网络模型在许多问题的实验中表现优越,但在实际应用中依然受到时间和空间上的制约.大而深
的深度网络模型运算量大,即使借助图形处理器(graphics processing unit,简称 GPU)加速
[7]
,时间上也依然不能
满足许多应用场景的需求.此外,大规模模型参数也要占用大量的内存空间,这对于手机等移动设备来说是无法
适用的.因此,在不影响深度网络模型效果的前提下,压缩网络模型是一个重要的研究问题.
传统的深度网络模型主要由卷积层、非线性激活层、下采样层以及全连接层等模块堆叠起来组成.卷积层
具有局部连接、权重共享的特点,虽然需要训练的参数不多,但一次前向的耗时较大;相比之下,全连接层虽然参
数可达到网络全部参数80%以上,但占用前向推断的时间不多.经典的深度网络模型可以参考最初用于图像
识别的 AlexNet
[8]
或者 VGG
[9]
等网络模型.这些模块大致可分为两类:一类是包括卷积层、全连接层等在内的含
有训练参数的模块,其中,参数的数量往往是人为设定的;另一类是包括非线性激活层以及下采样层等在内的不
含有任何训练参数的层.模型参数在一定程度上代表了模型的复杂度,也在一定程度上决定着模型所占据的空
间大小.人为设定的参数数量往往是在实验室经过重复实验调出来的,这种局部最优的超参数并不代表网络的
真正需求”:们既存在一定程度上的冗余,也没有权衡成本和效果之间的关系.因此,网络压缩的一个方向是通
过压缩模型的参数数量来降低模型的复杂度,比如后面将要介绍的小模型拟合大模型方法等.
模型的运算时间成本并不仅仅依赖模型的参数数量,也依赖于模型的深度.以残差网络
[10]
为例,尽管在何凯
明经典论文中,1 000 多层的残差网络参数数量不到 AlexNet 1/10,但其训练以及测试耗时都明显大于
AlexNet.更深的网络还会在训练阶段产生更多的中间变量,而这些中间变量是反向传播算法必不可少的.换句
话说,更深的网络模型也有着更大的内存空间的需求.从这个角度看,深度网络模型的压缩不仅仅是减少模型的
参数,更重要的是能够降低模型运算时间,将模型的深度控制在合理的范围之内,从而满足实际应用的需要.
2 网络剪枝
网络剪枝(network pruning)
[11]
早期指删除网络中冗余参,提高网络泛化能力.文献[12]通过考量权重衰减
作为权重参数的泛化成本,提出了一种在反向传播网络中动态地选择隐含节点的个数的方式.文献[13]则将遗
传算法引入进来,用于优化前向神经网络中的权重链接以及发掘新的连接模式和结构. CNN 出现之后,网络
剪枝主要指减少冗余的浮点计算(floating point operations,简称 FLOP)
[14]
,从而提高网络运行效率.
网络剪枝按剪枝粒度(pruning granularities)可分为 4 ,如图 1 所示,从粗到细为:中间隐层(layer)剪枝、通
(feature map/channel/filter)剪枝、卷积核(kernel)剪枝、核内权重(intra kernel weight)剪枝、单个权重(weight)
剪枝.其中,Feature Map/Channel 都指网络中一层产生的特征图张量的一个通道.Filter 是网络中的权重参数,
Feature Map 是网络输出,在网络剪枝中两者等价,因为减去一个 Filter 会导致少产生一个 Feature Map.从剪枝目
标上分类,可分为减少参数/网络复杂度、减小过拟合/增加泛化能力/提高准确率、减小部署运行时间(test
run-time)/提高网络效率以及减小训练时间等.不同的剪枝方法侧重也会有所不同,有的剪枝方法完全依赖网络
参数,剪枝后不需要调优恢复准确率;有的剪枝方法则只适用于全连接层剪枝.下面按照剪枝粒度的分类从细到
of 16
免费下载
【版权声明】本文为墨天轮用户原创内容,转载时必须标注文档的来源(墨天轮),文档链接,文档作者等基本信息,否则作者和墨天轮有权追究责任。如果您发现墨天轮中有涉嫌抄袭或者侵权的内容,欢迎发送邮件至:contact@modb.pro进行举报,并提供相关证据,一经查实,墨天轮将立刻删除相关内容。

评论

关注
最新上传
暂无内容,敬请期待...
下载排行榜
Top250 周榜 月榜