对于监督式学习,一个标准的AI建模流程如下:
AI建模全流程
不可思议的AIOS 之
新华三资料开发部出品
Copyright © 2020 新华三技术有限公司 版权所有,保留一切权利
本文中的内容为通用性技术信息,某些信息可能不适用于您所购买的产品
训练数据集
算法建模训练 新数据
数据预处理 学习 模型评估 新样本预测
原始数据
标签
不知道大家是否还记得,上期我们用辨认水果,形象的为大家简单讲解
了建模流程(忘记的快去补课哦~),但是那只是我们为了帮助大家理解
抽象出来的简化版,本期我们正儿八经不开玩笑的来聊聊真正的建模流
程是怎样的!
01 数据预处理(Preprocessing)
从原始数据变为标准数据集的过程就叫数据预处理。
02 学习(Learning)
• 针对不同场景的数据集进行建模学习,需要选择不同的算法,建立不同的网络模型,这个
过程就叫做建模。
• 算法(各种不同功能的小人)+网络模型(小人的工作方式、小人之间的配合模式及工作流
程等)使用训练数据集不断反复的进行训练,以达到最终可以正确匹配图片和标签的效果。
标签
最终模型
03 模型评估(Evaluation)
在学习过程中,会根据反复的学习,不断的调整模型中所有特征的权重值,以及相关参数,这
些特征的权重值,以及参数等信息,最终会保存成一个模型文件。
但是由于一直是使用训练数据集在学习,计算机有可能为了满足所有的训练样本,而造成过拟
合。所以我们需要进行模型评估,使用从未在训练过程中使用的测试数据集,来验证我们最终
生成的模型是否能有很好的识别能力。
04 新样本预测(Prediction)
过五关斩六将,终于走到这一步了!
此时的模型已经具有生产意义了,因为经过模型评估,我们认为它在面对未知样本
时也有能很好的识别能力。这时就可以使用最终的模型文件来预测未知数据了。
…
各种算法们进行一波花式炫技 在算法们辛勤的工作后,只需要轻击保
存,就可以得到一个高大上的识别小猫
小狗的模型了
Ctrl+S
训练数据集
一本正经
过拟合:即最终模型的泛化能力不好,换句话说就是只能认识训练数据,一旦拿到非训练数
据就完全无法识别。举个“栗子”,假如我们在训练模型时,一直使用的都是站着的小猫小狗
的照片,当换成坐着的照片时,模型就不认识了。
测试数据集
标签
生成
正确率不达标
退回第二关回炉重造
正确率达标
进入下一关
一个标准的AI建模流程基本如上所述,而实际AI建模的开发工具有很多,下面我们来认
识一些主流的AI计算框架。
Python和C++
WOW~是不是没想到建模过程居然对算力有如此大的需求。什么?搞
不清楚算力究竟是啥?那记得锁定下期呀!
猫!
模型
狗!
模型
阁下哪位啊?
模型
我真棒!
模型
测试数据集
在现实场景中,深度学习模型是迅速迭代的,对于同一种模型算法需要反复调
试超参数以获得更好的预测效果。
深度学习的本质上是基于统计的科学,大规模的样本数据对深度学习的效果至
关重要。
更大规模、更复杂的神经网络模型已被证明非常有效。
这些都对计算能力
产生了更高的要求
8层神经元的AlexNet网络一次迭代的计算量大约为:
1.4 GFLOPs ≈ 14亿次浮点运算
微软提出的ResNet一次计算量大约为:
22.6 GFLOPs ≈ 226亿次的浮点运算
数据+标签 标准数据集
……
……
特征抽取
特征选择
降维
抽样
训
练
测
试
评论