但在这个微小的动作背后,一个庞大的数字帝国正在运转。
这个帝国的名字,叫AI。
1 像素帝国的黑暗时代
很久很久以前——其实也就是几十年前——在AI帝国崛起之前,整个世界被像素统治着。
像素是什么?就是那些构成一切图像的小方块。一张照片、一个画面、一张脸,在电脑眼里,都只是一堆数字。纯黑是0,纯白是255,中间的灰色就是1到254。仅此而已。
电脑看到的世界是这样的:
142 98 87 134 156 178 ...78 45 52 89 123 145 ...134 167 189 201 178 156 ...
没有面孔,没有表情,没有意义。只有冰冷的数字。
2 第一个发现:边缘
1968年,斯坦福人工智能实验室里,两个年轻人Irwin Sobel和Gary Feldman在做一件看似疯狂的事情——他们想让电脑”看见”东西。
他们发现了一个规律:只要找到数字变化最剧烈的地方,就能找到物体的边界。
就像你站在悬崖边上,脚下的颜色和远处的颜色完全不同。那个分界线,就是边缘。
他们设计了一个小小的检测器,只有9个数字:
-1 0 1-2 0 2-1 0 1
把它叠在图片上,做几次简单的乘法和加法,就能算出”这里有没有边缘”。
原理其实很简单:右边减左边。如果左右亮度一样,结果是0;如果右边更亮,结果就是正数;如果左边更亮,结果是负数。
这就是Sobel算子——人类设计的第一个”特征检测器”。
但是,仅靠边缘还远远不够。
3 漫长的黑暗时期
从1968年到2012年,AI在”看”这件事上卡住了将近半个世纪。
科学家们尝试了无数种方法:
有人写规则:”如果有两个圆形在上面,一个三角形在中间,下面有一条横线,那可能是一张脸”
有人提取特征:”检测眼睛的形状”、”测量鼻子的位置”
但都撞上了同一堵墙:规则越写越多,却永远覆盖不了真实世界的复杂性。
侧脸怎么办?戴帽子怎么办?只露出半张脸怎么办?光线暗了怎么办?表情变了怎么办?
人类设计者绞尽脑汁,却始终无法让电脑真正”看见”。
4 转折:让电脑自己学
1986年,一篇发表在《Nature》上的论文悄悄埋下了一颗种子。作者是Rumelhart、Hinton和Williams。他们提出了一个想法——反向传播。
简单来说,就是让电脑自己调整检测器里的数字。
一开始,所有数字都是随机的。电脑用这些随机的检测器去判断”这是猫还是狗”,肯定会错很多。
但每次猜错,它都会计算:哪个数字该调大一点,哪个该调小一点,下次就能更接近正确答案。
重复这个过程几百万次。
神奇的事情发生了:那些原本随机的数字,自己变成了有意义的检测器。
有的变成了边缘检测器(电脑自己”发明”了和Sobel算子几乎一模一样的东西)。
有的变成了纹理检测器。
有的检测的东西,连人类都说不清楚——但它们确实有用。
电脑没有被告知”要检测边缘”。它自己发现了”检测边缘有助于区分物体”。
这就是”学习”的本质:不是有人教了它规则,而是它从大量的对错反馈中,自己找到了有用的规律。
5 叠加:帝国的崛起
但一层检测器还不够。一个边缘检测器只能告诉你”这里有一条线”,不能告诉你”这是一只眼睛”。
解决方法是:叠加很多层。
像素 → 边缘 → 形状 → 部件 → 整体
第一层检测器:从原始像素中找到各种边缘。
第二层检测器:把边缘组合成简单形状——圆形、三角形、弧线。
第三层检测器:把形状组合成部件——眼睛、鼻子、嘴巴。
第四层检测器:把部件组合成整体——人脸、猫脸、汽车。
每一层都在上一层的基础上,检测更复杂的东西。
这就是”深度学习”里”深度”的含义——很多层检测器叠加在一起。
而所有检测器里的数字,都不是人类设计的,是电脑自己从数据里学出来的。
6 2012:帝国元年
为什么这个想法在1986年就有了,却要到2012年才爆发?
因为三个条件终于同时凑齐了:
第一,数据。
2009年,斯坦福大学的李飞飞教授团队发布了ImageNet数据集。超过1400万张标注好的图片,涵盖2万多个类别。每张图片都有人告诉你”这是猫”、”这是狗”、”这是汽车”。
这些”正确答案”是电脑学习的前提——没有答案,就无法判断对错。
为了建成ImageNet,他们动用了来自167个国家的近5万名标注工人,从1.6亿张候选图片中筛选和标注。
第二,算力。
训练一个模型,需要对几百万张图片、几千万个参数反复做计算。用普通电脑的CPU,可能要算好几个月甚至几年。
但有人发现了一个聪明的办法:用游戏显卡(GPU)来算。
GPU原本是用来生成游戏画面的,特别擅长”同时做很多简单的计算”。而训练神经网络恰好也是这种活——对几百万个数字做大量简单的乘法和加法。
2012年,Geoffrey Hinton的学生Alex Krizhevsky用两块游戏显卡(NVIDIA GTX 580,当时售价499美元),花了5-6天,训练出了一个8层的神经网络,取名AlexNet。
第三,算法改进。
AlexNet还用了几个关键的技术改进。比如一种让深层网络更容易训练的数学技巧(叫ReLU),以及一种防止网络”死记硬背”训练数据的方法(叫Dropout)。
三个条件——海量数据、GPU算力、算法改进——同时到位。
那次突破有多震撼?在ImageNet图像识别比赛中,AlexNet将错误率从同年第二名的26.2%直接降到了15.3%——领先超过10个百分点。
打个比方:所有人都在74分左右竞争,突然有人考了85分。
7 帝国的统治
现在,AI帝国已经统治了几乎所有和”看”有关的领域。
手机人脸识别:当你拿起手机,它看到的不是一张脸,而是几百万个数字。这些数字经过很多层检测器——第一层找边缘,第二层找形状,第三层找五官部件——最后输出一组数字,也就是你这张脸的”数字指纹”。把它和你第一次录入时存下的指纹比较,如果足够接近,就解锁。
整个过程没有任何”理解”。手机不知道什么是眼睛、什么是鼻子。它只是在做加减乘除。
那些检测器里的数字,是从几百万张人脸照片中”学”出来的。没有人告诉电脑”要检测眼睛”,它自己在反复的”猜对了/猜错了”中发现了某些数字组合对区分不同人脸特别有用。
这就是AI的”聪明”:不是真的理解,而是从海量数据中找到了反复出现的模式。
8 一个新的疆域
AI能”看”了。图片在它眼里是数字矩阵,它通过层层检测器从数字中提取特征。
但文字呢?
当你对ChatGPT说”苹果”,它”看到”的是什么?不是一个水果的画面,不是咬一口的味道——那它”看到”的是什么?
文字怎么变成数字?AI又怎么”理解”这些数字的意思?
一个更大的帝国正在扩张。
而这个故事,才刚刚开始。
下一篇:文字帝国的崛起——从“国王”减去“男人”加上“女人”等于什么开始。
关注微信公众号【让天下没有难学的编程】,一起学习AI吧

求职、职场,技术讨论等,任何问题都欢迎+V




