暂无图片
暂无图片
暂无图片
暂无图片
暂无图片

AI 的诞生:一个从像素中崛起的帝国

现在是公元2026年。每天早上,你拿起手机,看一眼屏幕,解锁。整个过程不到一秒。你从来没想过这件事有什么特别的。

但在这个微小的动作背后,一个庞大的数字帝国正在运转。

这个帝国的名字,叫AI。

1 像素帝国的黑暗时代

很久很久以前——其实也就是几十年前——在AI帝国崛起之前,整个世界被像素统治着。

像素是什么?就是那些构成一切图像的小方块。一张照片、一个画面、一张脸,在电脑眼里,都只是一堆数字。纯黑是0,纯白是255,中间的灰色就是1到254。仅此而已。

电脑看到的世界是这样的:

    142  98  87 134 156 178 ...
     78  45  52  89 123 145 ...
    134 167 189 201 178 156 ...

    没有面孔,没有表情,没有意义。只有冰冷的数字。

    2 第一个发现:边缘

    1968年,斯坦福人工智能实验室里,两个年轻人Irwin Sobel和Gary Feldman在做一件看似疯狂的事情——他们想让电脑”看见”东西。

    他们发现了一个规律:只要找到数字变化最剧烈的地方,就能找到物体的边界。

    就像你站在悬崖边上,脚下的颜色和远处的颜色完全不同。那个分界线,就是边缘。

    他们设计了一个小小的检测器,只有9个数字:

      -1 0 1
      -2 0 2
      -1 0 1

      把它叠在图片上,做几次简单的乘法和加法,就能算出”这里有没有边缘”。

      原理其实很简单:右边减左边。如果左右亮度一样,结果是0;如果右边更亮,结果就是正数;如果左边更亮,结果是负数。

      这就是Sobel算子——人类设计的第一个”特征检测器”。

      但是,仅靠边缘还远远不够。

      3 漫长的黑暗时期

      从1968年到2012年,AI在”看”这件事上卡住了将近半个世纪。

      科学家们尝试了无数种方法:

      有人写规则:”如果有两个圆形在上面,一个三角形在中间,下面有一条横线,那可能是一张脸”

      有人提取特征:”检测眼睛的形状”、”测量鼻子的位置”

      但都撞上了同一堵墙:规则越写越多,却永远覆盖不了真实世界的复杂性。

      侧脸怎么办?戴帽子怎么办?只露出半张脸怎么办?光线暗了怎么办?表情变了怎么办?

      人类设计者绞尽脑汁,却始终无法让电脑真正”看见”。

      4 转折:让电脑自己学

      1986年,一篇发表在《Nature》上的论文悄悄埋下了一颗种子。作者是Rumelhart、Hinton和Williams。他们提出了一个想法——反向传播

      简单来说,就是让电脑自己调整检测器里的数字。

      一开始,所有数字都是随机的。电脑用这些随机的检测器去判断”这是猫还是狗”,肯定会错很多。

      但每次猜错,它都会计算:哪个数字该调大一点,哪个该调小一点,下次就能更接近正确答案。

      重复这个过程几百万次。

      神奇的事情发生了:那些原本随机的数字,自己变成了有意义的检测器。

      有的变成了边缘检测器(电脑自己”发明”了和Sobel算子几乎一模一样的东西)。

      有的变成了纹理检测器。

      有的检测的东西,连人类都说不清楚——但它们确实有用。

      电脑没有被告知”要检测边缘”。它自己发现了”检测边缘有助于区分物体”。

      这就是”学习”的本质:不是有人教了它规则,而是它从大量的对错反馈中,自己找到了有用的规律。

      5 叠加:帝国的崛起

      但一层检测器还不够。一个边缘检测器只能告诉你”这里有一条线”,不能告诉你”这是一只眼睛”。

      解决方法是:叠加很多层。

        像素 → 边缘 → 形状 → 部件 → 整体

        第一层检测器:从原始像素中找到各种边缘。

        第二层检测器:把边缘组合成简单形状——圆形、三角形、弧线。

        第三层检测器:把形状组合成部件——眼睛、鼻子、嘴巴。

        第四层检测器:把部件组合成整体——人脸、猫脸、汽车。

        每一层都在上一层的基础上,检测更复杂的东西。

        这就是”深度学习”里”深度”的含义——很多层检测器叠加在一起。

        而所有检测器里的数字,都不是人类设计的,是电脑自己从数据里学出来的。

        6 2012:帝国元年

        为什么这个想法在1986年就有了,却要到2012年才爆发?

        因为三个条件终于同时凑齐了:

        第一,数据。

        2009年,斯坦福大学的李飞飞教授团队发布了ImageNet数据集。超过1400万张标注好的图片,涵盖2万多个类别。每张图片都有人告诉你”这是猫”、”这是狗”、”这是汽车”。

        这些”正确答案”是电脑学习的前提——没有答案,就无法判断对错。

        为了建成ImageNet,他们动用了来自167个国家的近5万名标注工人,从1.6亿张候选图片中筛选和标注。

        第二,算力。

        训练一个模型,需要对几百万张图片、几千万个参数反复做计算。用普通电脑的CPU,可能要算好几个月甚至几年。

        但有人发现了一个聪明的办法:用游戏显卡(GPU)来算。

        GPU原本是用来生成游戏画面的,特别擅长”同时做很多简单的计算”。而训练神经网络恰好也是这种活——对几百万个数字做大量简单的乘法和加法。

        2012年,Geoffrey Hinton的学生Alex Krizhevsky用两块游戏显卡(NVIDIA GTX 580,当时售价499美元),花了5-6天,训练出了一个8层的神经网络,取名AlexNet。

        第三,算法改进。

        AlexNet还用了几个关键的技术改进。比如一种让深层网络更容易训练的数学技巧(叫ReLU),以及一种防止网络”死记硬背”训练数据的方法(叫Dropout)。

        三个条件——海量数据、GPU算力、算法改进——同时到位。

        那次突破有多震撼?在ImageNet图像识别比赛中,AlexNet将错误率从同年第二名的26.2%直接降到了15.3%——领先超过10个百分点。

        打个比方:所有人都在74分左右竞争,突然有人考了85分。

        7 帝国的统治

        现在,AI帝国已经统治了几乎所有和”看”有关的领域。

        手机人脸识别:当你拿起手机,它看到的不是一张脸,而是几百万个数字。这些数字经过很多层检测器——第一层找边缘,第二层找形状,第三层找五官部件——最后输出一组数字,也就是你这张脸的”数字指纹”。把它和你第一次录入时存下的指纹比较,如果足够接近,就解锁。

        整个过程没有任何”理解”。手机不知道什么是眼睛、什么是鼻子。它只是在做加减乘除。

        那些检测器里的数字,是从几百万张人脸照片中”学”出来的。没有人告诉电脑”要检测眼睛”,它自己在反复的”猜对了/猜错了”中发现了某些数字组合对区分不同人脸特别有用。

        这就是AI的”聪明”:不是真的理解,而是从海量数据中找到了反复出现的模式。

        8 一个新的疆域

        AI能”看”了。图片在它眼里是数字矩阵,它通过层层检测器从数字中提取特征。

        但文字呢?

        当你对ChatGPT说”苹果”,它”看到”的是什么?不是一个水果的画面,不是咬一口的味道——那它”看到”的是什么?

        文字怎么变成数字?AI又怎么”理解”这些数字的意思?

        一个更大的帝国正在扩张。

        而这个故事,才刚刚开始。


        下一篇:文字帝国的崛起——从“国王”减去“男人”加上“女人”等于什么开始。


        关注微信公众号【让天下没有难学的编程】,一起学习AI吧

        求职、职场,技术讨论等,任何问题都欢迎+V

        文章转载自让天下没有难学的编程,如果涉嫌侵权,请发送邮件至:contact@modb.pro进行举报,并提供相关证据,一经查实,墨天轮将立刻删除相关内容。

        评论