工作这些年,一直在分布式计算、云计算、并行计算、大数据、服务器、计算机集群领域徘徊。LAXCUS分布式操作系统能发展到今天,和当年这些工作经历密不可分。LAXCUS分布式操作系统很多的技术和设计理念,都来源于早期从事的一些项目。今天就说说当年参与过的三个比较典型的高性能计算项目。
第一个项目是朋友介绍的,是一个视频分享网站的视频转码的订单,网站名字就不说了,这家公司现在还在,说出来有替人宣传嫌疑,只是面对抖音这种大平台,他们就显得没落多了。当时他们情况是这样,视频网站的内容需要统一用MP4格式在浏览器网页上播放,因为上传的格式多种多样,我们必须把这些视频转换成MP4格式。如果从PC时代过来的人,视频转码的工作想必大家都在自己的电脑上试过,通常一个100M左右的视频转码需要20分钟以上(当时通常标配是奔腾4处理器,1G左右的内存)。我们为了提高转码效率,让用户以接近实时得到处理结果,必须在接收完视频后,立即将一个视频拆分成多个单元,分散到多台计算机上进行转码,然后回收所有转码视频,按照顺序再次组合成一个新视频。我估计现在视频网站都是这个套路。我们团队早期做过很多流媒体工作,这项工作基本没有什么难度,驾轻就熟,很快就完成了。视频转码严重依赖计算机和计算机性能,只要机器足够多,性能足够好,视频差不多能以接近实时的状态完成转码。后来又再一次改进,从用户上传视频开始立即进行转码,收到一段转一段,用户的视频上传完毕,我们的转码工作也完成,用户可以马上看到自己上传的转码后视频,基本上是零延时,并且稳定性、效率都高于对方提出的要求。做完这个,合作方老板很满意,接着又给了几个高性能计算项目,至今仍然有联系。
第二个项目,在当时是高度保密项目,现在很多能公开展示的高科技产品,都或许与它有说不清道不明的关联。如果用这个项目写一篇论文,论文题目可以这样写:关于空中移动目标运行轨迹和落点的问题。这个项目是大领导带队拿下来的,项目实质就是测试炮弹打导弹,测试看是不是能打着,评估技术可行性。当时人还在技术单位,但是从事的研究领域和空气动力学毫不相关,对这方面的知识基本属于文盲,知道的也就是那么几个有限的名词和数学公式,但是这正好符合大领导和上面更大领域的要求,不需要我们懂这些深涩的理论,有专人来负责这些事情。我们的工作就是把很多传感器(他们没明说,但是地球人都明白这东西应该是雷达)接收的数据,包括当前多少公里范围内的空气的风速、风向、地表的曲面率,还有其它一些指标在收集后(这些瞬间产生的3D数据和数据量非常大),分散到一大堆计算机上去执行(测试时准备了100个节点),并且要很快计算出结果(必须比空中运动的目标快)处理这些工作,尤其是实现实时计算,需要依赖大内存、高性能CPU,以及高速网络,跳过硬盘这个瓶颈,才能得以实现快速计算。这些大规模、分布式、并行计算的技术,后来已经深度融合进LAXCUS分布式操作系统,现在则是用GPU取代了CPU,用BI网络取代了早期的宽带网络。这个保密项目花了很长时间,主要的时候都花在与合作方的沟通改进测试,然后是再沟通再改进再测试,循环往复,周而复始。后来终于完成了,合作方拿着项目产品做了试验,据说可行性很高,上面更大的领导非常满意,还摆了庆功酒。做为一个小小的参与者和看客,反正我没见着也没喝着。其实他们怎么计算的,我到最后也没有搞明白,问过一次,说是机密,不能随便过问。
第三个是中某油的页岩气项目,属于民用项目。当时的背景是,在四川涪陵地区发现了大面积的天然气,按照自然规律,油气是共生的,所以中某油想通过采集页岩样本,分析这个地区地下有没有石油资源,如果有,是不是具有开采价值。这套计算机软件原本已经是有的,最早艾克森.美孚石开发的,跑在克雷-1超级计算机上。那套超算是上世纪七八十年代的机器,经过了二三十年的技术演进升级后,在当时已经完全不能满足技术需要,属于博物馆展品产品。更大的问题是,其中很多数据分析理论已经过时,需要深度调整。中某油更不满意的还是计算速度太慢,往往计算一次,需要几小时甚至几天才能出算出结果。这个项目放在今天,换上LAXCUS分布式操作系统和GPU算力集群的组合,可能就是几分钟的事情。这一次洽谈的结果又是双方的合作:中某油出熟悉采油的技术专家,我们出并行计算的码农,前前后后折腾了大半年,基本是把计算机代码从头到尾重写一遍。这次硬件设备是中某油提供的一套全新的计算机集群,我们根据以前积攒的工作经验,加上新设计开发的分布式并行算法,计算效率提高了数倍。不过和上次炮弹打导弹一样,整个项目静悄悄开始,静悄悄结束,后面是个什么结果就不知道了。
Laxcus分布式操作系统研发团队正在扩招中,岗位包括:技术合伙人、项目主管、核心开发人员,公司提供了丰厚的股权和期权奖励,欢迎“有想法”和“不安分”的小伙伴联系我们,加入Laxcus分布式操作系统研发团队,抓住人工智能和算力互联网发展浪潮红利!





