丽莎老师讲机器人之人工智能的三生三世(二)
三、规划决策系统的发展历史:
人工智能规划决策系统的发展,一度是以棋类游戏为载体的。最早在18世纪的时候,就出现过一台可以下棋的机器,击败了当时几乎所有的人类棋手,包括拿破仑和富兰克林等。不过最终被发现机器里藏着一个人类高手,通过复杂的机器结构以混淆观众的视线,只是一场骗局而已。
真正基于人工智能的规划决策系统出现在电子计算机诞生之后,1962年时,Arthur Samuel制作的西洋跳棋程序Checkers经过屡次改进后,终于战胜了州冠军。
当时的程序虽然还算不上智能,但也已经具备了初步的自我学习能力,这场胜利在当时还是引起了巨大的轰动,毕竟是机器首次在智力的角逐中战胜人类。这也让人们发出了乐观的预言:“机器将在十年内战胜人类象棋冠军”。
但人工智能所面临的困难比人们想象得要大很多,跳棋程序在此之后也败给了国家冠军,未能更上一层楼。而国际象棋相比跳棋要复杂得多,在当时的计算能力下,机器若想通过暴力计算战胜人类象棋棋手,每步棋的平均计算时长是以年为单位的。人们也意识到,只有尽可能减少计算复杂度,才可能与人类一决高下。
80年代,随着算法上的不断优化,机器象棋程序在关键胜负手上的判断能力和计算速度大幅提升,已经能够击败几乎所有的顶尖人类棋手。
到了90年代,硬件性能、算法能力等都得到了大幅提升,在1997年那场著名的人机大战中,IBM研发的深蓝(Deep Blue)战胜国际象棋大师卡斯帕罗夫,人类意识到在象棋游戏中已经很难战胜机器了。
到了2016年,硬件层面出现了基于GPU、TPU的并行计算,算法层面出现了蒙特卡洛决策树与深度神经网络的结合。
人们从棋类游戏中积累的知识和经验,也被应用在更广泛的需要决策规划的领域,包括机器人控制、无人车等等。棋类游戏完成了它的历史使命,带领人工智能到达了一个新的历史起点。
四、人工智能的现在
时至今日,人工智能的发展已经突破了一定的“阈值”。与前几次的热潮相比,这一次的人工智能来得更“实在”了,这种“实在”体现在不同垂直领域的性能提升、效率优化。计算机视觉、语音识别、自然语言处理的准确率都已不再停留在“过家家”的水平,应用场景也不再只是一个新奇的“玩具”,而是逐渐在真实的商业世界中扮演起重要的支持角色。
五、语音处理的现在
一个完整的语音处理系统,包括前端的信号处理、中间的语音语义识别和对话管理(更多涉及自然语言处理)、以及后期的语音合成。
总体来说,随着语音技术的快速发展,之前的限定条件正在不断减少:包括从小词汇量到大词汇量再到超大词汇量、从限定语境到弹性语境再到任意语境、从安静环境到近场环境再到远场嘈杂环境、从朗读环境到口语环境再到任意对话环境、从单语种到多语种再到多语种混杂,但这给语音处理提出了更高的要求。
六、计算机视觉的现在:
计算机视觉的研究方向,按技术难度的从易到难、商业化程度的从高到低,依次是处理、识别检测、分析理解。
图像处理是指不涉及高层语义,仅针对底层像素的处理;图像识别检测则包含了语音信息的简单探索;图像理解则更上一层楼,包含了更丰富、更广泛、更深层次的语义探索。
目前在处理和识别检测层面,机器的表现已经可以让人满意。但在理解层面,还有许多值得研究的地方。
图像处理以大量的训练数据为基础(例如通过有噪声和无噪声的图像配对),通过深度神经网络训练一个端到端的解决方案。有几种典型任务:去噪声、去模糊、超分辨率处理、滤镜处理等。
运用到视频上,主要是对视频进行滤镜处理。这些技术目前已经相对成熟,在各类P图软件、视频处理软件中随处可见。
图像识别检测的过程包括图像预处理、图像分割、特征提取和判断匹配,也是基于深度学习的端到端方案。可以用来处理分类问题(如识别图片的内容是不是猫)、定位问题(如识别图片中的猫在哪里)、检测问题(如识别图片中有哪些动物、分别在哪里)、分割问题(如图片中的哪些像素区域是猫)等。
这些技术也已比较成熟,图像上的应用包括人脸检测识别、OCR(Optical Character Recognition,光学字符识别)等,视频上可用来识别影片中的明星等。
当然,深度学习在这些任务中都扮演了重要角色。
传统的人脸识别算法,即使综合考虑颜色、形状、纹理等特征,也只能做到95%左右的准确率。而有了深度学习的加持,准确率可以达到99.5%,错误率下降了10倍,从而使得在金融、安防等领域的广泛商业化应用成为可能。
OCR领域,传统的识别方法要经过清晰度判断、直方图均衡、灰度化、倾斜矫正、字符切割等多项预处理工作,得到清晰且端正的字符图像,再对文字进行识别和输出。
而深度学习的出现不仅省去了复杂且耗时的预处理和后处理工作,更将字准确率从60%提高到90%以上。
七、自然语言处理的现在:
自然语言处理中的几个核心环节包括知识的获取与表达、自然语言理解、自然语言生成等等,也相应出现了知识图谱、对话管理、机器翻译等研究方向,与前述的处理环节形成多对多的映射关系。
由于自然语言处理要求机器具备的是比“感知”更难的“理解”能力,因此其中的许多问题直到今天也未能得到较好的解决。
知识图谱是基于语义层面对知识进行组织后得到的结构化结果,可以用来回答简单事实类的问题。
包括语言知识图谱(词义上下位、同义词等)、常识知识图谱(“鸟会飞但兔子不会飞”)、实体关系图谱(“刘德华的妻子是朱丽倩”)。
知识图谱的构建过程其实就是获取知识、表示知识、应用知识的过程。
八、机器学习的现在:
按照人工智能的层次来看,机器学习是比计算机视觉、自然语言处理、语音处理等技术层更底层的一个概念。近几年来技术层的发展风生水起,处在算法层的机器学习也产生了几个重要的研究方向。
鉴于机器学习还存在不少的局限、不具备通用性,在一个比较狭窄的垂直领域的应用就成为了较好的切入口。
因为在限定的领域内,一是问题空间变得足够小,模型的效果能够做到更好;二是具体场景下的训练数据更容易积累,模型训练更高效、更有针对性;三是人们对机器的期望是特定的、具体的,期望值不高。
这三点导致机器在这个限定领域内表现出足够的智能性,从而使最终的用户体验也相对更好。
九、人工智能的未来:
随着技术水平的突飞猛进,人工智能终于迎来它的黄金时代。回顾人工智能六十年来的风风雨雨,历史告诉了我们这些经验:
首先,基础设施带来的推动作用是巨大的,人工智能屡次因数据、运算力、算法的局限而遇冷,突破的方式则是由基础设施逐层向上推动至行业应用;
其次,游戏AI在发展过程中扮演了重要的角色,因为游戏中牵涉到人机对抗,能帮助人们更直观地理解AI、感受到触动,从而起到推动作用;
最后,我们也必须清醒地意识到,虽然在许多任务上,人工智能都取得了匹敌甚至超越人类的结果,但瓶颈还是非常明显的。
因此,在金融、律政、医疗等等垂直领域,我们都看到了一些成熟应用,且已经实现了一定的商业化。可以预见,在垂直领域内的重复性劳动,未来将有很大比例会被人工智能所取代。