⑦ 预测所需的核心资源“数据”
移动设备普及引发数据爆发式增长
2008年金融危机,若有AI或许会不同

编者按回顾失败,是通往成功的捷径。
“AI错误笔记”专栏将探讨与人工智能相关的产品和服务、企业与人物的失败案例。

人工智能(AI)是“预测机器”,引入AI,就是要通过预测最大化收益。为达成这一目标,最重要的就是“数据”。


必须有数据,才能对AI进行训练,并在此基础上进行预测。为了让AI做出更优的预测,就必须进行更多、更丰富的学习。


“iPhone革命”为AI夯实基础
手持iPhone的史蒂夫·乔布斯。美联社供图

手持iPhone的史蒂夫·乔布斯。美联社供图

View original image

我们已经知道,AI需要大量数据。那么,这些庞大的数据从何而来?现代意义上的AI概念诞生于20世纪50年代,那时难道没有数据吗?当然不是。


AI之所以能演化为预测机器,是因为数据的爆炸式增长与硬件性能的飞速发展相互叠加。伴随互联网革命,数据的生产和存储变得更加容易。互联网铺开了名为“数据”的资源大地。


随后,随着移动设备的普及,数据史又迎来了新的转折点,这就是2007年的“iPhone革命”。2007年不仅仅意味着一种名为智能手机的新型设备的推出,其意义远不止于此。


1984年,全世界互联网的月度总流量为15千兆字节(GB)。到了2014年,这一数字增至42.4艾字节。1984年一个月才产生的流量,在2014年相当于每百分之一秒就会产生一次。

1984年,全世界互联网的月度总流量为15千兆字节(GB)。到了2014年,这一数字增至42.4艾字节。1984年一个月才产生的流量,在2014年相当于每百分之一秒就会产生一次。

View original image

作为一台“握在手里的电脑、会移动的电脑”,iPhone开启了数据的洪水时代。个人在何时何地购买什么、向哪里移动等个人偏好与喜好的信息,都开始被系统性地收集。由于iPhone内置了全球定位系统、加速度计、陀螺仪等多种传感器,与人类行为和运动相关的数据也得以被采集。摄像头功能的强化,更是引发了图像与视频数据的指数级增长。


此外,在应用商店中,有人开发应用,有人使用应用,从而留下数据这一“痕迹”。iPhone彻底改变了数据生成与采集的范式,这为AI向预测机器发展奠定了重要基础。


与此同时,2000年代以后计算机性能的飞速提升,在处理爆炸式增长的数据方面发挥了关键作用。如果没有信息处理速度和存储容量的支撑,就不可能对数据进行有效处理。


要进行预测,必须先掌握数据。各种传感器可以获取与健康相关的数据。关于心率的大量数据,使预测心脏异常成为可能。图为搭载心率传感器的 Galaxy Ring。三星电子提供

要进行预测,必须先掌握数据。各种传感器可以获取与健康相关的数据。关于心率的大量数据,使预测心脏异常成为可能。图为搭载心率传感器的 Galaxy Ring。三星电子提供

View original image

三星电子今年7月公开了一款名为“Galaxy Ring”的设备。这是一枚佩戴在手指上的戒指,同时也是一款可穿戴设备。戒指内侧配有3个传感器。加速度传感器用于测量佩戴者的运动与活动量;光学传感器用于监测心率;温度传感器则用于感知和观察体温变化。


Galaxy Ring通过传感器收集到的信息,就是数据。对佩戴Galaxy Ring人群的体温、心率和运动数据进行分析,就可以为健康管理提供判断依据。佩戴者平时的心率数据、偏离平均线的异常心率数据,以及健康个体的心率数据叠加在一起,就可以通过比较进行预测。例如预测心律何时会出现不规则变化、脑卒中前兆何时出现等。


Galaxy Ring的预测能力,会随着使用者数量的增加而变得更加精准。系统在不断累积用户的正常健康数据和异常数据的同时,也在收集各类症状发生概率的数据。通过反复执行“信息收集—预测—获得预测结果反馈”这一结构,预测能力会不断提升。


如果有AI预测,2008年金融危机会不一样吗
机器学习通过欺诈检测、安全威胁识别、个性化与推荐、利用聊天机器人提供一体化客户服务、脚本撰写与翻译、数据分析等关键功能,为业务提供支持。同时,它也广泛应用于自动驾驶、无人机、飞机、增强现实与虚拟现实、机器人技术等领域。盖蒂图片银行供图

机器学习通过欺诈检测、安全威胁识别、个性化与推荐、利用聊天机器人提供一体化客户服务、脚本撰写与翻译、数据分析等关键功能,为业务提供支持。同时,它也广泛应用于自动驾驶、无人机、飞机、增强现实与虚拟现实、机器人技术等领域。盖蒂图片银行供图

View original image

没有数据,就不可能进行预测。在当今这个传感器和各类设备高度普及的时代,数据甚至可以说是“过剩”。


在这一点上,我们会遇到“机器学习(Machine Learning)”这一概念。机器学习可以被视为:通过让算法从数据中学习,从而实现模式识别、目标识别等预测任务的方法。借助机器学习,AI可以获得更多学习和经验,自我调整并进一步提升预测能力。


数据生成的速度与日俱增,如果没有机器学习,要对实时涌现的数据进行分析与利用几乎是不可能的。


让全球经济陷入低迷的2008年金融危机,如果当时已经广泛应用机器学习,也许结果会有所不同。彼时专家们同样基于数据进行预测,但方法是线性的,在处理变量方面也存在诸多限制。


参考图片。Getty Image Bank供图

参考图片。Getty Image Bank供图

View original image

当时用于预测股价波动的方法论,主要基于名为“回归(regression)”的统计技术,即以过去发生的事情的平均值为依据进行预测。比如,“上个月韩国股市有15个交易日收涨、5个交易日收跌,那么下个月也将以3:1的比例收涨”,这种就是典型做法,非常简单。


因此,人们会叠加一种称为“条件平均(conditional average)”的方法。如果一个月中有15天收涨,就要进一步分析“在什么条件下上涨”。例如,是否处在业绩发布期、前一日跌幅超过2%的情况下有多少比例等。通过这些条件,可以做出更为精确的预测。


2008年金融危机期间,专家们利用多个条件平均构建出类似多元回归的模型进行预测。


问题在于,他们所使用的数据与真实的住房市场价格几乎毫无关联。他们根据自己认为重要的数据建立假设并进行验证。尽管有关过去的资料十分丰富,最终预测仍然严重偏离现实。


AI研究者表示,如果当时采用的是机器学习,情况可能会不同。即便是多元回归,也不可能无限增加变量数量,否则模型会过于复杂。但机器学习可以把握数十、数百乃至数千个变量之间的关系,在海量数据中筛选出模式和有用信息方面极具优势。如果以当前水平的机器学习当时就已在华尔街得到应用,也许能够更早、更准确地捕捉到危机的征兆。


数据,只要拼命收集再拿来用就行吗
堆叠的书籍。Getty Image Bank供图

堆叠的书籍。Getty Image Bank供图

View original image

虽然数据泛滥,但要获得真正需要的数据并不容易。数据是关于过去观察与经验的信息。单纯“攒了很多数据”,本身什么也做不成。


首先必须先提出与待解决问题相关的问题。例如,“我想预测什么”“对我们组织、我们公司而言,需要什么样的预测”。这样就可以缩小与所要预测的问题、现象相关的数据范围,即筛选出具有相关性的数据。接下来,还需要足够数量的数据,才能发现模式并加以泛化。



然而,数据中也潜藏着诸多陷阱,有些陷阱极其深邃,导致不少AI服务或产品以失败告终。我们有必要审视与数据相关的风险。

下期连载预告
⑧在“新冠战争”最前线,却唯独不给医护人员打疫苗的AI(12月15日)
⑨一张贴纸,系着一条人命(12月21日)
⑩连妈妈都认不出的我的脸,iPhone却能识别(12月22日)


本报道由人工智能(AI)翻译技术生成。

版权所有 © 阿视亚经济。未经许可不得转载,禁止用于AI训练及使用。