尊敬的【高启强】:您网购的《孙子兵法》正在配送…
正文共2598字, 预计阅读时间约为8分钟 也可点击本篇推文音频, 用耳朵聆听知识~
小时候,我们寄信的时候,必须准确无误地给出目的地信息,包括省、市、区、街道、门牌号和单位名,只要有一个信息有误,邮递系统就可能找不到目的地,或把信发到错误的地方。
现如今,我们在网购平台添加收货地址时, 无需给出完整的信息,系统就能自动帮我们补齐缺少的信息。 例如,高启强想网购一本《孙子兵法》,他只需填写“临江省京海市旧厂街鱼摊”,平台就会帮他补齐缺少的行政区信息,甚至鱼摊的门牌号。
这个功能是怎么实现的呢?大院er向大家介绍一种非常重要的算法——聚类,它被广泛地应用于我们生活的方方面面。
什么是聚类
“分类”(Classification)的概念,我们一定不陌生,它是指根据明确的特征差异,将若干事物分为多个部分。例如,高启强从批发市场进了一批鱼,按照“吃草还是吃肉”,可以将其分为2类。
分类所依据的特征是完全明确的 ,一条鱼被分到“吃草”类还是“吃肉”,结果是确定的,且与其它鱼被分到的类别无关。另外,某个类别中可能没有任何元素,例如这次进的全是吃草的鱼,没有吃肉的鱼。
(分类:特征明确,结果确定)
聚类(Clustering)与分类表面上很像,但底层逻辑又截然不同。 表面上,聚类也是将若干事物分为多个部分;但不同的是, 聚类并不依据任何明确的特征,而是根据差异性。 例如,高启强从鱼缸里抓了一把石子,想把它们分为两堆,原则就是这两堆石子“差异最大”。
这里的“差异”,并不是一个明确的概念。任意两个石子,在大小、形状、颜色、质地等方面均不同。两个石子是否被归为一类,不仅取决于它们是否相似,更取决于是否有其它石子与其更相似。
(换个角度说,聚类不是寻找“相似”,而是寻找“更相似”)
另外,也不难理解,聚类的任何类别都必须有元素。例如,高启强不可能把全部石子归为一类,另一类没有一个石子。
聚类有什么用呢?它可以“学习”。 所谓学习,就是根据已有的经历,对过去的世界产生一定的认知,当接触新的事物时,对其做出可预计的反应,例如将其归到某一类熟悉的事物中。
(学习:根据旧事物来建模,以此对新事物做出反应的过程)
举例来讲,高启强将一堆石子(已有的经历)进行聚类,将其分为两类(产生认知),当他从鱼缸里拿出一颗新的石子(接触新事物),可根据新石子与两类石子的相似性,将新石子归到某一类(做出反应)。
(根据已有的聚类/学习成果,就可以对新石子进行归类)
在下文中,我们并不详细讲解各种聚类算法,而是着重介绍聚类的应用。
收货地址——写错了地址也不怕(别错得太厉害)
回到本文最初的问题:高启强网购《孙子兵法》时,平台是如何帮他自动补齐收货地址的?
最初,网购平台也没有这个功能,但它拥有大量用户输入的地址,其中有正确且详细的地址,也有残缺甚至错误的地址(这些就是平台的“学习资料”)。
然后, 平台根据这些地址的“差异性”,对其进行聚类。 不难想象,同一个地址对应的信息相似性最大,差异性最小,这些详细或残缺的地址被归为一类(平台的“学习成果”)。
例如,“京海市旧厂街鱼摊”、“临江省京海市xx区旧厂街xx号鱼摊”、“临江省京海市旧厂街鱼摊”等信息,被平台归为一类,即平台认为它们对应同一地址。而“枫丹白露”、“京海市枫丹白露”、“临江省京海市xx区xx街xx号枫丹白露”被归为另一类。
最后,当高启强输入“临江省京海市旧厂街鱼摊”时,平台发现,这个信息与“临江省京海市xx区旧厂街xx号鱼摊”这一类更为相似,而与“枫丹白露”这一类差异较大,那么平台就能从“鱼摊”类中选出最详细的地址,进而帮高启强补齐信息(平台对输入做出反应)。
(高启强:我那鱼摊还有门牌号呢?我自己都不知道)
甚至,即使高启强打错了字,输入“临江省京海市旧厂街鱼 滩 ”,平台依旧认为它和“临江省京海市xx区旧厂街xx号鱼摊”这一类更为相似,而不是“枫丹白露”类,进而帮助高启强自动纠错。 当然,错误不能太大,如果输入“汉东省京州市…”,那平台就无法找到相应的地址。
语音助手——说不说普通话都能听懂
除了自动补全、纠正收货地址以外,聚类还可以用于地图APP的语音助手,它背后的原理也是聚类,只是需要两次聚类/学习。
假如高启强和蒋天都用同一个地图APP,也都喜欢用它的语音助手,可高启强讲普通话,而蒋天讲“港普”,发音差异很大,语音助手又是如何“听懂”两个人的指令呢?
第1次学习
与收货地址的学习类似,地图APP先收集大量的语音信息,包括各个年龄段、性别,地区(方言),作为“学习”的资料。
然后对其进行聚类,同一个汉字对应的发音更为相似,即使它们带有方言口音。例如,多个“jiu”的发音被归为一类,“chang”和“jie”亦是如此。
第2次学习
可“jiu-chang-jie”又是什么地方呢?“jiu-chang-jie”可以是“酒厂街”、“酒昌节”、“救场姐”……
利用相同的聚类/学习原理,地图APP发现“jiu-chang-jie”与“旧厂街”最为相似,因此自动判定目的地是“旧厂街”。
这样一来,无论是高启强用普通话讲“旧厂街”,还是蒋天用“港普”讲“旧厂街”,地图APP都能直接导航到旧厂街。
内容投放——如果高启强掌握了这个方法,人生可能不同
聚类还可以用于内容投放。如果高启强掌握了这个方法,可能真的能做上“正经生意”。
举例来讲,若强盛集团想给网络用户投放手机销售的广告,而不同用户喜好的风格、需要的功能和手里的预算不同。如何才能精准投放,向不同的用户群体展示他们更可能购买的手机型号,进而提高广告的效率,降低成本呢?
首先,我们应有一个概念: 每个人在网络里的行为习惯都是可以被量化的。 一个人的消费历史、搜索记录、征信报告、购物类型及比例等等,都反映了一个人的行为习惯,而绝大多数人的行为习惯有很强的“惯性”,短期内难以改变。
(对算法而言,人只是一串数,只要信息够多,就能还原、预测一个人)
强盛集团可以购买和收集大量用户的信息,用这些信息对用户的行为习惯进行“描述”,这些信息就是强盛集团的“学习资料”。
然后,对这些用户进行聚类,拥有相似行为习惯的用户被归为一类,归为一类的用户大概率会选择相同型号的手机,这就是强盛集团的“学习成果”。
再然后,对这些用户类别进行特性提取,例如第1类用户是“时尚达人”,第2类用户是“职场精英”,第3类用户是“企业高管”……
(精准投放的本质是用户的聚类)
最后,就可以对不同类别的用户进行精准的广告投放,例如向“时尚达人”投放功能新颖的机型,向“职场精英”投放商务型手机,向“企业高管”投放高端机型。
这样一来,强盛集团就大大提高了用户的购买概率,提高了广告效率,也许就成功“转型”了,不必借助黑社会势力来赚钱了。
再谈“学习”——为什么安欣和高启强的价值观截然不同
前面提到过,聚类是一种非常重要的“学习”手段。具体来讲,它是一种 “无监督学习”(Unsupervised Learning) ,即没有任何先验信息的学习。
无论是高启强分石子,还是网购平台补齐收货地址,都仅仅使用了手里的样本信息,而这些样本本身没有任何的标签信息。
相对应的,还有一些算法属于 “有监督学习”(Supervised Learning) ,即使用了先验信息的学习。小球分类就是一种典型的有监督学习,它使用了每个小球明确的颜色信息。
当没有可信的先验信息可用时,无监督学习可能是唯一的方案。 可以说,无监督学习的结果完全取决于样本数据(学习资料)。
例如,高启强多次体验到“有关系”给他带来的尊严后,逐渐学会了建立自己的关系网。这当然是一个片面的认知,但对于高启强而言,他的经历/样本只能得到这一结论。
当先验信息的准确性很高时,有监督学习的性能自然高于无监督学习。 例如,安欣从小在警察家庭长大,他接触的一切事情都有“好”或“坏”的标签,也就逐渐成长为一个坚守底线的人民警察。
(对学习而言,好的先验信息非常重要)
作者:望墨溢
作者单位:西北工业大学航海学院
版权说明 :未经授权严禁任何形式的媒体转载和摘编,并且严禁转载至微信以外的平台!
文章首发于科学大院,仅代表作者观点,不代表科学大院立场。转载请联系[email protected]
科学大院 是中科院官方科普微平台,由中科院科学传播局主办、中国科普博览团队运营,致力于最新科研成果的深度解读、社会热点事件的科学发声。
转载授权、合作、投稿事宜请联系[email protected]
大院er拍了拍你:不要忘记
点亮这里的 赞 和 在看 噢~