亚马逊大咖:智能湖仓如何为营销提供灵活高效的能力支撑?
分享者Troy Cui,他在数据及技术平台架构上有丰富的经验积累。曾负责数据产品、中间件及高性能深度学习计算平台的专项研发工作,并且主导过大数据和人工智能平台在健康、生命科学、生产制造和金融等行业的设计和落地工作。Troy目前任职于亚马逊云科技大中华区产品部,负责数据分析产品推广工作,对全球领先的技术架构有深刻理解。
- 湖仓一体背景介绍
- 企业创新引擎—大数据和机器学习的融合
- 坚实的数据底座赋能营销业务场景
- 参考案例
01 营销的基本诉求和现实挑战
1、2021年与2017年相比,所购买的物品会被频繁使用的比例显著升高( 为价值付费提升至76% ) 2、越来越多人愿意为便利付费,可是74%的人不满意推送内容( 为时间付费从50%提升至62% ) 3、将消费体验的重要性排在性价比,更健康的购物模式等其他所有选项之前的比例,从一年前的11%提高到20%,性价比则从31%降到24%。在18-45岁年龄段尤其明显( 关注消费体验从10%提升至20% )
通过这些数字的变化,我们可以了解到,如果企业不能很准确地把产品能力触达到潜在用户身上,那么,这个企业很快会被淘汰。所以无论是数字化营销还是其他营销手段,最终的目的都是通过数据实现营销的增长。
大量增长的数据vs 营销端复杂场景的需求
当下,越来越多的企业,利用云上的数据分析与人工智能能力,把整个数据变成了最核心的资产。但如何利用好数据的资产化,不是每个企业都能做到的,企业都希望做数据驱动型组织。但随着大量数据的增长,面临的营销端复杂场景的需求也会更为复杂,这其中包括: 数量指数增长、更为复杂的使用场景及基于实时数据的快速决策 。
越来越多企业通过融合大数据和机器学习能力提升业务产出
1、 大数据与机器学习分而治之 —数据及技术孤岛制约敏捷迭代 2、 数据处理的能力不足 —限制机器学习由实验转向实践 3、 数据分析人员参与度低 —机器学习项目价值屡受挑战
02 企业创新引擎—大数据和机器学习的融合
对于企业来说,创新引擎究竟该如何融合大数据与机器学习呢?这是最直接需要解决的问题。我们在去年提出了“智能湖仓”架构。
所以如果单一的产品求大求全,往往带来的结果是每个方向上都不够精,或者整个方向对企业客户来说是太大的验证阶段。再回到营销场景,数据来源非常广且复杂,所以在架构上也同样考虑多数据源到分析引擎通道是否畅通,以及引擎的整体效能。
总体来说,亚马逊云科技的理念是 企业应在云中打造统一的数据基础底座,实现大数据与机器学习的“双剑合璧”,为企业发展提供创新引擎 。
亚马逊云科技“云、数、智三位一体”服务组合
统一融合的治理底座,包括数据质量、数据权限、可视化等部分,还要看大数据、机器学习之间是否有充分的循环,这个循环想要实现起来需要三个主要能力。
一、统一融合的治理底座
此外,我们要给机器学习做生产级别的数据处理能力。对于海量的数据处理,因为会涉及到非常多异构的数据加工,所以需要相对开放的异构引擎;还需要相对灵活的平台,要有动态弹性,兼具性能与成本收益;最后要有数据质量的管控,能够复用大数据的工程经验,提升机器学习的数据质量。
二、为机器学习提供生产级别数据处理能力
三、用更加智能的数据分析,统一技术与业务价值
1、丰富智能分析场景 2、赋能业务人员反馈模型效果 3、推动业务人员自主创新
接下来,我会用常规的营销业务场景,分享我们是如何帮助企业实现大数据与机器学习的融合架构。
03 坚实的数据底座赋能营销业务场景
假设我们是偏零售企业,现在面临数据和机器学习融合的场景,要做智能化营销,整个图便代表了数与质最主要的能力。
现实中,当我们真的要做数据分析与实验时,往往数仓的人员会给到一个数据集,算法工程师基于固定的数据开始迭代自己的算法,在过程中我们想要真的做数据更新,是比较困难的。等到实验结束,把这个模型用到生产实际环境中,需要有效数仓的数据以及实际业务端中大量的实时数据,时效性因为来不及,所以对于营销来说,整个生产环境要面临硬数据库,以及天猫的CDP。
多数据源下的营销数据归一:Athena的联邦查询能力
• 跨关系型数据库、非关系型数据库、对象存储、大数据系统或自定义数据源实现联合数据查询和加工 • 跨本地或云中数据源运行数据查询 • 可应用于数据的即席探索以及复杂的机器学习或大数据生产工作流中
想要大数据和机器学习在场景里做到业务赋能,最直接的就是要有一个共同的底座,通过技术能力数据共享。
数据网格:跨部门实现大数据和机器学习数据资产共享
我们面临的下一个问题,数据不能完全开放,如何发现建模所需要的数据在哪个部门的哪个表中,如何使用它们?只能做元数据的共享。所以这也是为什么我们做了Lake Formation,它可以实现数据跨部门的共享。
企业各部门数据的统一权限管控
在共享话题里面,还会涉及到权限与隐私保护。比如大数据部门、机器学习部门要共享数据,要屏蔽个人隐私数据。如果没有Lake Formation精确到行、列,甚至单元级别的管控情况下,以前我们都是通过创建多个表、多个数据库额外的开发量来解决的,现在从我们整个湖仓的架构里面,是可以通过Lake Formation单一的权限管控的接口,来完成数据单元格级别的控制,这样可以非常方便地控制这些访问者,应该访问到哪些数据。
上述是数据共享的部分。接下来,我们一起来看看底座中应该靠什么样的计算支撑上面的实验。
统一的大数据和机器学习开发平台
实际上我们在数据加工方面,项目下很难通过单一的引擎来实现所有的技术挑战。所以在湖仓中,除了强调空间安全可靠灵活扩展的服务之外,还要专门构建各种各样的服务。像我们去年发布的SageMaker Studio,它就是基于多种专门构建的计算服务,一站式地完成数据开发、模型开发及相关的生产任务。
真实的数据流对规模和实时性要求极为复杂
所以这也是为什么亚马逊云科技专门构建,灵活扩展的无服务器分析服务。它既可以批量数据计算(运营数据加工、订单数据加工),还可以流式数据计算(用户行为数据加工)。
实践中业务诉求转为智能项目往往困难重重
我们让业务人员自己主动探索机器学习建模,这个方式非常简单粗暴,通过查询或分析SQL对数据仓库中的数据进行自动建模并生成预测,我们 做Interface也是通过这样的方式来完成。
在此基础上,业务人员还可以自主探索机器学习建模。采用Amazon Glue DataBrew无服务器化、无代码完成可视化数据探索和加工 + Amazon SageMaker Canvas 无需代码即可可视化构建机器学习模型并生成准确的预测的方式。
04 参考案例
协助宝马实现全球团队访问车队和企业数据
解决方案 • 构建CloudDataHub(CDH),整个车队和企业的流数据整合到一个数据湖。 • 构建数据门户,提供简便的数据上传和分析功能。
收益 • 消除了数据孤岛,为所有团队提供可扩展的、安全的、细颗粒度的全企业数据访问机制。 • 整合了机器学习技术Amazon SageMaker与数据分析功能,采用率正在不断增长,每天系统数据处理量超过10TB。
BMWCloud Data Hub使用案例
某家电品牌CDP& 自动化营销解决方案
现在整个销售重心都从逐渐从线下转到线上,需要更注重偏C端的消费者。这两年受疫情影响,对于非常多的零售快消企业,包括家电企业、3C数码很早就上云了。2019年这个品牌的家电集团启动了全新的消费者体验升级的项目,先搭建了CDP做整个的2C端用户管理,后续再做营销自动化解决方案,所以实际上这一部分是比较完整的,我们通过CDP、MAP的方式,底层用智能湖仓做架构。
某头部广告客户-智能的移动营销
每天需要处理超过1000亿个广告请求,这一需求的背后,是每天数十个PB的数据处理规模、每小时数十亿个特征规模的模型训练,以及每天数万次的分析和模型训练工作。如何满足高吞吐量、高弹性的同时,通过高自动化运维实现成本上的优化与节省,成为客户面临的首要挑战。
数智融合,重塑营销创新引擎
上述的例子,我们可以看出,为了打破数据的孤岛,我们把很多机器学习的项目,从实验转向到实践端,这涉及到海量数据、性能的处理等。所以,实际上整个湖仓架构中,在我们去年完成了湖仓架构本身的建设与架构的定义之后,今年更是加深了一步。
亚马逊云科技助客户从数据驱动组织、构想到最终实现
在整个用户端、企业端、业务端,不能只为客户单纯地提供一个平台底座。所以很多2C的客户,非常希望我们帮他们拼一些差不多的积木,同时,我们也有很多面向行业,面向某些迁移的机器学习解决方案实验室;而且,我们也会提供大数据和机器学习的专业服务。