数据中台在2019年因互联网巨头推动而“大火”,如今进入静水深流的深化期——它不再是口号式的热词,而是作为企业数智化的基础设施,与AI、要素市场化深度融合。未来,其价值将更多体现在业务智能化闭环(如自动决策、动态优化)中,成为“看不见的引擎”。
介绍本期好书之前,感谢 机械工业出版社 的大力支持❤️。400<=文章阅读量<500:留言点赞前4名赠书。300<=文章阅读量<400:留言点赞前3名赠书。200<=文章阅读量<300:留言点赞前2名赠书。100<=文章阅读量<200:留言点赞前1名赠书。截止时间:2025 年 08 月 06 日 15:00。
张巍 | 著
本书适合从事数字化中台以及大型数字化产品与系统建设的读者阅读。对于数字化转型企业的中高阶管理者来说,本书也是一本贴近实战和业务的数字化参考手册。初阶的数字化产品人才能够通过本书的学习获得方法论和视野上的提升,中高阶的数字化人才以及管理者可以梳理出自身业务与产品建设中的问题,并找到匹配的解法或参考案例。
虽然从管理、经营、技术层面上都可以提升服务效能,但是从根本上变革服务方式和服务能力的手段还是通过技术驱动。从人工服务到人工智能服务并不是一夜之间就可以发生的转变,事实上,这种转变更加依赖人的参与。乍一看,人工智能产品会让人有一种“黑盒子”的感觉,人们把语音、文字、图片和视频扔给了人工智能,不知道里面究竟是走了什么样的流程、经过什么样的处理就得到了一个结果,在打造人工智能产品时很容易没有头绪。实际上,人工智能产品和相应的能力建设与表单设计和流程优化相比并没有更复杂,只是需要理解几个核心的概念和它们之间的相互关系,下面的公式并不精确,但是能够简化对于人工智能模型的理解:理解了这三个公式,就能够理解如何在企业内构建人工智能的相关能力。从顶层到底层,首先要理解的概念是“什么是人工智能产品”。以发票的自动识别和处理为例,在“人工处理”的阶段,需要一名经过培训的财务人员将员工提交的发票进行整理,核对发票信息与员工提交的信息,判断从报销单的形式到填写内容,再到发票单据的匹配是否符合公司的财务规定、是否匹配业务和差旅的真实行为,最终决策是通过还是驳回,并反馈驳回的原因,如图3中功能视角所示。如果把发票自动识别和处理做成一个产品,那么这个产品由两大部分组成: 第一部分承载提交材料、接收反馈的功能;第二部分是处理材料的模型,用于识别五花八门的发票和上面的信息以及报销单据的字段内容。产品首先自动识别发票上的内容,提交给财务规则模块判定是否通过,此时第一个公式的含义就浮现出来了。人工智能的产品就是基于业务和产品的需要,提供一套获取 “输入”、反馈 “输出”的功能,在功能之下是处理这些信息的模型。第二个公式要解释模型为什么能够完成发票的识别和判断。做过财务或者经常在外跑业务的伙伴会知道,尽管发票的开具越来越规范,但是出一次差、提交一次报销还是会收到六七种不同样式的发票,汇集到公司财务就会是几十甚至上百种不同的发票。模型识别这些发 票依赖两个要素,一个是算法,一个是参数。算法可以理解为前面介绍的方法论,识别发票的方法论告诉我们,拿到一张发票的图片之后应该怎样从里面找到文字所在的位置并将图像转化为文字,但是方法论只是一个通用的框架ꎬ怎么识别火车票、机打发票、定额发票,并不会从框架中得到答案,能够解决这个具体问题的是模型参数。可以把算法理解成一张复杂的路网,即神经网络,网的一边是要识别的图像,网的另一边是需要得到的答案,即发票上的信息。是否能够得到正确的答案取决于在这个路网上每个交叉路口的判断,如果判断准确就能像走迷宫一样走出正确的路径,即正确的输出。路口的判断规则就来自模型参数,这些参数决定了路网中的每个节点会按照什么规则来进行判断,最终生成发票的相关信息,如图4所示。这个过程与写产品规则时的“如果-就”(IF-THEN)条件相似,只不过人脑习惯的参数可能只有几个,而模型中的参数是成千上万个,某些模型可能需要数以亿计的参数。最终,整个模型通过参数就能够理解不同类型的发票应该如何识别,有了这些信息,下一步只要把数据给到业务规则进行判断,就能够知道某一张发票是打车票、打车时间是工作日规定的加班时间、金额也没有超过公司设定的差旅标准,从而报销车费。
最后一个公式既是一个技术问题,又是一个业务问题,能够揭示模型中的参数是怎么来的。从技术角度看,模型中的参数不论多少,都是基于算法通过数据集训练出来的:把成千上万张不同类型的发票图片标注清楚,然后扔进算法的那张网里面,通过大量图片的训练让网中的每个节点都知道遇到不同图片如何判断;每次训练都会被评估和反馈, 最终当训练的产出质量达到预期要求时,这张网就成为一个合格的发票识别模型。从数字化产品的角度看,需要关注的不是如何调校模型参数,而是如何为模型训练提供高质量的数据,因为好的模型一定是优质的数据训练出来的,如果训练数据质量差,模型的效果也不会很好。这就是为什么在人工智能产品领域流行着这样一句话,叫作 “先有人工,才有智能”。在试图构建人工智能的能力过程中,高效地积累优质数据是建设能力的关键,数字化产品经理需要在理解模型生成原理的基础上想方设法在模型训练之前打造好数据生成的机制,包括训练之前的数据采集、分类、标注、审核以及产品上线后的数据收集和反馈。 还是以发票识别为例,如果没有提前做好机制建设,就需要在训练之前临时收集成千上万张发票图片,甚至采购其他公司标注好的训练数据,专门安排训练人员人工识别发票中的关键信息并标注,然后通过几轮算法训练得到可用的模型;如果做好了产品和机制的准备,就可以在报销流程的产品功能中预先保存发票图片,引导员工填好相关信息,并且在审核环节完成准确性校验, 用不了多久就能在不增加额外成本的前提下,积累一批适配公司实际业务情况的优质训练数据,同时在算法上线之后也可以配套异常监控流程,及时发现和处理算法异常的案例,并积累下来用于算法后续的训练和迭代。图5 以报销流程为例,呈现了业务流程和数据流转之间的大致关系(并不完全按照产品实现),以及业务流程中的数据如何驱动算法的持续迭代。所以在数字化产品体系中融合人工智能的能力并没有想象中那么复杂,把算法当成一个相对复杂的规则引擎,构建出一个体系化的数据积累、训练、迭代闭环后,人工智能也就离我们不远了。
本公众号文末 留言 参与赠书活动!
其它公众号的抽奖关键字,需要到对应公众号文章中获取! 参与公众号抽奖越多,中奖概率越高,最高 4 倍概率!“路虽远行则将至,事虽难做则必成”。这是作者在编写这本书过程中最喜欢的一句话,也是作者多年来工作的真实写照。希望本书能够帮助每一位读者在数据库领域走得更远,做得更好。感谢大家的支持,期待与您的进一步交流!