PostgreSQL码农集散地

重新发现PostgreSQL之美 - 17 物以类聚 人以群分

场景:

  • 数据分类, 直面精准运营, 产生价值.

挑战:

  • 传统数据库只有1种分类方法,width_bucket,而且bucket必须均分,而数据多数遵循28法则,我们需要的是抓大放小,所以均匀的bucket不能对数据很好的诠释和透视.

  • 传统数据库只能对1个维度进行分类,无法支持多个维度的分类需求.

  • 高级分析必须将数据拉到程序端计算, 拉取数据效率极低, 增加了运行时间.

PG解决方案:

  • width_bucket支持自定义bucket窗口大小,支持抓大放小.

  • 通过kmeans分类方法, 可以支持多维度的数据分类, 满足业务的分类需求(例如从喜好、消费情况、活跃时间区间、性别、地域等等多种维度精准定位目标群体)

  • 通过madlib扩展库, 能在数据库中整合更加高级的机器学习能力, 同时支持plpython扩展机器学习算法, 支持业务可定制的算法诉求.

  • 在数据库中分类比在业务中分类效率更高, 因为不需要move data, 同时PG支持greenplum这样的MPP形态, 完全不需要担心算力和存储问题.

  • https://developer.aliyun.com/article/128017

  • http://madlib.apache.org/product.html

  • https://github.com/digoal/blog/blob/master/201508/20150817_01.md

视频回放: https://www.bilibili.com/video/BV1uq4y1L7u6/

欢迎关注我的github (https://github.com/digoal/blog) , 学习数据库不迷路.  

近期正在写公开课材料, 未来将通过视频号推出.