自从离开锤子科技之后,我就把工作重心放到了构建产品和业务之上,鲜有再直接参与技术。但昨天,在腾讯云的一个交流活动上,我听了一下午云原生相关的技术分享,还挺有趣的。
腾讯云的朋友兴奋地告诉我,他们的容器产品刚刚入选了 Gartner 亚太区“卓越表现者”象限,并且是中国唯一入选的企业。
这个很厉害。我和 Gartner 打过交道,咱知道,他们的评选流程非常严格——先是在全球范围内做客户访谈,然后再基于真实反馈给出评分。也正因为中立客观,所以 Gartner 的报告这些年在市场上非常受青睐。
获得了 Gartner 的认可,也就意味着,腾讯云容器的产品和服务能力已经能够与 Google、微软、AWS 等全球容器领域的顶级企业并驾齐驱。怪不得朋友和我讲起来这事两眼放光,无比激动。对以容器为核心的云原生技术,我并不陌生。云计算这些年,大致经历了两个发展阶段。第一个阶段主要是把传统的 IDC 的场景搬到线上,用云的方式统一管理。所以,那些年我们能看到,云厂商主要售卖的是云服务器、云数据库这类产品。从线下迁移到线上,这是第一个阶段的重点。但到了云上后,又会发现其实以服务器为单元的云计算使用方式,对资源的利用率并不高,无法真正发挥云计算的规模优势。于是,以 Docker 为代表的容器技术诞生之后,云计算迅速跨入到第二个阶段:云原生。顾名思义,云原生的意思是为云而生,它的逻辑是在云的语境里,怎么合理就怎么来,不需要像第一个阶段那样,还要平衡历史负担。或者这么说吧,第一阶段和第二阶段的关系很像数字移民和数字原住民。云原生指的是在云端环境开发、构建、部署以及管理应用程序的一套理念。它的优势是快速部署、快速验证、快速扩缩容。这话说着都是大词,我举个例子吧。作为初创团队,墨问没有专门的运维人员,技术能力有限,但我们的应用也需要快速部署、快速扩缩容这样的特性。 怎么办呢?最开始创业考虑架构时,技术同事毫不犹豫地选择了云原生。腾讯云在云原生领域的一个关键产品就是刚刚提到的容器服务,简称 TKE。TKE 你可以理解为是一套高性能的容器管理服务,覆盖 Serverless、边缘计算、分布式云等多种业务部署场景。同时,腾讯云还围绕 TKE,构建了一系列面对各个行业的解决方案。感兴趣的话可以去官网看看。朋友告诉我,截至目前,腾讯云的 TKE 平台拥有国内最大规模的 Kubernetes 集群,以及最为领先的在调度技术。从局外人的角度看,腾讯内部已经做了云原生的改造,TKE 从服务内部业务开始,一步步拓展到外部客户。它是腾讯内部能力溢出的结果,天然经过各种场景和大规模流量的打磨。毕竟,腾讯旗下有多款国民级的产品。并且,在云原生改造过程中,势必会涉及传统架构的兼容问题,比如有状态的服务怎么平滑地迁移到云原生架构。这些,腾讯都已经躺过坑,并把解决方案融入到了 TKE 中。和朋友聊天,他说他们在老架构和老业务的兼容上下了很大功夫,在业内也是领先的。很多人对这家公司的营收体量没概念,最新的财报显示,2023 年贝壳总交易额为 3.14 万亿元,净收入为 778 亿元。贝壳高度重视效率,所以在内部提效的时候,云原生化被提上了议题。而推进云原生最大的难点是业务适配,比如怎么做容器化改造。当时贝壳面临两个选择,第一,自研一套云原生架构;第二,选择成熟的云服务。其实早几年,贝壳的研发团队已经在托管数据中心做了相对完整的云原生方案,包括 Kubernetes 集群、日志、监控、流量涉及、CI/CD。 但那时候,业务的发展速度远远快于技术团队的迭代速度,他们最终还是选择了腾讯云 TKE。因为基于 TKE 原生节点,贝壳可以借助腾讯公司云原生化的经验。TKE 原生节点 本身就是腾讯在云原生化,在降本增效过程中打磨出来的产品,集成了在离线混部、GPU 虚拟化、内存压缩等能力, 可以最大限度的提升集群中节点的利用率。贝壳的流量峰值一般是在早上 9 点到 10 点,和下午 3 点到 5 点。没有云原生化之前,也就是裸金属部署的模式下,他们的服务器配置只能以波峰时为准,但这样算下来,其他时间都是浪费的,因为平常业务不忙的时候,根本用不了那么多资源。迁移到 TKE 之后,贝壳的应用因此具备了快速扩缩容的能力。等波峰一过去,他们便可以迅速释放资源,这样一来,成本自然就降低了。这是贝壳曾经经历过的故事。我也很庆幸我们公司一开始就用了云原生架构,这样一方面能降低成本;另外一方面,也不用担心某天流量突然涨了,我们服务器扛不住的问题。毕竟扩缩容很方便。如果你正在做云原生改造,或者准备启动新的项目,那或许可以考虑下腾讯云 TKE。毕竟,这是 Gartner 官方认可的容器服务。