火山引擎发布新一代云原生监控引擎 VMP
来源 | 火山引擎云原生团队
随着全球企业容器化进程的加速,企业云环境变得越来越复杂,如何让一个监控系统及时地、准确地告知用户应用运行是否正常是十分重要的。
开源项目 Prometheus 因其具有动态发现与繁荣的开源社区等优势,已逐渐成为容器观测事实上的标准解决方案,被大量企业用于监控云原生系统。然而随着系统复杂度不断攀升,大规模管理 Prometheus 基础设施对很多企业来说仍是一个巨大挑战。
高可用免运维的云原生监控引擎
与自建 Prometheus 相比,VMP 围绕易用性、可靠性开发了多种能力,并充分整合开源生态。用户使用后无需关注监控系统后端复杂的构建,也无需考虑维护海量数据的存储和运维成本,可以将更多精力放在核心业务增长上。
节省成本
作为全托管式服务,与自建 Prometheus 相比,VMP 能够极大节省用户的使用成本。
稳定可靠
火山引擎 VMP 采用单 AZ 多副本、跨 AZ 高可用的方案,这使得 VMP 在出现实例故障、AZ 故障的情况下依旧可以正常使用,保障了监控服务的稳定性和可靠性。
多兼容可迁移
VMP 在兼容开源生态前提下,具有以下兼容性优势:
兼容 Prometheus 社区生态。支持 Prometheus 社区提供的第三方 Exporter,能够很好的满足用户对各种环境、插件的监控;
兼容原生 Prometheus.yaml 采集规则配置文件和配置方法,允许用户自定义采集规则; 兼容 PromQL 语法
因此,VMP 服务具备良好的迁移性,已经在使用原生 Promethus 的用户,可以直接迁移至 VMP 服务中,包括配置文件、对接了原生 Promethus 的代码、Grafana 面板等。
简单易用
VMP 支持快速创建逻辑隔离或物理隔离的云端存储,用户无需手工配置、调优 Prometheus 环境。无需考虑维护海量数据的存储成本,支持接入公有云 VKE 等产品,满足监控告警的需求。
性能出色
覆盖丰富监控场景
内部业务如何使用VMP?
字节跳动机器学习团队是 VMP 的用户之一,其活跃时序数达到了千万级。
在应对其 AI 业务场景时,传统的 Prometheus 会因为短生命周期监控对象多而导致 series churn ① 的问题,VMP 有效解决了该类问题,为机器学习团队提供了稳定的 Prometheus 监控服务。同时,AI 场景下,活跃时序的波动较大,该团队也通过 VMP 按量计费的特性有效控制了成本。
幸福里是字节跳动旗下的房产信息平台,也选择了 VMP 为其提供监控告警服务。
幸福里 APP 集内容、社区、工具于一体,用户量大,因此需要一款灵活、准确度高的监控告警工具保障应用稳定性。研发团队通过 VMP 采集容器服务 VKE 的稳定性指标并配置相应的告警,保证了幸福里平稳使用云上容器服务,有效降低运维成本。
结语
注释
① series churn: series churn 描述的是一个 time series 集合变到了不活跃状态,并且被一个新的 time series 集合取代。在 Kubernetes 中,由于 auto scaling 和 rolling update,新旧副本不断更替,series churn 对 Prometheus 性能的影响变得很大。由于旧的 time series 不会被马上回收,所以 time series 的总量会出现一个线性的增长,当总量变得很大时,一个涉及到大量 time series 的查询操作就很容易使 Prometheus OOM。
[1] 火山引擎: www.volcengine.com
[2] 火山引擎 VMP: www.volcengine.com/product/vmp
火山引擎云原生团队主要负责火山引擎公有云及私有化场景中 PaaS 类产品体系的构建,结合字节跳动多年的云原生技术栈经验和最佳实践沉淀,帮助企业加速数字化转型和创新。产品包括容器服务、镜像仓库、分布式云原生平台、函数服务、服务网格、持续交付、可观测服务等。
活动时间:2023 年 6 月 3 日(周六)
活动地点:北京市方恒时尚中心(字节工区)/ 线上
报名链接:点击“阅读原文”立即报名!
预热福利:报名线下参会即可参与抽奖,50% 中奖率,筋膜枪、AI 音箱、掘金周边电脑支架、手机支架等奖品现场兑换,快来与讲师面对面交流吧!