楼仔

突发,阿里云崩了!

大家好呀,我是楼仔。

距离上次语雀发生 P0 级故障不到一个月,这次阿里又出事了,影响的产品包括淘宝、咸鱼、阿里云、语雀等阿里系产品。

Image

01 事故表现

阿里云健康状况全面黄灯:

Image

阿里云盘报错:

Image

再看看语雀:

Image

淘宝商品图片点击查看直接黑屏,钉钉、闲鱼也都出现相关异常。

02 事件回顾

18:16,阿里云官方回应:

Image

字太小,直接贴一下原文。

尊敬的客户:

您好!北京时间 2023年11月12日 17:44起,阿里云监控发现云产品控制台访问及 API 调用出现异常,阿里云工程师正在紧急介入排查。非常抱歉给您的使用带来不便,若有任何问题,请随时联系我们。

进展更新:

  • 17:50 阿里云已确认故障原因与某个底层服务组件有关,工程师正在紧急处理中。
  • 18:54 经过工程师处理,杭州、北京等地域控制台已恢复,其他地域控制台服务逐步恢复中。
  • 19:20 工程师通过分批重启组件服务,绝大部分地域控制台服务已恢复访问。

03 事件原因

阿里的这次故障起源于阿里云的一款存储组件—— OSS(Object Storage Service,对象存储服务)。

什么是 OSS?我们看一下阿里官网介绍:

Image

OSS 是一个对象存储服务,当数据文件过大时,一般会将数据分成元数据和对象文件数据来分开存储。

对于阿里云,OSS 就是他们提供的一个组件,可靠性可达 99.975%。

Image

稳定性是他们全年必须达成的指标,而且是非常重要的考核指标之一,目前的这波故障持续时间较长,可用性大概率达不到 3 个 9 了。

04 一点感想

这次事故影响太大,按照以往我呆大厂的经验,没有年终奖,还算是较轻的处罚了。

大家都是工程师,就不要抱着看热闹的心态,这波事故的小组同学,这 2 周会非常难受,各种压力、质疑、复盘等,因为我也经历过。

希望你们能顶住压力,挺过去!

最后,希望大家都能敬畏线上,远离事故。


最后,把楼仔的座右铭送给你:我从清晨走过,也拥抱夜晚的星辰,人生没有捷径,你我皆平凡,你好,陌生人,一起共勉。

原创好文: