突发,阿里云崩了!
大家好呀,我是楼仔。
距离上次语雀发生 P0 级故障不到一个月,这次阿里又出事了,影响的产品包括淘宝、咸鱼、阿里云、语雀等阿里系产品。
01 事故表现
阿里云健康状况全面黄灯:
阿里云盘报错:
再看看语雀:
淘宝商品图片点击查看直接黑屏,钉钉、闲鱼也都出现相关异常。
02 事件回顾
18:16,阿里云官方回应:
字太小,直接贴一下原文。
尊敬的客户:
您好!北京时间 2023年11月12日 17:44起,阿里云监控发现云产品控制台访问及 API 调用出现异常,阿里云工程师正在紧急介入排查。非常抱歉给您的使用带来不便,若有任何问题,请随时联系我们。
进展更新:
17:50 阿里云已确认故障原因与某个底层服务组件有关,工程师正在紧急处理中。 18:54 经过工程师处理,杭州、北京等地域控制台已恢复,其他地域控制台服务逐步恢复中。 19:20 工程师通过分批重启组件服务,绝大部分地域控制台服务已恢复访问。
03 事件原因
阿里的这次故障起源于阿里云的一款存储组件—— OSS(Object Storage Service,对象存储服务)。
什么是 OSS?我们看一下阿里官网介绍:
OSS 是一个对象存储服务,当数据文件过大时,一般会将数据分成元数据和对象文件数据来分开存储。
对于阿里云,OSS 就是他们提供的一个组件,可靠性可达 99.975%。
稳定性是他们全年必须达成的指标,而且是非常重要的考核指标之一,目前的这波故障持续时间较长,可用性大概率达不到 3 个 9 了。
04 一点感想
这次事故影响太大,按照以往我呆大厂的经验,没有年终奖,还算是较轻的处罚了。
大家都是工程师,就不要抱着看热闹的心态,这波事故的小组同学,这 2 周会非常难受,各种压力、质疑、复盘等,因为我也经历过。
希望你们能顶住压力,挺过去!
最后,希望大家都能敬畏线上,远离事故。
最后,把楼仔的座右铭送给你:我从清晨走过,也拥抱夜晚的星辰,人生没有捷径,你我皆平凡,你好,陌生人,一起共勉。