任易大叔
23-11-13 12:55 微博认证:头条文章作者

千万别动不动就说史诗级故障,难道这年头连史诗级故障都烂大街了么?#阿里系app已全面恢复#

2023年11月12日,阿里云发生了API鉴权(身份验证)故障,需要身份验证的API调用受到影响,导致饿了 么、闲鱼、钉钉等部分功能模块不可用,工程师1小时以内定位到原因,然后分批重启组件,用了不到两小时基本解决问题。

我看见网上有人说这是全球性故障、史诗级故障,这个说法有点上纲上线了。什么叫史诗级故障?停止 服务三天到四天,网站全部瘫痪,影响人数上千万,问题都定位不到。比如Gmail在2011年持续5天的故障。

云计算里有两种产品, 一种是垂直产品应用, 一种是通用基础组件,而这次阿里云的故障,核心在于身份验证出了问题,然后导致API服务无法访问,然后再产生了各种新问题。

根据阿里云的报告,以及用户的反馈,可以确定云产品控制台、管控API等需要身份验证的功能都受到影 响,导致OSS (对象存储)、OTS、SLS、 MNS等产品的服务受到影响,而云服务器、云数据库、网络等核心产品的实际运行是正常的,说明阿里云的某个底层组件出了问题,影响了部分有依赖的产品。

而主要故障在1个多小时修复,相比一年8760个小时来说,故障时间占比为0.023%,可用时间占比为 99.977%。

2021年12月7日,亚马逊云服务就出现过同类情况, AWS出现宕机,导致包括自有的Prime Music、Prime Video和Alexa在内的网站和APP访问, Disney Plus、 Facebook、Tinder和Venmo等公司部署在 AWS上的应用也出现了问题,任天堂于12月8日凌晨宣布旗下Switch网络服务大规模瘫痪。

当时正值圣诞促销季,麦当劳, Instacart、Venmo、 Roku、Tinder ,Coinbase ,Cash App却全都无法 使用,配送系统停摆、广告系统崩溃、订单数据延迟、后台无法登录。 原因是容量扩容自动化导致的网络拥堵。

2022年5月3日凌晨3点,微软的Azure在全球范围内出现了大面积宕机,整个过程持续了将近2个小时, 宕机原因是影响DNS解析的名称服务器授权调整,影响了底层基础服务导致的。

然后2023年1月28日,微软再次发生网络问题, Microsoft 365和PowerBI的访问全部出现网络延迟,无 法服务,原因是微软调整了广域网络(WAN),影响网际网络用户端与Azure之间、云计算地区内多个 服务之间,以及ExpressRoute的网络连接。出现问题微软以后立即回滚,然后问题解决了。

大家都是人,犯错误很正常,重点在于不要犯同样的错误,以及鸡蛋不能放在同一个篮子里。比如阿里云这一次因为一个关键组件故障,导致全球所有可用区都受到影响,这就是没有做好风险识别和单点故 障识别导致的。

这能算史诗级(Epic)故障么?其实还不算,只能算是影响特别重大的故障。

阿里云信息披露,算是这么多家云厂商中最及时、最坦诚、最详尽的了,也是给各个企业一个充分的经验借鉴,让大家在容灾方案设计时,除了保证应用和数据的高可用,还要考虑中间件的高可用;除了考虑自身的架构设计,也要评估单个业务组件如果出现故障,会不会产生连锁性影响。

毕竟人生中充满了黑天鹅事件,我们除了积极应对风险,还能怎么办呢?狡兔务必三窟,永远留下后手就是唯一的答案。

发布于 江苏