谷歌云荷兰区域宕机15小时,电源故障引发冷却失效
据科技媒体The Register 7月21日报道,谷歌云上周发生了一起持续15小时的服务中断:位于荷兰的europe-west4-a可用区内,VMware Engine(GCVE)、NetApp Volumes和Bare Metal Solutions(裸金属)三项服务同时瘫痪。谷歌的事故报告写明了故障链条——服务该可用区的数据中心先出现电源故障,继而引发冷却系统失效。
这份报告还无意间透露了一个此前不为外界所知的架构细节:上述三项服务由一座独立的专用数据中心承载。分析师指出,这正是问题所在——用户以为自己买到的是"可用区级"的冗余能力,实际上部分服务的物理鸡蛋放在同一个篮子里。The Register的评论一针见血:并非所有云厂商的"韧性承诺"都是等价的,而用户往往要等到事故报告出炉,才知道自己业务背后的真实架构。
这已是7月的第二起大型云事故。7月16日,AWS CloudFront刚因VPC Origins配置故障中断约3.5小时。两周之内AWS、谷歌云先后中招,指向同一个教训:单一云厂商内部的"多可用区",并不能替代真正的异构容灾。
如果说CloudFront事故的教训是"控制面是全局的",谷歌云这次的教训就是"你以为的冗余未必是冗余"。跨云、跨服务商部署一个低成本的独立容灾节点,正在从"可选项"变成"必选项"——具体做法可参考本站上周发布的实操指南《云宕机频发,用香港服务器搭异构容灾节点》,香港云服务器 按月付费即可作为热备起点。
声明:本文由SellBGP编辑部依据主办方及公开渠道信息独立撰写。转载请注明出处。