|
美东时间7 月 27 日下午,美国第二大移动运营商 T-Mobile 发生全国范围的网络瘫痪。故障在当天下午三点四十八分左右进入爆发期,第三方独立监控平台短时间内收到的故障投诉超过二十二万起。
投诉覆盖全美各地,纽约、洛杉矶、芝加哥、底特律、明尼阿波利斯、华盛顿等主要都市圈的反馈最为密集。大量用户反映手机处于仅限紧急呼叫状态,完全脱离移动网络,无法接打电话、收发短信,移动数据也同步中断。
T-Mobile 官方已确认收到大量服务中断报告,称正在全力解决相关技术问题,恢复服务是当前最高优先级。截至目前,官方既没有给出明确的恢复时间,也没有公开披露故障的技术根因。
故障核心指向核心网认证环节
从行业渠道流出的内部工程进展来看,故障的核心指向用户身份验证环节异常。简单来讲,就是网络后台无法正常完成用户身份核验,进而无法允许用户设备接入移动网络。
目前工程团队重点排查的方向,包括归属用户服务器过载、移动性管理实体流量限流,以及验证请求超时等网络基础设施问题。这两类网元是核心网里负责用户身份管理和接入控制的核心部件。
这也能解释故障为何是全国性同步爆发。用户认证是所有终端接入网络的必经关口,一旦这个中枢环节出现全局性异常,所有区域的用户都会同时失去网络接入权限,不会只局限在单个地市或区域。
集中化架构放大了故障影响 这次事故很有代表性,它直接折射出移动通信网络架构演进带来的新风险。
在传统通信网络中,核心网网元大多按区域分散部署,单个节点出现故障,影响范围通常只局限在局部。随着网络云化和虚拟化的推进,主流运营商都在推动核心网功能的集中化部署,以此提升资源使用效率,简化运维体系。
集中化确实带来了成本和效率的收益,但也把风险集中到了少数核心节点上。一旦核心节点出现配置错误、容量过载或者软件缺陷,故障会在极短时间内扩散到全网。尤其是用户认证这类入口级的功能,没有足够的容灾隔离手段的话,很容易出现全网停摆的极端情况。
给全行业带来的几点警示
这件事给全球通信行业带来的警示,值得所有运营商重视。
首先,核心网基础能力的韧性建设必须放在更靠前的位置。用户身份认证、签约数据存储这类功能,不直接面向用户提供增值业务,却是整个网络运行的基石。运营商不能只盯着业务层面的创新,而忽略了底层基础能力的可靠性投入。
其次,集中化架构必须配套完善的故障隔离机制。全网集中部署的同时,要保留区域级的限流、熔断和隔离能力,避免单点故障快速传导至整个网络。日常运维演练也要覆盖全网级故障场景,不能只做局部故障的预案。
最后,网络云化改造要控制节奏,不能为了追求技术先进性而牺牲稳定性。核心网每一次架构调整,都要做充分的压力测试和容灾验证,尤其是控制面的关键节点,必须留有足够的冗余备份。
后续走向判断
从技术处置的角度看,这类核心网认证环节的故障,只要定位准确,通常不需要太长时间就能恢复基础服务。但要彻底查清根因,并且优化相关机制避免复发,往往需要数天甚至更长的时间。
对T-Mobile 自身而言,这次事故的影响不止于服务中断本身。大规模网络瘫痪必然带来用户满意度下降,后续还可能面临监管机构的调查,以及用户层面的赔偿诉求。全美范围的公共通信服务中断,已经属于重大通信事件。
放到整个行业来看,这次事故会成为一个典型案例。全球主流运营商都会借此复盘自身核心网的架构可靠性,尤其是集中化部署后的风险点。未来一段时间,核心网容灾和用户认证系统的韧性建设,会成为运营商运维和规划部门的重点工作。
|