Coinbase 意外宕机:深入解析近期事件
- Coinbase 在 2026 年 5 月 7 日面临重大挑战,由于多个冷却器故障导致 AWS 数据中心过热。
- 此次事件导致包括交易能力、交易所访问和用户余额更新在内的功能出现长时间问题。
- Coinbase CEO Brian Armstrong 强调需要增强基础设施,以防止未来类似事件发生。
- 技术问题包括订单匹配机制故障和 Kafka 集群中断。
- 事件期间没有数据丢失,系统逐步恢复至正常功能。
- Coinbase 正在重新评估交易速度与基础设施弹性之间的平衡。
事件概述
在 2026 年 5 月 7 日,Coinbase 遭遇了一次意外的服务中断。这次中断源于 AWS 数据中心的冷却系统多台冷却器故障,导致过热。此不可预见的事件导致许多用户在交易能力、交易所访问和余额更新方面遇到长期问题。
事件承认
Coinbase CEO Brian Armstrong 表示,这种服务中断对于公司来说是“不可接受的”。尽管 Coinbase 的大多数服务都设计了冗余,以承受任何给定 AWS 可用区 (AZ) 的中断,但在这种情况下,该中心化交易所的弹性较差。他指出,交易所有独特的架构,优化以实现低延迟和客户端的共址。尽管可以使其对单个 AWS 区域故障具有弹性,但这样做可能会引入不必要的延迟。
技术细节:问题出在哪里?
Coinbase 平台部门负责人 Rob Witoff 提供了关于事件技术细节的进一步见解。问题始于 5 月 7 日 23:50 UTC 左右,当时监控系统检测到内部服务出现级联故障。这些问题影响了现货交易、主要服务、国际交易所运营、衍生产品和用户余额更新。
- 交易所订单匹配机制中的组件失效;
- 负责 Coinbase 内部服务通信的 Kafka 集群崩溃。
订单匹配系统无法达到法定人数 — 继续安全交易所需的最小节点数量 — 导致 Coinbase 暂停了零售、专业和机构部门的交易。同时,与 Kafka 相关的问题导致余额显示延迟。
确保无数据丢失
尽管遇到这些挫折,Coinbase 向用户保证,在此期间没有数据丢失。在恢复基础设施稳定性后,公司实施了分阶段的市场恢复方法,包括最初将市场转变为“仅取消”模式,然后对所有产品进行彻底检查。随后,他们激活了拍卖模式,然后全面恢复交易活动。
前进方向:基础设施改进
在解决近期事件暴露的技术挑战的同时,内部优化业务流程仍是持续优先关注的领域!早期公告显示,计划缩减约 14% 的职位,原因包括加密货币市场波动需要降低成本,以及在运营中增加 AI 角色!总体而言,这些发展突显了在当今不断发展的动态加密货币领域中,维护强大可靠的基础设施的重要性!
