谈论 SLA 接近 100% 的时候,很多人第一反应是“哇,全年几乎不会掉线”。但真要较真起来,99.99% 和 99.9% 背后的差距,可能比你想象的更值钱——而且这笔钱怎么赔、赔多少,往往被那串漂亮的小数点掩盖了。
99.99% 意味着什么
从数学上算一笔账:99.99% 的可用率,全年允许的不可用时间是 52 分 35 秒。而 99.9% 则是 8 小时 45 分 48 秒。相差八个多小时。对于依赖实时交易的系统(比如电商支付接口、证券行情推送、在线游戏登录服),这八小时可能就是几十万甚至上百万的损失。所以真正关键的从来不是那个“四个九”的数字本身,而是当故障发生时,你的业务究竟能承受多大的不可用窗口。
另一个容易被忽略的点:可用率是按月度还是全年计算?有些商家玩文字游戏,拿“全年 99.99%”当卖点,但实际按月考核时,每个月允许的不可用时间只有 4 分 23 秒——这意味着任何一次超过五分钟的宕机都会导致当月 SLA 不达标。而如果是按年度计算,你可以把故障集中到某个月,其他月份拉平,这对用户其实更不利。所以看条款时一定要分清统计周期。
赔偿方式:服务信用不等于现金
绝大多数高 SLA 方案(包括一线云厂商)的赔偿,都是以“服务信用”形式返还到账户余额,而不是直接退现金。这个服务信用通常有使用期限(比如 12 个月),而且只能用于后续消费,不能提现。相当于商家说:“抱歉让你停机了,送你一笔代金券来补偿,但你不能拿它买别的东西。”
赔偿额度通常是阶梯式的。比如可用率在 99.99%-99.9% 之间,赔偿当月费用的 10%;低于 99.9% 但高于 99.0%,赔偿 25%;低于 99.0% 赔偿 50% 甚至更高。但这里有个坑:很多商家的赔偿上限是当月费用的 100% 或 200%,意味着就算你停机一整月,最多也就拿回一两倍月费。而如果你因此损失的业务收入是月费的一千倍,那这点赔偿连零头都不够。
所以对于高价值业务,SLI(服务等级指标)和 SLO(服务等级目标)之外的商业保险可能是更实际的兜底手段——比如 AWS 的 Support Plan 附带业务中断赔偿,但那又是另一个价格体系了。
那些不赔的情况
接近 100% 的 SLA 条款里,排除项写得不比赔偿规则少。常见的雷区包括:
- 计划内维护(窗口通常提前 7-14 天邮件通知,但如果你的业务 24×7 运行,这段时间就是赤裸裸的不可用)
- DDoS 攻击(商家会免责,除非你买了额外的抗 DDoS 增值服务)
- 用户自身操作(比如自己改了防火墙规则、重装系统导致故障)
- 第三方组件中断(比如你的 CDN 挂了、对方的数据库出问题,SLA 只覆盖商家自己的基础设施)
最微妙的是“不可抗力”——自然灾害、战争、地震、大规模光缆被挖断。这些虽然概率低,但一旦发生,所有 SLA 条款自动失效。2017 年 AWS S3 故障 4 小时那次就被认定为内部故障赔偿了,但 2020 年某海底光缆中断三天就没赔。
真到了索赔那一步,你得准备什么
不是自动到账的。需要你主动开工单,附上监控截图、日志时间线、甚至第三方的节点监控数据。很多中小商家会要求你提供“持续的不可用时间证明”,比如每分钟 Ping 超时的记录。如果只是偶尔断一两秒,商家会说是“瞬时抖动”,不算可用率扣减。
这点上,大厂的经验值得参考:最好自己搭建外部监控(比如 UptimeRobot、Checkly),从多个地理位置定期发起请求,记录完整的时间戳。这样当故障发生时,你手里有站在第三方视角的证据,而不是依赖商家内部的“正常运行时间仪表盘”——那个仪表盘在你不可用时可能也不更新。
值不值得为 99.99% 买单
如果你的业务容忍 10 分钟的停机,99.9% 就够了,没必要多花一倍价格去买“四个九”。但如果你做的是凌晨三点也会有人下单的跨境电商、或者 B 端客户的 API 必须保持 99.99% 的响应率,那这笔钱就是买一个心理安全垫——知道即使出问题,也能拿回一些补偿,且补偿流程相对透明。
最后说句实在话:SLA 数字再漂亮,也不如一个靠谱的运维团队和冗余架构来得实在。毕竟,等你真去索赔的时候,商家很可能已经赔偿给你一张“下个月继续在它家消费”的优惠券。
99.9%和99.99%差八小时?那我现在的业务用99.9%就够了,不用多花钱升级
赔服务信用这招太精了,等于绑着你继续消费😅
计划内维护也算不可用时间的话,那24小时跑的业务怎么搞?
之前用某云宕机了俩小时,最后退了十块钱代金券,够干啥的
这行水真深,小数点后面全是套路
还是自己搞个多机房备份实在,指望赔偿不现实