K快连 VPN
节点优化 2026-08-19 · 阅读时长 5 分钟

晚高峰节点优化复盘:北美西海岸 P99 延迟降了 47ms

8 月份我们对北美西海岸方向做了次大规模路由调优,经过 4 次迭代,P99 延迟从 136ms 降到 89ms。本文把原始 Grafana 监控图、配置变更记录、A/B 测试数据都贴出来,看过程比看结论更值得。

北美西海岸节点优化
北美西海岸节点架构图:LA + SEA + SFO 三地机房

问题背景:晚高峰 P99 延迟飙到 136ms

8 月初有用户反馈晚高峰(北京时间 21:00-23:00)使用北美西海岸节点时偶发卡顿。从 Grafana 监控看,P50 延迟稳定在 78ms,但 P99 飙到了 136ms,丢包率 1.8%。这意味着 1% 的请求会卡 3 秒以上——对游戏玩家是致命的。

技术团队 8 月 5 日立项,目标是「P99 延迟降到 100ms 以下,丢包率降到 0.5% 以下」。下面记录 4 次迭代的过程。

第一轮:BGP 路由表优化(8 月 6 日)

第一轮怀疑是 BGP 路由问题。我们重新协商了与 Level3 / Cogent / NTT 三家上游的 BGP peering,新增 2 条直连线路。效果:P50 延迟从 78ms 降到 72ms,但 P99 几乎没变化(135ms)。

结论:BGP 路由不是主要瓶颈,问题在更高层。

第二轮:节点扩容(8 月 9 日)

第二轮怀疑是单节点过载。我们在洛杉矶新增 4 条 10Gbps 节点,将西海岸总带宽从 40Gbps 提升到 80Gbps。效果:丢包率从 1.8% 降到 0.9%,P99 降到 112ms。

结论:节点扩容有效但不显著,问题在客户端与服务端的协议层交互。

第三轮:协议层调优(8 月 12 日)

第三轮我们对 KL-Protocol 1.0 做了协议层调优:

  1. 调整 MTU 从 1420 到 1380,减少分片概率
  2. 改用心跳间隔从 25 秒到 30 秒,减少控制包占比
  3. 引入 BBR v2 拥塞控制算法替代 CUBIC

效果立竿见影:P99 延迟从 112ms 降到 96ms,丢包率降到 0.4%。这次迭代是关键拐点。

第四轮:智能选路 2.0 灰度(8 月 15 日)

8 月 15 日我们把 8.6.2 智能选路 2.0 的预测模型对北美西海岸节点做了灰度,10% 用户启用。8 月 18 日扩展到 50% 用户。效果:P99 延迟稳定在 89ms,丢包率 0.12%。

达到 8 月初的目标(P99 ≤ 100ms,丢包率 ≤ 0.5%),灰度 100% 推送随 8.6.2 正式版一起发布。

复盘:3 个值得记的教训

  1. BGP 不是万能的:很多团队遇到延迟问题先调 BGP,但实际可能是协议层 MTU、心跳、拥塞控制的问题
  2. 节点扩容有上限:单纯堆节点能解决丢包,但解决不了延迟,延迟问题要从协议层入手
  3. 智能选路是放大器:智能选路 2.0 本身不会让节点变快,但能让客户端避开已经拥堵的节点,把好钢用在刀刃上

赵青玄 ・ 快连官方 SRE 团队负责人

10 年大规模分布式系统运维经验,负责快连VPN 全球节点稳定性。