5G URLLC 要求 20 ms 端到端延迟,如何评估核心网切片是否达标

解读

面试官真正想考察的是:

  1. 你是否理解“端到端 20 ms”在运营商现网中的统计口径(空口+承载+核心网+业务服务器,通常取 99.9% 分位或 99.99% 分位)。
  2. 能否把宏观 KPI 拆成核心网切片可量化、可复现、可灰度验证的测试指标。
  3. 是否熟悉国内运营商 5G 切片验收流程(集团集采测试→省公司现网试点→商用放号),并能在实验环境用最小成本给出“Go/No-Go”结论。
  4. 遇到超标能否快速定位是“转发面”还是“控制面”问题,并给出优化建议。

知识点

  1. URLLC 端到端延迟预算:空口 4 ms、承载 2 ms、核心网 6 ms、业务服务器 8 ms(参考工信部 5G 增强行动方案)。
  2. 核心网切片延迟分解:
    • 用户面(UPF)转发延迟 = 节点转发 + 排队 + 出口调度;
    • 控制面(SMF/AMF)延迟 = 会话建立/切换信令;
    • 同步面(5G TSN/DetNet)时钟误差。
  3. 国内测试规范:
    • 《中国电信 5G 定制网切片测试规范 V3.2》要求单 UPF 单跳 1 ms@64B、99.9%;
    • 《中国移动 5G 专网 SLA 保障白皮书》要求核心网切片环回 5 ms@99.9%。
  4. 测试手段:
    • 实验室:Spirent Landslide、IXIA Novus 100GE 打流,SR-IOV+DPDK 模拟 gNB/UE;
    • 现网:探针 TWAMP、INT(带内遥测)、gNB 侧 TraceID、UPF 镜像 Telemetry;
    • 时钟:SyncE+PTP 1588v2,时间戳精度 <100 ns。
  5. 统计方法:
    • 样本量 ≥ 1 000 000 报文,置信区间 99%,误差 ≤ 0.1 ms;
    • 取 99.9% 分位 + 6σ 异常剔除;
    • 用双样本 t-test 对比“切片”与“默认承载”延迟分布。
  6. 瓶颈定位:
    • Linux ftrace + eBPF 跟踪 UPF 核间调度;
    • dpdk-procinfo 查看 mbuf pool 抖动;
    • SMF 日志计算 PDU Session Create 时延(T3560)。
  7. 优化套路:
    • CPU 隔离+NUMA 绑核;
    • 开启 UPF 预调度(pre-scheduling);
    • 配置 QoS 5QI=3、DRX 短周期;
    • 部署边缘 UPF(MEC)<20 km,光纤直驱。

答案

“评估核心网切片是否满足 URLLC 20 ms,我分四步:

第一步,明确口径。与运营商、设备商三方对齐‘端到端’定义,取 99.9% 分位,扣除空口与业务服务器预算后,留给核心网的部分≤6 ms。

第二步,在实验室搭建 1:1 拓扑:Spirent 模拟 2 000 个 gNB 小区,每小区 100 个 URLLC 终端,5QI=3,包长 64 B,速率 50 pkt/s。UPF 采用华为/中兴/爱立信现网同版本 VNF,部署在裸金属+SR-IOV 环境,CPU 隔离 8 核,NUMA 绑核,开启 DPDK 23.11。用 IXIA 打 TWAMP Light 报文,采集 UPF 入口/出口硬件时间戳,统计环回延迟。

第三步,输出报告。连续 24 h 打流,样本 8.64 亿包,99.9% 分位 4.8 ms,平均 0.9 ms,6σ 外异常 0.0004%,满足集团≤5 ms 门槛。同时对比默认承载,延迟降低 42%,p-value<0.01,证明切片生效。

第四步,现网验证。选择浙江移动 5G 专网试点,UPF 下沉到萧山机房,距离基站 12 km。探针插入 gNB 侧 eCPRI 帧,UPF 镜像 Telemetry,INT 带内打标签,回传至省公司大数据平台。一周业务忙时数据:核心网段 99.9% 分位 5.2 ms,略超 0.2 ms。用 eBPF 定位发现 NUMA1 远端内存占比 18%,调整为本地内存后降至 4.9 ms,达标并通过集团验收。”

拓展思考

  1. 如果未来 URLLC 延迟要求降到 5 ms,核心网预算只剩 1 ms,测试方案如何升级?
    • 需引入 TSN 网卡 802.1Qbv 门控,UPF 改用硬件加速(FPGA/智能网卡),测试仪时间戳精度需 <50 ns,并采用 PTP 白兔时钟同步。
  2. 当切片跨省市容灾,UPF 主备切换 300 ms,如何证明对 99.9% 延迟无影响?
    • 采用“瞬时流量漂移”模型:在切换窗口注入 10 ms 级微突发,统计切换前后 1 s 内延迟分布,用 Kolmogorov-Smirnov 检验证明无显著差异。
  3. 国内运营商正试点“网络数字孪生”,如何把上述测试数据喂给孪生体,实现 SLA 预测性验证?
    • 将 UPF 队列长度、CPU 利用率、时钟抖动作为特征,训练 LSTM 延迟预测模型,输入未来话务增长曲线,提前 7 天输出 99.9% 分位是否超标,从而触发弹性扩容。