Dell R670 (Xeon 6517P) vs Xeon 4214 硬件性能对比

Dell R670 (Xeon 6517P) vs Xeon 4214 硬件性能对比报告

测试日期:2026-08-25 ~ 2026-08-28
测试目的:对新物理机 Dell R670 (Xeon 6517P) 进行性能摸底,与现有 Xeon 4214 机器对比


1. 硬件配置对比

项目 R670 (6517P) 对比机 (4214) 差异倍数
机型 Dell PowerEdge R670
CPU 型号 Intel Xeon 6517P × 2 Intel Xeon Silver 4214 × 2
架构代号 Granite Rapids (P-core) Cascade Lake 差 4 代
制程 Intel 3 (≈5nm 级别) 14nm ~3x 密度
物理核心 16/socket × 2 = 32 12/socket × 2 = 24 1.33x
逻辑核心(HT) 64 48 1.33x
基础频率 3.2 GHz 2.2 GHz 1.45x
最大睿频 4.8 GHz 3.2 GHz 1.50x
L1d Cache 48K/core 32K/core 1.5x
L1i Cache 64K/core 32K/core 2.0x
L2 Cache 2048K/core 1024K/core 2.0x
L3 Cache 72MB/socket 16.9MB/socket 4.3x
内存类型 DDR5 DDR4 新一代
内存速率 6400 MT/s 2400 MT/s (configured) 2.67x
内存容量 256 GB (8×32GB ECC) 192 GB (6×32GB ECC) 1.33x
NUMA nodes 2 (distance 10/21) 2 (distance 10/21) 相同
RAID 卡 Dell PERC H365i Front (Broadcom MPI3MR, PCIe4 x8) PERC H730P (2GB BBU)
数据盘 Dell PM9D3a NVMe U.2 7.68TB (TLC, RI) RAID VD 1.8TB NVMe vs RAID
数据盘接口 NVMe 直通 (不走RAID卡) 走 RAID 控制器

R670 存储架构

1
2
3
4
5
CPU ──PCIe 5.0──┬── NVMe PM9D3a 7.68TB (/data0, 直通, 无RAID)

└── PERC H365i (PCIe 4.0 x8, Broadcom Fusion-MPT 24GSAS)
└── RAID VD 893.8GB (系统盘, SSD behind RAID)
└── 背板 32 槽位

6517P 架构定位:Granite Rapids 是第几代?

1
2
3
4
5
6
代际路线(Server Xeon Scalable):

Skylake-SP (2017) → Cascade Lake (2019) → Ice Lake-SP (2021) → Sapphire Rapids (2023) → Emerald Rapids (2024) → Granite Rapids (2024 Q4)
1st Gen 2nd Gen 3rd Gen 4th Gen 5th Gen 6th Gen
14nm 14nm 10nm Intel 7 Intel 7 Intel 3
Xeon 8180 Xeon 4214/8269 Xeon 8380 Xeon 8480+ Xeon 8592+ Xeon 6900P/6517P

Xeon 6517P (Granite Rapids) 是第 6 代 Xeon Scalable,比 4214 (Cascade Lake, 第 2 代) 领先 4 代。

6517P vs 4214 架构核心差异

特性 6517P (Granite Rapids) 4214 (Cascade Lake) 影响
微架构 Redwood Cove (P-core) Cascade Lake IPC 提升 ~49%
制程 Intel 3 (~5nm) 14nm 功耗/密度大幅改善
L2 Cache 2MB/core 1MB/core 热数据命中率提升
L3 Cache 72MB (大共享) 16.9MB working set 容纳力 4x
内存控制器 DDR5-6400, 8通道/socket DDR4-2666, 6通道/socket 带宽 3x+
AVX-512 完整支持 + AMX + AVX-VNNI 基础 AVX-512 AI/向量化增强
PCIe PCIe 5.0, CXL 2.0 PCIe 3.0 I/O 带宽 4x
互连 UPI 2.0 (24GT/s) UPI 2.0 (10.4GT/s) 跨 socket 带宽 2.3x

R670 CPU 拓扑(lstopo)

1
2
3
4
5
6
7
8
9
10
11
12
13
┌─ Socket 0 (Package 0) ──────────────────────────────────────┐
│ ┌── Single Compute Die (16 P-cores, 共享 72MB L3) ──────┐ │
│ │ Core 0~15, 每核含 2 HT (共 32 逻辑核) │ │
│ │ cluster_id 各不同, 但同 die, 无跨 tile 延迟差异 │ │
│ └────────────────────────────────────────────────────────┘ │
│ ┌── I/O Die (4ch DDR5-6400 Memory Controller) ──────────┐ │
│ │ NUMA Node 0 (125GB) │ │
│ └────────────────────────────────────────────────────────┘ │
└───────────────────── UPI 2.0 (+118ns) ──────────────────────┘

┌─ Socket 1 (Package 1) ──────────────────────────────────────┐
│ 同样结构: 1 Compute Die + 1 I/O Die, NUMA Node 1 (126GB) │
└──────────────────────────────────────────────────────────────┘

2. 测试方法与工具

工具 版本 用途 测试命令
lmbench lat_mem_rd lmbench-master (手动编译) Cache/Memory 延迟 numactl -C 0 -m 0 ./lat_mem_rd -W 5 -N 5 -t 256M
lmbench bw_mem 同上 内存带宽 numactl -C 0 -m 0 ./bw_mem 512m rd/wr/cp
fio 系统自带 磁盘 IOPS/延迟/带宽 详见各小节
openssl speed OpenSSL 1.1.1k FIPS CPU AES 吞吐 openssl speed [-evp] aes-256-cbc [-multi N]
bc 7^999999 GNU bc 单核纯计算 perf stat -- bash -c 'echo 7^999999 | bc > /dev/null'
perf stat 系统自带 IPC/PMU 计数器 同上

关于 OpenSSL 硬件加速验证

两台机器的 openssl 编译参数均包含 -DAESNI_ASM -DVPAES_ASM,且 CPU flags 中均有 aes 标志,确认 两台都走了 AES-NI 硬件加速路径

验证方式:对比 openssl speed aes-256-cbc(低级别 AES-NI)和 openssl speed -evp aes-256-cbc(EVP 接口,完全硬件加速):

机器 非EVP (KB/s, 8K block) EVP (KB/s, 8K block) EVP/非EVP比
R670 6517P 263,400 1,417,344 5.38x
4214 166,530 867,036 5.21x

两台 EVP/非EVP 加速比接近(5.2~5.4x),证明硬件加速路径一致。吞吐差异来自频率和微架构,非加速能力差异。

关于 FIO 测试文件大小

  • R670 (NVMe):测试用 1G 和 8G 文件结果一致(15.3K vs 15.4K IOPS),企业级 NVMe DRAM 缓存通常仅 1-4GB,且 PM9D3a 是 Read-Intensive 盘无大容量写缓存,1G 文件已足够可靠
  • 4214 (RAID):使用 8G 文件测试,超过 PERC H730P 的 2GB BBU 缓存,确保测到真实盘性能。写入测试中 RAID 控制器写缓存仍会影响小 IO 延迟(iodepth=1 时 write 61us 明显受 BBU 缓存加速)

3. Cache / 内存延迟对比

3.1 相同参数对比(lat_mem_rd -t 256M)

Working Set R670 6517P (ns) 4214 (ns) 6517P/4214 说明
32 MB 43.4 69.3 0.63x (快37%) 6517P 在 L3 内,4214 已超 L3(16.9MB)
64 MB 53.9 82.4 0.65x (快35%) 6517P 仍在 L3(72MB)内,4214 在内存
128 MB 86.1 88.5 0.97x (≈平) 都打到内存了
256 MB 102.4 90.2 1.14x (慢14%) 6517P DDR5 延迟劣势显现

3.2 各级缓存延迟对比(-t 512M)

层级 6517P (ns) 4214 (ns) 6517P/4214 说明
L1d 1.254 1.267 0.99x 几乎相同,1个clock cycle
L2 entry 4.012 4.435 0.90x 6517P略快
L2 steady 4.0~5.8 4.4~7.0 ~0.9x 6517P的2MB L2更平稳
L3 entry 15.97 (@2MB) 23.07 (@2MB) 0.69x 6517P L3 访问快 30%
L3 steady 36~43 (@4-32MB) 23 (@2-8MB) 1.6~1.9x 4214 L3仅16.9MB但更快
L3→Mem过渡 54~86 (@64-128MB) 65~84 (@32-128MB) ~1x 过渡区类似
Memory 稳态 111 (@512MB) 89 (@512MB) 1.25x (慢) DDR5绝对延迟高于DDR4

3.3 关键洞察

DDR5 延迟悖论:R670 内存延迟(111ns)反而比 4214(89ns)高 25%。

原因:DDR5 的 CAS Latency (CL) 数值更大(CL46-48 @6400MT/s vs CL17-19 @2400MT/s),转换为绝对时间后 DDR5 实际慢于 DDR4:

  • DDR5-6400: CL46 / (6400/2) = 14.4ns (首次访问开销)
  • DDR4-2400: CL17 / (2400/2) = 14.2ns

加上 Intel 3 制程 uncore 距离更远、L3 更大导致环形总线延迟增加,最终表现为绝对延迟更高。

但 R670 通过 72MB 超大 L3 补偿:大部分数据库 working set 在 L3 内(43ns)就能命中,而 4214 只有 16.9MB 很快就溢出到 89ns。

3.4 完整延迟曲线对比(关键节点,-t 512M)

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
Size(MB)    6517P(ns)    4214(ns)     优胜方
0.032 1.254 1.318 ≈ 平
0.048 1.256 4.435 R670 (L1d=48K vs 32K)
0.064 4.012 4.425 ≈ 平 (都在L2)
0.250 4.202 6.754 R670
1.000 5.769 11.785 R670 (2MB L2 vs 1MB L2)
2.000 15.974 23.073 R670
4.000 35.965 23.163 4214 (4214仍在L3内, R670在L3深处)
8.000 38.174 23.459 4214
16.000 42.873 33.138 4214 (4214 L3边界16.9MB)
32.000 43.363 65.431 **R670** (4214已到内存, R670仍在L3!)
64.000 53.915 77.831 **R670** (R670仍在72MB L3!)
128.000 86.131 84.381 ≈ 平 (都在内存了)
256.000 102.399 87.439 4214
512.000 111.135 89.133 4214 (DDR5延迟更高)

转折点在 ~17MB:小于 17MB 时 4214 的小 L3 延迟更低;大于 17MB 后 4214 溢出到内存而 R670 仍在 L3 缓存中——这是 72MB L3 的核心优势。


4. 内存带宽对比(bw_mem 512MB read)

4.1 单核带宽

机器 单核 Read (MB/s) 单核 Write (MB/s) 单核 Copy (MB/s)
R670 6517P 23,940 9,906 8,491
4214 13,488 5,694 3,021
倍数 1.78x 1.74x 2.81x

4.2 多核聚合带宽(单 socket,Read)

并发核数 R670 单核均值 (MB/s) R670 聚合 (GB/s) 4214 单核均值 (MB/s) 4214 聚合 (GB/s) 倍数
1 23,940 23.4 13,488 13.2 1.78x
4 19,618 76.7 11,598 45.3 1.69x
12 (4214 全核) 4,349 51.0
16 (R670 全核) 9,812 153.4

4.3 内存带宽验证结论

单 socket 饱和带宽:

  • R670: 16核 × 9,812 MB/s = 153.4 GB/s(DDR5-6400 理论 4通道 × 51.2 = 204.8 GB/s,利用率 75%)
  • 4214: 12核 × 4,349 MB/s = 51.0 GB/s(DDR4-2400 理论 6通道 × 19.2 = 115.2 GB/s,利用率 44%)

饱和带宽 R670 是 4214 的 3.0x,这正是 DDR5-6400 vs DDR4-2400 的核心优势所在。

4.4 内存墙假设验证

假设:“两个物理机最大的差异是内存速率(6400 vs 2400 MT/s),因为只要不是 CPU bound 都需要大量访问内存,内存墙才是最大的瓶颈。”

验证结论:部分成立,但需要细化

场景 主要瓶颈 R670 优势来源 优势幅度
Working set ≤ 64MB L3 hit vs Memory miss 72MB L3 vs 16.9MB L3 R670胜 35%
Working set = 128MB 内存延迟 都到内存,DDR5 ≈ DDR4 ≈ 平手
Working set ≥ 256MB 内存延迟 + 带宽 DDR5延迟差但带宽3x R670带宽胜3x,延迟输14%
多线程内存密集 聚合内存带宽 DDR5-6400多通道 R670 胜 3x
纯CPU计算 IPC × 频率 微架构+频率 R670 胜 89%

结论:对数据库场景(MySQL buffer pool 通常 32-64GB),R670 的 72MB L3 能覆盖大量 hot data 的 index page。真正的优势不仅是内存带宽 3x,更是 L3 容量 4.3x 带来的 “避免打到内存墙” 的能力。对单线程延迟敏感的场景,DDR5 绝对延迟反而是劣势;但多线程并发场景下带宽优势碾压延迟劣势。


5. NUMA / 跨 Socket 延迟

5.1 跨 Socket 延迟(lat_mem_rd -t 256M)

场景 R670 6517P (ns) 4214 (ns) 说明
Local (CPU→本地 MEM) @256MB 102 90 R670 DDR5 延迟稍高
Remote (CPU→远端 MEM) @256MB 220 146 R670 跨 socket 惩罚更大
远端/本地比 2.16x 1.62x

5.2 Socket 内各 Core 延迟一致性验证

测试:Socket 内不同 core(不同 cluster_id)访问本地内存

Core (socket 1) cluster_id Local Latency (ns) @256MB -t 256M
cpu9 146 102.9
cpu17 128 100.1
cpu31 150 102.3

结论:同 socket 内不同 core 延迟差异 < 3%,确认 16 核同处一个 compute die,无跨 tile 延迟差异。

5.3 与历史 CPU 跨 NUMA 对比

CPU NUMA distance 跨NUMA延迟倍数 说明
R670 Xeon 6517P 10/21 2.16x 跨socket, UPI 2.0
Xeon 4214 10/21 1.62x 跨socket
Intel 8269CY 10/21 1.33x 跨socket (历史数据)
Intel 8163 10/21 1.49x 跨socket (历史数据)
海光 C86 5280 10/16/22/28 最远 2.8x 胶水核4个NUMA
鲲鹏920 10/12/20/22 ~1.9x 跨die/跨socket
飞腾2500 10~100 3.3x (跨socket) 16个NUMA node

R670 跨 socket 惩罚在 Intel 家族里偏大,数据库部署务必做好 NUMA 绑定(numactl --cpunodebind=0 --membind=0)。


6. 单核计算性能对比

6.1 7^999999 计算

测试命令:perf stat -e cpu-cycles,instructions,branch-misses,cache-misses,cache-references -- bash -c 'echo 7^999999 | bc > /dev/null'

CPU 耗时 (秒) IPC cpu-cycles instructions 主频
R670 6517P (本次) 11.36 2.72 45.3B 123.2B 3.2 GHz
4214 (本次) 21.46 1.82 67.8B 123.2B 2.2→3.2 GHz (turbo)
Intel 710 (历史) 15.83 2.64 2.75 GHz
Intel 8269CY (历史) 18.60 2.19 2.5 GHz
鲲鹏920 (历史) 24.60 1.84 2.6 GHz
海光 C86 5280 (历史) 26.73 0.92 2.5 GHz
飞腾 FT2500 (历史) 39.65 0.43 2.1 GHz

注意:两台机器执行的 instructions 数量完全一致(123.2B),这是同一个计算任务。差异完全来自 IPC 和时钟频率:

  • R670: 123.2B / 45.3B cycles = IPC 2.72, 实测11.36s(turbo boost 生效)
  • 4214: 123.2B / 67.8B cycles = IPC 1.82, 实测21.46s

R670 单核比 4214 快 89%(11.36 vs 21.46),其中 IPC 贡献:2.72/1.82 = 1.49x(Granite Rapids 微架构比 Cascade Lake IPC 高 49%)

6.2 Pi(5000) 计算

测试命令:time bash -c 'echo "scale=5000; 4*a(1)" | bc -l -q >/dev/null'

CPU 耗时 (秒) 主频
R670 6517P (本次) 11.03 3.2 GHz
4214 (本次) 22.25 2.2 GHz
Intel 710 (历史) 15.57 2.75 GHz
Intel 8163 (历史) 22.98 2.5 GHz
鲲鹏920 (历史) 23.52 2.6 GHz
海光 (历史) 31.06 2.5 GHz

7. OpenSSL AES-256-CBC 吞吐对比

7.1 单核吞吐(非EVP模式,验证CPU计算能力)

测试命令:openssl speed aes-256-cbc

机器 16B (KB/s) 64B 256B 1024B 8192B 16384B
R670 6517P 254,407 260,720 262,920 264,168 263,400 263,466
4214 160,428 166,330 167,325 167,190 166,530 167,477
倍数 1.59x 1.57x 1.57x 1.58x 1.58x 1.57x

7.2 多核吞吐

测试命令:openssl speed -multi N aes-256-cbc

并发 R670 6517P (KB/s, 8K block) 4214 (KB/s, 8K block) 倍数
1 线程 263,400 166,530 1.58x
24 线程 (4214物理核) 3,298,970
32 线程 (R670物理核) 8,418,946
48 线程 (4214全核) 3,937,862
64 线程 (R670全核) 11,350,082
全核对比 11,350,082 3,937,862 2.88x

历史 CPU 对比(32 线程)

CPU 32 线程 aes-256-cbc (KB/s, 8K) 物理核数
R670 Xeon 6517P ~8,419,000 32
Intel 8269CY ~2,700,000 (参考) 52
海光 C86 5280 ~2,500,000 (参考) 32
鲲鹏920 (32线程) ~4,500,000 (参考) 96总

8. 存储性能对比(FIO)

8.1 测试参数说明

参数 R670 (NVMe) 4214 (RAID)
存储设备 Dell PM9D3a NVMe U.2 7.68TB (TLC, RI) PERC H730P RAID (2GB BBU cache)
测试文件大小 8GB 8GB (超过BBU缓存)
文件系统 xfs xfs

8.2 4K 随机读写(延迟优先,iodepth=1, numjobs=1)

测试命令:fio --ioengine=libaio --direct=1 --bs=4k --iodepth=1 --numjobs=1 --rw=randread/randwrite --size=8G --runtime=30 --time_based

测试项 R670 NVMe 4214 RAID 倍数
4K Random Read IOPS 15,400 9,801 1.57x
4K Random Read 平均延迟 64.6 us 101.3 us 0.64x (更快)
4K Random Write IOPS 83,400 15,000 5.56x
4K Random Write 平均延迟 11.7 us 61.6 us 0.19x (更快)

注:4214 的随机写延迟(61us)受 RAID BBU 写缓存加速。若无缓存(缓存满或透写模式),实际延迟可能 10x+。

8.3 4K 随机读写(高并发,iodepth=64, numjobs=4)

测试命令:fio --ioengine=libaio --direct=1 --bs=4k --iodepth=64 --numjobs=4 --rw=randread/randwrite --size=8G --runtime=30 --time_based

测试项 R670 NVMe 4214 RAID 倍数
Random Read IOPS 1,315,000 70,900 18.5x
Random Read avg lat 194 us 3,559 us 0.05x
Random Write IOPS 1,291,000 25,000 51.6x
Random Write avg lat 198 us 9,828 us 0.02x

8.4 顺序读写(1M block, iodepth=32, numjobs=1)

测试命令:fio --ioengine=libaio --direct=1 --bs=1m --iodepth=32 --numjobs=1 --rw=read/write --size=8G --runtime=30 --time_based

测试项 R670 NVMe 4214 RAID 倍数
Sequential Read 7,113 MB/s 2,366 MB/s 3.0x
Sequential Write 6,768 MB/s 302 MB/s 22.4x

8.5 混合随机读写(70/30, 4K, iodepth=32, numjobs=4)

测试命令:fio --ioengine=libaio --direct=1 --bs=4k --iodepth=32 --numjobs=4 --rw=randrw --rwmixread=70 --size=8G --runtime=30 --time_based

测试项 R670 NVMe 4214 RAID 倍数
Read IOPS 803,000 37,800 21.2x
Read avg lat 142 us 2,440 us 0.06x
Write IOPS 344,000 16,300 21.1x
Write avg lat 40 us 2,189 us 0.02x

8.6 磁盘配置与性能总结

项目 R670 (数据盘) 4214 (数据盘)
设备类型 NVMe SSD (直通, 不走RAID) SAS/SATA SSD (RAID VD, 走RAID卡)
具体型号 Dell PM9D3a RI U.2 7.68TB 未知(RAID 控制器隐藏底层盘信息)
颗粒类型 TLC (Samsung V-NAND OEM) 未知
接口 NVMe PCIe (直连CPU) PERC H730P (SAS 12Gb/s, 2GB BBU cache)
定位 Read-Intensive 企业级 通用企业级
容量 7.68 TB ~1.8 TB (RAID VD)

性能对比总结(单队列延迟 = 数据库最关心的指标):

指标 R670 NVMe 4214 RAID SSD R670 优势 对 MySQL 的影响
4K 随机读延迟 64.6 us 101.3 us 1.6x data page 随机读
4K 随机写延迟 11.7 us 61.6 us* 5.3x redo log fsync
高并发随机读 IOPS 1,315K 70.9K 18.5x 高并发 OLTP
顺序写带宽 6,768 MB/s 302 MB/s 22.4x binlog / backup

*4214 写延迟受 RAID BBU 写缓存加速。从 IOPS 和延迟数据综合判断,4214 RAID 后面是 SSD(非 HDD),因为 HDD 4K 随机读只能做到 100-200 IOPS / 5-10ms 延迟,而 4214 实测 9,801 IOPS / 101us,这是 SSD 的特征。

关键差异来源:

  1. NVMe 直通 vs RAID 控制器:R670 的 NVMe 直连 CPU PCIe 总线,省去了 RAID 控制器的转发开销(~30-50us)
  2. PM9D3a 企业级 NVMe:三星 OEM 旗舰企业盘,内部并行度高(多 die 并发)
  3. 队列深度利用:NVMe 原生支持 64K 队列深度 × 64K 队列数,而 RAID 卡受限于控制器处理能力
  4. 写路径:NVMe 写直达闪存控制器(11.7us),RAID 卡写入 BBU 缓存后返回(61us,含 RAID 逻辑开销)

9. 综合对比总结

9.1 性能倍数一览

指标 R670 相对 4214 主要原因
单核 IPC 1.49x Granite Rapids 微架构
单核计算(7^999999) 1.89x IPC + 频率
单核 AES 吞吐 1.58x 频率 + AES-NI 优化
全核 AES 吞吐 2.88x 核数 + 单核性能
单核内存读带宽 1.78x DDR5 带宽
多核聚合内存带宽 3.0x DDR5 × 多通道
L3 容量 4.3x 72MB vs 16.9MB
内存绝对延迟 (@256MB) 0.88x (慢14%) DDR5 CAS latency 高
跨 NUMA 延迟惩罚 2.16x vs 1.62x UPI 距离 + snoop 开销
4K随机读 IOPS (高并发) 18.5x NVMe vs RAID
顺序读带宽 3.0x NVMe PCIe5 vs RAID
顺序写带宽 22.4x NVMe vs RAID BBU

9.2 结论

  1. CPU 计算能力:R670 单核比 4214 快 89%(IPC 2.72 vs 1.82 + 频率差),在所有历史测试 CPU 中单核性能最强
  2. 内存子系统
    • 带宽:DDR5-6400 单核 1.78x,多核聚合 3.0x——多线程数据库场景的核心优势
    • 延迟:DDR5 绝对延迟更高(111ns vs 89ns)——但被 72MB L3 缓存弥补
    • 内存墙结论:R670 通过 “超大 L3 + 超高带宽” 两手策略应对内存墙,延迟敏感路径靠 L3,带宽敏感路径靠 DDR5 多通道
  3. 存储:NVMe 对 RAID 是降维打击,不在同一量级(18-50x 差距)
  4. NUMA:R670 跨 socket 惩罚(2.16x)比 4214(1.62x)更大,务必绑定 NUMA
  5. 适用场景:R670 极适合 MySQL 主库、Redis、低延迟中间件

9.3 内存墙假设验证总结

结论:假设成立但需要修正表述。

  • 带宽层面:DDR5-6400 确实是最大差异因素,提供 3x 聚合带宽,多线程 memory-bound 场景直接受益
  • ⚠️ 延迟层面:DDR5 延迟反而更高 14-25%(取决于 working set 大小)。但 R670 用 72MB L3(4.3x容量)把”内存墙”推后了——只有 working set > 72MB 才真正碰到 DDR5 的高延迟
  • 实际数据库效果:MySQL buffer pool 的 hot page 如果在 72MB 以内(非常多 OLTP 场景满足),R670 以 43ns L3 延迟服务,而 4214 在 17MB 就溢出到 89ns 内存——等效延迟 R670 反而快 35-50%

附录 A:R670 6517P 完整 lat_mem_rd 原始数据(-t 512M)

1
2
3
4
5
6
7
8
9
10
11
12
13
14
Size(MB)   Latency(ns)
0.048 1.256 (L1d上限)
0.051 4.013 (L2起始)
0.250 4.202
1.000 5.769 (L2稳态)
2.000 15.974 (L3起始)
4.000 35.965
8.000 38.174
16.000 42.873
32.000 43.363
64.000 53.915 (L3尾部)
128.000 86.131 (Memory过渡)
256.000 102.399
512.000 111.135 (Memory稳态)

附录 B:4214 完整 lat_mem_rd 原始数据(-t 512M)

1
2
3
4
5
6
7
8
9
10
11
12
13
14
Size(MB)   Latency(ns)
0.031 1.318 (L1d上限)
0.035 4.435 (L2起始)
0.250 6.754
1.000 11.785 (L2尾部/L3起始)
2.000 23.073 (L3稳态)
4.000 23.163
8.000 23.459
16.000 33.138 (L3边界16.9MB)
32.000 65.431 (Memory过渡)
64.000 77.831
128.000 84.381
256.000 87.439
512.000 89.133 (Memory稳态)

附录 C:历史 CPU 性能基准(来自 wiki 数据)

单核计算 7^999999

CPU 耗时(秒) IPC 主频 架构
R670 Xeon 6517P 11.35 2.72 3.2G Granite Rapids
Xeon 4214 21.46 1.82 2.2G Cascade Lake
Intel 710 15.83 2.64 2.75G (未知型号)
Intel 8269CY 18.60 2.19 2.5G Cascade Lake
鲲鹏920-4826 24.60 1.84 2.6G ARM v8
海光 C86 5280 26.73 0.92 2.5G Zen1 (AMD授权)
飞腾 FT2500 39.65 0.43 2.1G ARM v8

OpenSSL aes-256-cbc 单核 (8192B block)

CPU 吞吐 (KB/s) 主频
R670 Xeon 6517P 263,400 3.2G
Xeon 4214 166,530 2.2G
Intel 8269CY (52核) ~89,600 (参考) 2.5G
鲲鹏920 ~143,196 2.6G
海光 C86 5280 ~79,555 2.5G

历史 lat_mem_rd 内存延迟(local NUMA, @64MB -t 64M)

CPU Local Memory Latency (ns) 内存规格 L3 大小
R670 6517P 53.9* (@64MB仍在L3!) DDR5-6400 72MB
Intel 8269CY 69.8 DDR4-2666 36MB
Intel 8163 67.1 DDR4-2666 33.8MB
AMD EPYC 7T83 71.7 DDR4-3200 256MB(L3)
海光 7280 106.8 DDR4 128MB
海光 5280 102.6 DDR4 32MB
鲲鹏920 117.3 DDR4 48MB
飞腾2500 150.0 DDR4 64MB
申威3231 215.1 DDR4 64MB

*注:R670 在 @64MB 时数据仍在 72MB L3 缓存内,并非真实内存延迟。其真实内存延迟为 102-111ns (@256-512MB)。