Dell R670 (Xeon 6517P) vs Xeon 4214 硬件性能对比
Dell R670 (Xeon 6517P) vs Xeon 4214 硬件性能对比报告
测试日期:2026-08-25 ~ 2026-08-28
测试目的:对新物理机 Dell R670 (Xeon 6517P) 进行性能摸底,与现有 Xeon 4214 机器对比
1. 硬件配置对比
| 项目 | R670 (6517P) | 对比机 (4214) | 差异倍数 |
|---|---|---|---|
| 机型 | Dell PowerEdge R670 | — | — |
| CPU 型号 | Intel Xeon 6517P × 2 | Intel Xeon Silver 4214 × 2 | — |
| 架构代号 | Granite Rapids (P-core) | Cascade Lake | 差 4 代 |
| 制程 | Intel 3 (≈5nm 级别) | 14nm | ~3x 密度 |
| 物理核心 | 16/socket × 2 = 32 | 12/socket × 2 = 24 | 1.33x |
| 逻辑核心(HT) | 64 | 48 | 1.33x |
| 基础频率 | 3.2 GHz | 2.2 GHz | 1.45x |
| 最大睿频 | 4.8 GHz | 3.2 GHz | 1.50x |
| L1d Cache | 48K/core | 32K/core | 1.5x |
| L1i Cache | 64K/core | 32K/core | 2.0x |
| L2 Cache | 2048K/core | 1024K/core | 2.0x |
| L3 Cache | 72MB/socket | 16.9MB/socket | 4.3x |
| 内存类型 | DDR5 | DDR4 | 新一代 |
| 内存速率 | 6400 MT/s | 2400 MT/s (configured) | 2.67x |
| 内存容量 | 256 GB (8×32GB ECC) | 192 GB (6×32GB ECC) | 1.33x |
| NUMA nodes | 2 (distance 10/21) | 2 (distance 10/21) | 相同 |
| RAID 卡 | Dell PERC H365i Front (Broadcom MPI3MR, PCIe4 x8) | PERC H730P (2GB BBU) | — |
| 数据盘 | Dell PM9D3a NVMe U.2 7.68TB (TLC, RI) | RAID VD 1.8TB | NVMe vs RAID |
| 数据盘接口 | NVMe 直通 (不走RAID卡) | 走 RAID 控制器 | — |
R670 存储架构
1 | CPU ──PCIe 5.0──┬── NVMe PM9D3a 7.68TB (/data0, 直通, 无RAID) |
6517P 架构定位:Granite Rapids 是第几代?
1 | 代际路线(Server Xeon Scalable): |
Xeon 6517P (Granite Rapids) 是第 6 代 Xeon Scalable,比 4214 (Cascade Lake, 第 2 代) 领先 4 代。
6517P vs 4214 架构核心差异
| 特性 | 6517P (Granite Rapids) | 4214 (Cascade Lake) | 影响 |
|---|---|---|---|
| 微架构 | Redwood Cove (P-core) | Cascade Lake | IPC 提升 ~49% |
| 制程 | Intel 3 (~5nm) | 14nm | 功耗/密度大幅改善 |
| L2 Cache | 2MB/core | 1MB/core | 热数据命中率提升 |
| L3 Cache | 72MB (大共享) | 16.9MB | working set 容纳力 4x |
| 内存控制器 | DDR5-6400, 8通道/socket | DDR4-2666, 6通道/socket | 带宽 3x+ |
| AVX-512 | 完整支持 + AMX + AVX-VNNI | 基础 AVX-512 | AI/向量化增强 |
| PCIe | PCIe 5.0, CXL 2.0 | PCIe 3.0 | I/O 带宽 4x |
| 互连 | UPI 2.0 (24GT/s) | UPI 2.0 (10.4GT/s) | 跨 socket 带宽 2.3x |
R670 CPU 拓扑(lstopo)
1 | ┌─ Socket 0 (Package 0) ──────────────────────────────────────┐ |
2. 测试方法与工具
| 工具 | 版本 | 用途 | 测试命令 |
|---|---|---|---|
| lmbench lat_mem_rd | lmbench-master (手动编译) | Cache/Memory 延迟 | numactl -C 0 -m 0 ./lat_mem_rd -W 5 -N 5 -t 256M |
| lmbench bw_mem | 同上 | 内存带宽 | numactl -C 0 -m 0 ./bw_mem 512m rd/wr/cp |
| fio | 系统自带 | 磁盘 IOPS/延迟/带宽 | 详见各小节 |
| openssl speed | OpenSSL 1.1.1k FIPS | CPU AES 吞吐 | openssl speed [-evp] aes-256-cbc [-multi N] |
| bc 7^999999 | GNU bc | 单核纯计算 | perf stat -- bash -c 'echo 7^999999 | bc > /dev/null' |
| perf stat | 系统自带 | IPC/PMU 计数器 | 同上 |
关于 OpenSSL 硬件加速验证
两台机器的 openssl 编译参数均包含 -DAESNI_ASM -DVPAES_ASM,且 CPU flags 中均有 aes 标志,确认 两台都走了 AES-NI 硬件加速路径。
验证方式:对比 openssl speed aes-256-cbc(低级别 AES-NI)和 openssl speed -evp aes-256-cbc(EVP 接口,完全硬件加速):
| 机器 | 非EVP (KB/s, 8K block) | EVP (KB/s, 8K block) | EVP/非EVP比 |
|---|---|---|---|
| R670 6517P | 263,400 | 1,417,344 | 5.38x |
| 4214 | 166,530 | 867,036 | 5.21x |
两台 EVP/非EVP 加速比接近(5.2~5.4x),证明硬件加速路径一致。吞吐差异来自频率和微架构,非加速能力差异。
关于 FIO 测试文件大小
- R670 (NVMe):测试用 1G 和 8G 文件结果一致(15.3K vs 15.4K IOPS),企业级 NVMe DRAM 缓存通常仅 1-4GB,且 PM9D3a 是 Read-Intensive 盘无大容量写缓存,1G 文件已足够可靠
- 4214 (RAID):使用 8G 文件测试,超过 PERC H730P 的 2GB BBU 缓存,确保测到真实盘性能。写入测试中 RAID 控制器写缓存仍会影响小 IO 延迟(iodepth=1 时 write 61us 明显受 BBU 缓存加速)
3. Cache / 内存延迟对比
3.1 相同参数对比(lat_mem_rd -t 256M)
| Working Set | R670 6517P (ns) | 4214 (ns) | 6517P/4214 | 说明 |
|---|---|---|---|---|
| 32 MB | 43.4 | 69.3 | 0.63x (快37%) | 6517P 在 L3 内,4214 已超 L3(16.9MB) |
| 64 MB | 53.9 | 82.4 | 0.65x (快35%) | 6517P 仍在 L3(72MB)内,4214 在内存 |
| 128 MB | 86.1 | 88.5 | 0.97x (≈平) | 都打到内存了 |
| 256 MB | 102.4 | 90.2 | 1.14x (慢14%) | 6517P DDR5 延迟劣势显现 |
3.2 各级缓存延迟对比(-t 512M)
| 层级 | 6517P (ns) | 4214 (ns) | 6517P/4214 | 说明 |
|---|---|---|---|---|
| L1d | 1.254 | 1.267 | 0.99x | 几乎相同,1个clock cycle |
| L2 entry | 4.012 | 4.435 | 0.90x | 6517P略快 |
| L2 steady | 4.0~5.8 | 4.4~7.0 | ~0.9x | 6517P的2MB L2更平稳 |
| L3 entry | 15.97 (@2MB) | 23.07 (@2MB) | 0.69x | 6517P L3 访问快 30% |
| L3 steady | 36~43 (@4-32MB) | 23 (@2-8MB) | 1.6~1.9x | 4214 L3仅16.9MB但更快 |
| L3→Mem过渡 | 54~86 (@64-128MB) | 65~84 (@32-128MB) | ~1x | 过渡区类似 |
| Memory 稳态 | 111 (@512MB) | 89 (@512MB) | 1.25x (慢) | DDR5绝对延迟高于DDR4 |
3.3 关键洞察
DDR5 延迟悖论:R670 内存延迟(111ns)反而比 4214(89ns)高 25%。
原因:DDR5 的 CAS Latency (CL) 数值更大(CL46-48 @6400MT/s vs CL17-19 @2400MT/s),转换为绝对时间后 DDR5 实际慢于 DDR4:
- DDR5-6400: CL46 / (6400/2) = 14.4ns (首次访问开销)
- DDR4-2400: CL17 / (2400/2) = 14.2ns
加上 Intel 3 制程 uncore 距离更远、L3 更大导致环形总线延迟增加,最终表现为绝对延迟更高。
但 R670 通过 72MB 超大 L3 补偿:大部分数据库 working set 在 L3 内(43ns)就能命中,而 4214 只有 16.9MB 很快就溢出到 89ns。
3.4 完整延迟曲线对比(关键节点,-t 512M)
1 | Size(MB) 6517P(ns) 4214(ns) 优胜方 |
转折点在 ~17MB:小于 17MB 时 4214 的小 L3 延迟更低;大于 17MB 后 4214 溢出到内存而 R670 仍在 L3 缓存中——这是 72MB L3 的核心优势。
4. 内存带宽对比(bw_mem 512MB read)
4.1 单核带宽
| 机器 | 单核 Read (MB/s) | 单核 Write (MB/s) | 单核 Copy (MB/s) |
|---|---|---|---|
| R670 6517P | 23,940 | 9,906 | 8,491 |
| 4214 | 13,488 | 5,694 | 3,021 |
| 倍数 | 1.78x | 1.74x | 2.81x |
4.2 多核聚合带宽(单 socket,Read)
| 并发核数 | R670 单核均值 (MB/s) | R670 聚合 (GB/s) | 4214 单核均值 (MB/s) | 4214 聚合 (GB/s) | 倍数 |
|---|---|---|---|---|---|
| 1 | 23,940 | 23.4 | 13,488 | 13.2 | 1.78x |
| 4 | 19,618 | 76.7 | 11,598 | 45.3 | 1.69x |
| 12 (4214 全核) | — | — | 4,349 | 51.0 | — |
| 16 (R670 全核) | 9,812 | 153.4 | — | — | — |
4.3 内存带宽验证结论
单 socket 饱和带宽:
- R670: 16核 × 9,812 MB/s = 153.4 GB/s(DDR5-6400 理论 4通道 × 51.2 = 204.8 GB/s,利用率 75%)
- 4214: 12核 × 4,349 MB/s = 51.0 GB/s(DDR4-2400 理论 6通道 × 19.2 = 115.2 GB/s,利用率 44%)
饱和带宽 R670 是 4214 的 3.0x,这正是 DDR5-6400 vs DDR4-2400 的核心优势所在。
4.4 内存墙假设验证
假设:“两个物理机最大的差异是内存速率(6400 vs 2400 MT/s),因为只要不是 CPU bound 都需要大量访问内存,内存墙才是最大的瓶颈。”
验证结论:部分成立,但需要细化
| 场景 | 主要瓶颈 | R670 优势来源 | 优势幅度 |
|---|---|---|---|
| Working set ≤ 64MB | L3 hit vs Memory miss | 72MB L3 vs 16.9MB L3 | R670胜 35% |
| Working set = 128MB | 内存延迟 | 都到内存,DDR5 ≈ DDR4 | ≈ 平手 |
| Working set ≥ 256MB | 内存延迟 + 带宽 | DDR5延迟差但带宽3x | R670带宽胜3x,延迟输14% |
| 多线程内存密集 | 聚合内存带宽 | DDR5-6400多通道 | R670 胜 3x |
| 纯CPU计算 | IPC × 频率 | 微架构+频率 | R670 胜 89% |
结论:对数据库场景(MySQL buffer pool 通常 32-64GB),R670 的 72MB L3 能覆盖大量 hot data 的 index page。真正的优势不仅是内存带宽 3x,更是 L3 容量 4.3x 带来的 “避免打到内存墙” 的能力。对单线程延迟敏感的场景,DDR5 绝对延迟反而是劣势;但多线程并发场景下带宽优势碾压延迟劣势。
5. NUMA / 跨 Socket 延迟
5.1 跨 Socket 延迟(lat_mem_rd -t 256M)
| 场景 | R670 6517P (ns) | 4214 (ns) | 说明 |
|---|---|---|---|
| Local (CPU→本地 MEM) @256MB | 102 | 90 | R670 DDR5 延迟稍高 |
| Remote (CPU→远端 MEM) @256MB | 220 | 146 | R670 跨 socket 惩罚更大 |
| 远端/本地比 | 2.16x | 1.62x |
5.2 Socket 内各 Core 延迟一致性验证
测试:Socket 内不同 core(不同 cluster_id)访问本地内存
| Core (socket 1) | cluster_id | Local Latency (ns) @256MB -t 256M |
|---|---|---|
| cpu9 | 146 | 102.9 |
| cpu17 | 128 | 100.1 |
| cpu31 | 150 | 102.3 |
结论:同 socket 内不同 core 延迟差异 < 3%,确认 16 核同处一个 compute die,无跨 tile 延迟差异。
5.3 与历史 CPU 跨 NUMA 对比
| CPU | NUMA distance | 跨NUMA延迟倍数 | 说明 |
|---|---|---|---|
| R670 Xeon 6517P | 10/21 | 2.16x | 跨socket, UPI 2.0 |
| Xeon 4214 | 10/21 | 1.62x | 跨socket |
| Intel 8269CY | 10/21 | 1.33x | 跨socket (历史数据) |
| Intel 8163 | 10/21 | 1.49x | 跨socket (历史数据) |
| 海光 C86 5280 | 10/16/22/28 | 最远 2.8x | 胶水核4个NUMA |
| 鲲鹏920 | 10/12/20/22 | ~1.9x | 跨die/跨socket |
| 飞腾2500 | 10~100 | 3.3x (跨socket) | 16个NUMA node |
R670 跨 socket 惩罚在 Intel 家族里偏大,数据库部署务必做好 NUMA 绑定(numactl --cpunodebind=0 --membind=0)。
6. 单核计算性能对比
6.1 7^999999 计算
测试命令:perf stat -e cpu-cycles,instructions,branch-misses,cache-misses,cache-references -- bash -c 'echo 7^999999 | bc > /dev/null'
| CPU | 耗时 (秒) | IPC | cpu-cycles | instructions | 主频 |
|---|---|---|---|---|---|
| R670 6517P (本次) | 11.36 | 2.72 | 45.3B | 123.2B | 3.2 GHz |
| 4214 (本次) | 21.46 | 1.82 | 67.8B | 123.2B | 2.2→3.2 GHz (turbo) |
| Intel 710 (历史) | 15.83 | 2.64 | — | — | 2.75 GHz |
| Intel 8269CY (历史) | 18.60 | 2.19 | — | — | 2.5 GHz |
| 鲲鹏920 (历史) | 24.60 | 1.84 | — | — | 2.6 GHz |
| 海光 C86 5280 (历史) | 26.73 | 0.92 | — | — | 2.5 GHz |
| 飞腾 FT2500 (历史) | 39.65 | 0.43 | — | — | 2.1 GHz |
注意:两台机器执行的 instructions 数量完全一致(123.2B),这是同一个计算任务。差异完全来自 IPC 和时钟频率:
- R670: 123.2B / 45.3B cycles = IPC 2.72, 实测11.36s(turbo boost 生效)
- 4214: 123.2B / 67.8B cycles = IPC 1.82, 实测21.46s
R670 单核比 4214 快 89%(11.36 vs 21.46),其中 IPC 贡献:2.72/1.82 = 1.49x(Granite Rapids 微架构比 Cascade Lake IPC 高 49%)
6.2 Pi(5000) 计算
测试命令:time bash -c 'echo "scale=5000; 4*a(1)" | bc -l -q >/dev/null'
| CPU | 耗时 (秒) | 主频 |
|---|---|---|
| R670 6517P (本次) | 11.03 | 3.2 GHz |
| 4214 (本次) | 22.25 | 2.2 GHz |
| Intel 710 (历史) | 15.57 | 2.75 GHz |
| Intel 8163 (历史) | 22.98 | 2.5 GHz |
| 鲲鹏920 (历史) | 23.52 | 2.6 GHz |
| 海光 (历史) | 31.06 | 2.5 GHz |
7. OpenSSL AES-256-CBC 吞吐对比
7.1 单核吞吐(非EVP模式,验证CPU计算能力)
测试命令:openssl speed aes-256-cbc
| 机器 | 16B (KB/s) | 64B | 256B | 1024B | 8192B | 16384B |
|---|---|---|---|---|---|---|
| R670 6517P | 254,407 | 260,720 | 262,920 | 264,168 | 263,400 | 263,466 |
| 4214 | 160,428 | 166,330 | 167,325 | 167,190 | 166,530 | 167,477 |
| 倍数 | 1.59x | 1.57x | 1.57x | 1.58x | 1.58x | 1.57x |
7.2 多核吞吐
测试命令:openssl speed -multi N aes-256-cbc
| 并发 | R670 6517P (KB/s, 8K block) | 4214 (KB/s, 8K block) | 倍数 |
|---|---|---|---|
| 1 线程 | 263,400 | 166,530 | 1.58x |
| 24 线程 (4214物理核) | — | 3,298,970 | — |
| 32 线程 (R670物理核) | 8,418,946 | — | — |
| 48 线程 (4214全核) | — | 3,937,862 | — |
| 64 线程 (R670全核) | 11,350,082 | — | — |
| 全核对比 | 11,350,082 | 3,937,862 | 2.88x |
历史 CPU 对比(32 线程)
| CPU | 32 线程 aes-256-cbc (KB/s, 8K) | 物理核数 |
|---|---|---|
| R670 Xeon 6517P | ~8,419,000 | 32 |
| Intel 8269CY | ~2,700,000 (参考) | 52 |
| 海光 C86 5280 | ~2,500,000 (参考) | 32 |
| 鲲鹏920 (32线程) | ~4,500,000 (参考) | 96总 |
8. 存储性能对比(FIO)
8.1 测试参数说明
| 参数 | R670 (NVMe) | 4214 (RAID) |
|---|---|---|
| 存储设备 | Dell PM9D3a NVMe U.2 7.68TB (TLC, RI) | PERC H730P RAID (2GB BBU cache) |
| 测试文件大小 | 8GB | 8GB (超过BBU缓存) |
| 文件系统 | xfs | xfs |
8.2 4K 随机读写(延迟优先,iodepth=1, numjobs=1)
测试命令:fio --ioengine=libaio --direct=1 --bs=4k --iodepth=1 --numjobs=1 --rw=randread/randwrite --size=8G --runtime=30 --time_based
| 测试项 | R670 NVMe | 4214 RAID | 倍数 |
|---|---|---|---|
| 4K Random Read IOPS | 15,400 | 9,801 | 1.57x |
| 4K Random Read 平均延迟 | 64.6 us | 101.3 us | 0.64x (更快) |
| 4K Random Write IOPS | 83,400 | 15,000 | 5.56x |
| 4K Random Write 平均延迟 | 11.7 us | 61.6 us | 0.19x (更快) |
注:4214 的随机写延迟(61us)受 RAID BBU 写缓存加速。若无缓存(缓存满或透写模式),实际延迟可能 10x+。
8.3 4K 随机读写(高并发,iodepth=64, numjobs=4)
测试命令:fio --ioengine=libaio --direct=1 --bs=4k --iodepth=64 --numjobs=4 --rw=randread/randwrite --size=8G --runtime=30 --time_based
| 测试项 | R670 NVMe | 4214 RAID | 倍数 |
|---|---|---|---|
| Random Read IOPS | 1,315,000 | 70,900 | 18.5x |
| Random Read avg lat | 194 us | 3,559 us | 0.05x |
| Random Write IOPS | 1,291,000 | 25,000 | 51.6x |
| Random Write avg lat | 198 us | 9,828 us | 0.02x |
8.4 顺序读写(1M block, iodepth=32, numjobs=1)
测试命令:fio --ioengine=libaio --direct=1 --bs=1m --iodepth=32 --numjobs=1 --rw=read/write --size=8G --runtime=30 --time_based
| 测试项 | R670 NVMe | 4214 RAID | 倍数 |
|---|---|---|---|
| Sequential Read | 7,113 MB/s | 2,366 MB/s | 3.0x |
| Sequential Write | 6,768 MB/s | 302 MB/s | 22.4x |
8.5 混合随机读写(70/30, 4K, iodepth=32, numjobs=4)
测试命令:fio --ioengine=libaio --direct=1 --bs=4k --iodepth=32 --numjobs=4 --rw=randrw --rwmixread=70 --size=8G --runtime=30 --time_based
| 测试项 | R670 NVMe | 4214 RAID | 倍数 |
|---|---|---|---|
| Read IOPS | 803,000 | 37,800 | 21.2x |
| Read avg lat | 142 us | 2,440 us | 0.06x |
| Write IOPS | 344,000 | 16,300 | 21.1x |
| Write avg lat | 40 us | 2,189 us | 0.02x |
8.6 磁盘配置与性能总结
| 项目 | R670 (数据盘) | 4214 (数据盘) |
|---|---|---|
| 设备类型 | NVMe SSD (直通, 不走RAID) | SAS/SATA SSD (RAID VD, 走RAID卡) |
| 具体型号 | Dell PM9D3a RI U.2 7.68TB | 未知(RAID 控制器隐藏底层盘信息) |
| 颗粒类型 | TLC (Samsung V-NAND OEM) | 未知 |
| 接口 | NVMe PCIe (直连CPU) | PERC H730P (SAS 12Gb/s, 2GB BBU cache) |
| 定位 | Read-Intensive 企业级 | 通用企业级 |
| 容量 | 7.68 TB | ~1.8 TB (RAID VD) |
性能对比总结(单队列延迟 = 数据库最关心的指标):
| 指标 | R670 NVMe | 4214 RAID SSD | R670 优势 | 对 MySQL 的影响 |
|---|---|---|---|---|
| 4K 随机读延迟 | 64.6 us | 101.3 us | 1.6x | data page 随机读 |
| 4K 随机写延迟 | 11.7 us | 61.6 us* | 5.3x | redo log fsync |
| 高并发随机读 IOPS | 1,315K | 70.9K | 18.5x | 高并发 OLTP |
| 顺序写带宽 | 6,768 MB/s | 302 MB/s | 22.4x | binlog / backup |
*4214 写延迟受 RAID BBU 写缓存加速。从 IOPS 和延迟数据综合判断,4214 RAID 后面是 SSD(非 HDD),因为 HDD 4K 随机读只能做到 100-200 IOPS / 5-10ms 延迟,而 4214 实测 9,801 IOPS / 101us,这是 SSD 的特征。
关键差异来源:
- NVMe 直通 vs RAID 控制器:R670 的 NVMe 直连 CPU PCIe 总线,省去了 RAID 控制器的转发开销(~30-50us)
- PM9D3a 企业级 NVMe:三星 OEM 旗舰企业盘,内部并行度高(多 die 并发)
- 队列深度利用:NVMe 原生支持 64K 队列深度 × 64K 队列数,而 RAID 卡受限于控制器处理能力
- 写路径:NVMe 写直达闪存控制器(11.7us),RAID 卡写入 BBU 缓存后返回(61us,含 RAID 逻辑开销)
9. 综合对比总结
9.1 性能倍数一览
| 指标 | R670 相对 4214 | 主要原因 |
|---|---|---|
| 单核 IPC | 1.49x | Granite Rapids 微架构 |
| 单核计算(7^999999) | 1.89x | IPC + 频率 |
| 单核 AES 吞吐 | 1.58x | 频率 + AES-NI 优化 |
| 全核 AES 吞吐 | 2.88x | 核数 + 单核性能 |
| 单核内存读带宽 | 1.78x | DDR5 带宽 |
| 多核聚合内存带宽 | 3.0x | DDR5 × 多通道 |
| L3 容量 | 4.3x | 72MB vs 16.9MB |
| 内存绝对延迟 (@256MB) | 0.88x (慢14%) | DDR5 CAS latency 高 |
| 跨 NUMA 延迟惩罚 | 2.16x vs 1.62x | UPI 距离 + snoop 开销 |
| 4K随机读 IOPS (高并发) | 18.5x | NVMe vs RAID |
| 顺序读带宽 | 3.0x | NVMe PCIe5 vs RAID |
| 顺序写带宽 | 22.4x | NVMe vs RAID BBU |
9.2 结论
- CPU 计算能力:R670 单核比 4214 快 89%(IPC 2.72 vs 1.82 + 频率差),在所有历史测试 CPU 中单核性能最强
- 内存子系统:
- 带宽:DDR5-6400 单核 1.78x,多核聚合 3.0x——多线程数据库场景的核心优势
- 延迟:DDR5 绝对延迟更高(111ns vs 89ns)——但被 72MB L3 缓存弥补
- 内存墙结论:R670 通过 “超大 L3 + 超高带宽” 两手策略应对内存墙,延迟敏感路径靠 L3,带宽敏感路径靠 DDR5 多通道
- 存储:NVMe 对 RAID 是降维打击,不在同一量级(18-50x 差距)
- NUMA:R670 跨 socket 惩罚(2.16x)比 4214(1.62x)更大,务必绑定 NUMA
- 适用场景:R670 极适合 MySQL 主库、Redis、低延迟中间件
9.3 内存墙假设验证总结
结论:假设成立但需要修正表述。
- ✅ 带宽层面:DDR5-6400 确实是最大差异因素,提供 3x 聚合带宽,多线程 memory-bound 场景直接受益
- ⚠️ 延迟层面:DDR5 延迟反而更高 14-25%(取决于 working set 大小)。但 R670 用 72MB L3(4.3x容量)把”内存墙”推后了——只有 working set > 72MB 才真正碰到 DDR5 的高延迟
- ✅ 实际数据库效果:MySQL buffer pool 的 hot page 如果在 72MB 以内(非常多 OLTP 场景满足),R670 以 43ns L3 延迟服务,而 4214 在 17MB 就溢出到 89ns 内存——等效延迟 R670 反而快 35-50%
附录 A:R670 6517P 完整 lat_mem_rd 原始数据(-t 512M)
1 | Size(MB) Latency(ns) |
附录 B:4214 完整 lat_mem_rd 原始数据(-t 512M)
1 | Size(MB) Latency(ns) |
附录 C:历史 CPU 性能基准(来自 wiki 数据)
单核计算 7^999999
| CPU | 耗时(秒) | IPC | 主频 | 架构 |
|---|---|---|---|---|
| R670 Xeon 6517P | 11.35 | 2.72 | 3.2G | Granite Rapids |
| Xeon 4214 | 21.46 | 1.82 | 2.2G | Cascade Lake |
| Intel 710 | 15.83 | 2.64 | 2.75G | (未知型号) |
| Intel 8269CY | 18.60 | 2.19 | 2.5G | Cascade Lake |
| 鲲鹏920-4826 | 24.60 | 1.84 | 2.6G | ARM v8 |
| 海光 C86 5280 | 26.73 | 0.92 | 2.5G | Zen1 (AMD授权) |
| 飞腾 FT2500 | 39.65 | 0.43 | 2.1G | ARM v8 |
OpenSSL aes-256-cbc 单核 (8192B block)
| CPU | 吞吐 (KB/s) | 主频 |
|---|---|---|
| R670 Xeon 6517P | 263,400 | 3.2G |
| Xeon 4214 | 166,530 | 2.2G |
| Intel 8269CY (52核) | ~89,600 (参考) | 2.5G |
| 鲲鹏920 | ~143,196 | 2.6G |
| 海光 C86 5280 | ~79,555 | 2.5G |
历史 lat_mem_rd 内存延迟(local NUMA, @64MB -t 64M)
| CPU | Local Memory Latency (ns) | 内存规格 | L3 大小 |
|---|---|---|---|
| R670 6517P | 53.9* (@64MB仍在L3!) | DDR5-6400 | 72MB |
| Intel 8269CY | 69.8 | DDR4-2666 | 36MB |
| Intel 8163 | 67.1 | DDR4-2666 | 33.8MB |
| AMD EPYC 7T83 | 71.7 | DDR4-3200 | 256MB(L3) |
| 海光 7280 | 106.8 | DDR4 | 128MB |
| 海光 5280 | 102.6 | DDR4 | 32MB |
| 鲲鹏920 | 117.3 | DDR4 | 48MB |
| 飞腾2500 | 150.0 | DDR4 | 64MB |
| 申威3231 | 215.1 | DDR4 | 64MB |
*注:R670 在 @64MB 时数据仍在 72MB L3 缓存内,并非真实内存延迟。其真实内存延迟为 102-111ns (@256-512MB)。