NVMe FDP 如何优化 RocksDB 性能?大普微 R6101 实测验证
作为当前主流的 LSM-Tree 键值存储引擎,RocksDB 被广泛应用于分布式数据库、云原生存储与边缘计算等核心场景。然而,一个长期存在的问题正在影响这类系统的性能与闪存寿命:主机侧掌握着完整的数据生命周期信息,却无法通过传统块存储接口传递给底层 SSD。
这种主机与设备之间的语义壁垒,让不同寿命的数据在闪存介质中被混合存放,持续放大 SSD 内部的垃圾回收开销。而 NVMe FDP(灵活数据放置)正是当前填补这一语义鸿沟的主流标准方案。本文基于原生支持 NVMe FDP 的大普微 R6101 系列企业级 SSD,解析该技术在 RocksDB 中的运行机制,并以实测数据进行验证。
▶▶ 一图看懂 FDP 如何提升 RocksDB 性能

▶▶方案详解
01 | RocksDB 数据混写与写放大的成因
RocksDB 的数据天然带有鲜明的生命周期特征:预写日志(WAL)在内存表刷盘为 SST 后即被废弃,生命周期极短;而 LSM-Tree 中的 SST 文件,存活时间随层级向下呈阶梯化递增。越上层的文件因频繁参与 Compaction 而快速消亡,越沉淀至底层的数据存活越久。
受限于传统块存储接口的语义缺失,这些寿命各异的数据会被 SSD 的闪存转换层无差别地交织写入相同的 NAND 物理块。当大量短生命周期数据快速失效后,SSD 在垃圾回收释放空间时,被迫将同一物理块中仍然存活的长生命周期数据搬移至新块。
这种因生命周期混写导致的有效数据反复搬移,正是设备级写放大与性能抖动的根源。它消耗的不只是闪存的擦写寿命,还有 SSD 内部本应服务于前端 I/O 的带宽与主控算力。
02 | NVMe FDP 的数据隔离机制
NVMe FDP 的核心思路,是将主机端的数据放置策略与 SSD 内部的物理介质分配机制打通。
在具体实现上,RocksDB 通过数据放置标识符(Placement Identifier, PID),将具有相同生命周期的 I/O 流映射到 SSD 内部对应的回收单元句柄(Reclaim Unit Handle, RUH):为 WAL 分配独立的 PID,并将 SST 文件按 LSM-Tree 层级分配至不同的 PID。SSD 控制器接收到带有特定 RUH 指令的数据后,将其写入独立的物理回收单元(Reclaim Unit, RU)。
不同生命周期的数据自此在介质底层实现物理隔离,数据混写问题得到有效缓解。这为 RocksDB 带来以下工程实际收益:
1. 降低写放大:NAND 同一物理块内的数据失效时间趋于集中。触发垃圾回收时,目标块内的有效数据占比大幅减少,从而显著降低了主控对底层数据的冗余搬移。
2. 延长闪存寿命:数据搬移量的减少,直接降低了 NAND 闪存额外的编程/擦除操作,有效减缓了 LSM-Tree 写入密集场景下的物理磨损。
3. 改善性能:垃圾回收开销的下降缓解了对 SSD 内部带宽与主控算力的抢占,有效减少了前端 I/O 的排队阻塞,从而保障了更稳定的吞吐量与更低的长尾延迟。
03 | 基于大普微 R6101 的性能测试验证
测试环境配置

测试负载配置

R6101 在硬件架构与固件算法上实现了深度的物理数据隔离,保障高并发读写下吞吐量的稳定输出与长尾延迟的有效收敛,是本次性能验证的关键支撑。
测试结果
1. 不限制压测写入速度

图1. RocksDB前端压测吞吐量对比

图2. Compaction读写吞吐对比
在不限制压测写入速度时,开启 FDP 后,RocksDB 前端压测吞吐量从 163.7 MB/s 提升至 200.3 MB/s,增幅 22.36%;后台 Compaction 的读、写吞吐量也分别获得 18.33% 与 18.37% 的增长。这组数据表明,FDP 功能可以有效提高系统处理高并发数据写入的整体能力。
2. 控制压测写入速度为150 MiB/s

图3. 负载各分位数延迟对比

图4. Stall停顿次数对比
将写入负载恒定控制在 150 MiB/s、观测系统稳定性时,各分位数的响应时间均有缩短,其中最关键的 P99.9 长尾延迟从 20890.6μs 大幅降至 5918.3μs,降幅高达 71.7%。同一恒定负载下,Stall 发生次数从 4.34 亿次骤降至 2510 万次,减少了 94.22%。面对持续写入,系统能够提供更加平稳、可预期的服务质量,极端请求超时的概率被大幅压低。
以上测试数据表明,数据库引擎的长尾延迟与系统级停顿,根源在于 SSD 无序垃圾回收引发的突发性 I/O 拥塞。依托 R6101 对 FDP 的原生支持,介质层面的不可预期阻塞被大幅削减,底层 I/O 响应的确定性向上传导至应用层,直接表现为停顿次数与长尾延迟的显著收敛。
04 | FDP 多场景应用价值
RocksDB 的 I/O 模型 在分布式架构中具备高度代表性。本次验证不仅证实了 FDP 数据隔离机制的工程有效性,也说明该技术在一切存在明显数据生命周期差异的业务场景中,都拥有广泛的适用空间:
1. AI 数据密集型场景:优化训练、缓存等不同生命周期数据的放置
2. 多租户云存储:隔离不同租户的 I/O 流,避免相互干扰
3. CDN 缓存节点:区分冷热数据,收敛回收开销
4. 大规模日志与流式处理平台:为高频写入负载提供稳态支撑
在这些高负载场景中,大普微 R6101 系列企业级 SSD 能够以更低的写放大,为业务的高吞吐与低延迟运行提供确定性的底层支撑。
从 FDP 的数据隔离,到更广义的主机与介质协同,企业级存储的演进方向表明,SSD 正深度参与数据的全生命周期管理,成为智能数据基础设施的重要一环。
