AI 场景下,QLC SSD 兼顾性能与容量的新解法:SLC+QLC 双模方案
随着 AI 负载大规模进入数据中心,存储系统承载的业务类型更加多样:训练端需要海量数据的高吞吐承载,推理端则要求 TTFT 等关键指标的快速响应,容量、带宽与低延迟三重诉求集中落在同一套存储系统上。在传统异构存储架构中,SLC 与 QLC 分离部署各有优势。面对 AI 场景日益增长的高并发与大容量需求,二者协同仍有进一步优化空间。
大普微(DapuStor)自研 SLC + QLC 双模 SSD 方案(以下简称“双模”),凭借盘内双模融合的创新设计,突破了性能与容量难以兼顾的瓶颈,为构建 AI 场景存储系统提供了更优的解决方案。
01 创新双模架构:单盘实现SLC+QLC双模融合
双模方案的核心意义,在于以软件定义的创新,彻底打破了物理介质在性能与容量之间的传统边界。
技术原理:盘内模式智能切换
此方案无需额外搭载昂贵的独立SLC颗粒,而是基于固件与控制器的深度调优,将部分QLC单元智能配置为SLC模式。在单块QLC SSD内部,动态划分出 “高性能SLC高速区” 与 “大容量QLC存储区” ,真正实现了 一块盘搞定性能与容量的跨界突破。

灵活适配:按需定义容量配比
该方案提供灵活的容量配比选项,精准适配不同业务的压力场景。以30.72T QLC SSD为例:

相比传统的全QLC模式,该方案在提供高性能加速能力的同时,最大化保留存储容量,实现了性能与容量的更优平衡。
02 六大核心优势,全面超越传统架构
传统SLC与QLC分离部署的模式存在明显的物理资源浪费。双模方案通过架构革新,提升空间利用率的同时在六个维度展现出显著优势:

1.性能密度双重提升
传统分布式存储的异构部署存在明显的物理资源浪费:SLC专用盘占用了宝贵的服务器插槽,却仅能提供极小的有效容量,导致服务器整体存储密度大幅受限。同时,受限于介质特性,纯QLC盘片的随机写性能较低(约30K IOPS),极易成为系统瓶颈。
双模方案通过全槽位皆双模的策略,完美打破了这一局限:
● 密度层面: 24个槽位可全量部署大容量双模SSD,无需单独牺牲插槽给小容量加速盘。全槽位有效存储将单台服务器的空间利用率与容量密度推向极致。
● 性能层面: 双模单盘的平均随机写性能是传统分离部署下纯QLC单盘的7倍多。同时,传统分离部署可能仅有4块SLC,而双模方案24个槽位均自带SLC高速区。以“800G SLC + 26.51T QLC”的配置为例,24槽位服务器相当于直接内置了容量高达 19.2TB 的SLC高速区。
相比分离部署,双模方案不仅最大化了机架的存储容量,更让SLC高速区容量实现了成倍增长,系统整体的并发吞吐性能与高频数据承载力得到了指数级跃升。
2.PCIe通道负载均衡

传统1:N(SLC:QLC)异构配比中,单块SLC需同时承接多块QLC的写入压力,在 AI 训练的周期性突发写入等场景下,该盘对应的PCIe通道负载激增,而其他QLC对应通道负载不足,形成性能瓶颈,整体吞吐能力严重受损。

双模方案解决了传统架构的性能困境:24块双模SSD的SLC高速区共同分摊整体写入压力,每块盘仅需承担1/24的带宽负载,PCIe通道数据传输趋于均衡,无局部过载问题。这种设计能最大程度发挥硬件潜力,让存储集群的吞吐性能逼近理论上限。
3.8μs极致低延迟
双模方案通过三大固件优化技术,让SLC高速区性能达到行业顶尖水平:
● 采用Die隔离方案,SLC高速区独享硬件资源,杜绝性能干扰;
● 优化SLC预留空间比例,大幅降低写放大,兼顾稳态性能与使用寿命;
● 内部I/O按SLC、QLC分区精细化调度,全路径优先级管理,确保关键业务数据极速响应。
相较于传统架构中SLC盘因高负载沦为性能瓶颈,双模方案的负载分摊设计让SLC高速区始终保持低压力运行。实测数据显示,在4K随机写入场景下,双模方案的SLC写入平均延迟在8μs 以内,完美支撑数据库Journal、WAL日志及元数据缓存等低延迟需求。
4.故障域精准收敛

分布式存储的可靠性核心在于故障域控制。传统分离架构(通常1块SLC加速5块QLC)中,单块SLC故障会直接牵连5块QLC盘的数据。以30.72TB规格为例,单点故障将导致高达 150TB 的庞大故障域,数据重建往往耗时数天,严重拖累集群性能与可靠性。在 AI 实际业务场景中,重建期间的带宽占用会拉低数据供给速率,进而影响整个训练集群的运行效率。
双模方案通过盘内隔离设计,实现了故障域的绝对收敛。单块双模SSD故障时,数据恢复仅局限于该盘自身。相比传统架构,数据重建量锐减近80%,存储集群整体可靠性得到本质提升,为核心业务连续性提供坚实保障。
5.部署扩容零门槛
传统异构架构的1:N配比的严苛限制,让部署与扩容陷入两难:SLC盘不足则性能不达标,过多则占用插槽、降低容量密度;扩容时需严格维持配比平衡,否则会导致集群能力不均衡,给QoS管理带来巨大挑战。
双模方案采用全同构部署设计,所有SSD在性能和容量规格完全一致,无需复杂的配比计算。部署阶段即插即用,扩容时仅需批量添加双模SSD,集群会自动均衡负载与数据分布,大幅降低运维成本,完美适配业务的弹性增长需求。
6.TCO全面优化与系统寿命倍增
TCO全面优化
传统异构架构往往仅配备少量SLC盘进行有限加速,若要在传统架构下单独配置高达19.2TB的SLC SSD,其硬件采购成本将极其高昂。双模方案直接为系统(以24盘位800G为例)内生了19.2TB的专属SLC高速区,企业无需再为获取海量的SLC加速空间付出高昂费用,大幅降低TCO。
寿命大幅延长
双模架构极大延长了整体寿命。其pSLC(SLC高速区)的写入/擦除(P/E)Cycles可达常规QLC的25倍以上。在 AI 实际业务场景中,负载的写入强度显著高于传统业务,若直接落在 QLC 介质上,会缩短其使用寿命。双模架构通过介质分工、FDP技术与磨损均衡算法升级,pSLC与QLC在底层空间实现了完全的物理隔绝,高频随机擦写全部由pSLC承担,不消耗QLC的寿命配额。双模SSD的使用寿命较传统QLC SSD大幅延长,显著降低了存储集群的全周期生命成本。
03 面向AI应用,双模方案加速多场景落地
双模方案以其全维度优势,可广泛适配 AI 训练、数据库、云计算与大数据分析等核心场景:
| AI 训练
在大数据与 AI 训练中:海量训练数据沉淀于 QLC 存储区,高频读写的热点数据由 SLC 高速区承接,原本需跨两类介质完成的冷热分层被收敛进同一块盘内部,有效减少跨设备数据的迁移开销;
| 数据库
在数据库系统(如 MySQL/Oracle)中: pSLC 承接高频日志,QLC 保障大容量,实现提速与降本双管齐下;
| 云计算
在云计算与虚拟化中: 单盘即可兼顾虚拟机高并发启动与海量数据存放,大幅简化集群架构;
同时,双模方案尤其在 HDD 替代场景中展现出独特的成本优势。传统 HDD 常需额外部署 TLC SSD 作为性能缓存,双模 SSD 方案解决了这一问题:在以 QLC 替代 HDD 的同时,凭借自身 SLC 高速区的高性能表现,可直接省去 TLC 缓存层级,实现“加速+存储”的一体化部署。
目前,大普微SLC+QLC双模方案已进入客户灰度验证阶段,并逐步在实际业务场景中落地应用。随着AI从模型训练加速迈向规模化推理与应用落地,大普微持续推动存储技术创新,为AI业务的长期演进提供更加高效、可靠的存力支撑。
