1. 大模型推理的I/O瓶颈现状
当前大模型推理系统面临的核心矛盾,已经从单纯的计算能力不足转变为存储带宽与计算能力的不匹配。以DeepSeek-V3.2 660B模型为例,在典型Agent场景下(单轮平均追加429个token,KV-Cache命中率98.7%),其Cache-Compute比例高达22GB/PFLOP。这意味着每完成1PFLOP的计算,就需要搬运22GB的KV-Cache数据。
这种I/O密集型特征在现有架构中造成了严重的资源浪费:
- Prefill节点的存储网卡持续满载(利用率>95%)
- Decode节点的存储网卡长期闲置(利用率<5%)
- GPU计算核心因等待数据而空转(利用率仅30-40%)
硬件发展加剧了这一矛盾:从NVIDIA Ampere到Blackwell架构,GPU计算能力提升了8.3倍,而网络带宽仅增长1.7倍,I/O与计算的比例恶化了14.4倍。这种失衡导致在处理64K上下文长度时,系统吞吐量被限制在理论值的53%以下。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. DualPath架构设计原理
2.1 双路径数据流设计
传统Prefill-Decode分离架构的单一数据路径存在根本性缺陷:所有KV-Cache必须通过Prefill节点的存储网卡加载。DualPath的创新在于构建了两条并行数据通路:
- 经典路径:Storage → Prefill节点(传统方式)
- 新增路径:Storage → Decode节点 → RDMA → Prefill节点
这种设计带来了三个关键优势:
- 将单点带宽扩展为集群全局带宽
- 利用Decode节点闲置的存储网卡
- 通过计算网卡的高带宽特性弥补存储带宽不足
2.2 数学约束条件
为确保双路径架构的稳定性,研究团队推导出严格的数学约束。设:
- β:单节点存储网卡带宽
- γ:计算网卡带宽
- N:单节点GPU数量
- μ:内存带宽
则系统必须满足:
code复制(β/γ) < (N-1)/N
Σ(读流量) < μ
在实际硬件配置中(如NVIDIA HGX H100),这些条件天然成立:
- β=200Gbps(PCIe 5.0 x16)
- γ=400Gbps(InfiniBand NDR)
- N=8
- μ=3TB/s(HBM3)
