这个我比较有经验, 没那么复杂, 单纯是因为写速度拉了, 甚至打不过SSD(图是我刚测的, CPU1上的2条128G, 这玩意还有NUMA). 现代PD分离推理至少要40GB/s的KVCache池速度(传输时间≤≤Prefill 耗时的 10%计算). 所以400Gb RDMA内存池更爽了.
现在回头看 Intel Optane PMem,确实有点生不逢时。 当我们开始讨论把 inference 的 KV cache 从内存 evict 到 SSD 时,它原本所在的位置,反而显得很有价值:不是取代 DRAM,也不是做一块更快的 SSD,而是在两者之间补上一层。 HBM → DRAM → PMem → SSD...