정의
Sparse MoE Memory Demand Shift는 sparse MoE가 token당 active compute는 줄이지만 전체 expert weights를 memory에 상주시켜야 하므로 비용의 일부가 compute에서 memory capacity와 memory bandwidth로 이동하는 현상이다.
즉 sparse MoE는 비용을 없애는 것이 아니라 청구서의 위치를 바꿀 수 있다. 대형 serving에서는 batch가 커질수록 사용자마다 다른 expert 조합이 호출되어 전체 expert가 사실상 모두 뜨거워지고, full HBM residency가 필요해진다.
핵심 메커니즘
- Token 하나는 일부 expert만 활성화한다.
- 그러나 모든 expert weight는 언제든 호출될 수 있으므로 memory residency 문제가 생긴다.
- 대형 commercial serving에서는 batch 다양성 때문에 expert locality가 약하다.
- 작은 on-prem workload에서는 query domain이 좁아 일부 expert만 반복 호출될 수 있다.
- 이 경우 HBM full residency 대신 server DRAM offloading이 가능해질 수 있다.
메모리 수요 해석
- 대형 서빙 사업자: latency와 throughput 때문에 full HBM 상주가 필요할 가능성이 높다.
- compliance on-prem 수요: 속도보다 data sovereignty가 중요하면 DRAM offloading을 감수할 수 있다.
- 메모리 시장 관점: HBM 수요를 줄이는 것이 아니라, 기존에 도입하지 않았을 long-tail 수요가 RDIMM으로 생길 수 있다.
연결
- 20260603-llm-inference-roofline-analysis — inference의 memory-bound 구조.
- 20260605-memory-dual-market-hbm-pricing — HBM과 범용 DRAM의 이중 수요 프레임.
- 20260717-open-weight-compliance-demand — 오픈웨이트가 on-prem 수요를 여는 조건.