정의

Sparse MoE Memory Demand Shift는 sparse MoE가 token당 active compute는 줄이지만 전체 expert weights를 memory에 상주시켜야 하므로 비용의 일부가 compute에서 memory capacity와 memory bandwidth로 이동하는 현상이다.

즉 sparse MoE는 비용을 없애는 것이 아니라 청구서의 위치를 바꿀 수 있다. 대형 serving에서는 batch가 커질수록 사용자마다 다른 expert 조합이 호출되어 전체 expert가 사실상 모두 뜨거워지고, full HBM residency가 필요해진다.

핵심 메커니즘

  • Token 하나는 일부 expert만 활성화한다.
  • 그러나 모든 expert weight는 언제든 호출될 수 있으므로 memory residency 문제가 생긴다.
  • 대형 commercial serving에서는 batch 다양성 때문에 expert locality가 약하다.
  • 작은 on-prem workload에서는 query domain이 좁아 일부 expert만 반복 호출될 수 있다.
  • 이 경우 HBM full residency 대신 server DRAM offloading이 가능해질 수 있다.

메모리 수요 해석

  • 대형 서빙 사업자: latency와 throughput 때문에 full HBM 상주가 필요할 가능성이 높다.
  • compliance on-prem 수요: 속도보다 data sovereignty가 중요하면 DRAM offloading을 감수할 수 있다.
  • 메모리 시장 관점: HBM 수요를 줄이는 것이 아니라, 기존에 도입하지 않았을 long-tail 수요가 RDIMM으로 생길 수 있다.

연결

출처

클리핑 · X