안녕하세요. 은호입니다.
최근 AI 모델은 같은 작업을 더 적은 연산과 메모리로 처리하는 방향으로 빠르게 발전하고 있습니다. 희소 어텐션과 하이브리드 구조가 확산되면서, 겉으로 보면 AI 인프라에 필요한 메모리도 함께 줄어들 것처럼 보입니다.
하지만 실제 추론 환경에서는 반대되는 변화가 동시에 나타나고 있습니다. 에이전트가 다루는 문맥은 길어지고 있고, 한 번에 처리해야 하는 요청도 늘어나면서 저장하고 다시 불러와야 할 데이터는 오히려 빠르게 커지고 있습니다.
이 변화가 중요한 이유는 AI 메모리의 병목이 사라지는 것이 아니라 위치를 바꾸고 있기 때문입니다. GPU 안의 HBM에 집중됐던 메모리 문제가 서버 D램과 스토리지, 인터페이스까지 어떻게 번지고 있는지 살펴보겠습니다.