SK하이닉스·샌디스크 "HBF는 AI 모델 가중치, HBM은 KV 캐시" AI 메모리 역할 분리로 돌파구 마련 하나?

실시간 키워드

2022.08.01 00:00 기준

SK하이닉스·샌디스크 "HBF는 AI 모델 가중치, HBM은 KV 캐시" AI 메모리 역할 분리로 돌파구 마련 하나?

위클리 포스트 2026-08-06 01:53:48 신고

3줄요약

SK하이닉스와 샌디스크(SanDisk)가 공동 개발 중인 HBF(High Bandwidth Flash)의 구체적인 활용 방안이 공개됐다. 양사는 HBF를 AI 모델의 가중치(Model Weights) 저장용으로 활용하고, HBM(High Bandwidth Memory)은 실시간 연산에 필요한 KV 캐시(Key-Value Cache) 전용으로 사용하는 새로운 메모리 계층 구조를 제안했다.

현재 대규모 언어모델(LLM)은 대부분 HBM 하나에 모든 데이터를 저장한다. 여기에는 AI 모델의 가중치와 추론 과정에서 생성되는 KV 캐시가 모두 포함된다. 때문에 HBM 용량이 부족하면 GPU를 추가해야 하고, 이는 시스템 구축 비용을 크게 높이는 원인으로 지적돼 왔다.

AI 모델에서 가중치는 학습을 통해 생성된 모든 지식을 저장하는 데이터다.

예를 들어 1,000억(100B) 파라미터 모델을 FP16 형식으로 저장하려면 약 200GB의 메모리가 필요하다. 모델 규모가 커질수록 필요한 메모리도 비례해서 증가한다. 반면 KV 캐시는 성격이 다르다. LLM은 새로운 토큰을 생성할 때마다 이전 문맥(Context)을 반복 계산하지 않도록 중간 연산 결과를 KV 캐시에 저장한다. 문맥이 길어질수록 KV 캐시 용량도 계속 증가하며, 추론 과정에서 지속적인 읽기와 쓰기(Read/Write)가 반복된다.

현재는 이러한 두 종류의 데이터를 모두 HBM이 처리하고 있다.

문제는 HBM이 매우 비싸다는 점이다. HBM4 12단(Stack)은 약 36GB, 16단 제품도 약 48GB 수준의 용량만 제공한다. 대규모 AI 모델을 수용하려면 GPU 수 자체를 늘려야 하고, 이는 AI 서버 구축 비용을 급격히 증가시키는 원인이 된다.

SK하이닉스와 샌디스크는 이러한 현실의 복안으로 HBF를 제안했다. HBF는 HBM처럼 적층(Stacking) 구조를 사용하지만, DRAM 대신 NAND 플래시를 활용한다. 복수의 NAND 다이를 TSV(Through Silicon Via)로 연결하고 하단에 제어 로직 다이(Logic Die)를 배치한다. 

공개된 초기 규격은 최대 512GB 용량과 0.4~3TB/s의 메모리 대역폭을 지원한다.

하지만 NAND 자체는 DRAM보다 훨씬 느리다. 일반적으로 SRAM은 약 1ns, DRAM은 약 100ns 수준의 읽기 지연시간을 갖는 반면 NAND는 약 100μs 수준으로 훨씬 길다. 하지만 HBF는 수천 개의 NAND 채널을 동시에 병렬 접근하는 구조를 채택해 이러한 단점을 보완했다. 개별 셀의 응답 속도는 느리더라도 대규모 병렬 읽기를 통해 최대 3TB/s 수준의 대역폭을 구현하는 것이 핵심이다. 

단, 문제는 NAND의 구조적 특성에 있다. 쓰기 속도와 쓰기 내구성(Write Endurance)은 DRAM보다 크게 떨어진다. HBF가 지속적인 쓰기 작업이 발생하는 KV 캐시에는 적합하지 않다고 지적하는 이유다. 

하지만, AI 모델의 가중치는 한 번 로드된 이후 읽기(Read) 중심으로 활용되는 경우가 대부분이다. HBF의 가장 적합한 활용 분야로 지목받는 배경이다. 즉 AI 모델의 가중치는 HBF에 저장하고, 실시간으로 생성되고 갱신되는 KV 캐시는 기존 HBM 역할로 활용하는 계층형 메모리(Hierarchical Memory) 조합이 주목받고 있다. 

이러한 방식은 HBM 용량을 KV 캐시에 집중적으로 활용할 수 있다는 장점도 있다. HBM에서 가중치 저장 공간이 줄어들면 더 긴 컨텍스트(Context Window)를 지원하거나 더 많은 동시 추론 작업을 수행할 수 있게 된다.

문제는 HBF가 SSD만큼 저렴한 메모리가 될 가능성이 낮다는 데 있다. HBF 역시 TSV와 첨단 패키징 기술을 사용하기 때문에 일반 SSD보다 제조 비용이 높다. 그럼에도 HBM보다는 훨씬 낮은 비용으로 대용량 AI 모델을 저장할 수 있어 AI 인프라 구축 비용을 줄이는 데 분명 효과가 있다. 현행 HBM 중심 설계에서 HBM과 HBF를 함께 사용하는 계층형 메모리 아키텍처가 차세대 AI 서버 표준으로 발전할 가능성에 무게가 실리는 이유다.
 

실시간 키워드

  1. -
  2. -
  3. -
  4. -
  5. -
  6. -
  7. -
  8. -
  9. -
  10. -

0000.00.00 00:00 기준

이 시각 주요뉴스

알림 문구가 한줄로 들어가는 영역입니다

신고하기

작성 아이디가 들어갑니다

내용 내용이 최대 두 줄로 노출됩니다

신고 사유를 선택하세요

이 이야기를
공유하세요

이 콘텐츠를 공유하세요.

콘텐츠 공유하고 수익 받는 방법이 궁금하다면👋>
주소가 복사되었습니다.
유튜브로 이동하여 공유해 주세요.
유튜브 활용 방법 알아보기