article detail
퓨리오사AI 검증해보니…HBF 적용하면 LLM 작업시간·에너지 효율 모두 개선
2026. 10. 7. 오전 12:43

AI 요약
퓨리오사AI와 UC버클리 연구진은 LLM 추론 환경에서 HBF를 메모리 계층에 추가하는 시뮬레이션 결과 전체 작업시간이 기존 시스템 대비 최대 86% 감소하고 에너지 소비량도 60% 줄었다고 발표했습니다. 연구진은 GPU당 HBM 8개·HBF 8개 배치(스택당 HBM 24GB, HBF 375GB, GPU당 전체 HBM 192GB·HBF 3TB)에서 자주 쓰는 KV캐시는 HBM에, 재사용 예상되는 오래된 KV캐시는 HBF에 보관해 서버로의 재불러오기나 문맥 재계산 부담을 줄였다고 설명했습니다. 메모리 업계에서는 지난 8월 SK하이닉스가 샌디스크와 함께 OCP를 통해 HBF 표준규격(최대 512GB 스택·대역폭 약 0.4TB/s~3.0TB/s)을 공개했고, 삼성전자는 zNAND-O 등 낸드 적층 기술을 개발하고 있습니다.