AI 자동화20분
LLM 추론 GPU 메모리 계산: KV 캐시와 메모리 대역폭
NVIDIA의 H100 제품 페이지와 H200 제품 페이지 사양표를 나란히 놓으면 이상한 점이 하나 보입니다. SXM 모델 기준으로 FP16 Tensor Core 성능이 둘 다 1,979 TFLOPS(희소성 기준 표기)이고, FP8도 3,958 TFLOPS로 같습니다. 같은 Hopper 아키텍처라 연산 칸은 한 자리도 …
NVIDIA의 H100 제품 페이지와 H200 제품 페이지 사양표를 나란히 놓으면 이상한 점이 하나 보입니다. SXM 모델 기준으로 FP16 Tensor Core 성능이 둘 다 1,979 TFLOPS(희소성 기준 표기)이고, FP8도 3,958 TFLOPS로 같습니다. 같은 Hopper 아키텍처라 연산 칸은 한 자리도 …