AI 자동화19분
GPU 병렬화 세 가지: 데이터 병렬, 텐서 병렬, 파이프라인 병렬
vLLM 문서에 GPU 16장으로 모델 하나를 띄우는 예시가 있습니다. 서버 두 대에 8장씩 꽂힌 구성인데, 명령에는 숫자가 두 개 들어갑니다.
vLLM 문서에 GPU 16장으로 모델 하나를 띄우는 예시가 있습니다. 서버 두 대에 8장씩 꽂힌 구성인데, 명령에는 숫자가 두 개 들어갑니다.
NVIDIA의 H100 제품 페이지와 H200 제품 페이지 사양표를 나란히 놓으면 이상한 점이 하나 보입니다. SXM 모델 기준으로 FP16 Tensor Core 성능이 둘 다 1,979 TFLOPS(희소성 기준 표기)이고, FP8도 3,958 TFLOPS로 같습니다. 같은 Hopper 아키텍처라 연산 칸은 한 자리도 …
H100 서버 견적서를 보면 사양표에 NVLink 900GB/s가 적혀 있습니다. 그런데 GPU 한 장을 여러 사람이 나눠 쓰는 방법을 찾아보면 이번에는 MIG라는 말이 나옵니다. 둘 다 NVIDIA의 데이터센터 GPU 이야기이고, 이름 첫 글자도 비슷해서 같은 계열의 기능처럼 들립니다. 실제로는 방향이 정반대입니다.