LLM 서비스 운영에 B200은 몇 장이 필요할까?
모델 파라미터 크기, 목표 동시 요청 처리량, 최대 허용 지연 시간 요건으로부터 최적의 B200 클러스터 규모를 산출하는 방법을 정리했습니다.
"B200이 몇 장 필요한가"는 LLM 인프라 설계 시 가장 먼저 던지는 질문입니다. 그러나 이는 "우리 조직에 몇 명의 개발자가 필요한가"와 같아서 일괄적으로 단정할 수 없습니다. 필요한 GPU 장수는 가동하려는 모델의 VRAM 크기, 목표 동시 요청 처리량(Throughput), 응답 속도 SLA, 예산 범위 등을 종합 고려하여 수학적으로 도출해야 합니다.
GPU 필요 수량 산출 방법의 부재
검색해 보아도 "B200 몇 장이 적당하다"는 수치가 제각각이어서 신뢰할 수 있는 기술적 기준을 잡기 어렵습니다.
현재 API 트래픽을 GPU 인프라 규모로 환산 불가
현재 상용 API의 토큰 소비량과 초당 호출 수(RPS)로부터 자체 GPU 노드 수를 역산하지 못합니다.
동시 접속자 요건의 미정의
피크타임에 동시 유입되는 사용자 트래픽과 허용 가능한 지연 시간 기준이 명확히 수치화되어 있지 않습니다.
모델 크기에 따른 VRAM 요구량 격차
Llama 3.1 8B와 70B, 405B는 메모리 요구량이 수십 배 차이나므로 동일한 하드웨어 수량으로는 대응할 수 없습니다.
처리량과 응답 지연의 상충 관계
초당 처리 토큰 수(Throughput)와 사용자 응답 개시 시간(Time to First Token)은 트레이드오프 관계에 있어 구성 공식이 달라집니다.
텐서 병렬화와 칩 간 대역폭 제약
모델 파라미터가 단일 GPU VRAM에 담기는지, 여러 GPU로 분할(Tensor Parallelism)해야 하는지에 따라 노드 구성이 결정됩니다.
자사 AI 서비스의 모델 규격과 트래픽 프로파일을 정의하면 정확한 하드웨어 수량을 도출할 수 있습니다.
1단계: 서빙 모델 및 양자화 포맷 확정
Llama, Mistral 등 대상 모델 계열과 파라미터 수(8B, 70B, 405B), 그리고 가중치 정밀도(FP16, FP8, FP4)를 정해 기본 가중치 VRAM을 산정합니다.
2단계: 동시 요청과 KV 캐시 용량 계산
동시 접속자 수와 최대 컨텍스트 길이에 따라 메모리에 상주해야 하는 KV 캐시 총량을 계산하여 가중치 VRAM에 더합니다.
3단계: B200 칩당 가용 메모리 대입
B200의 고대역 HBM3e 메모리(192GB)를 기준으로 최소 GPU 수량을 산출하고, 텐서 병렬화 배수(2, 4, 8장)에 맞춥니다.
4단계: 피크타임 트래픽 기반 노드 복제
목표 초당 요청 수(RPS)를 처리하기 위해 계산된 최소 서빙 단위를 몇 개 복제(Replica)해야 하는지 결정합니다.
GPU 사이징 전 필수 확인 사항
- 운영할 LLM 모델 종류와 파라미터 크기 및 양자화 정책을 결정했는가
- 목표 초당 요청 수(RPS)와 최대 허용 대기 시간(지연 시간 SLA)을 정의했는가
- 피크타임 평균 입력 프롬프트 길이와 출력 토큰 길이를 측정했는가
- 상면 데이터센터 랙당 수용 가능한 전력 한계(예: 랙당 40kW 이상)를 확인했는가
- 초기 도입 예산 한도와 점진적 증설 계획을 수립했는가
자주 묻는 질문
Llama 3.1 405B 모델을 구동하려면 B200이 몇 장 필요한가요?
Llama 3.1 405B는 FP8 정밀도에서도 약 400GB 이상의 가중치 메모리가 필요하며 KV 캐시를 고려하면 최소 4~8장의 B200(NVLink 인터커넥트 필수)이 요구됩니다. 안정적인 고속 서빙을 위해서는 B200 8장 구성의 단일 서버 노드가 표준 권장 사양입니다.
GPU 간 인터커넥트 대역폭이 부족하면 어떻게 되나요?
GPU 간 통신 속도가 병목이 되어 연산 칩이 놀게 되므로, 모델 추론 속도가 급격히 저하됩니다. 대형 모델 서빙에는 NVLink 및 InfiniBand와 같은 초고속 패브릭이 필수적입니다.
초기에는 소규모로 시작하여 트래픽에 맞춰 늘릴 수 있나요?
가능합니다. 단일 노드(예: B200 4장 또는 8장)로 기본 인프라를 구축한 후, 트래픽 유입에 따라 동일 단위 노드를 수평 확장(Scale-out)하는 구조가 가장 안전합니다.
GPU 사이징 및 노드 구성 진단하기
모델 규격과 트래픽 요건을 바탕으로 최적의 B200 수량과 서버 구성을 산출해 드립니다.