giip
SES 안건 등록
AI GPU SERVER MANAGED OPERATIONS

NVIDIA DGX/HGX를 AI가 24시간 모니터링하고 운영합니다.

Linux만으로는 보이지 않는 GPU, ECC, XID, NVLink/NVSwitch, BMC 상태까지 통합 모니터링합니다. GIIP AI가 이상의 영향 범위와 원인을 분석하고, 필요한 대응을 제안·기록·실행합니다.

DGX OS·Ubuntu·HGX·DCGM·Prometheus·Redfish/IPMI 지원

DCGM·Prometheus·Redfish가 서버 상태를 수집하고, GIIP AI가 로그·메트릭·변경 이력을 분석해 장애 원인과 대응 방법을 제안합니다. 안전한 정형 작업은 Runbook으로 실행하고, GPU Reset·재시작·Firmware 업데이트 같은 고위험 작업은 고객 승인 후에 실행합니다.
문제

GPU 서버는 일반적인 Linux 모니터링만으로는 운영할 수 없습니다.

CPU와 메모리 그래프를 봐도 GPU 장애는 알 수 없습니다. DGX·HGX에는 OS 아래 층에 고유한 장애 방식이 있습니다.

!

OS 모니터링으로는 GPU 장애를 알 수 없다

OS의 CPU·Memory 모니터링만으로는 ECC, XID, 온도에 따른 스로틀링 같은 GPU 장애를 파악할 수 없습니다.

!

XID·ECC·NVLink 장애를 판단할 담당자가 없다

XID 코드, ECC 경향, NVLink 장애를 읽고 의미를 판단할 수 있는 담당자는 많지 않습니다.

!

Driver·CUDA·Toolkit 불일치 위험

Driver·CUDA·Container Toolkit·Fabric Manager가 지원되는 조합에서 벗어나 조용히 워크로드를 망가뜨립니다.

!

책임 경계가 불분명

DC·서버 벤더·NVIDIA·고객 사이에서 어디까지가 누구 담당인지 불분명해지기 쉽습니다.

GIIP의 운영 방식

통합 모니터링, AI 원인 분석, 그리고 승인제 실행.

DCGM·Prometheus·Redfish가 상태를 수집하고, GIIP AI가 원인과 권장 대응으로 바꿉니다. 안전한 작업은 자동으로 실행하고, 고위험 작업은 승인을 기다립니다.

모든 층을 하나의 뷰로

Linux, GPU, GPU 장애, NVLink/NVSwitch Fabric, BMC를 네 개의 흩어진 도구가 아니라 하나의 통합 뷰로 봅니다.

AI는 단순 알림이 아니라 대조한다

GIIP는 로그·메트릭·변경 이력을 결합해 원인을 추정합니다. 단일 임계값 알림이 아닙니다.

승인제 실행

안전한 Runbook은 자동으로 실행하고, GPU Reset·재시작·Firmware 업데이트는 승인 후에만 실행합니다.

기록과 보고

모든 대응을 Issue와 월간 보고에 기록해 나중에 추적할 수 있게 합니다.

COMPONENT ROLES

GIIP는 DCGM·Prometheus를 대체하지 않습니다

GIIP는 기존 모니터링 스택을 대체하는 것이 아니라, 그 위에 통합 뷰와 AI 분석, Issue 관리, 승인·실행·감사 로그를 얹습니다. 각 구성 요소의 역할은 다음과 같습니다.

DCGM ExporterGPU의 메트릭과 장애 정보(사용률·온도·ECC·XID 등)를 수집합니다.
node_exporterLinux의 CPU·메모리·디스크·네트워크 등 메트릭을 수집합니다.
Prometheus시계열 메트릭을 저장하고 알림 규칙을 평가합니다.
Alertmanager발생한 알림을 라우팅·중복 제거·억제합니다.
RedfishBMC 상태 조회·제어의 첫 번째 선택지(표준 API)입니다.
IPMI 2.0Redfish를 쓸 수 없는 장비를 위한 대체 수단입니다.
Grafana운영 담당자가 깊이 있게 살펴보는 대시보드입니다.
GIIP위 요소를 아우르는 통합 뷰, AI 원인 추정, Issue화, 대응 제안, 승인, 실행, 감사 로그를 담당합니다.

GIIP는 DCGM이나 Prometheus의 대체재가 아닙니다. 기존 모니터링 자산을 그대로 살리고, 그 위에 판단과 운영의 층을 더하는 위치입니다.

MONITORING SCOPE

모니터링 대상

Linux 표준 모니터링만으로는 보이지 않는 GPU·Fabric·BMC 층까지 다음 범위를 통합해 모니터링합니다.

Linux

  • CPU
  • Memory
  • Filesystem
  • NVMe
  • Network
  • Process
  • Service

GPU(GPU별)

  • Utilization
  • Memory
  • Temperature
  • Power
  • Clock
  • Throttle

GPU 장애

  • ECC
  • XID
  • PCIe Replay
  • Retired Pages
  • Row Remapping

Fabric

  • NVLink
  • NVSwitch
  • Fabric Manager

BMC

  • PSU
  • Fan
  • Temperature
  • Voltage
  • System Event Log

모니터링 기반

  • Exporter 중단
  • Metric 누락
  • Prometheus 수집 실패

소프트웨어 호환성

  • DGX OS
  • Ubuntu
  • Driver
  • CUDA
  • Container Toolkit
AI OPERATION FLOW

AI 운영 흐름

GIIP AI는 단순 임계값 알림이 아니라 여러 신호(로그·메트릭·변경 이력)를 결합해 분석합니다. 다만 완전 자동·무조건 자동 복구는 하지 않습니다.

  1. 1

    DCGM·Prometheus·Redfish에서 상태를 수집합니다.

  2. 2

    GIIP가 로그·메트릭·변경 이력을 통합해 분석합니다.

  3. 3

    영향 범위·추정 원인·권장 대응을 제시합니다.

  4. 4

    안전한 Runbook은 실행하고, 고위험 작업은 승인을 요청합니다.

  5. 5

    결과와 재발 방지책을 Issue·월간 보고에 기록합니다.

AI는 여러 신호를 대조해 원인을 추정하지만, GPU Reset이나 재시작처럼 되돌리기 어려운 작업은 고객 승인을 거친 뒤 실행합니다.

ARCHITECTURE

권장 아키텍처

기존 장비 구성을 존중하면서 모니터링과 제어 경로를 안전하게 놓습니다.

DGX/HGX OS

node_exporter, DCGM Exporter, NVSM, Fabric Manager가 동작합니다.

BMC

Redfish를 우선하고, 지원하지 않는 장비는 IPMI 2.0으로 대체합니다.

Central

Prometheus·Alertmanager·Grafana·GIIP를 집약합니다.

Connection

Management VLAN → VPN 또는 GIIP Connector → Central 경로로 연결합니다.

BMC를 인터넷에 직접 노출하지 않습니다. 관리 네트워크와 VPN·전용 커넥터를 통해서만 접근합니다.

PRICING

요금

기준 단위는 1 DGX/HGX(8 GPU 물리 노드)입니다. ja·en 페이지에서도 KRW로 참고 표시합니다. 실제 계약은 일본은 JPY, 한국은 KRW로 견적하며 자동 환산은 하지 않습니다.

DGX Monitoring

400,000 KRW

24×365 자동 모니터링, 알림, 월간 보고.

DGX Standard

800,000 KRW

모니터링, OS·GPU 소프트웨어 관리, 1차 분석, NVIDIA·OEM 문의.

DGX Premium

1,500,000 KRW

긴급 대응, CUDA·컨테이너 관리, 성능·장애 분석, 복구 지원.

AI Platform Managed

2,500,000 KRW~

Kubernetes·Slurm·테넌트·큐·모델 런타임 운영.

"24×365"는 자동 모니터링을 뜻합니다. 별도 SLA가 없는 한 사람에 의한 상시 대응이나 복구 시간을 보장하지 않습니다.

권장 표준 패키지

많은 고객에게 처음 권해 드리는 구성입니다.

초기 통합 구축
1,500,000 KRW
월 운영
1,000,000 KRW / 노드
계약 기간
12개월
세금
별도
구성 변경·기술 지원
월 최대 5시간

가격은 KRW이며 세금 별도입니다. 노드 수와 작업량에 따라 개별 견적합니다.

포함되는 것

  • 인벤토리(구성 정리)
  • Health Check(초기 건전성 확인)
  • Exporter·Prometheus·Alertmanager·Redfish·IPMI·GIIP 통합
  • AI 장애 분석
  • 승인된 Remote Recovery(원격 복구)
  • NVIDIA·OEM용 진단 자료 작성
  • 월간 보고

별도 견적 대상

  • 랙·전원·냉각·네트워크
  • 하드웨어 구매
  • NVIDIA License·Support
  • 현장 작업(온사이트)
  • 부품
  • Backup Storage
  • Kubernetes·Slurm·Run:ai 도입
  • 고객의 Model·RAG·Inference 애플리케이션
  • 대규모 Upgrade·Migration
  • Forensics(포렌식)
  • 보증·SLA
  • NVL72·멀티 노드·멀티 사이트·액체 냉각(Liquid Cooling)
SAFETY & RESPONSIBILITY

안전·승인·책임 범위

되돌리기 어려운 작업에는 반드시 고객 승인을 거칩니다.

GIIP가 자동으로 하는 것

  • 상태 수집
  • 이상 감지
  • 분석
  • 알림
  • Issue 생성
  • 승인된 Runbook 실행
  • 보고

고객 승인이 필요한 것

  • GPU Reset
  • Power Cycle
  • 재시작
  • Driver·CUDA·Firmware 업데이트
  • Job 중지
  • 권한·Firewall 변경
  • 삭제·되돌릴 수 없는 작업

DC·NVIDIA·OEM 담당 범위

  • 전원
  • 냉각
  • 케이블링
  • 온사이트 점검
  • 부품 교체
  • 보증
  • 유상 지원

GIIP는 "NVIDIA 공식 파트너", "NVIDIA 인증 서비스" 등 확인되지 않은 명칭을 사용하지 않습니다.

이것으로 얻는 것

GPU·NVLink·BMC

Linux를 넘어선 통합 뷰

24×365

자동 모니터링(SLA는 별도)

승인제

고위험 작업은 고객 승인 후

감사 로그

모든 대응을 기록·추적

자주 묻는 질문

일반적인 Ubuntu 서버 운영과 무엇이 다른가요?

일반 서버 운영은 OS(CPU·Memory·Disk)를 봅니다. 이 서비스는 거기에 GPU 층을 더합니다 — DCGM 메트릭, ECC/XID 장애, NVLink/NVSwitch Fabric, BMC, 그리고 GPU 신호가 무엇을 뜻하는지에 대한 AI 분석입니다.

DGX 외의 HGX나 OEM GPU 서버도 지원하나요?

지원합니다. DGX를 기준으로 하되, HGX 베이스보드나 Ubuntu에서 동작하는 OEM GPU 서버도 DCGM·node_exporter·Redfish 또는 IPMI를 쓸 수 있는 한 대상입니다.

기존 Prometheus/Grafana를 재사용할 수 있나요?

가능합니다. GIIP는 이를 대체하지 않고 위에 통합 뷰, AI 원인 분석, 승인, 감사 로그를 얹습니다. 기존 Prometheus·Grafana는 그대로의 역할로 사용합니다.

Redfish와 IPMI는 어떻게 고르나요?

Redfish는 표준 API라 첫 번째 선택지입니다. IPMI 2.0은 Redfish를 지원하지 않는 장비를 위한 대체 수단입니다. BMC는 인터넷에 직접 노출하지 않습니다.

GPU 장애 시 자동으로 재시작하나요?

하지 않습니다. 감지·분석·알림은 자동이지만, 재시작·GPU Reset·Power Cycle은 고객 승인 후에만 실행합니다. 무조건 자동 복구는 하지 않습니다.

NVIDIA Support 계약이 없으면 어떻게 되나요?

모니터링·분석·복구 지원은 진행하고, NVIDIA나 OEM이 요구하는 진단 자료도 작성합니다. 보증·유상 지원·NVIDIA 라이선스는 계속 고객의 계약입니다.

Kubernetes·Slurm은 어디까지 대응하나요?

기본 플랜은 노드·GPU·BMC까지입니다. Kubernetes·Slurm·테넌트/큐·모델 런타임 운영은 AI Platform Managed 플랜으로 별도 견적합니다.

DC 전력·냉각은 누구 담당인가요?

전원·냉각·케이블링·온사이트 점검·부품 교체는 DC·NVIDIA·OEM 담당입니다. GIIP는 모니터링·분석·승인된 원격 복구를 담당합니다.

24시간 유인 대응이 있나요?

24×365는 자동 모니터링을 뜻합니다. 별도 SLA가 없는 한 사람에 의한 상시 대응이나 복구 시간을 보장하지 않습니다. 필요하면 SLA로 별도 합의합니다.

여러 Node의 가격은 어떻게 되나요?

기준 단위는 1 DGX/HGX(8 GPU 노드)입니다. 여러 노드는 노드 단위로 견적합니다. 권장 표준 패키지는 초기 통합 구축 1,500,000 KRW + 노드당 월 1,000,000 KRW, 계약 기간 12개월, 세금 별도입니다.

관련 역량 살펴보기

AI에게 GPU 서버의 모니터링·운영을 맡기세요.

어떤 DGX/HGX를 어떻게 배선해 운영하는지 알려주세요. 모니터링 범위, 책임 경계, 노드 단위 견적을 보여드리겠습니다.

contact@littleworld.net