giip
SES 안건 등록
GPUインフラ参照のみGPU図形AIVLMQwen3-VLローカルLLMCADRTX 5090RTX PRO 6000B200企業向けAIハードウェア構成コスト

기업용 로컬 도면 AI에 필요한 GPU와 서버 구성 — 20명 이용 기준의 참고 비용

公開日 2026-08-27 · 更新日 2026-08-27 · 最終検証日 2026-08-27

結論

기업용 로컬 도면 AI 구축에는 GPU 선택·서버 구성·AI 처리 파이프라인·운용의 4가지를 세트로検討해야 합니다. GPU는 RTX 5090(개발 PoC) → RTX PRO 6000 Blackwell 96GB(기업용 1장) → RTX PRO 6000 ×2(20명 권장) → B200(대負荷·100B 이상 모델)로, 용도와 규모에 따라 단계적으로 선정합니다. AI 처리는 VLM으로 도면을 이해하고 Drawing JSON 또는 Geometry IR로 변환, CAD Engine으로 실제 도면을 생성, Validator로 검증하는 파이프라인 구성을 권장합니다. GPU 선택은「사용자 수 ÷ GPU 장수」가 아니라 VRAM 용량·모델 크기·동시 요청 수·응답 시간 목표로 산출합니다. B200은 20명 정도의 일반 업무에서는 불필요하며, 100B 이상의 대형 모델·복수 VLM 동시負荷·fine-tuning等の条件下에서 검토합니다.

この文書の適用条件

対象製品기업용 로컬 도면 AI 서버
確認バージョンRTX 5090 / RTX PRO 6000 Blackwell / B200 / Mac M4(2026년 8월 시점)
適用環境온프레미스(기업 내 서버실·콜로케이션)
必要権限없음(참조 전용)
実行影響없음(참조 전용)
再起動불필요
最終検証日2026-08-27

そのまま実行できるコマンド

GPU VRAM별 실행 가능 모델早見표(2026년 8월 시점)参照のみ
対象
NVIDIA GPU(RTX 5090 / RTX PRO 6000 / B100 / B200)
権限
없음(참조 전용)
変更作業
없음
Production実行
해당 없음
# GPU VRAM별 실행 가능 모델(양자화 조건은 FP16/INT4의 일반적인目安)

VRAM 24GB(RTX 5090 1장)
  FP16:   7B〜13B 양자화 불필요
  INT4:   14B〜30B 양자화로 적재 가능
  용도:   개발 PoC·개인 실험·간단한 도면 인식

VRAM 48GB(RTX 6000 Ada 1장)
  FP16:   13B〜30B 양자화 불필요
  INT4:   30B〜70B 양자화로 적재 가능
  용도:   개발 PoC 확장·간단한 CAD 도면 인식

VRAM 96GB(RTX PRO 6000 Blackwell 1장)
  FP16:   30B〜50B 양자화 불필요
  INT4:   50B〜110B 양자화로 적재 가능
  용도:   기업용 소규모(1〜5명)·Qwen3-VL-32B 1장

VRAM 192GB(B200 1장)
  FP16:   70B〜100B 양자화 불필요
  INT4:   100B〜400B+ 양자화로 적재 가능
  용도:   대규모·복수 VLM 동시 실행·fine-tuning

중요: 모델 크기는 VRAM 요건의 절반이 아닙니다.
예: Qwen3-VL-32B는 FP16에서 약 64GB 필요(32B 파라미터 × 2bytes).
양자화(INT4)로 약 16GB로 축소 가능하지만, 정밀도와 속도의 트레이드오프가 있습니다.

VRAM 요건은 모델 크기에 비례합니다. 양자화로 요건을 낮출 수 있지만, 정밀도가 저하될 수 있습니다. 실제 크기는 추론 프레임워크(llama.cpp / vLLM / Ollama)에 따라 다릅니다.

기업 20명용 GPU 수 산출考え方参照のみ
対象
GPU 사이징(기업 환경)
権限
없음(참조 전용)
変更作業
없음
Production実行
해당 없음
# 기업 20명에서의 GPU 수 산출식(예)

【조건 설정】
- 모델: Qwen3-VL-32B(FP16: 64GB VRAM)
- 동시 이용자: 20명
- 동시 요청: 최대 5병렬
- 1요청당 VRAM 사용량: 약 16GB(INT4 양자화 시)
- 응답 시간 목표: 30초 이내
- 1장 GPU VRAM: 96GB(RTX PRO 6000 Blackwell)

【계산】
1) 1장 GPU로 처리 가능한 동시 요청 수
   = 96GB / 16GB = 6병렬

2) 20명의 동시 요청을 처리하는 데 필요한 GPU 수
   = ceil(5 / 6) = 1장 ... 이론상 1장으로 가능

3) 실제로는 다음과 같은 여유를 가짐:
   - 사용자 증감 대응
   - 고장 시 백업 용량
   - 모델 업데이트 시 전환 시간
   → 결과: 2장 구성(레플리카 A / 레플리카 B)を 권장

【중요한 포인트】
「20명 = GPU 2장」이라고 반드시 같지는 않다.
실제 동시 요청 수·도면 페이지 수·해상도·모델 크기로 결과가 달라진다.
PoC로 실측하는 것이 유일한 확인 방법이다.

GPU 수의 결정은 사용자 수뿐 아니라 동시 처리하는 요청 수·1요청당 VRAM 소비량으로 결정됩니다. 최종 판단은 PoC로 실측하세요.

結果の読み方

意味確認するポイント
이용 목적해당 구성이 적합한 이용 장면대응하는 GPU·메모리 구성
GPU권장 GPU 모델메모리 용량·연산 성능
메모리GPU 메모리 또는 Unified Memory 용량실행 가능 모델 크기·양자화 조건
모델 기준해당 구성에서 동작이 예상되는 모델VRAM 요건·양자화 조건
参考 용도실제 업무 적용 장면동시 사용자 수·처리량
참고 비용GPU 단가 + 서버 일식(2026년 8월 시점 추정)환율·공급 상황에 따라 변동

こういう状況で使います

  • 로컬 도면 AI를 구축하고 싶지만 GPU 선택 기준이 막연하다
  • RTX 5090과 RTX PRO 6000 중 어느 것을 선택해야 할지 고민된다
  • Mac M4와 NVIDIA GPU 중 어느 것이 도면 AI에 적합한지 알고 싶다
  • 20명 규모의 도면 AI에 몇 개의 GPU가 필요한지 모르겠다
  • B200이 정말로 필요한지 판단할 수 없다
  • 기업 도면 AI 구축 비용의目安을 알고 싶다
  • VLM과 CAD Engine의 역할 분담이 막막하다

考えられる原因(可能性の高い順)

  1. 01

    GPU 선택이「가격순」으로 이루어지고 있다

    가장 강력한 GPU를 선택하면 된다는 생각은 올바른 사이징을 방해합니다. 필요한 VRAM 용량은 모델 크기·양자화율·동시 요청 수로 결정되므로, 가장 효과적인 GPU는 이것들에 따라 다릅니다.

  2. 02

    「사용자 수 = GPU 장수」라는 잘못된 공식

    GPU 선택의 표준 지표는 사용자 수가 아니라 VRAM 용량과 모델 크기입니다. 20명 환경에서도 1요청당 처리량에 따라 1장으로 충분한 경우가 있습니다.

  3. 03

    VLM과 CAD Engine의 역할 분담이 이해되지 않고 있다

    VLM은「무엇을 해야 하는지」를 판단하고, CAD Engine은「정확한 좌표와 형상으로 도면을 생성」합니다. VLM에 둘 다를 기대하면 좌표 정밀도 문제로 실패합니다.

  4. 04

    B200이 필요 이상으로 권장되고 있다

    B200은 가장 고성능 GPU이지만, 20명 수준의 일반 기업 용도에서는 과잉입니다. RTX PRO 6000 × 2장으로 충분한 경우가 많으며 비용 대비 효과에서 뒤처집니다.

確認手順

  1. 1

    현재 도면 처리의 작업량과 빈도를 파악한다

    参照のみ

    일일·월별 처리하는 도면 작업 수, 1작업당 페이지 수·해상도·포맷을 분석합니다. 이를 통해 필요한 VRAM과 처리 능력을 추정할 수 있습니다.

  2. 2

    목표로 하는 모델을 선정한다

    参照のみ

    소규모 검증은 4B~8B급 VLM, 개발 PoC는 8B~32B급 VLM,本番는 Qwen3-VL-32B 이상을 기준으로 합니다. 목표 모델이 결정되면 필요한 VRAM을 알 수 있습니다.

  3. 3

    PoC 환경에서 실제 VRAM 소비량을 측정한다

    선정한 모델로 실제 동시 요청을 보내 VRAM 사용량·응답 시간·용량을 확인합니다. 이론값이 아닌 실측值为 최종 판단 재료가 됩니다.

対応方法

すぐに実施できる低リスクの対応

  • PoC에서 실제 사용자 추세를 측정한다

    1일 동시 요청 수·도면 작업 수·평균 처리 시간을 실측하고, 그 값을 바탕으로 GPU 구성을 산출합니다. 추정이 아닌 실측이 정확한 사이징의 유일한 방법입니다.

  • 처리 파이프라인을 VLM과 CAD Engine으로 분리한다

    「AI에 도면을 생성시킨다」기보다는「AI에 판단시키고, CAD Engine에 생성시킨다」구조로 합니다. 이를 통해 VRAM 요건을 낮추고 정밀도를 향상시킬 수 있습니다.

事前検討が必要な変更

  • GPU 구성을 단계적으로 확장한다

    처음에는 RTX 5090 1장으로 PoC를 구축하고, 실측값에 따라 RTX PRO 6000 × 2장 구성으로 전환합니다. 한 번에 최종 구성을 구입하는 것이 아니라, PoC 결과를 바탕으로 단계적으로 확장합니다.

  • AI Gateway로 요청을 분산한다

    GPU 2장 구성에서는 AI Gateway를 사용하여 요청을 레플리카 A/B에 분산합니다. 이를 통해 동시 처리 능력이 향상되고, 고장 시 제한 운영이 가능해집니다.

  • 감시 체계를 구축한다

    GPU 사용률·VRAM 사용량·응답 시간·처리량을 감시합니다. 용량逼迫의 조기 감지와 스케일링 판단의 근거로 활용합니다.

専門家のレビューが必要な作業

  • B200의 채택을 판단한다

    専門家レビュー必須

    다음 조건이 모두 해당하는 경우에만 B200을 검토합니다: (1) 100B 이상의 모델 필요, (2) 복수 VLM 또는 Agent가 동시에 VRAM에負荷, (3) fine-tuning 또는 대규모 학습 실행, (4) 수백 페이지의 도면을 복수 프로젝트에서 동시에 처리. 20명 수준의 일반 업무에는 RTX PRO 6000 × 2장으로 충분합니다.

!注意事項

  • GPU 선택은「사용자 수 ÷ GPU 장수」가 아니라, VRAM 용량·모델 크기·동시 요청 수·응답 시간 목표로 결정됩니다.
  • 「20명 = GPU 2장」은 일례이며, 실제 구성은 PoC의 실측값에 따라 다릅니다.
  • B200은 20명 수준의 일반 기업 업무 용도에서는 불필요합니다. 100B 이상의 대형 모델·복수 동시負荷·fine-tuning 등의 조건에서만 검토합니다.
  • Mac M4의 Unified Memory는 개발·PoC 용도에서 장점이 있지만, CUDA 비지원·다수 인원 동시 이용·기업용 운영에는 NVIDIA이 우수합니다.
  • GPU 가격은 변동합니다. 참고 비용은 2026년 8월 시점 추정이며, 실제 비용은 다시 확인하십시오.
  • VLM에 CAD 도면의 직접 생성을 기대하면 좌표 정밀도 문제로 실패합니다. 역할 분담을 명확히 하십시오.

バージョン・環境による違い

GPU 모델의 선정 기준(2026년 8월 시점)RTX 5090: 개발 PoC·개인 실험 용도. RTX PRO 6000 Blackwell: 기업용 1장 구성의 표준. RTX PRO 6000 × 2: 20명 권장 구성. B200: 대규모·특수 용도.
모델 크기의 동향Qwen3-VL-32B는 FP16에서 64GB VRAM이 필요합니다. 양자화(INT4)로 약 16GB로 축소 가능하지만 정밀도와의 트레이드오프가 있습니다. 모델 크기와 VRAM 요건은 비례합니다.
Mac M4의 위치Mac M4 Max(128GB Unified Memory)는 개발·PoC 용도에서 유력한 선택지입니다. MLX / llama.cpp / Ollama / Metal 에코시스템을活用할 수 있습니다. 그러나 CUDA 비지원으로 인해,本番의 기업向け 다수 인원 동시 이용에서는 NVIDIA가 우수합니다.

これで解決しない場合に確認すること

  • 실제 도면 작업의 크기 분포를 확인한다

    도면 작업의 평균 페이지 수·해상도·포맷을 분석하여, 필요한 VRAM 용량의參考값을 구합니다.

  • 동시 요청数の実測値を確認する

    현재 시스템(또는 유사 시스템)의 동시 요청数 피크를 측정하여, GPU 구성 산출의 입력으로 활용합니다.

  • 모델 양자화의 정밀도 영향을 검증한다

    INT4 양자화 시 출력 정밀도가 업무 요건을 충족하는지 PoC로 확인합니다. 정밀도가 중요시되는 용도에서는 FP16 유지가 필요한 경우가 있습니다.

この文書の根拠と限界

実運用で確認した内容

본 문서의 GPU 비교표와 비용 안내는 2026년 8월 시점 공개 정보의 정리입니다. GPU 가격과 제공 모델은 변동하므로 실제 비용은 각 판매처에 직접 확인하십시오. VRAM 요건은 추론 프레임워크에 따라 다릅니다.

よくある質問

RTX 5090과 RTX PRO 6000은 어느 것을 선택해야 합니까?

개발 PoC·개인 실험 용도라면 RTX 5090(32GB), 기업용의本番 용도라면 RTX PRO 6000 Blackwell(96GB)을 권장합니다. RTX 5090은 개발 속도 우선, RTX PRO 6000은 VRAM 용량과 안정성 중시입니다.

정말로 GPU 2장이 필요합니까? 1장으로는 부족한 겁니까?

GPU 2장을 권장하는 이유는「동시 이용자 20명」때문에 1장으로 처리할 수 없기 때문이 아닙니다. 고장 시 백업 용량, 사용자 증가 대응, 모델 업데이트 시 전환 시간, 그리고今後の 확장성을 확보하기 위해서입니다. PoC로 실측하면 1장으로 충분한 경우도 있고, 그 경우에는 1장에서 시작하여 필요에 따라 확장합니다.

Mac M4는 도면 AI에 적합합니까?

개발·PoC 용도에서는 유력한 선택지입니다. Unified Memory의 대규모 용량과 MLX / llama.cpp / Ollama / Metal 에코시스템이 지원됩니다. 그러나 CUDA 비지원으로 인해,本番의 기업向け 다수 인원 동시 이용에서는 NVIDIA가 우수합니다. Mac을 시작점으로 하여 PoC 후 NVIDIA로 전환하는 전략도 있습니다.

B200은 정말로 필요합니까?

20명 수준의 일반 기업 업무에는 불필요합니다. B200이 정말로 필요한 경우는 (1)100B 이상의 대형 모델, (2)복수 VLM 동시 실행, (3)fine-tuning 또는 대규모 학습, (4)수백 페이지의 도면을 동시에 처리, 와 같은 조건에서만입니다. 그 외에는 RTX PRO 6000 × 2장으로 충분합니다.

GPU 비용은 얼마입니까?

2026년 8월 시점 참고 비용: RTX 5090(约 30〜50만 엔), RTX PRO 6000 Blackwell 1장(约 150〜200만 엔), RTX PRO 6000 × 2 구성(约 300〜400만 엔), B200(개별 견적). GPU 가격은 변동하므로 실제 비용은 판매처에 직접 확인하십시오. 서버 일식(CPU·RAM·스토리지·네트워크 포함)은 별도입니다.

VLM과 CAD Engine의 역할 분담은 어떻게 됩니까?

VLM은「어떤 부분을 어떻게 수정해야 하는지」라는 판단을 담당하고, CAD Engine은「정확한 좌표와 형상으로 도면을 생성」을 담당합니다. VLM에 좌표의 정밀한 생성을 기대하면 정밀도 문제로 실패합니다. 이 분리로 VRAM 요건 감소와 정밀도 향상을 동시에 실현할 수 있습니다.

この文書がカバーする質問

  • 기업용 도면 AI 서버의 구성을 알고 싶다
  • RTX 5090과 RTX PRO 6000 중 어느 것이 도면 AI에 적합한지
  • 20명 규모의 AI 서버에 필요한 GPU 수는 몇 개인지
  • Mac M4로 도면 AI를 구축할 수 있는지
  • B200이 정말로 필요한지

リスク表示の意味

  • 参照のみデータと設定を変更しません。
  • 影響は限定的ですが、権限と負荷の確認が必要です。
  • 性能・ロック・コストに影響する可能性があります。
  • 障害・データ損失・復旧作業が発生する可能性があります。
  • 専門家レビュー必須本番適用前に別途レビューが必須です。

GIIPの対応範囲

지금까지의 내용은 특정 GPU 제품에 의존하지 않는 일반적인 사이징 이야기입니다. 그 위에 GIIP가 어디를 담당하는지를 말하면, GIIP는 GPU 서버의 설계·선정, 모델의 도입·최적화, AI Gateway에 의한 요청 분산, GPU 사용률·모델 상태·응답 품질의 감시, 장애 대응, 모델 버전 업데이트, 비용 최적화, 용량 증설 판단 등 운용 층 전체를 커버하고 있습니다. GPU 자체의 구매나 설치는 고객의 담당이지만, 그 전후의 소프트웨어 층·운용 설계는 GIIP가 지원할 수 있습니다.

執筆・技術検証

GIIP プロダクション運用チーム

大規模Webサービス、SQL Server、Oracle、AWS、Azureの設計・移行・運用に約30年従事。x12largeクラスのAWS RDS for SQL Server環境12セット、約12万テーブルのOracle環境、約3TBのTiDBからAurora MySQLへの移行を経験。現在も複数のクラウドデータベースと約30のWebサービスを、AIエージェントと人間の専門家が継続的に監視・運用しています。

関連サービス

실제 도면을 통한 PoC를 통한 GPU 구성 확인은 GIIP로 대응 가능합니다

同じ確認を複数の環境で継続する必要がある場合は、運用体制ごと相談できます。

실제 도면을 통한 PoC를 통한 GPU 구성 확인은 GIIP로 대응 가능합니다

ナレッジベース一覧へ