giip
SES案件登録
GPUインフラ参照のみGPU図形AIVLMQwen3-VLローカルLLMCADRTX 5090RTX PRO 6000B200企业向けAIハードウェア構成コスト

企業向けローカル図形AIに必要なGPUとサーバー構成 — 20名利用基準の参考費用

公開日 2026-08-27 · 更新日 2026-08-27 · 最終検証日 2026-08-27

結論

企業向けローカル図形AIの構築には、GPU選択・サーバー構成・AI処理パイプライン・運用の4つをセットで検討する必要があります。GPUはRTX 5090(開発PoC)→RTX PRO 6000 Blackwell 96GB(企業用1枚)→RTX PRO 6000 ×2(20名推奨)→B200(大負荷・100B以上モデル)と、用途と規模に応じて段階的に選定します。AI処理はVLMで図形を理解し、Drawing JSONまたはGeometry IRに変換、CAD Engineで実際の図形を生成、Validatorで検証するパイプライン構成を推奨します。GPU選択は「ユーザー数÷GPU枚数」ではなく、VRAM容量・モデルサイズ・同時リクエスト数・応答時間目標で算出します。B200は20名程度の一般業務では不要で、100B以上の大型モデル・複数VLM同時負荷・fine-tuning等の条件下で検討します。

この文書の適用条件

対象製品企業向けローカル図形AIサーバー
確認バージョンRTX 5090 / RTX PRO 6000 Blackwell / B200 / Mac M4(2026年8月時点)
適用環境オンプレミス(企業内サーバー室・コロケーション)
必要権限なし(参照のみ)
実行影響なし(参照のみ)
再起動不要
最終検証日2026-08-27

そのまま実行できるコマンド

GPU VRAM別の実行可能モデル早見表(2026年8月時点)参照のみ
対象
NVIDIA GPU(RTX 5090 / RTX PRO 6000 / B100 / B200)
権限
なし(参照のみ)
変更作業
なし
Production実行
該当なし
# GPU VRAM別の実行可能モデル(量子化条件は FP16/INT4 の一般的な目安)

VRAM 24GB(RTX 5090 1枚)
  FP16:   7B〜13B 量子化不要
  INT4:   14B〜30B 量子化で読込可能
  用途:   開発PoC・个人实验・简单な図形认识

VRAM 48GB(RTX 6000 Ada 1枚)
  FP16:   13B〜30B 量子化不要
  INT4:   30B〜70B 量子化で読込可能
  用途:   開発PoC拡張・简单なCAD图形认识

VRAM 96GB(RTX PRO 6000 Blackwell 1枚)
  FP16:   30B〜50B 量子化不要
  INT4:   50B〜110B 量子化で読込可能
  用途:   企業用小规模(1〜5名)・Qwen3-VL-32B 1枚

VRAM 192GB(B200 1枚)
  FP16:   70B〜100B 量子化不要
  INT4:   100B〜400B+ 量子化で読込可能
  用途:   大規模・複数VLM同時実行・fine-tuning

重要: モデルサイズはVRAM要件の半分ではありません。
例: Qwen3-VL-32B は FP16 で約64GB必要(32Bパラメータ × 2bytes)。
量子化(INT4)で約16GBに缩减可能だが、精度と速度のトレードオフがあります。

VRAM要件はモデルサイズに比例します。量子化で要件を下げれますが、精度が低下する可能性があります。実際のサイズは推論フレームワーク(llama.cpp / vLLM / Ollama)により異なります。

企業20名向けGPU数算出の考え方参照のみ
対象
GPUサイジング(企業環境)
権限
なし(参照のみ)
変更作業
なし
Production実行
該当なし
# 企業20名でのGPU数算出式(例)

【条件設定】
- モデル: Qwen3-VL-32B(FP16: 64GB VRAM)
- 同時利用者: 20名
- 同時リクエスト: 最大5並列
- 1リクエストあたりVRAM使用量: 約16GB(INT4量子化時)
- 応答時間目標: 30秒以内
- 1枚のGPU VRAM: 96GB(RTX PRO 6000 Blackwell)

【計算】
1) 1枚のGPUで処理可能な同時リクエスト数
   = 96GB / 16GB = 6並列

2) 20名の同時リクエストを処理に必要なGPU数
   = ceil(5 / 6) = 1枚 ... 理論上は1枚で可能

3) 実際には以下の余裕を持つ:
   - ユーザー增減への対応
   - 故障時の备用容量
   - モデル更新時の切り替え時間
   → 結果: 2枚構成(レプリカA / レプリカB)を推奨

【重要なポイント】
「20名 = GPU 2枚」とは限らない。
実際の同時リクエスト数・図形ページ数・解像度・モデルサイズで結果は変わる。
PoCで実測することが唯一の確認方法。

GPU枚数の決定はユーザー数だけでなく、同時に処理するリクエスト数・1リクエストあたりのVRAM消費量で決まります。最終的な判断はPoCで実測してください。

結果の読み方

意味確認するポイント
利用目的その構成が適する利用シーン対応するGPU・メモリ構成
GPU推奨GPU型号メモリ容量・Compute性能
メモリGPUメモリまたはUnified Memory容量実行可能モデルサイズ・量子化条件
モデル基準その構成で動作がEXPECTされるモデルVRAM要件・量子化条件
参考用途実際の业务適用シーン同時ユーザー数・処理量
参考費用GPU单价+サーバー一式(2026年8月時点概算)為替・供給状況により変動

こういう状況で使います

  • ローカル図形AIを構築したいが、GPU選択の基準がわからない
  • RTX 5090とRTX PRO 6000のどちらを選ぶべきか迷っている
  • Mac M4とNVIDIA GPUのどちらが図形AIに向いているか知りたい
  • 20名規模の図形AIにいくつのGPUが必要かわからない
  • B200は本当に必要なのか判断できない
  • 企業での図形AI構築费用の目安を知りたい
  • VLMとCAD Engineの役割分担がわからない

考えられる原因(可能性の高い順)

  1. 01

    GPU選択が「価格順」で行われている

    最も強力なGPUを選べばいいという考えは、正しいサイジングを妨げます。必要なVRAM容量はモデルサイズ・量子化率・同時リクエスト数で決まるため、最も効果的なGPUはこれらにより異なります。

  2. 02

    「ユーザー数=GPU枚数」という誤った公式

    GPU選択の標準的な指標はユーザー数ではなくVRAM容量とモデルサイズです。20名の環境でも、1リクエストあたりの処理量によっては1枚で十分な場合があります。

  3. 03

    VLMとCAD Engineの役割分担が理解されていない

    VLMは「何をすべきか」を判断し、CAD Engineは「正確な座標と形状で図形を生成」します。VLMに両方を期待すると、座標精度の点で失敗します。

  4. 04

    B200が必要以上に推奨されている

    B200は最も高性能なGPUですが、20名程度の一般企業用途では過剰です。RTX PRO 6000 × 2枚で十分な場合が多く、费用対効果で劣ります。

確認手順

  1. 1

    現在の図形処理のコラー数と頻度を把握する

    参照のみ

    日次・月次に処理する図形コラー数、1コラーあたりのページ数・解像度を分析します。これにより必要なVRAMと処理能力が推定できます。

  2. 2

    目標とするモデルを選定する

    参照のみ

    소규모検証は4B〜8B級VLM、開発PoCは8B〜32B級VRM、本番はQwen3-VL-32B以上を基准にします。目標モデルが決まれば必要なVRAMがわかります。

  3. 3

    PoC環境で実際のVRAM消費量を測定する

    選定したモデルで実際の同時リクエストを投げて、VRAM使用量・応答時間・キャパシティを確認します。理論値ではなく実測値が最終判断材料になります。

対応方法

すぐに実施できる低リスクの対応

  • PoCで実際のユーザー傾向を測定する

    1日の同時リクエスト数・図形コラー数・平均処理時間を実測し、その値をもとにGPU構成を算出します。推定ではなく実測することが正確なサイジングの唯一の方法です。

  • 処理パイプラインをVLMとCAD Engineに分離する

    「AIに図形を生成させる」のではなく、「AIに判断させて、CAD Engineに生成させる」構造にします。これによりVRAM要件が下がり、精度が向上します。

事前検討が必要な変更

  • GPU構成を段階的に拡張する

    最初はRTX 5090 1枚でPoCを構築し、实測値に合わせてRTX PRO 6000 × 2枚の構成に移行します。一気に最終構成を購入のではなく、PoC結果をもとに段階的に扩展します。

  • AI Gatewayでリクエストを分散する

    GPU 2枚構成では、AI Gatewayを用いてリクエストをレプリカA/Bに分散します。これにより同時処理能力が向上し、障害時の制限運用が可能になります。

  • 監視体制を構築する

    GPU使用率・VRAM使用量・応答時間・処理件的を監視します。キャパシティ逼迫の早期検知と、スケーリング判断の根拠にします。

専門家のレビューが必要な作業

  • B200の採用を判断する

    専門家レビュー必須

    以下の条件がすべて該当する場合にのみB200を検討します:(1)100B以上のモデルが必要、(2)複数VLMまたはAgentが同時にVRAMに負荷、(3)fine-tuningまたは大規模学習を実行、(4)数百页の図形を複数プロジェクトで同時に処理。20名程度の一般業務にはRTX PRO 6000 × 2枚で十分です。

!注意事項

  • GPU選択は「ユーザー数÷GPU枚数」ではなく、VRAM容量・モデルサイズ・同時リクエスト数・応答時間目標で決まります。
  • 「20名 = GPU 2枚」は一例であり、実際の構成はPoCの実測値によって異なります。
  • B200は20名程度の一般業務用途では不要です。100B以上の大型モデル・複数同時負荷・fine-tuning等の条件下でのみ検討します。
  • Mac M4のUnified Memoryは開発・PoC用途では优点がありますが、CUDA非対応・多人数同時利用・企業向け運用にはNVIDIAが優位です。
  • GPU価格は変動します。参考費用は2026年8月時点の概算であり、实际の費用は改めて確認してください。
  • VLMにCAD図形の直接生成を期待すると、座標精度の問題で失敗します。役割分担を明確にしてください。

バージョン・環境による違い

GPU型号の選定基準(2026年8月時点)RTX 5090: 開発PoC・個人実験向け。RTX PRO 6000 Blackwell: 企業向け1枚構成の標準。RTX PRO 6000 × 2: 20名推奨構成。B200: 大規模・特殊用途。
モデルサイズの動向Qwen3-VL-32BはFP16で64GB VRAMが必要。量子化(INT4)で約16GBに缩减可能だが、精度とのトレードオフがある。モデルサイズとVRAM要件は比例する。
Mac M4の立ち位置Mac M4 Max(128GB Unified Memory)は開発・PoC用途では有力な選択肢。MLX / llama.cpp / Ollama / Metalエコシステムを活用できる。ただしCUDA非対応のため、本番の企業環境ではNVIDIAが優勢。

これで解決しない場合に確認すること

  • 実際の図形コラーのサイズ分布を確認する

    図形コラーの平均ページ数・解像度・ форма트를分析し、必要なVRAM容量の参考値を出します。

  • 同時リクエスト数の実測値を確認する

    現在のシステム(または類似システム)で同時リクエスト数のピークを測定し、GPU構成算出の入力にします。

  • モデル量子化の精度影響を検証する

    INT4量子化時の出力精度が业务要件を満たしているか、PoCで確認します。精度が重要視される用途ではFP16の維持が必要な場合があります。

この文書の根拠と限界

実運用で確認した内容

本記事のGPU比較表と費用目安は、2026年8月時点公開情報の整理です。GPU価格と提供モデルは変動するため、実際の費用は各販売店に直接確認してください。VRAM要件は推論フレームワークにより異なります。

よくある質問

RTX 5090とRTX PRO 6000はどちらを選べばいいですか?

開発PoC・個人実験用途ならRTX 5090(32GB)、企業向けの本番用途ならRTX PRO 6000 Blackwell(96GB)を推奨します。RTX 5090は開発 скорость優先、RTX PRO 6000はVRAM容量と安定性重視です。

本当にGPU 2枚が必要ですか?1枚では足りないのですか?

GPU 2枚を推奨するのは「同時利用者20名」不是因为1枚で処理できないためです。障害時の备用容量、ユーザー増加への対応、モデル更新時の切り替え時間、そして今後の拡張性を確保ためです。PoCで実測すると1枚で十分な場合もあり、その場合は1枚から始め、必要に応じて扩展します。

Mac M4は図形AIに向いていますか?

開発・PoC用途では有力な選択肢です。Unified Memoryの-large capacityと、MLX / llama.cpp / Ollama / Metalエコシステムが 支持합니다。ただしCUDA非対応のため、本番の企業向け多人数同時利用ではNVIDIAが優位です。Macを入り口にして、PoC後にNVIDIAに移行する戦略もあります。

B200は本当に必要ですか?

20名程度の一般企業業務には不要です。B200が本当に必要なのは、(1)100B以上の大型モデル、(2)複数VLM同時実行、(3)fine-tuningまたは大規模学習、(4)数百页の図形を同時に処理、のような条件下だけです。それ以外ではRTX PRO 6000 × 2枚で十分です。

GPUの費用はいくらですか?

2026年8月時点の参考費用: RTX 5090(約30〜50万円)、RTX PRO 6000 Blackwell 1枚(約150〜200万円)、RTX PRO 6000 × 2 構成(約300〜400万円)、B200(個別見積)。GPU価格は変動するため、実際の費用は販売店に確認してください。サーバー一式(CPU・RAM・ストレージ・ネットワーク含)は別途が必要です。

VLMとCAD Engineの役割分担はどうなりますか?

VLMは「どの部分をどう修改すべきか」という判断を担当し、CAD Engineは「正確な座標と形状で図形を生成」を担当します。VLMに座標の精密な生成を期待すると、精度の問題で失敗します。この分离により、VRAM要件下げと精度向上が同時に実現できます。

この文書がカバーする質問

  • 企業向け図形AIサーバーの構成を知りたい
  • RTX 5090とRTX PRO 6000のどちらが図形AIに向いているか
  • 20名規模のAIサーバーに必要なGPU数はいくつか
  • Mac M4で図形AIは構築できるか
  • B200は本当に必要なのか

リスク表示の意味

  • 参照のみデータと設定を変更しません。
  • 影響は限定的ですが、権限と負荷の確認が必要です。
  • 性能・ロック・コストに影響する可能性があります。
  • 障害・データ損失・復旧作業が発生する可能性があります。
  • 専門家レビュー必須本番適用前に別途レビューが必須です。

GIIPの対応範囲

ここまでの内容は、特定のGPU製品に依存しない一般的なサイジングの話です。そのうえでGIIPがどこを担当しているかを述べると、GIIPはGPUサーバーの設計・選定、モデルの導入・最適化、AI Gatewayによるリクエスト分散、GPU使用率・モデル状態・応答品質の監視、障害対応、モデルバージョン更新、コスト最適化、容量増設判断といった運用層全体をカバーしています。GPUそのものの購入や設置はお客様の担当ですが、その前後のソフトウェア層・運用設計はGIIPが支援できます。

執筆・技術検証

GIIP プロダクション運用チーム

大規模Webサービス、SQL Server、Oracle、AWS、Azureの設計・移行・運用に約30年従事。x12largeクラスのAWS RDS for SQL Server環境12セット、約12万テーブルのOracle環境、約3TBのTiDBからAurora MySQLへの移行を経験。現在も複数のクラウドデータベースと約30のWebサービスを、AIエージェントと人間の専門家が継続的に監視・運用しています。

関連するナレッジ

関連サービス

実際の図形でのPoCを通じたGPU構成確認はGIIPで対応できます

同じ確認を複数の環境で継続する必要がある場合は、運用体制ごと相談できます。

実際の図形でのPoCを通じたGPU構成確認はGIIPで対応できます

ナレッジベース一覧へ