企業向けローカル図形AIに必要なGPUとサーバー構成 — 20名利用基準の参考費用
公開日 2026-08-27 · 更新日 2026-08-27 · 最終検証日 2026-08-27
結論
企業向けローカル図形AIの構築には、GPU選択・サーバー構成・AI処理パイプライン・運用の4つをセットで検討する必要があります。GPUはRTX 5090(開発PoC)→RTX PRO 6000 Blackwell 96GB(企業用1枚)→RTX PRO 6000 ×2(20名推奨)→B200(大負荷・100B以上モデル)と、用途と規模に応じて段階的に選定します。AI処理はVLMで図形を理解し、Drawing JSONまたはGeometry IRに変換、CAD Engineで実際の図形を生成、Validatorで検証するパイプライン構成を推奨します。GPU選択は「ユーザー数÷GPU枚数」ではなく、VRAM容量・モデルサイズ・同時リクエスト数・応答時間目標で算出します。B200は20名程度の一般業務では不要で、100B以上の大型モデル・複数VLM同時負荷・fine-tuning等の条件下で検討します。
この文書の適用条件
| 対象製品 | 企業向けローカル図形AIサーバー |
|---|---|
| 確認バージョン | RTX 5090 / RTX PRO 6000 Blackwell / B200 / Mac M4(2026年8月時点) |
| 適用環境 | オンプレミス(企業内サーバー室・コロケーション) |
| 必要権限 | なし(参照のみ) |
| 実行影響 | なし(参照のみ) |
| 再起動 | 不要 |
| 最終検証日 | 2026-08-27 |
そのまま実行できるコマンド
- 対象
- NVIDIA GPU(RTX 5090 / RTX PRO 6000 / B100 / B200)
- 権限
- なし(参照のみ)
- 変更作業
- なし
- Production実行
- 該当なし
# GPU VRAM別の実行可能モデル(量子化条件は FP16/INT4 の一般的な目安)
VRAM 24GB(RTX 5090 1枚)
FP16: 7B〜13B 量子化不要
INT4: 14B〜30B 量子化で読込可能
用途: 開発PoC・个人实验・简单な図形认识
VRAM 48GB(RTX 6000 Ada 1枚)
FP16: 13B〜30B 量子化不要
INT4: 30B〜70B 量子化で読込可能
用途: 開発PoC拡張・简单なCAD图形认识
VRAM 96GB(RTX PRO 6000 Blackwell 1枚)
FP16: 30B〜50B 量子化不要
INT4: 50B〜110B 量子化で読込可能
用途: 企業用小规模(1〜5名)・Qwen3-VL-32B 1枚
VRAM 192GB(B200 1枚)
FP16: 70B〜100B 量子化不要
INT4: 100B〜400B+ 量子化で読込可能
用途: 大規模・複数VLM同時実行・fine-tuning
重要: モデルサイズはVRAM要件の半分ではありません。
例: Qwen3-VL-32B は FP16 で約64GB必要(32Bパラメータ × 2bytes)。
量子化(INT4)で約16GBに缩减可能だが、精度と速度のトレードオフがあります。VRAM要件はモデルサイズに比例します。量子化で要件を下げれますが、精度が低下する可能性があります。実際のサイズは推論フレームワーク(llama.cpp / vLLM / Ollama)により異なります。
- 対象
- GPUサイジング(企業環境)
- 権限
- なし(参照のみ)
- 変更作業
- なし
- Production実行
- 該当なし
# 企業20名でのGPU数算出式(例)
【条件設定】
- モデル: Qwen3-VL-32B(FP16: 64GB VRAM)
- 同時利用者: 20名
- 同時リクエスト: 最大5並列
- 1リクエストあたりVRAM使用量: 約16GB(INT4量子化時)
- 応答時間目標: 30秒以内
- 1枚のGPU VRAM: 96GB(RTX PRO 6000 Blackwell)
【計算】
1) 1枚のGPUで処理可能な同時リクエスト数
= 96GB / 16GB = 6並列
2) 20名の同時リクエストを処理に必要なGPU数
= ceil(5 / 6) = 1枚 ... 理論上は1枚で可能
3) 実際には以下の余裕を持つ:
- ユーザー增減への対応
- 故障時の备用容量
- モデル更新時の切り替え時間
→ 結果: 2枚構成(レプリカA / レプリカB)を推奨
【重要なポイント】
「20名 = GPU 2枚」とは限らない。
実際の同時リクエスト数・図形ページ数・解像度・モデルサイズで結果は変わる。
PoCで実測することが唯一の確認方法。GPU枚数の決定はユーザー数だけでなく、同時に処理するリクエスト数・1リクエストあたりのVRAM消費量で決まります。最終的な判断はPoCで実測してください。
結果の読み方
| 列 | 意味 | 確認するポイント |
|---|---|---|
| 利用目的 | その構成が適する利用シーン | 対応するGPU・メモリ構成 |
| GPU | 推奨GPU型号 | メモリ容量・Compute性能 |
| メモリ | GPUメモリまたはUnified Memory容量 | 実行可能モデルサイズ・量子化条件 |
| モデル基準 | その構成で動作がEXPECTされるモデル | VRAM要件・量子化条件 |
| 参考用途 | 実際の业务適用シーン | 同時ユーザー数・処理量 |
| 参考費用 | GPU单价+サーバー一式(2026年8月時点概算) | 為替・供給状況により変動 |
こういう状況で使います
- ローカル図形AIを構築したいが、GPU選択の基準がわからない
- RTX 5090とRTX PRO 6000のどちらを選ぶべきか迷っている
- Mac M4とNVIDIA GPUのどちらが図形AIに向いているか知りたい
- 20名規模の図形AIにいくつのGPUが必要かわからない
- B200は本当に必要なのか判断できない
- 企業での図形AI構築费用の目安を知りたい
- VLMとCAD Engineの役割分担がわからない
考えられる原因(可能性の高い順)
01
GPU選択が「価格順」で行われている
最も強力なGPUを選べばいいという考えは、正しいサイジングを妨げます。必要なVRAM容量はモデルサイズ・量子化率・同時リクエスト数で決まるため、最も効果的なGPUはこれらにより異なります。
02
「ユーザー数=GPU枚数」という誤った公式
GPU選択の標準的な指標はユーザー数ではなくVRAM容量とモデルサイズです。20名の環境でも、1リクエストあたりの処理量によっては1枚で十分な場合があります。
03
VLMとCAD Engineの役割分担が理解されていない
VLMは「何をすべきか」を判断し、CAD Engineは「正確な座標と形状で図形を生成」します。VLMに両方を期待すると、座標精度の点で失敗します。
04
B200が必要以上に推奨されている
B200は最も高性能なGPUですが、20名程度の一般企業用途では過剰です。RTX PRO 6000 × 2枚で十分な場合が多く、费用対効果で劣ります。
確認手順
- 1
現在の図形処理のコラー数と頻度を把握する
参照のみ日次・月次に処理する図形コラー数、1コラーあたりのページ数・解像度を分析します。これにより必要なVRAMと処理能力が推定できます。
- 2
目標とするモデルを選定する
参照のみ소규모検証は4B〜8B級VLM、開発PoCは8B〜32B級VRM、本番はQwen3-VL-32B以上を基准にします。目標モデルが決まれば必要なVRAMがわかります。
- 3
PoC環境で実際のVRAM消費量を測定する
低選定したモデルで実際の同時リクエストを投げて、VRAM使用量・応答時間・キャパシティを確認します。理論値ではなく実測値が最終判断材料になります。
対応方法
すぐに実施できる低リスクの対応
PoCで実際のユーザー傾向を測定する
低1日の同時リクエスト数・図形コラー数・平均処理時間を実測し、その値をもとにGPU構成を算出します。推定ではなく実測することが正確なサイジングの唯一の方法です。
処理パイプラインをVLMとCAD Engineに分離する
低「AIに図形を生成させる」のではなく、「AIに判断させて、CAD Engineに生成させる」構造にします。これによりVRAM要件が下がり、精度が向上します。
事前検討が必要な変更
GPU構成を段階的に拡張する
中最初はRTX 5090 1枚でPoCを構築し、实測値に合わせてRTX PRO 6000 × 2枚の構成に移行します。一気に最終構成を購入のではなく、PoC結果をもとに段階的に扩展します。
AI Gatewayでリクエストを分散する
中GPU 2枚構成では、AI Gatewayを用いてリクエストをレプリカA/Bに分散します。これにより同時処理能力が向上し、障害時の制限運用が可能になります。
監視体制を構築する
中GPU使用率・VRAM使用量・応答時間・処理件的を監視します。キャパシティ逼迫の早期検知と、スケーリング判断の根拠にします。
専門家のレビューが必要な作業
B200の採用を判断する
専門家レビュー必須以下の条件がすべて該当する場合にのみB200を検討します:(1)100B以上のモデルが必要、(2)複数VLMまたはAgentが同時にVRAMに負荷、(3)fine-tuningまたは大規模学習を実行、(4)数百页の図形を複数プロジェクトで同時に処理。20名程度の一般業務にはRTX PRO 6000 × 2枚で十分です。
!注意事項
- GPU選択は「ユーザー数÷GPU枚数」ではなく、VRAM容量・モデルサイズ・同時リクエスト数・応答時間目標で決まります。
- 「20名 = GPU 2枚」は一例であり、実際の構成はPoCの実測値によって異なります。
- B200は20名程度の一般業務用途では不要です。100B以上の大型モデル・複数同時負荷・fine-tuning等の条件下でのみ検討します。
- Mac M4のUnified Memoryは開発・PoC用途では优点がありますが、CUDA非対応・多人数同時利用・企業向け運用にはNVIDIAが優位です。
- GPU価格は変動します。参考費用は2026年8月時点の概算であり、实际の費用は改めて確認してください。
- VLMにCAD図形の直接生成を期待すると、座標精度の問題で失敗します。役割分担を明確にしてください。
バージョン・環境による違い
これで解決しない場合に確認すること
実際の図形コラーのサイズ分布を確認する
図形コラーの平均ページ数・解像度・ форма트를分析し、必要なVRAM容量の参考値を出します。
同時リクエスト数の実測値を確認する
現在のシステム(または類似システム)で同時リクエスト数のピークを測定し、GPU構成算出の入力にします。
モデル量子化の精度影響を検証する
INT4量子化時の出力精度が业务要件を満たしているか、PoCで確認します。精度が重要視される用途ではFP16の維持が必要な場合があります。
この文書の根拠と限界
実運用で確認した内容
本記事のGPU比較表と費用目安は、2026年8月時点公開情報の整理です。GPU価格と提供モデルは変動するため、実際の費用は各販売店に直接確認してください。VRAM要件は推論フレームワークにより異なります。
よくある質問
RTX 5090とRTX PRO 6000はどちらを選べばいいですか?
開発PoC・個人実験用途ならRTX 5090(32GB)、企業向けの本番用途ならRTX PRO 6000 Blackwell(96GB)を推奨します。RTX 5090は開発 скорость優先、RTX PRO 6000はVRAM容量と安定性重視です。
本当にGPU 2枚が必要ですか?1枚では足りないのですか?
GPU 2枚を推奨するのは「同時利用者20名」不是因为1枚で処理できないためです。障害時の备用容量、ユーザー増加への対応、モデル更新時の切り替え時間、そして今後の拡張性を確保ためです。PoCで実測すると1枚で十分な場合もあり、その場合は1枚から始め、必要に応じて扩展します。
Mac M4は図形AIに向いていますか?
開発・PoC用途では有力な選択肢です。Unified Memoryの-large capacityと、MLX / llama.cpp / Ollama / Metalエコシステムが 支持합니다。ただしCUDA非対応のため、本番の企業向け多人数同時利用ではNVIDIAが優位です。Macを入り口にして、PoC後にNVIDIAに移行する戦略もあります。
B200は本当に必要ですか?
20名程度の一般企業業務には不要です。B200が本当に必要なのは、(1)100B以上の大型モデル、(2)複数VLM同時実行、(3)fine-tuningまたは大規模学習、(4)数百页の図形を同時に処理、のような条件下だけです。それ以外ではRTX PRO 6000 × 2枚で十分です。
GPUの費用はいくらですか?
2026年8月時点の参考費用: RTX 5090(約30〜50万円)、RTX PRO 6000 Blackwell 1枚(約150〜200万円)、RTX PRO 6000 × 2 構成(約300〜400万円)、B200(個別見積)。GPU価格は変動するため、実際の費用は販売店に確認してください。サーバー一式(CPU・RAM・ストレージ・ネットワーク含)は別途が必要です。
VLMとCAD Engineの役割分担はどうなりますか?
VLMは「どの部分をどう修改すべきか」という判断を担当し、CAD Engineは「正確な座標と形状で図形を生成」を担当します。VLMに座標の精密な生成を期待すると、精度の問題で失敗します。この分离により、VRAM要件下げと精度向上が同時に実現できます。
この文書がカバーする質問
- 企業向け図形AIサーバーの構成を知りたい
- RTX 5090とRTX PRO 6000のどちらが図形AIに向いているか
- 20名規模のAIサーバーに必要なGPU数はいくつか
- Mac M4で図形AIは構築できるか
- B200は本当に必要なのか
リスク表示の意味
- 参照のみデータと設定を変更しません。
- 低影響は限定的ですが、権限と負荷の確認が必要です。
- 中性能・ロック・コストに影響する可能性があります。
- 高障害・データ損失・復旧作業が発生する可能性があります。
- 専門家レビュー必須本番適用前に別途レビューが必須です。
GIIPの対応範囲
ここまでの内容は、特定のGPU製品に依存しない一般的なサイジングの話です。そのうえでGIIPがどこを担当しているかを述べると、GIIPはGPUサーバーの設計・選定、モデルの導入・最適化、AI Gatewayによるリクエスト分散、GPU使用率・モデル状態・応答品質の監視、障害対応、モデルバージョン更新、コスト最適化、容量増設判断といった運用層全体をカバーしています。GPUそのものの購入や設置はお客様の担当ですが、その前後のソフトウェア層・運用設計はGIIPが支援できます。
執筆・技術検証
GIIP プロダクション運用チーム
大規模Webサービス、SQL Server、Oracle、AWS、Azureの設計・移行・運用に約30年従事。x12largeクラスのAWS RDS for SQL Server環境12セット、約12万テーブルのOracle環境、約3TBのTiDBからAurora MySQLへの移行を経験。現在も複数のクラウドデータベースと約30のWebサービスを、AIエージェントと人間の専門家が継続的に監視・運用しています。
関連サービス
実際の図形でのPoCを通じたGPU構成確認はGIIPで対応できます
同じ確認を複数の環境で継続する必要がある場合は、運用体制ごと相談できます。
実際の図形でのPoCを通じたGPU構成確認はGIIPで対応できます