Gemini 3.1 Pro vs 3.5 Flash 徹底比較:性能・料金・推奨アーキテクチャ
毎秒140〜190トークンの超高速3.5 Flashか、高度な推論とコーディングを誇る3.1 Proか。公式単価、ベンチマーク、実践的ハイブリッドルーティング設計まで一挙解説します。
Google Geminiエコシステムで商用サービスやAIパイプラインを構築する際、最も重要なアーキテクチャ判断が「3.1 Proと3.5 Flashのどちらをベースラインにするか」です。トークン単価の差は約1.33倍ですが、スループットには3倍近い差があり、複雑な推論(Reasoning)とハルシネーション抑制力にも明確な違いがあります。本ガイドでは公式スペックと単価を比較し、コストと品質を両立する2段階ルーティング設計およびGIIP LLMコスト計算機の活用法を提示します。
全リクエストを3.1 Proに送るとコストとレイテンシが跳ね上がる
月額API費用が急増し、リアルタイムチャットや即時応答を求めるユーザーが初期遅延(TTFT)によって離脱します。
3.5 Flashだけでは高度なコーディングや多段階推論で精度が不足する
複雑なツール呼び出し(Tool Calling)、アルゴリズム設計、大規模リファクタリングにおいて出力精度が低下したりハルシネーションが発生します。
自社の実トラフィックに基づいた正確な月額費用と削減余地が不透明
入力・出力トークン比率やプロンプトキャッシュ適用時の実費用、さらには自社GPU構築との損益分岐点が把握できていません。
スループット最適化と推論最適化の根本的な違い
Gemini 3.5 Flashは極めて高速なスループット(140〜190 tok/s)と大量バッチ処理のために軽量化された高効率モデルです。一方、3.1 Proはディープシンキング機構を備え、最高難度の論理推論に特化したフロンティアモデルです。
トークン単価と計算リソースの差
入力100万トークンあたり$1.50対$2.00、出力100万トークンあたり$9.00対$12.00と、3.1 Proが約1.33倍高価です。特に出力量が多いタスクほど累積コストの差が顕著になります。
初速(TTFT)とストリーミング応答速度
3.5 Flashは即座に出力を開始しますが、3.1 Proは複雑な質問に対して内部推論プロセスを走らせるため、初速までの待機時間がやや長くなります。
単一モデルに固定せず、タスクの難易度に応じた振り分けと2段階カスケードルーター(Cascading Router)を採用するのが最適解です。
ワークロード別のモデル分離
要約・分類・顧客応対・大容量RAG検索には3.5 Flashを標準適用し、アーキテクチャ設計・高難度デバッグ・厳密な論理処理のみ3.1 Proへ委譲します。
2段階カスケードルーター構成
3.5 Flashをゲートキーパーとして配置し、全体の約80%の日常的クエリを高速・低コストで処理。高難度フラグが付いた上位15〜20%のみ3.1 Proにルーティングすることで、API費用を40%以上削減します。
コンテキストキャッシュの積極活用
固定システムプロンプトや社内規定文書(最大100万トークン)をキャッシュ化することで、入力単価を3.5 Flashは$0.15、3.1 Proは$0.20まで90%以上削減可能です。
| 比較項目(スペック) | Gemini 3.5 Flash | Gemini 3.1 Pro (Preview) |
|---|---|---|
| 入力トークン単価(100万トークンあたり) | $1.50 USD(基本) | $2.00 USD(約1.33倍) |
| 出力トークン単価(100万トークンあたり) | $9.00 USD(基本) | $12.00 USD(約1.33倍) |
| キャッシュ入力読み取り単価(100万トークンあたり) | $0.15 USD(90%削減) | $0.20 USD(90%削減) |
| バッチAPI非同期割引単価 | 入力 $0.75 / 出力 $4.50(50%割引) | 入力 $1.00 / 出力 $6.00(50%割引) |
| 平均トークン生成速度(スループット) | 140 〜 190 tok/s(超高速) | 45 〜 80 tok/s(推論重視) |
| コンテキストウィンドウ(文脈長) | 1,000,000 トークン(1M) | 1,000,000 トークン(1M) |
| 最大単一出力トークン数 | 64,000 トークン(64K) | 64,000 トークン(64K) |
| 推奨適用タスク(用途) | リアルタイムチャット、要約・分類、大量バッチ処理 | コードリファクタリング、多段階推論、自律エージェント |
* GIIP LLMコスト計算機の公式データベース(Google Gemini API最新料金表同期)に基づく。為替やリージョンにより変動する場合があります。
モデル選定における5つの判断基準
- 応答速度(レイテンシ)がUXにおいて最重要か? → 3.5 Flashを優先
- 質問が高度なアルゴリズム、長文デバッグ、数学的証明を必要とするか? → 3.1 Proが必須
- 数千万件規模の文書をバッチ分類・抽出するか? → 3.5 Flashが圧倒的に低コスト
- 自律的に外部ツール連携や多段階計画を行うエージェントか? → 3.1 Proを推奨
- 月間のAPI費用が数十万円〜百万円を超えているか? → ハイブリッド構成およびGIIP計算機でのTCO診断を推奨
貴社サービスの月間トークン利用量をGIIP LLMコスト計算機に入力すると、Gemini 3.1 Proと3.5 Flashの月額費用差額や、自社GPU環境への移行損益分岐点を即座にシミュレーションできます。
GIIP LLMコスト計算機で試算するよくある技術的な質問(FAQ)
Gemini 3.5 Flashと3.1 Proのどちらをベースラインとして始めるべきですか?
一般的なWebアプリケーションでは、まず3.5 Flashをベースラインとして導入することを強くお勧めします。毎秒140〜190トークンの高速応答と低価格により優れた操作性を提供でき、一般的な対話・要約・構造化抽出では十分な品質を発揮します。品質検証で明確に高度な論理推論やコーディング精度が求められる特定エンドポイントに絞って3.1 Proを適用するのが最も合理的です。
コンテキスト長や機能面に違いはありますか?
基本仕様は両モデルとも共通しており、100万トークンの巨大コンテキストウィンドウと最大64,000トークンの単一出力をサポートします。マルチモーダル入力、ファンクションコーリング、構造化JSON出力も同様に利用可能です。違いは超長文コンテキスト内での高度な相関関係追跡および推論の深さにあります。
プロンプトキャッシュを活用するとどれくらい費用を削減できますか?
同一のシステムプロンプトや大規模リファレンス文書を繰り返し利用する場合、キャッシュ適用により入力トークン単価が90%以上削減されます(Flashは$0.15/1M、Proは$0.20/1M)。長文プロンプトを多用するサービスでは、モデル選定以上のコスト削減効果をもたらします。
カスケードルーティング導入による具体的な削減効果はどのくらいですか?
実運用環境では、最高難度の推論を必要とするクエリは全体の15〜25%程度です。80%を3.5 Flashで即時処理し、難関タスクの20%のみ3.1 Proに流す構成にすることで、全面Pro導入と比較して月額費用を約40〜55%削減しつつ平均応答速度を2倍近く高速化できます。
API利用料が増大した際、自社GPU構築(Llama/DeepSeek等)との損益分岐点はどう試算しますか?
月額のAPI支払額が50万円〜100万円を持続的に超える場合、NVIDIA L40SやH100/B200等のGPUサーバーをデータセンターに導入してオープンソースLLMをセルフホストする構成が、3〜5年の総所有コスト(TCO)において有利になるケースがあります。GIIP LLMコスト計算機(/llm-calculator)をご活用いただくことで、具体的な投資回収期間を瞬時に試算いただけます。
自社サービスのLLM利用コストを試算する
Gemini 3.1 Proと3.5 Flashの月額費用比較から、自社GPU構築の損益分岐点まで、GIIP LLMコスト計算機ですぐにご確認いただけます。