← Back to all pricing

Gemini 3.1 Pro API Pricing: Deep Multimodal Reasoning and 2M Scale

Comprehensive Gemini 3.1 Pro API pricing analysis ($2.00/M input, $12.00/M output), 2M context window economics, multimodal vision/audio benchmarks, and enterprise SLAs.

Full specs, context window and API limits →

How much does Gemini 3.1 Pro cost per million tokens?

Gemini 3.1 Pro costs $2.00 per million input tokens and $12.00 per million output tokens ($4.50/M blended at 3:1). Google flagship cognitive model designed for complex multi-modal analysis, long-context research, and high-precision STEM tasks. Verified 2026-09-08.

Verified 2026-09-07 source
Input
$2.00/M
Output
$12.00/M
Blended
$4.50/M
Provider
Verified 2026-04-06source

How much does Gemini 3.1 Pro cost per 1,000 requests?

Computed from generated token pricing. Each row assumes the listed input and output tokens per request; output is adjusted by this model's measured 0.63× verbosity factor.

Request shapeInput tokensOutput tokensCost / 1,000 requests
Short10050$0.5780
Medium1,000500$5.7800
Long4,0002,000$23.1200

Formula: ((input price × input tokens) + (output price × output tokens × verbosity factor)) ÷ 1,000,000 × 1,000. Assumptions: short 100/50, medium 1,000/500, long 4,000/2,000 input/output tokens per request. Verbosity run: 2026-06-21T00:00:00.000Z.

Batch 61 · exact-model pricing decision contributions · verified 2026-09-07

Exact model boundary: Google Gemini 3.1 Pro (gemini-3.1-pro). Pricing cards, context tiers, caching multipliers, and task pages remain fact owners.

Tier 1 vs Tier 2 context threshold billing ledger

Frozen Batch 61 scenario board. Formula / deterministic rule: rate = tokens <= 128000 ? tier1_rates : tier2_rates; tier 2 doubles input/output rates Boundary: Owns context window threshold economics for Gemini 3.1 Pro.

Frozen scenario / field IDExact identity and evidence fieldsResultState
batch61-gemini-3-1-pro-m1-r1
standard 32K prompt
model=gemini-3.1-pro; provider=Google; slug=gemini-3-1-pro; scenario=standard 32K prompt; token count; context tier; input rate; output rate; request cost; tier delta; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — standard 32K prompt is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch61-gemini-3-1-pro-m1-r2
document extraction (96K)
model=gemini-3.1-pro; provider=Google; slug=gemini-3-1-pro; scenario=document extraction (96K); token count; context tier; input rate; output rate; request cost; tier delta; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — document extraction (96K) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch61-gemini-3-1-pro-m1-r3
tier boundary (128K)
model=gemini-3.1-pro; provider=Google; slug=gemini-3-1-pro; scenario=tier boundary (128K); token count; context tier; input rate; output rate; request cost; tier delta; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — tier boundary (128K) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch61-gemini-3-1-pro-m1-r4
large codebase review (350K)
model=gemini-3.1-pro; provider=Google; slug=gemini-3-1-pro; scenario=large codebase review (350K); token count; context tier; input rate; output rate; request cost; tier delta; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — large codebase review (350K) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch61-gemini-3-1-pro-m1-r5
massive context dataset (1M)
model=gemini-3.1-pro; provider=Google; slug=gemini-3-1-pro; scenario=massive context dataset (1M); token count; context tier; input rate; output rate; request cost; tier delta; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — massive context dataset (1M) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch61-gemini-3-1-pro-m1-r6
extreme context analysis (2M)
model=gemini-3.1-pro; provider=Google; slug=gemini-3-1-pro; scenario=extreme context analysis (2M); token count; context tier; input rate; output rate; request cost; tier delta; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — extreme context analysis (2M) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict

First-party provenance: Google Gemini API pricing; verification date 2026-09-07. Missing or conflicting joins fail closed.

Native multimodal video, audio & image ingestion costs

Frozen Batch 61 scenario board. Formula / deterministic rule: media_cost = video_sec * video_rate + audio_sec * audio_rate + images * image_rate + text_tokens * token_rate Boundary: Owns multimodal token ingestion economics.

Frozen scenario / field IDExact identity and evidence fieldsResultState
batch61-gemini-3-1-pro-m2-r1
scanned PDF images (50 pages)
model=gemini-3.1-pro; provider=Google; slug=gemini-3-1-pro; scenario=scanned PDF images (50 pages); media type; duration/count; token equivalent; unit rate; calculated cost; verification status; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — scanned PDF images (50 pages) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch61-gemini-3-1-pro-m2-r2
15-minute meeting audio QA
model=gemini-3.1-pro; provider=Google; slug=gemini-3-1-pro; scenario=15-minute meeting audio QA; media type; duration/count; token equivalent; unit rate; calculated cost; verification status; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — 15-minute meeting audio QA is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch61-gemini-3-1-pro-m2-r3
1-hour video lecture understanding
model=gemini-3.1-pro; provider=Google; slug=gemini-3-1-pro; scenario=1-hour video lecture understanding; media type; duration/count; token equivalent; unit rate; calculated cost; verification status; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — 1-hour video lecture understanding is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch61-gemini-3-1-pro-m2-r4
mixed text and video dataset
model=gemini-3.1-pro; provider=Google; slug=gemini-3-1-pro; scenario=mixed text and video dataset; media type; duration/count; token equivalent; unit rate; calculated cost; verification status; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — mixed text and video dataset is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch61-gemini-3-1-pro-m2-r5
high-resolution engineering diagram
model=gemini-3.1-pro; provider=Google; slug=gemini-3-1-pro; scenario=high-resolution engineering diagram; media type; duration/count; token equivalent; unit rate; calculated cost; verification status; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — high-resolution engineering diagram is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch61-gemini-3-1-pro-m2-r6
unsupported media container
model=gemini-3.1-pro; provider=Google; slug=gemini-3-1-pro; scenario=unsupported media container; media type; duration/count; token equivalent; unit rate; calculated cost; verification status; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — unsupported media container has no matched, dated bilateral observation.FAIL CLOSED — manual, probe, or source evidence required

First-party provenance: Google Gemini model guide; verification date 2026-09-07. Missing or conflicting joins fail closed.

AI Studio vs Vertex AI enterprise deployment economics

Frozen Batch 61 scenario board. Formula / deterministic rule: vertex_spend = base_tokens_cost + enterprise_addons; token tariffs match published API Boundary: Owns enterprise infrastructure routing costs for Google serving.

Frozen scenario / field IDExact identity and evidence fieldsResultState
batch61-gemini-3-1-pro-m3-r1
standard developer project
model=gemini-3.1-pro; provider=Google; slug=gemini-3-1-pro; scenario=standard developer project; endpoint realm; tool surcharges; quota tier; search grounding add-on; monthly estimate; status; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — standard developer project is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch61-gemini-3-1-pro-m3-r2
Vertex AI enterprise project
model=gemini-3.1-pro; provider=Google; slug=gemini-3-1-pro; scenario=Vertex AI enterprise project; endpoint realm; tool surcharges; quota tier; search grounding add-on; monthly estimate; status; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — Vertex AI enterprise project is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch61-gemini-3-1-pro-m3-r3
grounding with Google Search
model=gemini-3.1-pro; provider=Google; slug=gemini-3-1-pro; scenario=grounding with Google Search; endpoint realm; tool surcharges; quota tier; search grounding add-on; monthly estimate; status; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — grounding with Google Search is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch61-gemini-3-1-pro-m3-r4
code execution environment run
model=gemini-3.1-pro; provider=Google; slug=gemini-3-1-pro; scenario=code execution environment run; endpoint realm; tool surcharges; quota tier; search grounding add-on; monthly estimate; status; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — code execution environment run is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch61-gemini-3-1-pro-m3-r5
provisioned throughput reservation
model=gemini-3.1-pro; provider=Google; slug=gemini-3-1-pro; scenario=provisioned throughput reservation; endpoint realm; tool surcharges; quota tier; search grounding add-on; monthly estimate; status; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — provisioned throughput reservation is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch61-gemini-3-1-pro-m3-r6
unresolved billing tier
model=gemini-3.1-pro; provider=Google; slug=gemini-3-1-pro; scenario=unresolved billing tier; endpoint realm; tool surcharges; quota tier; search grounding add-on; monthly estimate; status; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — unresolved billing tier has no matched, dated bilateral observation.FAIL CLOSED — manual, probe, or source evidence required

First-party provenance: Google Gemini API pricing; verification date 2026-09-07. Missing or conflicting joins fail closed.

Method and limitations: formulas are deterministic; observed and assumed inputs are labeled; no missing provider, host, account, region, realm, alias, snapshot, revision, weight, artifact, control, tool, modality, workload, rate-period, timestamp, or result is transferred. Run the Gemini 3.1 Pro Batch 61 scenario →

Continuous SEO Builder · Batch 73 Audit · 2026-09-08Owner: gemini-3-1-pro

Gemini 3.1 Pro API Pricing: Deep Multimodal Reasoning and 2M Scale

Gemini 3.1 Pro costs $2.00 per million input tokens and $12.00 per million output tokens ($4.50/M blended at 3:1). Google flagship cognitive model designed for complex multi-modal analysis, long-context research, and high-precision STEM tasks. Verified 2026-09-08.

Module 1 · Gemini 3.1 Pro Multimodal Flagship Token Rate Card
Blended Cost = (Input Tokens × $2.00 + Output Tokens × $12.00) / 1,000,000

Gemini 3.1 Pro combines elite reasoning with native multi-hour video and audio comprehension.

Boundary: Standard pay-as-you-go pricing for prompts <= 128K; prompts > 128K priced at extended tier.
ScenarioRendered Evidence & Bounds
Scenario 1Complex multi-document legal discovery (32K in, 4K out): $0.112000 per document pack
Scenario 2Medical diagnostic imaging critique (16K in, 2K out): $0.056000 per diagnostic pass
Scenario 3Hour-long video lecture multimodal analysis (80K in, 5K out): $0.220000 per lecture
Scenario 4Advanced algebraic topology proof derivation (8K in, 3K out): $0.052000 per proof run
Scenario 5Full software design specification drafting (24K in, 4K out): $0.096000 per design document
Scenario 6Monthly 50M token cognitive research workload: $225.00 infrastructure budget
Module 2 · Gemini 3.1 Pro 2M Context Caching & Corpus Amortization
Cached Cost = (Cached Input × $0.50 + Uncached Input × $2.00 + Output × $12.00) / 1,000,000

Context caching enables affordable, fluid conversational exploration of deep video and document archives.

Boundary: 75% discount on prompt prefixes >1,024 tokens held in Google AI Studio / Vertex AI cache.
ScenarioRendered Evidence & Bounds
Scenario 1Cached multi-video training library (250K tokens, 5K query): 71% input cost savings
Scenario 2Large enterprise document repository cache (500K tokens): $0.25000 vs $1.00000 per query
Scenario 3Interactive research dialogue over 1M token archive: 73% cumulative input savings
Scenario 4Hourly storage fee ($4.00/M/hr) amortized after only 3 queries per hour
Scenario 5Time-to-first-token cut by 50% by avoiding repetitive multimodal prompt encoding
Scenario 6Enables interactive real-time research over massive multimedia archives
Module 3 · Gemini 3.1 Pro vs Gemini 3.7 Flash Fleet Architecture
Fleet Efficiency = (0.85 × 3.7 Flash Spend) + (0.15 × 3.1 Pro Spend)

Pairing 3.7 Flash for velocity with 3.1 Pro for deep video reasoning cuts multimodal bills by 56%.

Boundary: Evaluates savings from routing routine tasks to 3.7 Flash and reserving 3.1 Pro for deep analysis.
ScenarioRendered Evidence & Bounds
Scenario 11M queries routed via tiered architecture: $1,950.00 vs $4,500.00 monolithic Pro fleet
Scenario 2Gemini 3.7 Flash ($0.75/$3.75) absorbs 85% high-speed multimodal extraction and chat
Scenario 3Gemini 3.1 Pro ($2.00/$12.00) handles 15% complex multi-hour video analysis and formal proofs
Scenario 4Fleet average response latency drops by 60% due to Flash sub-second generation speed
Scenario 5Enterprise cost savings exceed 56.6% compared to routing all traffic to 3.1 Pro
Scenario 6Seamless Vertex AI / Google AI Studio integration allows uniform SDK request formats
Explore Related Analyses:Google provider profileCompare vs Gemini 3.7 FlashCompare vs Claude Opus 5Fastest AI models comparison

How fast is Gemini 3.1 Pro?

Tokens / sec
55
TTFT
420 ms
Rank
#26 of 31
$ / M ÷ t/s
$0.08
Measured with 5 runs on a fixed prompt — see the full methodology.

How much does Gemini 3.1 Pro cost at scale?

Tokens / monthEst. cost (blended 3:1)
100,000$0.45
1,000,000$4.50
10,000,000$45.00
100,000,000$450.00

How does Gemini 3.1 Pro compare with other models?

Gemini 2.5 Flash Lite$0.18/MGemini 3.1 Flash Lite$0.56/MGemini 3.5 Flash Lite$0.85/MGemini 2.5 Flash$0.85/MGemini 3.7 Flash$1.50/MGPT-4o$4.38/MClaude Sonnet 5$4.00/MGPT-4.1$3.50/M
See all Google models →

What is Gemini 3.1 Pro best for?

#3 for Math & Reasoning#4 for Long Documents & RAG#5 for Image Understanding
Looking for a cheaper option?
GPT-OSS 120B (Cerebras) is 90% cheaper — a config migration. See all 8 alternatives to Gemini 3.1 Pro

Which Gemini 3.1 Pro head-to-head comparisons are available?

Gemini 3.1 Pro vs Claude Opus 4.8Gemini 3.1 Pro vs Claude Sonnet 5Gemini 3.1 Pro vs DeepSeek V4 ProGemini 3.1 Pro vs GPT-5.6 Sol

What are common questions about Gemini 3.1 Pro?

Is Gemini 3.1 Pro cheaper than GPT-4o?

Gemini 3.1 Pro costs $4.50/M blended tokens, GPT-4o costs $4.38/M — GPT-4o is cheaper.

How much does 1 million tokens cost with Gemini 3.1 Pro?

At a 3:1 input:output ratio, 1 million blended tokens costs approximately $4.50. Pure input costs $2.00/M; pure output costs $12.00/M.

What does Gemini 3.1 Pro cost at high volume?

At 100 million blended tokens a month, Gemini 3.1 Pro costs approximately $450.00. See the cost-at-scale table below for other volumes.

Try Gemini 3.1 Pro for free

Run real prompts against Gemini 3.1 Pro and every other model on this page in one workspace.

Try Gemini 3.1 Pro Free