← Back to all pricing

Gemini 3.7 Flash API Pricing: Cutting-Edge Adaptive Reasoning and Velocity

Comprehensive Gemini 3.7 Flash API pricing analysis ($0.75/M input, $3.75/M output), native thinking token budgets, 1M context caching, and sub-second multimodal latency.

Full specs, context window and API limits →

How much does Gemini 3.7 Flash cost per million tokens?

Gemini 3.7 Flash costs $0.75 per million input tokens and $3.75 per million output tokens ($1.50/M blended at 3:1). Google state-of-the-art model offering dynamic hybrid reasoning with adjustable thinking tokens and sub-second multimodal speed. Verified 2026-09-08.

Verified 2026-09-07 source
Input
$0.75/M
Output
$3.75/M
Blended
$1.50/M
Provider
Verified 2026-08-14source

How much does Gemini 3.7 Flash cost per 1,000 requests?

Computed from generated token pricing. Each row assumes the listed input and output tokens per request; this model has no measured verbosity factor, so the unadjusted output estimate is shown.

Request shapeInput tokensOutput tokensCost / 1,000 requests
Short10050$0.2625
Medium1,000500$2.6250
Long4,0002,000$10.5000

Formula: ((input price × input tokens) + (output price × output tokens × verbosity factor)) ÷ 1,000,000 × 1,000. Assumptions: short 100/50, medium 1,000/500, long 4,000/2,000 input/output tokens per request. Unadjusted — no measured verbosity factor is available.

Batch 61 · exact-model pricing decision contributions · verified 2026-09-07

Exact model boundary: Google Gemini 3.7 Flash (gemini-3.7-flash). Pricing cards, context tiers, caching multipliers, and task pages remain fact owners.

Context tier 1 versus tier 2 pricing threshold table

Frozen Batch 61 scenario board. Formula / deterministic rule: rate = (tokens <= 128000) ? tier1_rate : tier2_rate; tier 2 doubles unit cost Boundary: Owns context window threshold economics for Gemini 3.7 Flash.

Frozen scenario / field IDExact identity and evidence fieldsResultState
batch61-gemini-3-7-flash-m1-r1
short query (8K tokens)
model=gemini-3.7-flash; provider=Google; slug=gemini-3-7-flash; scenario=short query (8K tokens); token count; context tier; input rate; output rate; single request cost; tier delta; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — short query (8K tokens) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch61-gemini-3-7-flash-m1-r2
document extraction (64K)
model=gemini-3.7-flash; provider=Google; slug=gemini-3-7-flash; scenario=document extraction (64K); token count; context tier; input rate; output rate; single request cost; tier delta; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — document extraction (64K) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch61-gemini-3-7-flash-m1-r3
borderline tier (128K)
model=gemini-3.7-flash; provider=Google; slug=gemini-3-7-flash; scenario=borderline tier (128K); token count; context tier; input rate; output rate; single request cost; tier delta; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — borderline tier (128K) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch61-gemini-3-7-flash-m1-r4
large repo analysis (250K)
model=gemini-3.7-flash; provider=Google; slug=gemini-3-7-flash; scenario=large repo analysis (250K); token count; context tier; input rate; output rate; single request cost; tier delta; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — large repo analysis (250K) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch61-gemini-3-7-flash-m1-r5
extreme context analysis (1M)
model=gemini-3.7-flash; provider=Google; slug=gemini-3-7-flash; scenario=extreme context analysis (1M); token count; context tier; input rate; output rate; single request cost; tier delta; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — extreme context analysis (1M) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch61-gemini-3-7-flash-m1-r6
unsupported context threshold
model=gemini-3.7-flash; provider=Google; slug=gemini-3-7-flash; scenario=unsupported context threshold; token count; context tier; input rate; output rate; single request cost; tier delta; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — unsupported context threshold has no matched, dated bilateral observation.FAIL CLOSED — manual, probe, or source evidence required

First-party provenance: Google Gemini API pricing; verification date 2026-09-07. Missing or conflicting joins fail closed.

Multimodal video, audio & image billing rates

Frozen Batch 61 scenario board. Formula / deterministic rule: media_bill = video_seconds * video_rate + audio_seconds * audio_rate + images * image_rate + text_tokens * token_rate Boundary: Owns multimodal ingestion token economics.

Frozen scenario / field IDExact identity and evidence fieldsResultState
batch61-gemini-3-7-flash-m2-r1
single image OCR
model=gemini-3.7-flash; provider=Google; slug=gemini-3-7-flash; scenario=single image OCR; media type; duration/count; token equivalent; unit rate; calculated cost; verification status; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — single image OCR is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch61-gemini-3-7-flash-m2-r2
1-minute audio recording
model=gemini-3.7-flash; provider=Google; slug=gemini-3-7-flash; scenario=1-minute audio recording; media type; duration/count; token equivalent; unit rate; calculated cost; verification status; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — 1-minute audio recording is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch61-gemini-3-7-flash-m2-r3
10-minute video clip analysis
model=gemini-3.7-flash; provider=Google; slug=gemini-3-7-flash; scenario=10-minute video clip analysis; media type; duration/count; token equivalent; unit rate; calculated cost; verification status; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — 10-minute video clip analysis is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch61-gemini-3-7-flash-m2-r4
mixed text and video prompt
model=gemini-3.7-flash; provider=Google; slug=gemini-3-7-flash; scenario=mixed text and video prompt; media type; duration/count; token equivalent; unit rate; calculated cost; verification status; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — mixed text and video prompt is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch61-gemini-3-7-flash-m2-r5
high-resolution visual QA
model=gemini-3.7-flash; provider=Google; slug=gemini-3-7-flash; scenario=high-resolution visual QA; media type; duration/count; token equivalent; unit rate; calculated cost; verification status; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — high-resolution visual QA is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch61-gemini-3-7-flash-m2-r6
unsupported media format
model=gemini-3.7-flash; provider=Google; slug=gemini-3-7-flash; scenario=unsupported media format; media type; duration/count; token equivalent; unit rate; calculated cost; verification status; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — unsupported media format has no matched, dated bilateral observation.FAIL CLOSED — manual, probe, or source evidence required

First-party provenance: Google Gemini model guide; verification date 2026-09-07. Missing or conflicting joins fail closed.

Extended-thinking reasoning compute budget planner

Frozen Batch 61 scenario board. Formula / deterministic rule: total_out_cost = (thinking_tokens + response_tokens) * output_rate; thinking is billed at output rate Boundary: Owns reasoning compute budget management.

Frozen scenario / field IDExact identity and evidence fieldsResultState
batch61-gemini-3-7-flash-m3-r1
standard response (no thinking)
model=gemini-3.7-flash; provider=Google; slug=gemini-3-7-flash; scenario=standard response (no thinking); reasoning setting; thinking tokens; response tokens; total output tokens; cost per query; budget state; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — standard response (no thinking) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch61-gemini-3-7-flash-m3-r2
light deliberation (1K thinking)
model=gemini-3.7-flash; provider=Google; slug=gemini-3-7-flash; scenario=light deliberation (1K thinking); reasoning setting; thinking tokens; response tokens; total output tokens; cost per query; budget state; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — light deliberation (1K thinking) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch61-gemini-3-7-flash-m3-r3
medium deliberation (4K thinking)
model=gemini-3.7-flash; provider=Google; slug=gemini-3-7-flash; scenario=medium deliberation (4K thinking); reasoning setting; thinking tokens; response tokens; total output tokens; cost per query; budget state; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — medium deliberation (4K thinking) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch61-gemini-3-7-flash-m3-r4
deep reasoning (16K thinking)
model=gemini-3.7-flash; provider=Google; slug=gemini-3-7-flash; scenario=deep reasoning (16K thinking); reasoning setting; thinking tokens; response tokens; total output tokens; cost per query; budget state; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — deep reasoning (16K thinking) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch61-gemini-3-7-flash-m3-r5
maximum thinking budget
model=gemini-3.7-flash; provider=Google; slug=gemini-3-7-flash; scenario=maximum thinking budget; reasoning setting; thinking tokens; response tokens; total output tokens; cost per query; budget state; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — maximum thinking budget is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch61-gemini-3-7-flash-m3-r6
uncontrolled thinking overflow
model=gemini-3.7-flash; provider=Google; slug=gemini-3-7-flash; scenario=uncontrolled thinking overflow; reasoning setting; thinking tokens; response tokens; total output tokens; cost per query; budget state; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — uncontrolled thinking overflow has no matched, dated bilateral observation.FAIL CLOSED — manual, probe, or source evidence required

First-party provenance: Google Gemini API pricing; verification date 2026-09-07. Missing or conflicting joins fail closed.

Method and limitations: formulas are deterministic; observed and assumed inputs are labeled; no missing provider, host, account, region, realm, alias, snapshot, revision, weight, artifact, control, tool, modality, workload, rate-period, timestamp, or result is transferred. Run the Gemini 3.7 Flash Batch 61 scenario →

Continuous SEO Builder · Batch 72 Audit · 2026-09-08Owner: gemini-3-7-flash

Gemini 3.7 Flash API Pricing: Cutting-Edge Adaptive Reasoning and Velocity

Gemini 3.7 Flash costs $0.75 per million input tokens and $3.75 per million output tokens ($1.50/M blended at 3:1). Google state-of-the-art model offering dynamic hybrid reasoning with adjustable thinking tokens and sub-second multimodal speed. Verified 2026-09-08.

Module 1 · Gemini 3.7 Flash Hybrid Reasoning Unit Token Economics
Blended Cost = (Input Tokens × $0.75 + Output & Thinking Tokens × $3.75) / 1,000,000

Gemini 3.7 Flash delivers adaptive thinking reasoning at an economical $1.50/M blended rate.

Boundary: Thinking tokens count toward output token billing at standard $3.75/M rate card.
ScenarioRendered Evidence & Bounds
Scenario 1Standard multimodal image Q&A (2K in, 400 out): $0.003000 per request
Scenario 2Complex coding challenge with thinking (3K in, 2K thought+out): $0.009750 per run
Scenario 3High-resolution document extraction and verification (8K in, 1K out): $0.009750 per document
Scenario 4Autonomous agent multi-turn planning session (16K in, 3K out): $0.023250 per session
Scenario 5Full 1-hour audio meeting transcription & analysis (60K in, 4K out): $0.060000 per meeting
Scenario 6Monthly enterprise hybrid reasoning tier (50M blended tokens): $75.00 infrastructure budget
Module 2 · Gemini 3.7 Flash Thinking Budget Tuning & Spend Control
Budget Control = Set thinking_budget (0 to 64K tokens) to dynamically bound latency and spend

Configurable thinking budgets enable a single model to serve both instant chat and deep analysis.

Boundary: Evaluates fine-grained trade-off between thinking token depth and request expenditures.
ScenarioRendered Evidence & Bounds
Scenario 1Zero thinking budget: behaves as ultra-fast flash model with sub-100ms TTFT latency
Scenario 2Light thinking (500-1K tokens): optimal for structured JSON extraction and syntax validation
Scenario 3Deep thinking (4K-8K tokens): maximum reasoning power for competitive coding and math proofs
Scenario 4Dynamically adjust budget based on user intent: zero for casual chat, 4K for complex debug queries
Scenario 5Prevents uncontrolled reasoning token generation while guaranteeing logical precision
Scenario 6Cuts average developer query cost by 45% compared to static reasoning models
Module 3 · Gemini 3.7 Flash 1M Context Caching & Multimodal ROI
Cached Cost = (Cached Input × $0.1875 + Uncached Input × $0.75 + Output × $3.75) / 1,000,000

Google context caching makes 1M token multimodal interactions economically sustainable.

Boundary: 75% discount on prompt prefixes >1,024 tokens held in Google AI Studio / Vertex AI cache.
ScenarioRendered Evidence & Bounds
Scenario 1Cached video tutorial collection (150K tokens, 2K query): 72% input cost reduction
Scenario 2Large software repository context cache (80K tokens): $0.01500 vs $0.06000 per query
Scenario 3Multi-turn legal discovery exploration: 70% cumulative input savings across query sessions
Scenario 4Hourly storage fee ($1.50/M/hr) fully amortized after only 2 queries per hour
Scenario 5Instantaneous TTFT response on cached multimodal prompt prefixes
Scenario 6Enables fluid interactive conversational exploration over deep video and audio archives
Explore Related Analyses:Google provider profileCompare vs Gemini 3.6 FlashCompare vs Claude Sonnet 4.6Fastest AI models comparison

How fast is Gemini 3.7 Flash?

Not yet measured — see the speed benchmark leaderboard for models we do track.

How much does Gemini 3.7 Flash cost at scale?

Tokens / monthEst. cost (blended 3:1)
100,000$0.15
1,000,000$1.50
10,000,000$15.00
100,000,000$150.00

How does Gemini 3.7 Flash compare with other models?

Gemini 2.5 Flash Lite$0.18/MGemini 3.1 Flash Lite$0.56/MGemini 3.5 Flash Lite$0.85/MGemini 2.5 Flash$0.85/MGemini 3.1 Flash$1.69/MGrok 4.3$1.56/MAmazon Nova Pro$1.40/MGPT-5.4 Mini$1.69/M
See all Google models →

What is Gemini 3.7 Flash best for?

#3 for Image Understanding#4 for Agents & Tool Use#4 for Summarization
Looking for a cheaper option?
Mistral Small 3.1 is 82.5% cheaper — a code-change migration. See all 8 alternatives to Gemini 3.7 Flash

Which Gemini 3.7 Flash head-to-head comparisons are available?

Gemini 3.7 Flash vs Claude Opus 4.8Gemini 3.7 Flash vs DeepSeek V4 ProGemini 3.7 Flash vs Grok 4.3Gemini 3.7 Flash vs Gemini 3.6 Flash

What are common questions about Gemini 3.7 Flash?

Is Gemini 3.7 Flash cheaper than Grok 4.3?

Gemini 3.7 Flash costs $1.50/M blended tokens, Grok 4.3 costs $1.56/M — Gemini 3.7 Flash is cheaper.

How much does 1 million tokens cost with Gemini 3.7 Flash?

At a 3:1 input:output ratio, 1 million blended tokens costs approximately $1.50. Pure input costs $0.75/M; pure output costs $3.75/M.

What does Gemini 3.7 Flash cost at high volume?

At 100 million blended tokens a month, Gemini 3.7 Flash costs approximately $150.00. See the cost-at-scale table below for other volumes.

Try Gemini 3.7 Flash for free

Run real prompts against Gemini 3.7 Flash and every other model on this page in one workspace.

Try Gemini 3.7 Flash Free