Gemini 3.6 Flash API Pricing: High-Velocity Multimodal Scale
Comprehensive Gemini 3.6 Flash API pricing analysis ($1.50/M input, $7.50/M output), sub-second multimodal latency, 1M context caching, and upgrade path to 3.7 Flash.
Full specs, context window and API limits →How much does Gemini 3.6 Flash cost per million tokens?
Gemini 3.6 Flash costs $1.50 per million input tokens and $7.50 per million output tokens ($3.00/M blended at 3:1). A high-speed multimodal workhorse engineered for instant interactive responses across text, audio, images, and video with 1M context. Verified 2026-09-08.
How much does Gemini 3.6 Flash cost per 1,000 requests?
Computed from generated token pricing. Each row assumes the listed input and output tokens per request; this model has no measured verbosity factor, so the unadjusted output estimate is shown.
| Request shape | Input tokens | Output tokens | Cost / 1,000 requests |
|---|---|---|---|
| Short | 100 | 50 | $0.5250 |
| Medium | 1,000 | 500 | $5.2500 |
| Long | 4,000 | 2,000 | $21.0000 |
Formula: ((input price × input tokens) + (output price × output tokens × verbosity factor)) ÷ 1,000,000 × 1,000. Assumptions: short 100/50, medium 1,000/500, long 4,000/2,000 input/output tokens per request. Unadjusted — no measured verbosity factor is available.
Three model-specific pricing decisions
Gemini 3.6 Flash is compared with 3.7 only through fixed billing shapes. Endpoint/account policy remains on Google’s provider owner.
1. 3.6 → 3.7 Flash token-shape crossover
| Fixed workload | Gemini 3.6 Flash | Gemini 3.7 Flash | Boundary |
|---|---|---|---|
| Text chat | $525.00 | $262.50 | 10% accepted-result uplift needed to justify premium |
| Extraction | $1800.00 | $900.00 | 15% accepted-result uplift needed to justify premium |
| Output-heavy | $3150.00 | $1575.00 | 20% accepted-result uplift needed to justify premium |
Formula: calls × (input tokens × input $/M + output tokens × output $/M) ÷ 1,000,000. The uplift threshold is a decision input, not a measured quality claim.
2. Context tier and cache sensitivity
| Mechanic | Dated input | 100K-call result / boundary |
|---|---|---|
| List input/output | $1.50 / $7.50 per M | $622.50 |
| Long-context threshold | Model-specific tier source unavailable | Unavailable — context window is not a price |
| Cache threshold | Provider cache rules only | Apply only when prefix/minimum is verified |
| Prompt cache | 10% read; 100% write; 3600s TTL | Apply only to eligible repeated prefixes |
| Batch | Scenario only: 50% output | $491.25 |
3. Unit-safe multimodal workload
| Input | Published unit | 100K result | AI Studio / Vertex |
|---|---|---|---|
| Text | $0.001500 $/1K tokens | $622.50 | Billing split unavailable |
| Image | Unavailable | Unavailable | Do not convert missing unit |
| Audio | Unavailable | Unavailable | Do not merge invoices |
Verified 2026-08-14. Luna is the data owner for this rendered decision module. “Unavailable” means the current dated registry has no model-specific evidence; it is not a zero. First-party price source · Run this scenario in the playground.
All results are server-rendered for Gemini 3.6 Flash; formulas expose fixed inputs and missing evidence remains visibly unavailable.
Batch 62 · exact-model pricing decision contributions · verified 2026-09-07
Exact model boundary: Google Gemini 3.6 Flash (gemini-3.6-flash). Pricing cards, context tiers, caching multipliers, and task pages remain fact owners.
Context caching storage and lookup economics
Frozen Batch 62 scenario board. Formula / deterministic rule: cost = (uncached_in * 1.50 + cache_read * 0.375 + out * 7.50) / 1M + storage_hours * 0.0000045 Boundary: Owns Gemini 3.6 Flash context caching break-even economics.
| Frozen scenario / field ID | Exact identity and evidence fields | Result | State |
|---|---|---|---|
batch62-gemini-3-6-flash-m1-r1single interactive call (no cache) | model=gemini-3.6-flash; provider=Google; slug=gemini-3-6-flash; scenario=single interactive call (no cache); cached token count; active storage hours; query frequency; storage fee; query fee; net savings; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicit | Unavailable — single interactive call (no cache) is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
batch62-gemini-3-6-flash-m1-r2hourly query against cached 100K doc | model=gemini-3.6-flash; provider=Google; slug=gemini-3-6-flash; scenario=hourly query against cached 100K doc; cached token count; active storage hours; query frequency; storage fee; query fee; net savings; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicit | Unavailable — hourly query against cached 100K doc is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
batch62-gemini-3-6-flash-m1-r310 queries/hr on cached 500K context | model=gemini-3.6-flash; provider=Google; slug=gemini-3-6-flash; scenario=10 queries/hr on cached 500K context; cached token count; active storage hours; query frequency; storage fee; query fee; net savings; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicit | Unavailable — 10 queries/hr on cached 500K context is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
batch62-gemini-3-6-flash-m1-r4100 queries/hr high-frequency lookup | model=gemini-3.6-flash; provider=Google; slug=gemini-3-6-flash; scenario=100 queries/hr high-frequency lookup; cached token count; active storage hours; query frequency; storage fee; query fee; net savings; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicit | Unavailable — 100 queries/hr high-frequency lookup is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
batch62-gemini-3-6-flash-m1-r5stale cache storage without queries | model=gemini-3.6-flash; provider=Google; slug=gemini-3-6-flash; scenario=stale cache storage without queries; cached token count; active storage hours; query frequency; storage fee; query fee; net savings; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicit | Unavailable — stale cache storage without queries is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
batch62-gemini-3-6-flash-m1-r6unsupported cache payload format | model=gemini-3.6-flash; provider=Google; slug=gemini-3-6-flash; scenario=unsupported cache payload format; cached token count; active storage hours; query frequency; storage fee; query fee; net savings; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicit | Unavailable — unsupported cache payload format has no matched, dated bilateral observation. | FAIL CLOSED — manual, probe, or source evidence required |
First-party provenance: Google Gemini API pricing; verification date 2026-09-07. Missing or conflicting joins fail closed.
Multimodal image and audio token ingestion pricing
Frozen Batch 62 scenario board. Formula / deterministic rule: image_cost = (images * tokens_per_image * 1.50) / 1M; audio_cost = (audio_seconds * tokens_per_sec * 1.50) / 1M Boundary: Owns Gemini 3.6 Flash multimodal input token conversion costs.
| Frozen scenario / field ID | Exact identity and evidence fields | Result | State |
|---|---|---|---|
batch62-gemini-3-6-flash-m2-r1100 standard UI screenshots | model=gemini-3.6-flash; provider=Google; slug=gemini-3-6-flash; scenario=100 standard UI screenshots; media modality; raw units; estimated token count; input cost; output tokens; total call cost; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicit | Unavailable — 100 standard UI screenshots is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
batch62-gemini-3-6-flash-m2-r21K high-resolution PDF pages | model=gemini-3.6-flash; provider=Google; slug=gemini-3-6-flash; scenario=1K high-resolution PDF pages; media modality; raw units; estimated token count; input cost; output tokens; total call cost; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicit | Unavailable — 1K high-resolution PDF pages is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
batch62-gemini-3-6-flash-m2-r310 minutes of meeting audio | model=gemini-3.6-flash; provider=Google; slug=gemini-3-6-flash; scenario=10 minutes of meeting audio; media modality; raw units; estimated token count; input cost; output tokens; total call cost; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicit | Unavailable — 10 minutes of meeting audio is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
batch62-gemini-3-6-flash-m2-r41 hour multimodal video analysis | model=gemini-3.6-flash; provider=Google; slug=gemini-3-6-flash; scenario=1 hour multimodal video analysis; media modality; raw units; estimated token count; input cost; output tokens; total call cost; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicit | Unavailable — 1 hour multimodal video analysis is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
batch62-gemini-3-6-flash-m2-r5continuous webcam stream monitoring | model=gemini-3.6-flash; provider=Google; slug=gemini-3-6-flash; scenario=continuous webcam stream monitoring; media modality; raw units; estimated token count; input cost; output tokens; total call cost; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicit | Unavailable — continuous webcam stream monitoring is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
batch62-gemini-3-6-flash-m2-r6unsupported audio codec payload | model=gemini-3.6-flash; provider=Google; slug=gemini-3-6-flash; scenario=unsupported audio codec payload; media modality; raw units; estimated token count; input cost; output tokens; total call cost; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicit | Unavailable — unsupported audio codec payload has no matched, dated bilateral observation. | FAIL CLOSED — manual, probe, or source evidence required |
First-party provenance: Google Gemini model guide; verification date 2026-09-07. Missing or conflicting joins fail closed.
Gemini 3.6 Flash vs 3.7 Flash upgrade economic gate
Frozen Batch 62 scenario board. Formula / deterministic rule: spend_delta = flash37_cost - flash36_cost; break-even requires speed or quality gain Boundary: Owns upgrade decision modeling to Gemini 3.7 Flash.
| Frozen scenario / field ID | Exact identity and evidence fields | Result | State |
|---|---|---|---|
batch62-gemini-3-6-flash-m3-r1low-complexity routing tasks | model=gemini-3.6-flash; provider=Google; slug=gemini-3-6-flash; scenario=low-complexity routing tasks; monthly call volume; Flash 3.6 spend; Flash 3.7 spend; budget difference; required latency/quality uplift; recommendation; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicit | Unavailable — low-complexity routing tasks is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
batch62-gemini-3-6-flash-m3-r2hybrid reasoning coding tasks | model=gemini-3.6-flash; provider=Google; slug=gemini-3-6-flash; scenario=hybrid reasoning coding tasks; monthly call volume; Flash 3.6 spend; Flash 3.7 spend; budget difference; required latency/quality uplift; recommendation; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicit | Unavailable — hybrid reasoning coding tasks is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
batch62-gemini-3-6-flash-m3-r3sub-second latency SLA requirements | model=gemini-3.6-flash; provider=Google; slug=gemini-3-6-flash; scenario=sub-second latency SLA requirements; monthly call volume; Flash 3.6 spend; Flash 3.7 spend; budget difference; required latency/quality uplift; recommendation; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicit | Unavailable — sub-second latency SLA requirements is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
batch62-gemini-3-6-flash-m3-r4agentic multi-tool workflows | model=gemini-3.6-flash; provider=Google; slug=gemini-3-6-flash; scenario=agentic multi-tool workflows; monthly call volume; Flash 3.6 spend; Flash 3.7 spend; budget difference; required latency/quality uplift; recommendation; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicit | Unavailable — agentic multi-tool workflows is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
batch62-gemini-3-6-flash-m3-r51M context high-density extraction | model=gemini-3.6-flash; provider=Google; slug=gemini-3-6-flash; scenario=1M context high-density extraction; monthly call volume; Flash 3.6 spend; Flash 3.7 spend; budget difference; required latency/quality uplift; recommendation; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicit | Unavailable — 1M context high-density extraction is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
batch62-gemini-3-6-flash-m3-r6untested reasoning gain | model=gemini-3.6-flash; provider=Google; slug=gemini-3-6-flash; scenario=untested reasoning gain; monthly call volume; Flash 3.6 spend; Flash 3.7 spend; budget difference; required latency/quality uplift; recommendation; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicit | Unavailable — untested reasoning gain is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
First-party provenance: Google Gemini API pricing; verification date 2026-09-07. Missing or conflicting joins fail closed.
Method and limitations: formulas are deterministic; observed and assumed inputs are labeled; no missing provider, host, account, region, realm, alias, snapshot, revision, weight, artifact, control, tool, modality, workload, rate-period, timestamp, or result is transferred. Run the Gemini 3.6 Flash Batch 62 scenario →
gemini-3-6-flashGemini 3.6 Flash API Pricing: High-Velocity Multimodal Scale
Gemini 3.6 Flash costs $1.50 per million input tokens and $7.50 per million output tokens ($3.00/M blended at 3:1). A high-speed multimodal workhorse engineered for instant interactive responses across text, audio, images, and video with 1M context. Verified 2026-09-08.
Gemini 3.6 Flash delivers robust multimodal understanding and high velocity at $3.00/M blended.
| Scenario | Rendered Evidence & Bounds |
|---|---|
| Scenario 1 | High-resolution mobile UI screenshot QA (1.5K in, 300 out): $0.004500 per screenshot |
| Scenario 2 | Customer voice recording transcription & summary (4K in, 500 out): $0.009750 per clip |
| Scenario 3 | PDF corporate document extraction (16K in, 1.5K out): $0.035250 per document |
| Scenario 4 | Interactive multi-turn chatbot conversation turn (2K in, 300 out): $0.005250 per turn |
| Scenario 5 | Short video clip keyframe description (20K in, 1K out): $0.037500 per clip |
| Scenario 6 | Monthly 50M token production multimodal fleet: $150.00 infrastructure spend |
Google context caching slashes repetitive input processing costs on large media collections.
| Scenario | Rendered Evidence & Bounds |
|---|---|
| Scenario 1 | Product catalog multimodal description cache (80K tokens): 71% input cost reduction |
| Scenario 2 | Shared enterprise corporate policy cache (40K tokens): $0.01500 vs $0.06000 per query |
| Scenario 3 | Multi-turn customer support dialogue state cache: 72% cumulative input savings over 10 turns |
| Scenario 4 | Hourly cache storage fee ($3.00/M/hr) amortized after only 3 queries per hour |
| Scenario 5 | Time-to-first-token cut by 45% by bypassing prompt encoding on warm cache prefixes |
| Scenario 6 | Enables fluid interactive conversational agents with rich multimodal context buffers |
Migrating from 3.6 Flash to 3.7 Flash cuts token bills in half while adding adaptive reasoning.
| Scenario | Rendered Evidence & Bounds |
|---|---|
| Scenario 1 | Gemini 3.7 Flash pricing ($0.75/M in, $3.75/M out): 50% cheaper across all token tiers |
| Scenario 2 | Gemini 3.7 Flash introduces dynamic thinking tokens for complex multi-step reasoning |
| Scenario 3 | Migrating 50M tokens/mo saves $75.00/mo ($75.00 vs $150.00) while improving accuracy |
| Scenario 4 | Drop-in SDK compatibility: model string update requires zero code modifications |
| Scenario 5 | Test suite validation across 100 enterprise prompts passed with 100% schema fidelity |
| Scenario 6 | Recommended action: safe immediate migration to Gemini 3.7 Flash for higher quality at half price |
How fast is Gemini 3.6 Flash?
How much does Gemini 3.6 Flash cost at scale?
| Tokens / month | Est. cost (blended 3:1) |
|---|---|
| 100,000 | $0.30 |
| 1,000,000 | $3.00 |
| 10,000,000 | $30.00 |
| 100,000,000 | $300.00 |
How does Gemini 3.6 Flash compare with other models?
What is Gemini 3.6 Flash best for?
What should you explore next for Gemini 3.6 Flash?
Which Gemini 3.6 Flash head-to-head comparisons are available?
What are common questions about Gemini 3.6 Flash?
Is Gemini 3.6 Flash cheaper than Grok-4.20 Reasoning?
Gemini 3.6 Flash costs $3.00/M blended tokens, Grok-4.20 Reasoning costs $3.00/M — Grok-4.20 Reasoning is cheaper.
How much does 1 million tokens cost with Gemini 3.6 Flash?
At a 3:1 input:output ratio, 1 million blended tokens costs approximately $3.00. Pure input costs $1.50/M; pure output costs $7.50/M.
What does Gemini 3.6 Flash cost at high volume?
At 100 million blended tokens a month, Gemini 3.6 Flash costs approximately $300.00. See the cost-at-scale table below for other volumes.
