← Back to all pricing

Gemini 3.5 Flash Lite API Pricing: Sub-Second Multimodal Scale

Detailed Google Gemini 3.5 Flash Lite API pricing ($0.30/M input, $2.50/M output), 1M token context window, context caching discounts, and enterprise SLA budgets.

Full specs, context window and API limits →

How much does Gemini 3.5 Flash Lite cost per million tokens?

Google Gemini 3.5 Flash Lite charges $0.30 per million input tokens and $2.50 per million output tokens ($0.85/M blended at 3:1). Supports 1M context with native audio and video understanding. Verified 2026-09-08.

Verified 2026-09-07 source
Input
$0.30/M
Output
$2.50/M
Blended
$0.85/M
Provider
Verified 2026-08-14source

How much does Gemini 3.5 Flash Lite cost per 1,000 requests?

Computed from generated token pricing. Each row assumes the listed input and output tokens per request; this model has no measured verbosity factor, so the unadjusted output estimate is shown.

Request shapeInput tokensOutput tokensCost / 1,000 requests
Short10050$0.1550
Medium1,000500$1.5500
Long4,0002,000$6.2000

Formula: ((input price × input tokens) + (output price × output tokens × verbosity factor)) ÷ 1,000,000 × 1,000. Assumptions: short 100/50, medium 1,000/500, long 4,000/2,000 input/output tokens per request. Unadjusted — no measured verbosity factor is available.

Three model-specific pricing decisions

Flash Lite’s exact-model bill is separated from Google endpoint policy and the broad version comparison. Legacy status is visible in the neighboring input row.

1. 3.1 Flash Lite → 3.5 migration bill

ModelVerifiedInput / output per M100K fixed billLifecycle boundary
Gemini 3.5 Flash Lite2026-08-14$0.30 / $2.50$185.00Current selected owner
Gemini 3.1 Flash Lite2026-04-06$0.25 / $1.50$125.00Legacy — superseded by Gemini 3.5 Flash Lite

2. 1M-context extraction and agent sensitivity

Fixed workload (input / output)Gemini 3.5 Flash LiteGemini 3.6 FlashDecision boundary
1M extraction · 1,000,000 / 2,000$30500.00$151500.0010% accepted-result uplift required to justify the higher bill
Long agent · 250,000 / 4,000$8500.00$40500.0015% accepted-result uplift required to justify the higher bill

Formula: 100,000 × (input tokens × input $/M + output tokens × output $/M) ÷ 1,000,000. Uplift is a decision threshold, not a measured quality claim.

3. Unit-safe endpoint evidence

Surface / unitDated evidenceSafe calculation
Text$0.000300 $/1K tokens$185.00
VisionUnavailableNo image-unit conversion
CacheUnavailableNo discount default
BatchUnavailableNo discount default
AI Studio / VertexEndpoint distinction unavailable on price rowDo not merge invoices

Verified 2026-08-14. Luna is the data owner for this server-rendered module. “Unavailable” means no compatible dated evidence was found; it is never treated as zero. First-party price source · Run this exact scenario.

All three decisions are server-rendered for Gemini 3.5 Flash Lite; fixed inputs, formulas, dated sources, and unavailable states are intentionally visible.

Batch 67 · exact model pricing decision contributions · verified 2026-09-07

Exact model boundary: Google gemini-3.5-flash-lite (slug gemini-3-5-flash-lite). First-party provider pricing and API documentation remain fact owners.

Token pricing and enterprise tier expenditure matrix

Frozen Batch 67 scenario board. Formula / deterministic rule: monthly_spend = calls * ((in_tokens * 0.30 + out_tokens * 2.50) / 1M) Boundary: Owns base token tariff comparisons and budget expenditure modeling.

Frozen scenario / field IDModel, identity, provider, and evidence fieldsResultState
batch67-gemini-3-5-flash-lite-m1-r1
50K customer support classifications
model=gemini-3.5-flash-lite; slug=gemini-3-5-flash-lite; provider=Google; scenario=50K customer support classifications; workload; prompt tokens; completion tokens; standard spend; cached spend; net savings; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — 50K customer support classifications is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch67-gemini-3-5-flash-lite-m1-r2
200K data extraction requests
model=gemini-3.5-flash-lite; slug=gemini-3-5-flash-lite; provider=Google; scenario=200K data extraction requests; workload; prompt tokens; completion tokens; standard spend; cached spend; net savings; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — 200K data extraction requests is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch67-gemini-3-5-flash-lite-m1-r3
500K high-volume utility queries
model=gemini-3.5-flash-lite; slug=gemini-3-5-flash-lite; provider=Google; scenario=500K high-volume utility queries; workload; prompt tokens; completion tokens; standard spend; cached spend; net savings; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — 500K high-volume utility queries is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch67-gemini-3-5-flash-lite-m1-r4
prompt caching active (75% read discount)
model=gemini-3.5-flash-lite; slug=gemini-3-5-flash-lite; provider=Google; scenario=prompt caching active (75% read discount); workload; prompt tokens; completion tokens; standard spend; cached spend; net savings; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — prompt caching active (75% read discount) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch67-gemini-3-5-flash-lite-m1-r5
batch processing active (50% both)
model=gemini-3.5-flash-lite; slug=gemini-3-5-flash-lite; provider=Google; scenario=batch processing active (50% both); workload; prompt tokens; completion tokens; standard spend; cached spend; net savings; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — batch processing active (50% both) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch67-gemini-3-5-flash-lite-m1-r6
unresolved pricing currency
model=gemini-3.5-flash-lite; slug=gemini-3-5-flash-lite; provider=Google; scenario=unresolved pricing currency; workload; prompt tokens; completion tokens; standard spend; cached spend; net savings; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — unresolved pricing currency has no matched, dated bilateral observation.FAIL CLOSED — manual, probe, or source evidence required

First-party provenance: Google Gemini API pricing; verification date 2026-09-07. Missing or conflicting joins fail closed.

Context window saturation (1M scale) and multimodal gate

Frozen Batch 67 scenario board. Formula / deterministic rule: eligible = (context <= 1M ? Eligible : Excluded); multimodal audio/video support Boundary: Owns context scaling and capability gating for large multimodal inputs.

Frozen scenario / field IDModel, identity, provider, and evidence fieldsResultState
batch67-gemini-3-5-flash-lite-m2-r1
short text query (5K tokens)
model=gemini-3.5-flash-lite; slug=gemini-3-5-flash-lite; provider=Google; scenario=short text query (5K tokens); context size; text eligible; audio eligible; video eligible; token expenditure; routing verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — short text query (5K tokens) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch67-gemini-3-5-flash-lite-m2-r2
multi-hour audio transcription (300K tokens)
model=gemini-3.5-flash-lite; slug=gemini-3-5-flash-lite; provider=Google; scenario=multi-hour audio transcription (300K tokens); context size; text eligible; audio eligible; video eligible; token expenditure; routing verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — multi-hour audio transcription (300K tokens) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch67-gemini-3-5-flash-lite-m2-r3
dense legal repository (750K tokens)
model=gemini-3.5-flash-lite; slug=gemini-3-5-flash-lite; provider=Google; scenario=dense legal repository (750K tokens); context size; text eligible; audio eligible; video eligible; token expenditure; routing verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — dense legal repository (750K tokens) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch67-gemini-3-5-flash-lite-m2-r4
1M full context saturation test
model=gemini-3.5-flash-lite; slug=gemini-3-5-flash-lite; provider=Google; scenario=1M full context saturation test; context size; text eligible; audio eligible; video eligible; token expenditure; routing verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — 1M full context saturation test is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch67-gemini-3-5-flash-lite-m2-r5
video frame rate downsampling penalty
model=gemini-3.5-flash-lite; slug=gemini-3-5-flash-lite; provider=Google; scenario=video frame rate downsampling penalty; context size; text eligible; audio eligible; video eligible; token expenditure; routing verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — video frame rate downsampling penalty is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch67-gemini-3-5-flash-lite-m2-r6
unsupported media payload format
model=gemini-3.5-flash-lite; slug=gemini-3-5-flash-lite; provider=Google; scenario=unsupported media payload format; context size; text eligible; audio eligible; video eligible; token expenditure; routing verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — unsupported media payload format has no matched, dated bilateral observation.FAIL CLOSED — manual, probe, or source evidence required

First-party provenance: Google Gemini documentation; verification date 2026-09-07. Missing or conflicting joins fail closed.

Turnaround time latency and high-volume routing SLA audit

Frozen Batch 67 scenario board. Formula / deterministic rule: turnaround = ttft + (tokens_out / tps); Flash Lite optimized for high-volume endpoints Boundary: Owns turnaround time benchmarks and user experience responsiveness.

Frozen scenario / field IDModel, identity, provider, and evidence fieldsResultState
batch67-gemini-3-5-flash-lite-m3-r1
real-time chat autocomplete (<200ms)
model=gemini-3.5-flash-lite; slug=gemini-3-5-flash-lite; provider=Google; scenario=real-time chat autocomplete (<200ms); task; response SLA; latency; generation speed; SLA compliance; responsiveness verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — real-time chat autocomplete (<200ms) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch67-gemini-3-5-flash-lite-m3-r2
customer support agent reply (<400ms)
model=gemini-3.5-flash-lite; slug=gemini-3-5-flash-lite; provider=Google; scenario=customer support agent reply (<400ms); task; response SLA; latency; generation speed; SLA compliance; responsiveness verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — customer support agent reply (<400ms) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch67-gemini-3-5-flash-lite-m3-r3
structured JSON data parsing
model=gemini-3.5-flash-lite; slug=gemini-3-5-flash-lite; provider=Google; scenario=structured JSON data parsing; task; response SLA; latency; generation speed; SLA compliance; responsiveness verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — structured JSON data parsing is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch67-gemini-3-5-flash-lite-m3-r4
high-throughput batch classification
model=gemini-3.5-flash-lite; slug=gemini-3-5-flash-lite; provider=Google; scenario=high-throughput batch classification; task; response SLA; latency; generation speed; SLA compliance; responsiveness verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — high-throughput batch classification is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch67-gemini-3-5-flash-lite-m3-r5
concurrency contention latency spike
model=gemini-3.5-flash-lite; slug=gemini-3-5-flash-lite; provider=Google; scenario=concurrency contention latency spike; task; response SLA; latency; generation speed; SLA compliance; responsiveness verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — concurrency contention latency spike is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch67-gemini-3-5-flash-lite-m3-r6
unmeasured speed fixture
model=gemini-3.5-flash-lite; slug=gemini-3-5-flash-lite; provider=Google; scenario=unmeasured speed fixture; task; response SLA; latency; generation speed; SLA compliance; responsiveness verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — unmeasured speed fixture is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict

First-party provenance: Google Gemini documentation; verification date 2026-09-07. Missing or conflicting joins fail closed.

Method and limitations: formulas are deterministic; observed and assumed inputs are labeled; no missing provider, host, account, region, realm, alias, snapshot, revision, weight, artifact, control, tool, modality, workload, rate-period, timestamp, or result is transferred. Run the gemini-3-5-flash-lite Batch 67 scenario →

Batch 75 Verified Model Pricing IntelligenceModel owner: gemini-3-5-flash-lite (Google)Audit date: 2026-09-08

Gemini 3.5 Flash Lite API Pricing: Sub-Second Multimodal Scale

Google Gemini 3.5 Flash Lite charges $0.30 per million input tokens and $2.50 per million output tokens ($0.85/M blended at 3:1). Supports 1M context with native audio and video understanding. Verified 2026-09-08.

Token pricing and enterprise tier expenditure matrix

Frozen Batch 75 scenario board. Formula / deterministic rule: monthly_spend = calls * ((in_tokens * 0.30 + out_tokens * 2.50) / 1M) Boundary: Owns base token tariff comparisons and budget expenditure modeling.

Frozen scenario / field IDModel, identity, provider, and evidence fieldsResultState
batch75-gemini-3-5-flash-lite-m1-r1
50K customer support classifications
model=gemini-3.5-flash-lite; slug=gemini-3-5-flash-lite; provider=Google; scenario=50K customer support classifications; workload; prompt tokens; completion tokens; standard spend; cached spend; net savings; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — 50K customer support classifications is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch75-gemini-3-5-flash-lite-m1-r2
200K data extraction requests
model=gemini-3.5-flash-lite; slug=gemini-3-5-flash-lite; provider=Google; scenario=200K data extraction requests; workload; prompt tokens; completion tokens; standard spend; cached spend; net savings; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — 200K data extraction requests is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch75-gemini-3-5-flash-lite-m1-r3
500K high-volume utility queries
model=gemini-3.5-flash-lite; slug=gemini-3-5-flash-lite; provider=Google; scenario=500K high-volume utility queries; workload; prompt tokens; completion tokens; standard spend; cached spend; net savings; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — 500K high-volume utility queries is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch75-gemini-3-5-flash-lite-m1-r4
prompt caching active (75% read discount)
model=gemini-3.5-flash-lite; slug=gemini-3-5-flash-lite; provider=Google; scenario=prompt caching active (75% read discount); workload; prompt tokens; completion tokens; standard spend; cached spend; net savings; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — prompt caching active (75% read discount) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch75-gemini-3-5-flash-lite-m1-r5
batch processing active (50% both)
model=gemini-3.5-flash-lite; slug=gemini-3-5-flash-lite; provider=Google; scenario=batch processing active (50% both); workload; prompt tokens; completion tokens; standard spend; cached spend; net savings; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — batch processing active (50% both) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch75-gemini-3-5-flash-lite-m1-r6
unresolved pricing currency
model=gemini-3.5-flash-lite; slug=gemini-3-5-flash-lite; provider=Google; scenario=unresolved pricing currency; workload; prompt tokens; completion tokens; standard spend; cached spend; net savings; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — unresolved pricing currency has no matched, dated bilateral observation.FAIL CLOSED — manual, probe, or source evidence required

First-party provenance: Google Cloud AI pricing; verification date 2026-09-08. Missing or conflicting joins fail closed.

Context window saturation (1M scale) and multimodal gate

Frozen Batch 75 scenario board. Formula / deterministic rule: eligible = (context <= 1M ? Eligible : Excluded); multimodal audio/video support Boundary: Owns context scaling and capability gating for large multimodal inputs.

Frozen scenario / field IDModel, identity, provider, and evidence fieldsResultState
batch75-gemini-3-5-flash-lite-m2-r1
short text query (5K tokens)
model=gemini-3.5-flash-lite; slug=gemini-3-5-flash-lite; provider=Google; scenario=short text query (5K tokens); context size; text eligible; audio eligible; video eligible; token expenditure; routing verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — short text query (5K tokens) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch75-gemini-3-5-flash-lite-m2-r2
multi-hour audio transcription (300K tokens)
model=gemini-3.5-flash-lite; slug=gemini-3-5-flash-lite; provider=Google; scenario=multi-hour audio transcription (300K tokens); context size; text eligible; audio eligible; video eligible; token expenditure; routing verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — multi-hour audio transcription (300K tokens) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch75-gemini-3-5-flash-lite-m2-r3
dense legal repository (750K tokens)
model=gemini-3.5-flash-lite; slug=gemini-3-5-flash-lite; provider=Google; scenario=dense legal repository (750K tokens); context size; text eligible; audio eligible; video eligible; token expenditure; routing verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — dense legal repository (750K tokens) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch75-gemini-3-5-flash-lite-m2-r4
1M full context saturation test
model=gemini-3.5-flash-lite; slug=gemini-3-5-flash-lite; provider=Google; scenario=1M full context saturation test; context size; text eligible; audio eligible; video eligible; token expenditure; routing verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — 1M full context saturation test is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch75-gemini-3-5-flash-lite-m2-r5
video frame rate downsampling penalty
model=gemini-3.5-flash-lite; slug=gemini-3-5-flash-lite; provider=Google; scenario=video frame rate downsampling penalty; context size; text eligible; audio eligible; video eligible; token expenditure; routing verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — video frame rate downsampling penalty is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch75-gemini-3-5-flash-lite-m2-r6
unsupported media payload format
model=gemini-3.5-flash-lite; slug=gemini-3-5-flash-lite; provider=Google; scenario=unsupported media payload format; context size; text eligible; audio eligible; video eligible; token expenditure; routing verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — unsupported media payload format has no matched, dated bilateral observation.FAIL CLOSED — manual, probe, or source evidence required

First-party provenance: Google Gemini documentation; verification date 2026-09-08. Missing or conflicting joins fail closed.

Turnaround time latency and high-volume routing SLA audit

Frozen Batch 75 scenario board. Formula / deterministic rule: turnaround = ttft + (tokens_out / tps); Flash Lite optimized for high-volume endpoints Boundary: Owns turnaround time benchmarks and user experience responsiveness.

Frozen scenario / field IDModel, identity, provider, and evidence fieldsResultState
batch75-gemini-3-5-flash-lite-m3-r1
real-time chat autocomplete (<200ms)
model=gemini-3.5-flash-lite; slug=gemini-3-5-flash-lite; provider=Google; scenario=real-time chat autocomplete (<200ms); task; response SLA; latency; generation speed; SLA compliance; responsiveness verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — real-time chat autocomplete (<200ms) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch75-gemini-3-5-flash-lite-m3-r2
customer support agent reply (<400ms)
model=gemini-3.5-flash-lite; slug=gemini-3-5-flash-lite; provider=Google; scenario=customer support agent reply (<400ms); task; response SLA; latency; generation speed; SLA compliance; responsiveness verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — customer support agent reply (<400ms) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch75-gemini-3-5-flash-lite-m3-r3
structured JSON data parsing
model=gemini-3.5-flash-lite; slug=gemini-3-5-flash-lite; provider=Google; scenario=structured JSON data parsing; task; response SLA; latency; generation speed; SLA compliance; responsiveness verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — structured JSON data parsing is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch75-gemini-3-5-flash-lite-m3-r4
high-throughput batch classification
model=gemini-3.5-flash-lite; slug=gemini-3-5-flash-lite; provider=Google; scenario=high-throughput batch classification; task; response SLA; latency; generation speed; SLA compliance; responsiveness verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — high-throughput batch classification is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch75-gemini-3-5-flash-lite-m3-r5
concurrency contention latency spike
model=gemini-3.5-flash-lite; slug=gemini-3-5-flash-lite; provider=Google; scenario=concurrency contention latency spike; task; response SLA; latency; generation speed; SLA compliance; responsiveness verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — concurrency contention latency spike is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch75-gemini-3-5-flash-lite-m3-r6
unmeasured speed fixture
model=gemini-3.5-flash-lite; slug=gemini-3-5-flash-lite; provider=Google; scenario=unmeasured speed fixture; task; response SLA; latency; generation speed; SLA compliance; responsiveness verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — unmeasured speed fixture is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict

First-party provenance: Google Gemini documentation; verification date 2026-09-08. Missing or conflicting joins fail closed.

How fast is Gemini 3.5 Flash Lite?

Tokens / sec
162
TTFT
240 ms
Rank
#7 of 31
$ / M ÷ t/s
$0.0052
Measured with 5 runs on a fixed prompt — see the full methodology.

How much does Gemini 3.5 Flash Lite cost at scale?

Tokens / monthEst. cost (blended 3:1)
100,000$0.09
1,000,000$0.85
10,000,000$8.50
100,000,000$85.00

How does Gemini 3.5 Flash Lite compare with other models?

Gemini 2.5 Flash Lite$0.18/MGemini 3.1 Flash Lite$0.56/MGemini 2.5 Flash$0.85/MGemini 3.7 Flash$1.50/MGemini 3.1 Flash$1.69/MGemini 2.5 Flash$0.85/MMistral Large 3$0.75/MGLM-5.1$1.00/M
See all Google models →

What is Gemini 3.5 Flash Lite best for?

#4 for Image Understanding#5 for Summarization#7 for Math & Reasoning
Looking for a cheaper option?
GPT-OSS 120B (Cerebras) is 47.1% cheaper — a config migration. See all 8 alternatives to Gemini 3.5 Flash Lite

Which Gemini 3.5 Flash Lite head-to-head comparisons are available?

Gemini 3.5 Flash Lite vs Gemini 2.5 Flash Lite

What are common questions about Gemini 3.5 Flash Lite?

Is Gemini 3.5 Flash Lite cheaper than Gemini 2.5 Flash?

Gemini 3.5 Flash Lite costs $0.85/M blended tokens, Gemini 2.5 Flash costs $0.85/M — Gemini 2.5 Flash is cheaper.

How much does 1 million tokens cost with Gemini 3.5 Flash Lite?

At a 3:1 input:output ratio, 1 million blended tokens costs approximately $0.85. Pure input costs $0.30/M; pure output costs $2.50/M.

What does Gemini 3.5 Flash Lite cost at high volume?

At 100 million blended tokens a month, Gemini 3.5 Flash Lite costs approximately $85.00. See the cost-at-scale table below for other volumes.

Try Gemini 3.5 Flash Lite for free

Run real prompts against Gemini 3.5 Flash Lite and every other model on this page in one workspace.

Try Gemini 3.5 Flash Lite Free