← Back to all pricing

GPT-4o Mini API Pricing: Scalable Multimodal Triage and Extraction

Comprehensive GPT-4o Mini API pricing analysis ($0.15/M input, $0.60/M output), classification speed, multimodal vision processing, and modern tier comparisons.

Legacy — use GPT-5.4 Nano See GPT-5.6 Luna pricing.
No announced shutdown date. Source · Full retirement tracker

How much does GPT-4o Mini cost per million tokens?

GPT-4o Mini costs $0.15 per million input tokens and $0.60 per million output tokens ($0.2625/M blended at 3:1). A breakthrough lightweight model providing fast multimodal vision and text inference for high-volume enterprise production. Verified 2026-09-08.

Verified 2026-09-07 source
Input
$0.15/M
Output
$0.60/M
Blended
$0.26/M
Provider
Verified 2026-04-06source

How much does GPT-4o Mini cost per 1,000 requests?

Computed from generated token pricing. Each row assumes the listed input and output tokens per request; this model has no measured verbosity factor, so the unadjusted output estimate is shown.

Request shapeInput tokensOutput tokensCost / 1,000 requests
Short10050$0.0450
Medium1,000500$0.4500
Long4,0002,000$1.8000

Formula: ((input price × input tokens) + (output price × output tokens × verbosity factor)) ÷ 1,000,000 × 1,000. Assumptions: short 100/50, medium 1,000/500, long 4,000/2,000 input/output tokens per request. Unadjusted — no measured verbosity factor is available.

Batch 61 · exact-model pricing decision contributions · verified 2026-09-07

Exact model boundary: OpenAI GPT-4o Mini (gpt-4o-mini). Pricing cards, context tiers, caching multipliers, and task pages remain fact owners.

Prompt-caching and batch API discount stack

Frozen Batch 61 scenario board. Formula / deterministic rule: cost = (uncached_in * rate_in + cached_in * cache_rate + out * rate_out) * batch_multiplier; cache discount = 50%, batch = 50% Boundary: Owns GPT-4o Mini caching and batch savings modeling.

Frozen scenario / field IDExact identity and evidence fieldsResultState
batch61-gpt-4o-mini-m1-r1
interactive uncached query
model=gpt-4o-mini; provider=OpenAI; slug=gpt-4o-mini; scenario=interactive uncached query; input tokens; output tokens; cache status; batch queue; unit bill; effective discount; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — interactive uncached query is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch61-gpt-4o-mini-m1-r2
50% cache hit rate
model=gpt-4o-mini; provider=OpenAI; slug=gpt-4o-mini; scenario=50% cache hit rate; input tokens; output tokens; cache status; batch queue; unit bill; effective discount; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — 50% cache hit rate is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch61-gpt-4o-mini-m1-r3
80% high-reuse prefix
model=gpt-4o-mini; provider=OpenAI; slug=gpt-4o-mini; scenario=80% high-reuse prefix; input tokens; output tokens; cache status; batch queue; unit bill; effective discount; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — 80% high-reuse prefix is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch61-gpt-4o-mini-m1-r4
batch 24h queue job
model=gpt-4o-mini; provider=OpenAI; slug=gpt-4o-mini; scenario=batch 24h queue job; input tokens; output tokens; cache status; batch queue; unit bill; effective discount; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — batch 24h queue job is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch61-gpt-4o-mini-m1-r5
combined cache + batch workload
model=gpt-4o-mini; provider=OpenAI; slug=gpt-4o-mini; scenario=combined cache + batch workload; input tokens; output tokens; cache status; batch queue; unit bill; effective discount; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — combined cache + batch workload is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch61-gpt-4o-mini-m1-r6
unsupported prompt structure
model=gpt-4o-mini; provider=OpenAI; slug=gpt-4o-mini; scenario=unsupported prompt structure; input tokens; output tokens; cache status; batch queue; unit bill; effective discount; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — unsupported prompt structure has no matched, dated bilateral observation.FAIL CLOSED — manual, probe, or source evidence required

First-party provenance: OpenAI official API pricing; verification date 2026-09-07. Missing or conflicting joins fail closed.

Request-shape cost sensitivity and monthly forecasting

Frozen Batch 61 scenario board. Formula / deterministic rule: monthly_spend = calls * ((tokens_in * rate_in + tokens_out * rate_out) / 1M); verbosity index applies to output Boundary: Owns request shape cost sensitivity across chat, extraction, and generation.

Frozen scenario / field IDExact identity and evidence fieldsResultState
batch61-gpt-4o-mini-m2-r1
10K short chat turns
model=gpt-4o-mini; provider=OpenAI; slug=gpt-4o-mini; scenario=10K short chat turns; call volume; prompt tokens; completion tokens; verbosity multiplier; estimated monthly spend; cost tier; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — 10K short chat turns is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch61-gpt-4o-mini-m2-r2
100K data extraction calls
model=gpt-4o-mini; provider=OpenAI; slug=gpt-4o-mini; scenario=100K data extraction calls; call volume; prompt tokens; completion tokens; verbosity multiplier; estimated monthly spend; cost tier; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — 100K data extraction calls is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch61-gpt-4o-mini-m2-r3
1M high-volume classification
model=gpt-4o-mini; provider=OpenAI; slug=gpt-4o-mini; scenario=1M high-volume classification; call volume; prompt tokens; completion tokens; verbosity multiplier; estimated monthly spend; cost tier; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — 1M high-volume classification is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch61-gpt-4o-mini-m2-r4
output-heavy report generation
model=gpt-4o-mini; provider=OpenAI; slug=gpt-4o-mini; scenario=output-heavy report generation; call volume; prompt tokens; completion tokens; verbosity multiplier; estimated monthly spend; cost tier; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — output-heavy report generation is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch61-gpt-4o-mini-m2-r5
uncontrolled verbosity expansion
model=gpt-4o-mini; provider=OpenAI; slug=gpt-4o-mini; scenario=uncontrolled verbosity expansion; call volume; prompt tokens; completion tokens; verbosity multiplier; estimated monthly spend; cost tier; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — uncontrolled verbosity expansion is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch61-gpt-4o-mini-m2-r6
unresolved token count
model=gpt-4o-mini; provider=OpenAI; slug=gpt-4o-mini; scenario=unresolved token count; call volume; prompt tokens; completion tokens; verbosity multiplier; estimated monthly spend; cost tier; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — unresolved token count has no matched, dated bilateral observation.FAIL CLOSED — manual, probe, or source evidence required

First-party provenance: OpenAI model documentation; verification date 2026-09-07. Missing or conflicting joins fail closed.

Legacy maintenance vs GPT-5.6 Luna migration threshold

Frozen Batch 61 scenario board. Formula / deterministic rule: migration_delta = luna_monthly_cost - gpt4o_mini_monthly_cost; break-even requires defect reduction Boundary: Owns upgrade decision modeling to successor GPT-5.6 Luna.

Frozen scenario / field IDExact identity and evidence fieldsResultState
batch61-gpt-4o-mini-m3-r1
pure price comparison
model=gpt-4o-mini; provider=OpenAI; slug=gpt-4o-mini; scenario=pure price comparison; monthly call volume; baseline spend; Luna spend; net delta; required defect save; migration status; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — pure price comparison is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch61-gpt-4o-mini-m3-r2
low defect rate (<2%)
model=gpt-4o-mini; provider=OpenAI; slug=gpt-4o-mini; scenario=low defect rate (<2%); monthly call volume; baseline spend; Luna spend; net delta; required defect save; migration status; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — low defect rate (<2%) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch61-gpt-4o-mini-m3-r3
moderate defect rate (5%)
model=gpt-4o-mini; provider=OpenAI; slug=gpt-4o-mini; scenario=moderate defect rate (5%); monthly call volume; baseline spend; Luna spend; net delta; required defect save; migration status; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — moderate defect rate (5%) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch61-gpt-4o-mini-m3-r4
high defect penalty workload
model=gpt-4o-mini; provider=OpenAI; slug=gpt-4o-mini; scenario=high defect penalty workload; monthly call volume; baseline spend; Luna spend; net delta; required defect save; migration status; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — high defect penalty workload is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch61-gpt-4o-mini-m3-r5
128K context boundary
model=gpt-4o-mini; provider=OpenAI; slug=gpt-4o-mini; scenario=128K context boundary; monthly call volume; baseline spend; Luna spend; net delta; required defect save; migration status; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — 128K context boundary is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch61-gpt-4o-mini-m3-r6
untested quality uplift
model=gpt-4o-mini; provider=OpenAI; slug=gpt-4o-mini; scenario=untested quality uplift; monthly call volume; baseline spend; Luna spend; net delta; required defect save; migration status; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — untested quality uplift is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict

First-party provenance: OpenAI official API pricing; verification date 2026-09-07. Missing or conflicting joins fail closed.

Method and limitations: formulas are deterministic; observed and assumed inputs are labeled; no missing provider, host, account, region, realm, alias, snapshot, revision, weight, artifact, control, tool, modality, workload, rate-period, timestamp, or result is transferred. Run the GPT-4o Mini Batch 61 scenario →

Continuous SEO Builder · Batch 72 Audit · 2026-09-08Owner: gpt-4o-mini

GPT-4o Mini API Pricing: Scalable Multimodal Triage and Extraction

GPT-4o Mini costs $0.15 per million input tokens and $0.60 per million output tokens ($0.2625/M blended at 3:1). A breakthrough lightweight model providing fast multimodal vision and text inference for high-volume enterprise production. Verified 2026-09-08.

Module 1 · GPT-4o Mini High-Volume Production Unit Economics
Blended Cost = (Input Tokens × $0.15 + Output Tokens × $0.60) / 1,000,000

GPT-4o Mini delivers robust multimodal intelligence at an ultra-low $0.2625/M blended price.

Boundary: Standard pay-as-you-go rate card; image tokens priced per tile at proportional rates.
ScenarioRendered Evidence & Bounds
Scenario 1Support ticket intent categorization (600 in, 60 out): $0.000126 per ticket
Scenario 2E-commerce product image tagging (1.2K in, 100 out): $0.000240 per product
Scenario 3Receipt line-item extraction (2K in, 250 out): $0.000450 per receipt
Scenario 4Customer service chatbot response turn (1.5K in, 200 out): $0.000345 per turn
Scenario 5Content moderation and policy filtering (800 in, 30 out): $0.000138 per check
Scenario 6Monthly 100M token production tier: $26.25 total API infrastructure spend
Module 2 · GPT-4o Mini Prompt Caching & High-Density Amortization
Cached Cost = (Cached Input × $0.075 + Uncached Input × $0.15 + Output × $0.60) / 1,000,000

Automatic prompt caching further compresses already-low token costs on repeated application schemas.

Boundary: 50% automatic discount on prompt prefixes >1,024 tokens held in OpenAI active cache memory.
ScenarioRendered Evidence & Bounds
Scenario 1System prompt and JSON schema cache (4K prefix): 41% input cost savings
Scenario 2Product catalog description cache reused across customer queries: 45% input savings
Scenario 3Customer chat history cache amortized over 10 conversational turns: 43% savings
Scenario 4Reduces time-to-first-token latency by up to 40% on cached prompt prefixes
Scenario 5Cache break-even achieved immediately on turn 2 of identical system instructions
Scenario 6Net operational cost drops below $0.20/M blended for high-frequency extraction pipelines
Module 3 · GPT-4o Mini vs GPT-5 Nano Fleet Optimization Matrix
Tier Selection = Multimodal Vision Requirement vs Raw Text Token Rate ($0.05/$0.40)

Pairing GPT-4o Mini for vision with GPT-5 Nano for text maximizes enterprise cost optimization.

Boundary: Compares GPT-4o Mini against ultra-cheap GPT-5 Nano to identify optimal fleet placement.
ScenarioRendered Evidence & Bounds
Scenario 1GPT-4o Mini provides native vision comprehension: required for image and document OCR
Scenario 2GPT-5 Nano ($0.05/$0.40) provides raw text processing at 60% lower token rates
Scenario 3Dual-routing fleet: route image uploads to Mini, route plain text triage to Nano
Scenario 4Saves an additional 35% on text-only high-volume log parsing pipelines
Scenario 5Both models deliver sub-100ms response times for interactive user experiences
Scenario 6Recommended strategy: maintain Mini for multimodal endpoints; leverage Nano for pure text triage
Explore Related Analyses:OpenAI provider profileCompare vs GPT-4oCompare vs GPT-5 NanoCheapest AI API comparison

How fast is GPT-4o Mini?

Not yet measured — see the speed benchmark leaderboard for models we do track.

How much does GPT-4o Mini cost at scale?

Tokens / monthEst. cost (blended 3:1)
100,000$0.03
1,000,000$0.26
10,000,000$2.62
100,000,000$26.25

How does GPT-4o Mini compare with other models?

GPT-5 Nano$0.14/MGPT-5.4 Nano$0.46/MGPT-5 Mini$0.69/MGPT-5.4 Mini$1.69/Mo3-Mini$1.93/MGrok-3 Mini$0.26/MGPT-OSS 120B$0.26/MMistral Small 3.1$0.26/M
See all OpenAI models →

What is GPT-4o Mini best for?

#4 for Chatbots & Support#6 for Translation#16 for Writing & Content

Which GPT-4o Mini head-to-head comparisons are available?

GPT-4o Mini vs GPT-5.6 Luna

What are common questions about GPT-4o Mini?

Is GPT-4o Mini cheaper than Grok-3 Mini?

GPT-4o Mini costs $0.26/M blended tokens, Grok-3 Mini costs $0.26/M — Grok-3 Mini is cheaper.

How much does 1 million tokens cost with GPT-4o Mini?

At a 3:1 input:output ratio, 1 million blended tokens costs approximately $0.26. Pure input costs $0.15/M; pure output costs $0.60/M.

What does GPT-4o Mini cost at high volume?

At 100 million blended tokens a month, GPT-4o Mini costs approximately $26.25. See the cost-at-scale table below for other volumes.

Try GPT-4o Mini for free

Run real prompts against GPT-4o Mini and every other model on this page in one workspace.

Try GPT-4o Mini Free