OpenAI GPT-5.4 Mini API Pricing: Balanced Performance at Scale
Explore OpenAI GPT-5.4 Mini API pricing ($0.75/M input, $4.50/M output), balanced mid-tier intelligence, prompt caching savings, and batch discounts.
How much does GPT-5.4 Mini cost per million tokens?
OpenAI GPT-5.4 Mini costs $0.75 per million input tokens and $4.50 per million output tokens ($1.6875/M blended at 3:1). Delivers strong analytical capabilities and tool-use reliability for high-volume enterprise pipelines. Verified 2026-09-08.
How much does GPT-5.4 Mini cost per 1,000 requests?
Computed from generated token pricing. Each row assumes the listed input and output tokens per request; this model has no measured verbosity factor, so the unadjusted output estimate is shown.
| Request shape | Input tokens | Output tokens | Cost / 1,000 requests |
|---|---|---|---|
| Short | 100 | 50 | $0.3000 |
| Medium | 1,000 | 500 | $3.0000 |
| Long | 4,000 | 2,000 | $12.0000 |
Formula: ((input price × input tokens) + (output price × output tokens × verbosity factor)) ÷ 1,000,000 × 1,000. Assumptions: short 100/50, medium 1,000/500, long 4,000/2,000 input/output tokens per request. Unadjusted — no measured verbosity factor is available.
Three model-specific legacy pricing decisions
GPT-5.4 Mini owns compact-model extraction, coding-subtask, and tool-loop bills; GPT-5.6 Luna is used only for the numeric migration premium.
1. Fixed model-specific workload bills
| Workload | Input / output | 100K requests | Evidence boundary |
|---|---|---|---|
| Extraction | 2,000 / 400 | $330.00 | Text tokens |
| Coding subtask | 4,000 / 1,000 | $750.00 | Text tokens |
| Tool loop | 8,000 / 1,200 | $1140.00 | Retry shown separately |
Formula: requests × (input tokens × input $/M + output tokens × output $/M × output expansion) ÷ 1,000,000. Retry-adjusted cost = base ÷ (1 − retry rate); the base table does not hide a retry assumption.
2. Mini → Luna accepted-result crossover
| Fixed shape | GPT-5.4 Mini | GPT-5.6 Luna | Numeric decision boundary |
|---|---|---|---|
| Extraction · 2,000 / 400 | $358.70 | $463.16 | 29% accepted-result uplift required after fixed retry assumptions (8% → 5%) |
| Coding subtask · 4,000 / 1,000 | $815.22 | $1052.63 | 29% accepted-result uplift required after fixed retry assumptions (8% → 5%) |
This is a cost-per-accepted-result threshold, not a measured quality claim. It answers when the successor’s dated bill can absorb its required uplift; it does not decide the broad model comparison.
3. Volume sensitivity and evidence boundary
| Traffic / evidence | Result | Safe treatment |
|---|---|---|
| 100K requests | $358.70 | Fixed first workload; text-token units |
| 1M requests | $3300.00 | Linear token spend only; no volume discount inferred |
| 10M requests | $33000.00 | Budget exposure; quota and latency remain unavailable |
| Cache: Unavailable | Unavailable | Do not infer, zero-price, or import a neighboring model’s mechanic |
| Batch: Unavailable | Unavailable | Do not infer, zero-price, or import a neighboring model’s mechanic |
| Context: Unavailable | Unavailable | Do not infer, zero-price, or import a neighboring model’s mechanic |
| Shutdown date: Unavailable; revalidate before a current-price claim | Unavailable | Do not infer, zero-price, or import a neighboring model’s mechanic |
| Lifecycle | legacy; no sourced announcement date | No sourced shutdown date; revalidate before current claims |
Fixed monthly request cadence and cost
| Workload | Requests / month | Input / output | Monthly legacy cost |
|---|---|---|---|
| Extraction | 1,000,000 | 2,000 / 400 | $3300.00 |
| Coding subtask | 1,000,000 | 4,000 / 1,000 | $7500.00 |
| Tool loop | 1,000,000 | 8,000 / 1,200 | $11400.00 |
Monthly total = 1,000,000 requests × (input tokens × input $/M + output tokens × output $/M) ÷ 1,000,000. No volume discount is inferred.
Price verified 2026-04-06; lifecycle verified 2026-08-14. Luna is the data owner. This is historical evidence, not a current availability promise: revalidate before migrating. “Unavailable” means no compatible dated evidence was found; it is never treated as zero. First-party price source · lifecycle source · Test this model in All AI Ask.
Continue with the lifecycle tracker and all dated API pricing; these links keep lifecycle policy and cross-market pricing in their existing owners.
All three Batch 6 contributions are server-rendered for GPT-5.4 Mini; fixed inputs, formulas, dated provenance, successor boundary, lifecycle state, and missing-data treatment remain visible.
Batch 68 · exact model pricing decision contributions · verified 2026-09-08
Exact model boundary: OpenAI gpt-5.4-mini (slug gpt-5-4-mini). First-party provider pricing and API documentation remain fact owners.
Mid-tier token pricing and enterprise pipeline spend matrix
Frozen Batch 68 scenario board. Formula / deterministic rule: monthly_spend = calls * ((in_tokens * 0.75 + out_tokens * 4.50) / 1M) Boundary: Owns GPT-5.4 Mini unit economics and volume pipeline expenditure modeling.
| Frozen scenario / field ID | Model, identity, provider, and evidence fields | Result | State |
|---|---|---|---|
batch68-gpt-5-4-mini-m1-r125K structured data extraction tasks | model=gpt-5.4-mini; slug=gpt-5-4-mini; provider=OpenAI; scenario=25K structured data extraction tasks; workload; prompt tokens; completion tokens; standard spend; cached spend; batch spend; cost winner; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicit | Unavailable — 25K structured data extraction tasks is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
batch68-gpt-5-4-mini-m1-r2100K customer support ticket resolutions | model=gpt-5.4-mini; slug=gpt-5-4-mini; provider=OpenAI; scenario=100K customer support ticket resolutions; workload; prompt tokens; completion tokens; standard spend; cached spend; batch spend; cost winner; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicit | Unavailable — 100K customer support ticket resolutions is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
batch68-gpt-5-4-mini-m1-r3500K automated code review passes | model=gpt-5.4-mini; slug=gpt-5-4-mini; provider=OpenAI; scenario=500K automated code review passes; workload; prompt tokens; completion tokens; standard spend; cached spend; batch spend; cost winner; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicit | Unavailable — 500K automated code review passes is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
batch68-gpt-5-4-mini-m1-r4prompt caching reuse (50% input discount) | model=gpt-5.4-mini; slug=gpt-5-4-mini; provider=OpenAI; scenario=prompt caching reuse (50% input discount); workload; prompt tokens; completion tokens; standard spend; cached spend; batch spend; cost winner; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicit | Unavailable — prompt caching reuse (50% input discount) is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
batch68-gpt-5-4-mini-m1-r5batch processing API queue (50% discount) | model=gpt-5.4-mini; slug=gpt-5-4-mini; provider=OpenAI; scenario=batch processing API queue (50% discount); workload; prompt tokens; completion tokens; standard spend; cached spend; batch spend; cost winner; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicit | Unavailable — batch processing API queue (50% discount) is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
batch68-gpt-5-4-mini-m1-r6unresolved billing currency | model=gpt-5.4-mini; slug=gpt-5-4-mini; provider=OpenAI; scenario=unresolved billing currency; workload; prompt tokens; completion tokens; standard spend; cached spend; batch spend; cost winner; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicit | Unavailable — unresolved billing currency has no matched, dated bilateral observation. | FAIL CLOSED — manual, probe, or source evidence required |
First-party provenance: OpenAI API pricing; verification date 2026-09-08. Missing or conflicting joins fail closed.
Tool-use agent reliability and structured JSON schema gate
Frozen Batch 68 scenario board. Formula / deterministic rule: agent_efficiency = successful_tool_calls / total_tokens_billed Boundary: Owns function calling reliability and structured output schema compliance.
| Frozen scenario / field ID | Model, identity, provider, and evidence fields | Result | State |
|---|---|---|---|
batch68-gpt-5-4-mini-m2-r1multi-step database query tool loop | model=gpt-5.4-mini; slug=gpt-5-4-mini; provider=OpenAI; scenario=multi-step database query tool loop; agent task; tool call count; schema compliance rate; tokens billed; error recovery cost; agent verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicit | Unavailable — multi-step database query tool loop is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
batch68-gpt-5-4-mini-m2-r2API integration agent with 5+ functions | model=gpt-5.4-mini; slug=gpt-5-4-mini; provider=OpenAI; scenario=API integration agent with 5+ functions; agent task; tool call count; schema compliance rate; tokens billed; error recovery cost; agent verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicit | Unavailable — API integration agent with 5+ functions is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
batch68-gpt-5-4-mini-m2-r3strict JSON schema extraction pass | model=gpt-5.4-mini; slug=gpt-5-4-mini; provider=OpenAI; scenario=strict JSON schema extraction pass; agent task; tool call count; schema compliance rate; tokens billed; error recovery cost; agent verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicit | Unavailable — strict JSON schema extraction pass is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
batch68-gpt-5-4-mini-m2-r4high-concurrency customer agent swarm | model=gpt-5.4-mini; slug=gpt-5-4-mini; provider=OpenAI; scenario=high-concurrency customer agent swarm; agent task; tool call count; schema compliance rate; tokens billed; error recovery cost; agent verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicit | Unavailable — high-concurrency customer agent swarm is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
batch68-gpt-5-4-mini-m2-r5schema validation retry penalty | model=gpt-5.4-mini; slug=gpt-5-4-mini; provider=OpenAI; scenario=schema validation retry penalty; agent task; tool call count; schema compliance rate; tokens billed; error recovery cost; agent verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicit | Unavailable — schema validation retry penalty is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
batch68-gpt-5-4-mini-m2-r6unsupported function schema parameter | model=gpt-5.4-mini; slug=gpt-5-4-mini; provider=OpenAI; scenario=unsupported function schema parameter; agent task; tool call count; schema compliance rate; tokens billed; error recovery cost; agent verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicit | Unavailable — unsupported function schema parameter has no matched, dated bilateral observation. | FAIL CLOSED — manual, probe, or source evidence required |
First-party provenance: OpenAI API documentation; verification date 2026-09-08. Missing or conflicting joins fail closed.
Prompt caching break-even and long-context cost optimization
Frozen Batch 68 scenario board. Formula / deterministic rule: cache_cost = (tokens * 0.375) / 1M + storage_fee; un-cached = (tokens * 0.75) / 1M Boundary: Owns long-context economics and prompt cache amortization for GPT-5.4 Mini.
| Frozen scenario / field ID | Model, identity, provider, and evidence fields | Result | State |
|---|---|---|---|
batch68-gpt-5-4-mini-m3-r132K system prompt and schema context | model=gpt-5.4-mini; slug=gpt-5-4-mini; provider=OpenAI; scenario=32K system prompt and schema context; context depth; base input cost; cached input cost; minimum reuse break-even; caching recommendation; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicit | Unavailable — 32K system prompt and schema context is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
batch68-gpt-5-4-mini-m3-r264K multi-turn customer history workspace | model=gpt-5.4-mini; slug=gpt-5-4-mini; provider=OpenAI; scenario=64K multi-turn customer history workspace; context depth; base input cost; cached input cost; minimum reuse break-even; caching recommendation; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicit | Unavailable — 64K multi-turn customer history workspace is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
batch68-gpt-5-4-mini-m3-r3128K document retrieval context pass | model=gpt-5.4-mini; slug=gpt-5-4-mini; provider=OpenAI; scenario=128K document retrieval context pass; context depth; base input cost; cached input cost; minimum reuse break-even; caching recommendation; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicit | Unavailable — 128K document retrieval context pass is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
batch68-gpt-5-4-mini-m3-r4agent workspace with 10+ turn iterations | model=gpt-5.4-mini; slug=gpt-5-4-mini; provider=OpenAI; scenario=agent workspace with 10+ turn iterations; context depth; base input cost; cached input cost; minimum reuse break-even; caching recommendation; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicit | Unavailable — agent workspace with 10+ turn iterations is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
batch68-gpt-5-4-mini-m3-r5cache eviction before 5-minute TTL | model=gpt-5.4-mini; slug=gpt-5-4-mini; provider=OpenAI; scenario=cache eviction before 5-minute TTL; context depth; base input cost; cached input cost; minimum reuse break-even; caching recommendation; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicit | Unavailable — cache eviction before 5-minute TTL is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
batch68-gpt-5-4-mini-m3-r6unresolved cache storage retention | model=gpt-5.4-mini; slug=gpt-5-4-mini; provider=OpenAI; scenario=unresolved cache storage retention; context depth; base input cost; cached input cost; minimum reuse break-even; caching recommendation; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicit | Unavailable — unresolved cache storage retention has no matched, dated bilateral observation. | FAIL CLOSED — manual, probe, or source evidence required |
First-party provenance: OpenAI API pricing; verification date 2026-09-08. Missing or conflicting joins fail closed.
Method and limitations: formulas are deterministic; observed and assumed inputs are labeled; no missing provider, host, account, region, realm, alias, snapshot, revision, weight, artifact, control, tool, modality, workload, rate-period, timestamp, or result is transferred. Run the gpt-5-4-mini Batch 68 scenario →
How fast is GPT-5.4 Mini?
How much does GPT-5.4 Mini cost at scale?
| Tokens / month | Est. cost (blended 3:1) |
|---|---|
| 100,000 | $0.17 |
| 1,000,000 | $1.69 |
| 10,000,000 | $16.88 |
| 100,000,000 | $168.75 |
How does GPT-5.4 Mini compare with other models?
What should you explore next for GPT-5.4 Mini?
What are common questions about GPT-5.4 Mini?
Is GPT-5.4 Mini cheaper than Gemini 3.1 Flash?
GPT-5.4 Mini costs $1.69/M blended tokens, Gemini 3.1 Flash costs $1.69/M — Gemini 3.1 Flash is cheaper.
How much does 1 million tokens cost with GPT-5.4 Mini?
At a 3:1 input:output ratio, 1 million blended tokens costs approximately $1.69. Pure input costs $0.75/M; pure output costs $4.50/M.
What does GPT-5.4 Mini cost at high volume?
At 100 million blended tokens a month, GPT-5.4 Mini costs approximately $168.75. See the cost-at-scale table below for other volumes.
