← Back to all pricing

OpenAI GPT-5.4 Mini API Pricing: Balanced Performance at Scale

Explore OpenAI GPT-5.4 Mini API pricing ($0.75/M input, $4.50/M output), balanced mid-tier intelligence, prompt caching savings, and batch discounts.

Legacy — superseded by GPT-5.6 Luna See GPT-5.6 Luna pricing.
No announced shutdown date. Source · Full retirement tracker

How much does GPT-5.4 Mini cost per million tokens?

OpenAI GPT-5.4 Mini costs $0.75 per million input tokens and $4.50 per million output tokens ($1.6875/M blended at 3:1). Delivers strong analytical capabilities and tool-use reliability for high-volume enterprise pipelines. Verified 2026-09-08.

Verified 2026-09-08 source
Input
$0.75/M
Output
$4.50/M
Blended
$1.69/M
Provider
Verified 2026-04-06source

How much does GPT-5.4 Mini cost per 1,000 requests?

Computed from generated token pricing. Each row assumes the listed input and output tokens per request; this model has no measured verbosity factor, so the unadjusted output estimate is shown.

Request shapeInput tokensOutput tokensCost / 1,000 requests
Short10050$0.3000
Medium1,000500$3.0000
Long4,0002,000$12.0000

Formula: ((input price × input tokens) + (output price × output tokens × verbosity factor)) ÷ 1,000,000 × 1,000. Assumptions: short 100/50, medium 1,000/500, long 4,000/2,000 input/output tokens per request. Unadjusted — no measured verbosity factor is available.

Three model-specific legacy pricing decisions

GPT-5.4 Mini owns compact-model extraction, coding-subtask, and tool-loop bills; GPT-5.6 Luna is used only for the numeric migration premium.

1. Fixed model-specific workload bills

WorkloadInput / output100K requestsEvidence boundary
Extraction2,000 / 400$330.00Text tokens
Coding subtask4,000 / 1,000$750.00Text tokens
Tool loop8,000 / 1,200$1140.00Retry shown separately

Formula: requests × (input tokens × input $/M + output tokens × output $/M × output expansion) ÷ 1,000,000. Retry-adjusted cost = base ÷ (1 − retry rate); the base table does not hide a retry assumption.

2. Mini → Luna accepted-result crossover

Fixed shapeGPT-5.4 MiniGPT-5.6 LunaNumeric decision boundary
Extraction · 2,000 / 400$358.70$463.1629% accepted-result uplift required after fixed retry assumptions (8% → 5%)
Coding subtask · 4,000 / 1,000$815.22$1052.6329% accepted-result uplift required after fixed retry assumptions (8% → 5%)

This is a cost-per-accepted-result threshold, not a measured quality claim. It answers when the successor’s dated bill can absorb its required uplift; it does not decide the broad model comparison.

3. Volume sensitivity and evidence boundary

Traffic / evidenceResultSafe treatment
100K requests$358.70Fixed first workload; text-token units
1M requests$3300.00Linear token spend only; no volume discount inferred
10M requests$33000.00Budget exposure; quota and latency remain unavailable
Cache: UnavailableUnavailableDo not infer, zero-price, or import a neighboring model’s mechanic
Batch: UnavailableUnavailableDo not infer, zero-price, or import a neighboring model’s mechanic
Context: UnavailableUnavailableDo not infer, zero-price, or import a neighboring model’s mechanic
Shutdown date: Unavailable; revalidate before a current-price claimUnavailableDo not infer, zero-price, or import a neighboring model’s mechanic
Lifecyclelegacy; no sourced announcement dateNo sourced shutdown date; revalidate before current claims

Fixed monthly request cadence and cost

WorkloadRequests / monthInput / outputMonthly legacy cost
Extraction1,000,0002,000 / 400$3300.00
Coding subtask1,000,0004,000 / 1,000$7500.00
Tool loop1,000,0008,000 / 1,200$11400.00

Monthly total = 1,000,000 requests × (input tokens × input $/M + output tokens × output $/M) ÷ 1,000,000. No volume discount is inferred.

Price verified 2026-04-06; lifecycle verified 2026-08-14. Luna is the data owner. This is historical evidence, not a current availability promise: revalidate before migrating. “Unavailable” means no compatible dated evidence was found; it is never treated as zero. First-party price source · lifecycle source · Test this model in All AI Ask.

Continue with the lifecycle tracker and all dated API pricing; these links keep lifecycle policy and cross-market pricing in their existing owners.

All three Batch 6 contributions are server-rendered for GPT-5.4 Mini; fixed inputs, formulas, dated provenance, successor boundary, lifecycle state, and missing-data treatment remain visible.

Batch 68 · exact model pricing decision contributions · verified 2026-09-08

Exact model boundary: OpenAI gpt-5.4-mini (slug gpt-5-4-mini). First-party provider pricing and API documentation remain fact owners.

Mid-tier token pricing and enterprise pipeline spend matrix

Frozen Batch 68 scenario board. Formula / deterministic rule: monthly_spend = calls * ((in_tokens * 0.75 + out_tokens * 4.50) / 1M) Boundary: Owns GPT-5.4 Mini unit economics and volume pipeline expenditure modeling.

Frozen scenario / field IDModel, identity, provider, and evidence fieldsResultState
batch68-gpt-5-4-mini-m1-r1
25K structured data extraction tasks
model=gpt-5.4-mini; slug=gpt-5-4-mini; provider=OpenAI; scenario=25K structured data extraction tasks; workload; prompt tokens; completion tokens; standard spend; cached spend; batch spend; cost winner; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — 25K structured data extraction tasks is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch68-gpt-5-4-mini-m1-r2
100K customer support ticket resolutions
model=gpt-5.4-mini; slug=gpt-5-4-mini; provider=OpenAI; scenario=100K customer support ticket resolutions; workload; prompt tokens; completion tokens; standard spend; cached spend; batch spend; cost winner; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — 100K customer support ticket resolutions is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch68-gpt-5-4-mini-m1-r3
500K automated code review passes
model=gpt-5.4-mini; slug=gpt-5-4-mini; provider=OpenAI; scenario=500K automated code review passes; workload; prompt tokens; completion tokens; standard spend; cached spend; batch spend; cost winner; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — 500K automated code review passes is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch68-gpt-5-4-mini-m1-r4
prompt caching reuse (50% input discount)
model=gpt-5.4-mini; slug=gpt-5-4-mini; provider=OpenAI; scenario=prompt caching reuse (50% input discount); workload; prompt tokens; completion tokens; standard spend; cached spend; batch spend; cost winner; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — prompt caching reuse (50% input discount) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch68-gpt-5-4-mini-m1-r5
batch processing API queue (50% discount)
model=gpt-5.4-mini; slug=gpt-5-4-mini; provider=OpenAI; scenario=batch processing API queue (50% discount); workload; prompt tokens; completion tokens; standard spend; cached spend; batch spend; cost winner; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — batch processing API queue (50% discount) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch68-gpt-5-4-mini-m1-r6
unresolved billing currency
model=gpt-5.4-mini; slug=gpt-5-4-mini; provider=OpenAI; scenario=unresolved billing currency; workload; prompt tokens; completion tokens; standard spend; cached spend; batch spend; cost winner; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — unresolved billing currency has no matched, dated bilateral observation.FAIL CLOSED — manual, probe, or source evidence required

First-party provenance: OpenAI API pricing; verification date 2026-09-08. Missing or conflicting joins fail closed.

Tool-use agent reliability and structured JSON schema gate

Frozen Batch 68 scenario board. Formula / deterministic rule: agent_efficiency = successful_tool_calls / total_tokens_billed Boundary: Owns function calling reliability and structured output schema compliance.

Frozen scenario / field IDModel, identity, provider, and evidence fieldsResultState
batch68-gpt-5-4-mini-m2-r1
multi-step database query tool loop
model=gpt-5.4-mini; slug=gpt-5-4-mini; provider=OpenAI; scenario=multi-step database query tool loop; agent task; tool call count; schema compliance rate; tokens billed; error recovery cost; agent verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — multi-step database query tool loop is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch68-gpt-5-4-mini-m2-r2
API integration agent with 5+ functions
model=gpt-5.4-mini; slug=gpt-5-4-mini; provider=OpenAI; scenario=API integration agent with 5+ functions; agent task; tool call count; schema compliance rate; tokens billed; error recovery cost; agent verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — API integration agent with 5+ functions is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch68-gpt-5-4-mini-m2-r3
strict JSON schema extraction pass
model=gpt-5.4-mini; slug=gpt-5-4-mini; provider=OpenAI; scenario=strict JSON schema extraction pass; agent task; tool call count; schema compliance rate; tokens billed; error recovery cost; agent verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — strict JSON schema extraction pass is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch68-gpt-5-4-mini-m2-r4
high-concurrency customer agent swarm
model=gpt-5.4-mini; slug=gpt-5-4-mini; provider=OpenAI; scenario=high-concurrency customer agent swarm; agent task; tool call count; schema compliance rate; tokens billed; error recovery cost; agent verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — high-concurrency customer agent swarm is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch68-gpt-5-4-mini-m2-r5
schema validation retry penalty
model=gpt-5.4-mini; slug=gpt-5-4-mini; provider=OpenAI; scenario=schema validation retry penalty; agent task; tool call count; schema compliance rate; tokens billed; error recovery cost; agent verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — schema validation retry penalty is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch68-gpt-5-4-mini-m2-r6
unsupported function schema parameter
model=gpt-5.4-mini; slug=gpt-5-4-mini; provider=OpenAI; scenario=unsupported function schema parameter; agent task; tool call count; schema compliance rate; tokens billed; error recovery cost; agent verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — unsupported function schema parameter has no matched, dated bilateral observation.FAIL CLOSED — manual, probe, or source evidence required

First-party provenance: OpenAI API documentation; verification date 2026-09-08. Missing or conflicting joins fail closed.

Prompt caching break-even and long-context cost optimization

Frozen Batch 68 scenario board. Formula / deterministic rule: cache_cost = (tokens * 0.375) / 1M + storage_fee; un-cached = (tokens * 0.75) / 1M Boundary: Owns long-context economics and prompt cache amortization for GPT-5.4 Mini.

Frozen scenario / field IDModel, identity, provider, and evidence fieldsResultState
batch68-gpt-5-4-mini-m3-r1
32K system prompt and schema context
model=gpt-5.4-mini; slug=gpt-5-4-mini; provider=OpenAI; scenario=32K system prompt and schema context; context depth; base input cost; cached input cost; minimum reuse break-even; caching recommendation; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — 32K system prompt and schema context is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch68-gpt-5-4-mini-m3-r2
64K multi-turn customer history workspace
model=gpt-5.4-mini; slug=gpt-5-4-mini; provider=OpenAI; scenario=64K multi-turn customer history workspace; context depth; base input cost; cached input cost; minimum reuse break-even; caching recommendation; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — 64K multi-turn customer history workspace is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch68-gpt-5-4-mini-m3-r3
128K document retrieval context pass
model=gpt-5.4-mini; slug=gpt-5-4-mini; provider=OpenAI; scenario=128K document retrieval context pass; context depth; base input cost; cached input cost; minimum reuse break-even; caching recommendation; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — 128K document retrieval context pass is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch68-gpt-5-4-mini-m3-r4
agent workspace with 10+ turn iterations
model=gpt-5.4-mini; slug=gpt-5-4-mini; provider=OpenAI; scenario=agent workspace with 10+ turn iterations; context depth; base input cost; cached input cost; minimum reuse break-even; caching recommendation; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — agent workspace with 10+ turn iterations is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch68-gpt-5-4-mini-m3-r5
cache eviction before 5-minute TTL
model=gpt-5.4-mini; slug=gpt-5-4-mini; provider=OpenAI; scenario=cache eviction before 5-minute TTL; context depth; base input cost; cached input cost; minimum reuse break-even; caching recommendation; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — cache eviction before 5-minute TTL is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch68-gpt-5-4-mini-m3-r6
unresolved cache storage retention
model=gpt-5.4-mini; slug=gpt-5-4-mini; provider=OpenAI; scenario=unresolved cache storage retention; context depth; base input cost; cached input cost; minimum reuse break-even; caching recommendation; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — unresolved cache storage retention has no matched, dated bilateral observation.FAIL CLOSED — manual, probe, or source evidence required

First-party provenance: OpenAI API pricing; verification date 2026-09-08. Missing or conflicting joins fail closed.

Method and limitations: formulas are deterministic; observed and assumed inputs are labeled; no missing provider, host, account, region, realm, alias, snapshot, revision, weight, artifact, control, tool, modality, workload, rate-period, timestamp, or result is transferred. Run the gpt-5-4-mini Batch 68 scenario →

How fast is GPT-5.4 Mini?

Not yet measured — see the speed benchmark leaderboard for models we do track.

How much does GPT-5.4 Mini cost at scale?

Tokens / monthEst. cost (blended 3:1)
100,000$0.17
1,000,000$1.69
10,000,000$16.88
100,000,000$168.75

How does GPT-5.4 Mini compare with other models?

GPT-5 Nano$0.14/MGPT-4o Mini$0.26/MGPT-5.4 Nano$0.46/MGPT-5 Mini$0.69/Mo3-Mini$1.93/MGemini 3.1 Flash$1.69/MGrok 4.3$1.56/MGemini 3.7 Flash$1.50/M
See all OpenAI models →

What are common questions about GPT-5.4 Mini?

Is GPT-5.4 Mini cheaper than Gemini 3.1 Flash?

GPT-5.4 Mini costs $1.69/M blended tokens, Gemini 3.1 Flash costs $1.69/M — Gemini 3.1 Flash is cheaper.

How much does 1 million tokens cost with GPT-5.4 Mini?

At a 3:1 input:output ratio, 1 million blended tokens costs approximately $1.69. Pure input costs $0.75/M; pure output costs $4.50/M.

What does GPT-5.4 Mini cost at high volume?

At 100 million blended tokens a month, GPT-5.4 Mini costs approximately $168.75. See the cost-at-scale table below for other volumes.

Try GPT-5.4 Mini for free

Run real prompts against GPT-5.4 Mini and every other model on this page in one workspace.

Try GPT-5.4 Mini Free