← Back to all pricing

OpenAI GPT-5.4 Nano API Pricing: Rapid Edge Triage & Classification

Examine OpenAI GPT-5.4 Nano API pricing ($0.20/M input, $1.25/M output), ultra-low latency intent classification, sub-second routing, and batch savings.

Legacy — superseded by GPT-5.6 Luna See GPT-5.6 Luna pricing.
No announced shutdown date. Source · Full retirement tracker

How much does GPT-5.4 Nano cost per million tokens?

OpenAI GPT-5.4 Nano costs $0.20 per million input tokens and $1.25 per million output tokens ($0.4625/M blended at 3:1). Engineered for high-throughput classification, sub-100ms intent routing, and real-time guardrails. Verified 2026-09-08.

Verified 2026-09-08 source
Input
$0.20/M
Output
$1.25/M
Blended
$0.46/M
Provider
Verified 2026-04-06source

How much does GPT-5.4 Nano cost per 1,000 requests?

Computed from generated token pricing. Each row assumes the listed input and output tokens per request; output is adjusted by this model's measured 0.78× verbosity factor.

Request shapeInput tokensOutput tokensCost / 1,000 requests
Short10050$0.0688
Medium1,000500$0.6875
Long4,0002,000$2.7500

Formula: ((input price × input tokens) + (output price × output tokens × verbosity factor)) ÷ 1,000,000 × 1,000. Assumptions: short 100/50, medium 1,000/500, long 4,000/2,000 input/output tokens per request. Verbosity run: 2026-06-16T20:31:30.728Z.

Three model-specific legacy pricing decisions

GPT-5.4 Nano owns high-volume classification, routing, and short-generation economics; image, latency, and quota units are not substituted.

1. Fixed model-specific workload bills

WorkloadInput / output100K requestsEvidence boundary
Classification300 / 30$9.75100K / 1M / 10M ladder
Routing500 / 80$20.00100K / 1M / 10M ladder
Short generation1,000 / 500$82.50Text tokens

Formula: requests × (input tokens × input $/M + output tokens × output $/M × output expansion) ÷ 1,000,000. Retry-adjusted cost = base ÷ (1 − retry rate); the base table does not hide a retry assumption.

2. Nano → Luna migration premium

Fixed shapeGPT-5.4 NanoGPT-5.6 LunaNumeric decision boundary
Classification · 300 / 30$10.26$50.00387% accepted-result uplift required after fixed retry assumptions (5% → 4%)
Routing · 500 / 80$21.05$102.08387% accepted-result uplift required after fixed retry assumptions (5% → 4%)

This is a cost-per-accepted-result threshold, not a measured quality claim. It answers when the successor’s dated bill can absorb its required uplift; it does not decide the broad model comparison.

3. Budget-impact and missing-input ledger

Traffic / evidenceResultSafe treatment
100K requests$10.26Fixed first workload; text-token units
1M requests$97.50Linear token spend only; no volume discount inferred
10M requests$975.00Budget exposure; quota and latency remain unavailable
Latency and quota: UnavailableUnavailableDo not infer, zero-price, or import a neighboring model’s mechanic
Cache and batch: UnavailableUnavailableDo not infer, zero-price, or import a neighboring model’s mechanic
Shutdown date: Unavailable; no indefinite-availability inferenceUnavailableDo not infer, zero-price, or import a neighboring model’s mechanic
Lifecyclelegacy; no sourced announcement dateNo sourced shutdown date; revalidate before current claims

Nano-to-Luna premium by workload shape

WorkloadNano costLuna costAbsolute premiumPremiumAccepted-result uplift required
Classification$9.75$48.00$38.25392.3%392.3%
Routing$20.00$98.00$78.00390.0%390.0%
Short generation$82.50$400.00$317.50384.8%384.8%

Premium = Luna cost − Nano cost; percentage premium and required accepted-result uplift = (Luna ÷ Nano − 1) × 100 at each fixed shape.

Price verified 2026-04-06; lifecycle verified 2026-08-14. Luna is the data owner. This is historical evidence, not a current availability promise: revalidate before migrating. “Unavailable” means no compatible dated evidence was found; it is never treated as zero. First-party price source · lifecycle source · Test this model in All AI Ask.

Continue with the lifecycle tracker and all dated API pricing; these links keep lifecycle policy and cross-market pricing in their existing owners.

All three Batch 6 contributions are server-rendered for GPT-5.4 Nano; fixed inputs, formulas, dated provenance, successor boundary, lifecycle state, and missing-data treatment remain visible.

Batch 68 · exact model pricing decision contributions · verified 2026-09-08

Exact model boundary: OpenAI gpt-5.4-nano (slug gpt-5-4-nano). First-party provider pricing and API documentation remain fact owners.

Ultra-budget token pricing and high-volume classification matrix

Frozen Batch 68 scenario board. Formula / deterministic rule: monthly_spend = calls * ((in_tokens * 0.20 + out_tokens * 1.25) / 1M) Boundary: Owns GPT-5.4 Nano token tariff modeling and high-volume classification spend.

Frozen scenario / field IDModel, identity, provider, and evidence fieldsResultState
batch68-gpt-5-4-nano-m1-r1
100K intent routing classifications
model=gpt-5.4-nano; slug=gpt-5-4-nano; provider=OpenAI; scenario=100K intent routing classifications; workload; prompt tokens; completion tokens; standard spend; cached spend; batch spend; cost winner; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — 100K intent routing classifications is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch68-gpt-5-4-nano-m1-r2
500K customer inquiry triage calls
model=gpt-5.4-nano; slug=gpt-5-4-nano; provider=OpenAI; scenario=500K customer inquiry triage calls; workload; prompt tokens; completion tokens; standard spend; cached spend; batch spend; cost winner; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — 500K customer inquiry triage calls is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch68-gpt-5-4-nano-m1-r3
2M automated content moderation passes
model=gpt-5.4-nano; slug=gpt-5-4-nano; provider=OpenAI; scenario=2M automated content moderation passes; workload; prompt tokens; completion tokens; standard spend; cached spend; batch spend; cost winner; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — 2M automated content moderation passes is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch68-gpt-5-4-nano-m1-r4
prompt caching reuse (50% input discount)
model=gpt-5.4-nano; slug=gpt-5-4-nano; provider=OpenAI; scenario=prompt caching reuse (50% input discount); workload; prompt tokens; completion tokens; standard spend; cached spend; batch spend; cost winner; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — prompt caching reuse (50% input discount) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch68-gpt-5-4-nano-m1-r5
batch processing API queue (50% discount)
model=gpt-5.4-nano; slug=gpt-5-4-nano; provider=OpenAI; scenario=batch processing API queue (50% discount); workload; prompt tokens; completion tokens; standard spend; cached spend; batch spend; cost winner; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — batch processing API queue (50% discount) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch68-gpt-5-4-nano-m1-r6
unresolved billing currency
model=gpt-5.4-nano; slug=gpt-5-4-nano; provider=OpenAI; scenario=unresolved billing currency; workload; prompt tokens; completion tokens; standard spend; cached spend; batch spend; cost winner; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — unresolved billing currency has no matched, dated bilateral observation.FAIL CLOSED — manual, probe, or source evidence required

First-party provenance: OpenAI API pricing; verification date 2026-09-08. Missing or conflicting joins fail closed.

Sub-second latency SLA and intent classification turnaround audit

Frozen Batch 68 scenario board. Formula / deterministic rule: turnaround = ttft + (tokens_out / tps); optimized for lowest TTFT Boundary: Owns turnaround time benchmarks and user experience responsiveness.

Frozen scenario / field IDModel, identity, provider, and evidence fieldsResultState
batch68-gpt-5-4-nano-m2-r1
real-time intent classification (<80ms)
model=gpt-5.4-nano; slug=gpt-5-4-nano; provider=OpenAI; scenario=real-time intent classification (<80ms); task; response SLA; TTFT; generation speed; SLA compliance; responsiveness champion; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — real-time intent classification (<80ms) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch68-gpt-5-4-nano-m2-r2
customer support routing ticket (<150ms)
model=gpt-5.4-nano; slug=gpt-5-4-nano; provider=OpenAI; scenario=customer support routing ticket (<150ms); task; response SLA; TTFT; generation speed; SLA compliance; responsiveness champion; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — customer support routing ticket (<150ms) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch68-gpt-5-4-nano-m2-r3
content moderation guardrail pass (<120ms)
model=gpt-5.4-nano; slug=gpt-5-4-nano; provider=OpenAI; scenario=content moderation guardrail pass (<120ms); task; response SLA; TTFT; generation speed; SLA compliance; responsiveness champion; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — content moderation guardrail pass (<120ms) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch68-gpt-5-4-nano-m2-r4
high-concurrency request surge
model=gpt-5.4-nano; slug=gpt-5-4-nano; provider=OpenAI; scenario=high-concurrency request surge; task; response SLA; TTFT; generation speed; SLA compliance; responsiveness champion; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — high-concurrency request surge is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch68-gpt-5-4-nano-m2-r5
network transit buffer
model=gpt-5.4-nano; slug=gpt-5-4-nano; provider=OpenAI; scenario=network transit buffer; task; response SLA; TTFT; generation speed; SLA compliance; responsiveness champion; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — network transit buffer is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch68-gpt-5-4-nano-m2-r6
unmeasured speed fixture
model=gpt-5.4-nano; slug=gpt-5-4-nano; provider=OpenAI; scenario=unmeasured speed fixture; task; response SLA; TTFT; generation speed; SLA compliance; responsiveness champion; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — unmeasured speed fixture is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict

First-party provenance: OpenAI API documentation; verification date 2026-09-08. Missing or conflicting joins fail closed.

Two-tier triage architecture: Nano triage vs Mini execution

Frozen Batch 68 scenario board. Formula / deterministic rule: blended_cost = nano_volume * nano_cost + mini_volume * mini_cost Boundary: Owns architectural routing between fast Nano triage and deeper Mini execution.

Frozen scenario / field IDModel, identity, provider, and evidence fieldsResultState
batch68-gpt-5-4-nano-m3-r1
100% GPT-5.4 Nano baseline ($0.20/$1.25)
model=gpt-5.4-nano; slug=gpt-5-4-nano; provider=OpenAI; scenario=100% GPT-5.4 Nano baseline ($0.20/$1.25); escalation mix; total monthly queries; blended spend; cost savings vs pure Mini; accuracy retention; routing recommendation; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — 100% GPT-5.4 Nano baseline ($0.20/$1.25) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch68-gpt-5-4-nano-m3-r2
90% Nano triage / 10% Mini escalation
model=gpt-5.4-nano; slug=gpt-5-4-nano; provider=OpenAI; scenario=90% Nano triage / 10% Mini escalation; escalation mix; total monthly queries; blended spend; cost savings vs pure Mini; accuracy retention; routing recommendation; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — 90% Nano triage / 10% Mini escalation is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch68-gpt-5-4-nano-m3-r3
80% Nano triage / 20% Mini escalation
model=gpt-5.4-nano; slug=gpt-5-4-nano; provider=OpenAI; scenario=80% Nano triage / 20% Mini escalation; escalation mix; total monthly queries; blended spend; cost savings vs pure Mini; accuracy retention; routing recommendation; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — 80% Nano triage / 20% Mini escalation is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch68-gpt-5-4-nano-m3-r4
50% Nano triage / 50% Mini escalation
model=gpt-5.4-nano; slug=gpt-5-4-nano; provider=OpenAI; scenario=50% Nano triage / 50% Mini escalation; escalation mix; total monthly queries; blended spend; cost savings vs pure Mini; accuracy retention; routing recommendation; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — 50% Nano triage / 50% Mini escalation is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch68-gpt-5-4-nano-m3-r5
100% direct GPT-5.4 Mini execution
model=gpt-5.4-nano; slug=gpt-5-4-nano; provider=OpenAI; scenario=100% direct GPT-5.4 Mini execution; escalation mix; total monthly queries; blended spend; cost savings vs pure Mini; accuracy retention; routing recommendation; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — 100% direct GPT-5.4 Mini execution is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch68-gpt-5-4-nano-m3-r6
unresolved routing confidence threshold trigger
model=gpt-5.4-nano; slug=gpt-5-4-nano; provider=OpenAI; scenario=unresolved routing confidence threshold trigger; escalation mix; total monthly queries; blended spend; cost savings vs pure Mini; accuracy retention; routing recommendation; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — unresolved routing confidence threshold trigger has no matched, dated bilateral observation.FAIL CLOSED — manual, probe, or source evidence required

First-party provenance: OpenAI API pricing; verification date 2026-09-08. Missing or conflicting joins fail closed.

Method and limitations: formulas are deterministic; observed and assumed inputs are labeled; no missing provider, host, account, region, realm, alias, snapshot, revision, weight, artifact, control, tool, modality, workload, rate-period, timestamp, or result is transferred. Run the gpt-5-4-nano Batch 68 scenario →

How fast is GPT-5.4 Nano?

Not yet measured — see the speed benchmark leaderboard for models we do track.

How much does GPT-5.4 Nano cost at scale?

Tokens / monthEst. cost (blended 3:1)
100,000$0.05
1,000,000$0.46
10,000,000$4.63
100,000,000$46.25

How does GPT-5.4 Nano compare with other models?

GPT-5 Nano$0.14/MGPT-4o Mini$0.26/MGPT-5 Mini$0.69/MGPT-5.4 Mini$1.69/Mo3-Mini$1.93/MCodestral$0.45/MGPT-OSS 120B (Cerebras)$0.45/MGemini 3.1 Flash Lite$0.56/M
See all OpenAI models →

What are common questions about GPT-5.4 Nano?

Is GPT-5.4 Nano cheaper than Codestral?

GPT-5.4 Nano costs $0.46/M blended tokens, Codestral costs $0.45/M — Codestral is cheaper.

How much does 1 million tokens cost with GPT-5.4 Nano?

At a 3:1 input:output ratio, 1 million blended tokens costs approximately $0.46. Pure input costs $0.20/M; pure output costs $1.25/M.

What does GPT-5.4 Nano cost at high volume?

At 100 million blended tokens a month, GPT-5.4 Nano costs approximately $46.25. See the cost-at-scale table below for other volumes.

Try GPT-5.4 Nano for free

Run real prompts against GPT-5.4 Nano and every other model on this page in one workspace.

Try GPT-5.4 Nano Free