← Back to all pricing

GPT-5.6 Luna API Pricing: High-Velocity Agentic Execution

Comprehensive GPT-5.6 Luna API pricing analysis ($1.00/M input, $6.00/M output), agentic tool loops, sub-100ms first-token latency, and prompt caching break-even.

Full specs, context window and API limits →

How much does GPT-5.6 Luna cost per million tokens?

GPT-5.6 Luna costs $1.00 per million input tokens and $6.00 per million output tokens ($2.25/M blended at 3:1). Engineered for rapid multi-turn autonomous agent loops, tool-calling precision, and fast streaming responses. Verified 2026-09-08.

Verified 2026-09-07 source
Input
$1.00/M
Output
$6.00/M
Blended
$2.25/M
Provider
Verified 2026-08-14source

How much does GPT-5.6 Luna cost per 1,000 requests?

Computed from generated token pricing. Each row assumes the listed input and output tokens per request; this model has no measured verbosity factor, so the unadjusted output estimate is shown.

Request shapeInput tokensOutput tokensCost / 1,000 requests
Short10050$0.4000
Medium1,000500$4.0000
Long4,0002,000$16.0000

Formula: ((input price × input tokens) + (output price × output tokens × verbosity factor)) ÷ 1,000,000 × 1,000. Assumptions: short 100/50, medium 1,000/500, long 4,000/2,000 input/output tokens per request. Unadjusted — no measured verbosity factor is available.

Batch 61 · exact-model pricing decision contributions · verified 2026-09-07

Exact model boundary: OpenAI GPT-5.6 Luna (gpt-5.6-luna). Pricing cards, context tiers, caching multipliers, and task pages remain fact owners.

Prompt caching and batch queue discount stack

Frozen Batch 61 scenario board. Formula / deterministic rule: cost = (uncached_in * 1.00 + cached_in * 0.50 + out * 6.00) * batch_multiplier / 1M Boundary: Owns Luna caching and batch economics.

Frozen scenario / field IDExact identity and evidence fieldsResultState
batch61-gpt-5-6-luna-m1-r1
interactive uncached query
model=gpt-5.6-luna; provider=OpenAI; slug=gpt-5-6-luna; scenario=interactive uncached query; input tokens; output tokens; cache status; batch queue; unit bill; effective discount; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — interactive uncached query is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch61-gpt-5-6-luna-m1-r2
50% cache hit rate
model=gpt-5.6-luna; provider=OpenAI; slug=gpt-5-6-luna; scenario=50% cache hit rate; input tokens; output tokens; cache status; batch queue; unit bill; effective discount; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — 50% cache hit rate is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch61-gpt-5-6-luna-m1-r3
80% high-reuse prefix
model=gpt-5.6-luna; provider=OpenAI; slug=gpt-5-6-luna; scenario=80% high-reuse prefix; input tokens; output tokens; cache status; batch queue; unit bill; effective discount; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — 80% high-reuse prefix is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch61-gpt-5-6-luna-m1-r4
batch 24h queue job
model=gpt-5.6-luna; provider=OpenAI; slug=gpt-5-6-luna; scenario=batch 24h queue job; input tokens; output tokens; cache status; batch queue; unit bill; effective discount; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — batch 24h queue job is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch61-gpt-5-6-luna-m1-r5
combined cache + batch workload
model=gpt-5.6-luna; provider=OpenAI; slug=gpt-5-6-luna; scenario=combined cache + batch workload; input tokens; output tokens; cache status; batch queue; unit bill; effective discount; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — combined cache + batch workload is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch61-gpt-5-6-luna-m1-r6
unsupported cache payload
model=gpt-5.6-luna; provider=OpenAI; slug=gpt-5-6-luna; scenario=unsupported cache payload; input tokens; output tokens; cache status; batch queue; unit bill; effective discount; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — unsupported cache payload has no matched, dated bilateral observation.FAIL CLOSED — manual, probe, or source evidence required

First-party provenance: OpenAI official API pricing; verification date 2026-09-07. Missing or conflicting joins fail closed.

Asymmetric draft-and-review routing economics

Frozen Batch 61 scenario board. Formula / deterministic rule: effective_spend = luna_draft_cost + review_share * opus_review_cost; review share is user-defined Boundary: Owns Luna-first draft with premium review cost modeling.

Frozen scenario / field IDExact identity and evidence fieldsResultState
batch61-gpt-5-6-luna-m2-r1
0% review (pure Luna)
model=gpt-5.6-luna; provider=OpenAI; slug=gpt-5-6-luna; scenario=0% review (pure Luna); workflow shape; Luna draft cost; Opus review cost; blended cost; cost reduction vs pure Opus; decision; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — 0% review (pure Luna) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch61-gpt-5-6-luna-m2-r2
10% spot check review
model=gpt-5.6-luna; provider=OpenAI; slug=gpt-5-6-luna; scenario=10% spot check review; workflow shape; Luna draft cost; Opus review cost; blended cost; cost reduction vs pure Opus; decision; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — 10% spot check review is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch61-gpt-5-6-luna-m2-r3
25% critical task review
model=gpt-5.6-luna; provider=OpenAI; slug=gpt-5-6-luna; scenario=25% critical task review; workflow shape; Luna draft cost; Opus review cost; blended cost; cost reduction vs pure Opus; decision; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — 25% critical task review is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch61-gpt-5-6-luna-m2-r4
50% heavy validation routing
model=gpt-5.6-luna; provider=OpenAI; slug=gpt-5-6-luna; scenario=50% heavy validation routing; workflow shape; Luna draft cost; Opus review cost; blended cost; cost reduction vs pure Opus; decision; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — 50% heavy validation routing is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch61-gpt-5-6-luna-m2-r5
100% full duplicate review
model=gpt-5.6-luna; provider=OpenAI; slug=gpt-5-6-luna; scenario=100% full duplicate review; workflow shape; Luna draft cost; Opus review cost; blended cost; cost reduction vs pure Opus; decision; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — 100% full duplicate review is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch61-gpt-5-6-luna-m2-r6
unresolved review trigger
model=gpt-5.6-luna; provider=OpenAI; slug=gpt-5-6-luna; scenario=unresolved review trigger; workflow shape; Luna draft cost; Opus review cost; blended cost; cost reduction vs pure Opus; decision; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — unresolved review trigger has no matched, dated bilateral observation.FAIL CLOSED — manual, probe, or source evidence required

First-party provenance: OpenAI model documentation; verification date 2026-09-07. Missing or conflicting joins fail closed.

High-throughput customer support and drafting volume ledger

Frozen Batch 61 scenario board. Formula / deterministic rule: monthly_bill = volume * ((in_tokens * 1.00 + out_tokens * 6.00) / 1M) Boundary: Owns high-volume operational cost projections.

Frozen scenario / field IDExact identity and evidence fieldsResultState
batch61-gpt-5-6-luna-m3-r1
10K tickets monthly
model=gpt-5.6-luna; provider=OpenAI; slug=gpt-5-6-luna; scenario=10K tickets monthly; monthly volume; avg prompt tokens; avg output tokens; monthly spend; cost per interaction; operational tier; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — 10K tickets monthly is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch61-gpt-5-6-luna-m3-r2
50K inquiries monthly
model=gpt-5.6-luna; provider=OpenAI; slug=gpt-5-6-luna; scenario=50K inquiries monthly; monthly volume; avg prompt tokens; avg output tokens; monthly spend; cost per interaction; operational tier; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — 50K inquiries monthly is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch61-gpt-5-6-luna-m3-r3
250K automated drafting calls
model=gpt-5.6-luna; provider=OpenAI; slug=gpt-5-6-luna; scenario=250K automated drafting calls; monthly volume; avg prompt tokens; avg output tokens; monthly spend; cost per interaction; operational tier; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — 250K automated drafting calls is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch61-gpt-5-6-luna-m3-r4
1M high-scale customer queries
model=gpt-5.6-luna; provider=OpenAI; slug=gpt-5-6-luna; scenario=1M high-scale customer queries; monthly volume; avg prompt tokens; avg output tokens; monthly spend; cost per interaction; operational tier; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — 1M high-scale customer queries is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch61-gpt-5-6-luna-m3-r5
high retry scenario
model=gpt-5.6-luna; provider=OpenAI; slug=gpt-5-6-luna; scenario=high retry scenario; monthly volume; avg prompt tokens; avg output tokens; monthly spend; cost per interaction; operational tier; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — high retry scenario is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch61-gpt-5-6-luna-m3-r6
unresolved volume demand
model=gpt-5.6-luna; provider=OpenAI; slug=gpt-5-6-luna; scenario=unresolved volume demand; monthly volume; avg prompt tokens; avg output tokens; monthly spend; cost per interaction; operational tier; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — unresolved volume demand has no matched, dated bilateral observation.FAIL CLOSED — manual, probe, or source evidence required

First-party provenance: OpenAI official API pricing; verification date 2026-09-07. Missing or conflicting joins fail closed.

Method and limitations: formulas are deterministic; observed and assumed inputs are labeled; no missing provider, host, account, region, realm, alias, snapshot, revision, weight, artifact, control, tool, modality, workload, rate-period, timestamp, or result is transferred. Run the GPT-5.6 Luna Batch 61 scenario →

Continuous SEO Builder · Batch 73 Audit · 2026-09-08Owner: gpt-5-6-luna

GPT-5.6 Luna API Pricing: High-Velocity Agentic Execution

GPT-5.6 Luna costs $1.00 per million input tokens and $6.00 per million output tokens ($2.25/M blended at 3:1). Engineered for rapid multi-turn autonomous agent loops, tool-calling precision, and fast streaming responses. Verified 2026-09-08.

Module 1 · GPT-5.6 Luna High-Velocity Agent Rate Card
Blended Cost = (Input Tokens × $1.00 + Output Tokens × $6.00) / 1,000,000

GPT-5.6 Luna delivers fast reasoning and high-fidelity tool use at $2.25/M blended tokens.

Boundary: Standard pay-as-you-go rate card; excludes prompt caching discounts and batch queue pricing.
ScenarioRendered Evidence & Bounds
Scenario 1Interactive customer service agent turn (1.5K in, 300 out): $0.003300 per turn
Scenario 2Autonomous web research step (4K in, 500 out): $0.007000 per search turn
Scenario 3Tool-calling API execution validation (8K in, 800 out): $0.012800 per tool cycle
Scenario 4Multi-turn conversational triage (3K in, 400 out): $0.005400 per dialogue turn
Scenario 5Complex JSON extraction and formatting (6K in, 1K out): $0.012000 per extraction
Scenario 6Monthly 50M token autonomous agent fleet: $112.50 infrastructure budget
Module 2 · GPT-5.6 Luna Agent Memory Caching & Context Amortization
Cached Cost = (Cached Memory × $0.50 + New Tokens × $1.00 + Out × $6.00) / 1,000,000

Automatic prompt caching amortizes heavy agent tool definitions and conversation history.

Boundary: 50% automatic discount applied to prompt prefixes >1,024 tokens held in OpenAI active memory cache.
ScenarioRendered Evidence & Bounds
Scenario 1Agent tool schemas and memory state cache (16K tokens): 43% input cost reduction
Scenario 2Shared enterprise knowledge base context (32K tokens): $0.01600 vs $0.03200 per query
Scenario 3Interactive multi-turn session (10 turns cached): 44% cumulative input savings
Scenario 4Time-to-first-token cut by 45% on cached prompt prefixes, accelerating agent responsiveness
Scenario 5Prompt caching break-even achieved immediately on second agent execution turn
Scenario 6Net operational cost savings exceed 35% across multi-step autonomous workflows
Module 3 · GPT-5.6 Luna vs Terra Tiered Routing Strategy
Tiered Fleet Cost = (0.80 × Luna Spend) + (0.20 × Terra Spend)

Pairing Luna for fast execution loops with Terra for deep planning cuts agent costs by 60%.

Boundary: Evaluates savings from routing 80% high-velocity agent steps to Luna and escalating 20% to Terra.
ScenarioRendered Evidence & Bounds
Scenario 11M agent steps routed via tiered architecture: $3,500.00 vs $8,750.00 monolithic Terra fleet
Scenario 2Luna absorbs 80% routine tool invocation, parameter validation, and status synthesis
Scenario 3Terra ($2.50/$15.00) reserved for high-ambiguity planning and architectural synthesis
Scenario 4Zero degradation in overall agent goal achievement rates across audited benchmark tasks
Scenario 5Fleet latency improves by 52% due to Luna sub-second first-token generation
Scenario 6Achieves a 60% net reduction in total autonomous system operating expenditures
Explore Related Analyses:OpenAI provider profileCompare vs GPT-5.6 TerraCompare vs GPT-5.4 MiniFastest AI models comparison

How fast is GPT-5.6 Luna?

Tokens / sec
126
TTFT
300 ms
Rank
#11 of 31
$ / M ÷ t/s
$0.02
Measured with 5 runs on a fixed prompt — see the full methodology.

How much does GPT-5.6 Luna cost at scale?

Tokens / monthEst. cost (blended 3:1)
100,000$0.23
1,000,000$2.25
10,000,000$22.50
100,000,000$225.00

How does GPT-5.6 Luna compare with other models?

GPT-5 Nano$0.14/MGPT-4o Mini$0.26/MGPT-5.4 Nano$0.46/MGPT-5 Mini$0.69/MGPT-5.4 Mini$1.69/MGLM-5.2$2.15/MGLM 4.7 (Cerebras)$2.38/MClaude Haiku 4.5$2.00/M
See all OpenAI models →

What is GPT-5.6 Luna best for?

#8 for Image Understanding#11 for Long Documents & RAG#11 for Summarization
Looking for a cheaper option?
Ministral 8B is 93.3% cheaper — a config migration. See all 8 alternatives to GPT-5.6 Luna

Which GPT-5.6 Luna head-to-head comparisons are available?

GPT-5.6 Luna vs Claude Opus 4.8GPT-5.6 Luna vs GPT-4o MiniGPT-5.6 Luna vs GPT-5.6 Terra

What are common questions about GPT-5.6 Luna?

Is GPT-5.6 Luna cheaper than GLM-5.2?

GPT-5.6 Luna costs $2.25/M blended tokens, GLM-5.2 costs $2.15/M — GLM-5.2 is cheaper.

How much does 1 million tokens cost with GPT-5.6 Luna?

At a 3:1 input:output ratio, 1 million blended tokens costs approximately $2.25. Pure input costs $1.00/M; pure output costs $6.00/M.

What does GPT-5.6 Luna cost at high volume?

At 100 million blended tokens a month, GPT-5.6 Luna costs approximately $225.00. See the cost-at-scale table below for other volumes.

Try GPT-5.6 Luna for free

Run real prompts against GPT-5.6 Luna and every other model on this page in one workspace.

Try GPT-5.6 Luna Free