← Back to all pricing

Ministral 8B API Pricing: Symmetric Token Rates for Edge & Cloud

Examine Ministral 8B API pricing ($0.15/M input, $0.15/M output), symmetric token rates, edge on-device inference, and sub-second classification speed.

Full specs, context window and API limits →

How much does Ministral 8B cost per million tokens?

Ministral 8B costs $0.15 per million input tokens and $0.15 per million output tokens ($0.15/M blended at 3:1). Features unique symmetric pricing, 128K context, and ultra-compact edge deployment. Verified 2026-09-08.

Verified 2026-09-08 source
Input
$0.15/M
Output
$0.15/M
Blended
$0.15/M
Provider
Verified 2026-08-14source

How much does Ministral 8B cost per 1,000 requests?

Computed from generated token pricing. Each row assumes the listed input and output tokens per request; output is adjusted by this model's measured 0.93× verbosity factor.

Request shapeInput tokensOutput tokensCost / 1,000 requests
Short10050$0.0220
Medium1,000500$0.2198
Long4,0002,000$0.8790

Formula: ((input price × input tokens) + (output price × output tokens × verbosity factor)) ÷ 1,000,000 × 1,000. Assumptions: short 100/50, medium 1,000/500, long 4,000/2,000 input/output tokens per request. Verbosity run: 2026-06-16T20:31:30.728Z.

Three model-specific pricing decisions

Ministral 8B is evaluated as an edge-class, high-volume API row. Hardware, energy, image units, cache, and batch remain user-supplied or unavailable.

1. Requests-per-month ladder for routing, tagging, and extraction

WorkloadInput / output100K requests1M requests10M requests
Routing200 / 30$3.45$34.50$345.00
Tagging500 / 80$8.70$87.00$870.00
Short extraction1,000 / 250$18.75$187.50$1875.00

Formula: requests × token shape × listed $/M. Output expansion is not silently added.

2. Equal-input-rate audit against Mistral Small

Fixed input / outputMinistral 8BMistral Small 3.1Narrow decision boundary
Routing · 200 / 30$3.45$4.8010% accepted-result uplift required
Extraction · 1,000 / 250$18.75$30.0015% accepted-result uplift required

Formula: requests × (input tokens × input $/M + output tokens × output $/M) ÷ 1,000,000. The uplift is a planning threshold, not a measured quality claim.

3. API price/latency versus edge-deployment inputs

OptionDated calculationInput ledgerBoundary
Ministral API$18.75158 tokens/sec; TTFT 210 ms; 5 measured samplesAPI cost is sourced
Edge deploymentUnavailableHardware, utilization, energy, image units, cache, batchCollect user inputs before comparing

Verified 2026-08-14. Luna is the data owner. “Unavailable” means no compatible dated evidence was found; it is never treated as zero. First-party price source · Run this Batch 5 scenario.

All three Batch 5 decisions are server-rendered for Ministral 8B; fixed inputs, formulas, dated sources, speed sample state, and unavailable mechanics are visible.

Batch 68 · exact model pricing decision contributions · verified 2026-09-08

Exact model boundary: Mistral ministral-8b (slug ministral-8b). First-party provider pricing and API documentation remain fact owners.

Symmetric token pricing and high-volume spend matrix

Frozen Batch 68 scenario board. Formula / deterministic rule: monthly_spend = calls * ((in_tokens * 0.15 + out_tokens * 0.15) / 1M) Boundary: Owns Ministral 8B symmetric input/output token pricing calculations.

Frozen scenario / field IDModel, identity, provider, and evidence fieldsResultState
batch68-ministral-8b-m1-r1
100K compact classification queries
model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=100K compact classification queries; workload; prompt tokens; completion tokens; input cost; output cost; monthly spend; efficiency verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — 100K compact classification queries is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch68-ministral-8b-m1-r2
250K agent reasoning step checks
model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=250K agent reasoning step checks; workload; prompt tokens; completion tokens; input cost; output cost; monthly spend; efficiency verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — 250K agent reasoning step checks is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch68-ministral-8b-m1-r3
1M high-volume IoT telemetry passes
model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=1M high-volume IoT telemetry passes; workload; prompt tokens; completion tokens; input cost; output cost; monthly spend; efficiency verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — 1M high-volume IoT telemetry passes is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch68-ministral-8b-m1-r4
long-output code generation pass
model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=long-output code generation pass; workload; prompt tokens; completion tokens; input cost; output cost; monthly spend; efficiency verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — long-output code generation pass is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch68-ministral-8b-m1-r5
batch processing queue (50% discount)
model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=batch processing queue (50% discount); workload; prompt tokens; completion tokens; input cost; output cost; monthly spend; efficiency verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — batch processing queue (50% discount) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch68-ministral-8b-m1-r6
unresolved billing currency
model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=unresolved billing currency; workload; prompt tokens; completion tokens; input cost; output cost; monthly spend; efficiency verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — unresolved billing currency has no matched, dated bilateral observation.FAIL CLOSED — manual, probe, or source evidence required

First-party provenance: Mistral AI model pricing; verification date 2026-09-08. Missing or conflicting joins fail closed.

Edge on-device versus managed cloud API latency audit

Frozen Batch 68 scenario board. Formula / deterministic rule: turnaround = ttft + (tokens_out / tps); edge provides zero network overhead Boundary: Owns on-device quantization and cloud API response time benchmarks.

Frozen scenario / field IDModel, identity, provider, and evidence fieldsResultState
batch68-ministral-8b-m2-r1
sub-50ms local edge classification
model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=sub-50ms local edge classification; environment; task; TTFT; generation speed; SLA compliance; deployment recommendation; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — sub-50ms local edge classification is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch68-ministral-8b-m2-r2
smart appliance embedded assistant (<100ms)
model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=smart appliance embedded assistant (<100ms); environment; task; TTFT; generation speed; SLA compliance; deployment recommendation; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — smart appliance embedded assistant (<100ms) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch68-ministral-8b-m2-r3
cloud API call with network transit (<250ms)
model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=cloud API call with network transit (<250ms); environment; task; TTFT; generation speed; SLA compliance; deployment recommendation; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — cloud API call with network transit (<250ms) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch68-ministral-8b-m2-r4
high-concurrency edge sensor stream
model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=high-concurrency edge sensor stream; environment; task; TTFT; generation speed; SLA compliance; deployment recommendation; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — high-concurrency edge sensor stream is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch68-ministral-8b-m2-r5
quantization accuracy degradation canary
model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=quantization accuracy degradation canary; environment; task; TTFT; generation speed; SLA compliance; deployment recommendation; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — quantization accuracy degradation canary is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch68-ministral-8b-m2-r6
unsupported embedded runtime
model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=unsupported embedded runtime; environment; task; TTFT; generation speed; SLA compliance; deployment recommendation; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — unsupported embedded runtime has no matched, dated bilateral observation.FAIL CLOSED — manual, probe, or source evidence required

First-party provenance: Mistral AI documentation; verification date 2026-09-08. Missing or conflicting joins fail closed.

Local VRAM deployment break-even: RTX 4090 vs Cloud API

Frozen Batch 68 scenario board. Formula / deterministic rule: cloud_spend = monthly_tokens * 0.15 / 1M; hardware_cost = (gpu_depreciation + power) / mo Boundary: Owns local hardware capital expenditure vs managed cloud API consumption.

Frozen scenario / field IDModel, identity, provider, and evidence fieldsResultState
batch68-ministral-8b-m3-r1
low edge volume (<5M tokens/mo)
model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=low edge volume (<5M tokens/mo); monthly token volume; cloud API spend; local RTX 4090 monthly TCO; financial break-even; deployment verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — low edge volume (<5M tokens/mo) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch68-ministral-8b-m3-r2
25M monthly tokens (cloud optimal)
model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=25M monthly tokens (cloud optimal); monthly token volume; cloud API spend; local RTX 4090 monthly TCO; financial break-even; deployment verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — 25M monthly tokens (cloud optimal) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch68-ministral-8b-m3-r3
100M tokens/month (hardware break-even)
model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=100M tokens/month (hardware break-even); monthly token volume; cloud API spend; local RTX 4090 monthly TCO; financial break-even; deployment verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — 100M tokens/month (hardware break-even) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch68-ministral-8b-m3-r4
500M high-volume saturation (local optimal)
model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=500M high-volume saturation (local optimal); monthly token volume; cloud API spend; local RTX 4090 monthly TCO; financial break-even; deployment verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — 500M high-volume saturation (local optimal) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch68-ministral-8b-m3-r5
unplanned hardware failure and downtime
model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=unplanned hardware failure and downtime; monthly token volume; cloud API spend; local RTX 4090 monthly TCO; financial break-even; deployment verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — unplanned hardware failure and downtime has no matched, dated bilateral observation.FAIL CLOSED — manual, probe, or source evidence required
batch68-ministral-8b-m3-r6
unresolved local electricity tariff
model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=unresolved local electricity tariff; monthly token volume; cloud API spend; local RTX 4090 monthly TCO; financial break-even; deployment verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — unresolved local electricity tariff has no matched, dated bilateral observation.FAIL CLOSED — manual, probe, or source evidence required

First-party provenance: Mistral AI model pricing; verification date 2026-09-08. Missing or conflicting joins fail closed.

Method and limitations: formulas are deterministic; observed and assumed inputs are labeled; no missing provider, host, account, region, realm, alias, snapshot, revision, weight, artifact, control, tool, modality, workload, rate-period, timestamp, or result is transferred. Run the ministral-8b Batch 68 scenario →

Batch 75 Verified Model Pricing IntelligenceModel owner: ministral-8b (Mistral)Audit date: 2026-09-08

Ministral 8B API Pricing: Symmetric Token Rates for Edge & Cloud

Ministral 8B costs $0.15 per million input tokens and $0.15 per million output tokens ($0.15/M blended at 3:1). Features unique symmetric pricing, 128K context, and ultra-compact edge deployment. Verified 2026-09-08.

Symmetric token pricing and high-volume spend matrix

Frozen Batch 75 scenario board. Formula / deterministic rule: monthly_spend = calls * ((in_tokens * 0.15 + out_tokens * 0.15) / 1M) Boundary: Owns Ministral 8B symmetric input/output token pricing calculations.

Frozen scenario / field IDModel, identity, provider, and evidence fieldsResultState
batch75-ministral-8b-m1-r1
100K compact classification queries
model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=100K compact classification queries; workload; prompt tokens; completion tokens; input cost; output cost; monthly spend; efficiency verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — 100K compact classification queries is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch75-ministral-8b-m1-r2
250K agent reasoning step checks
model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=250K agent reasoning step checks; workload; prompt tokens; completion tokens; input cost; output cost; monthly spend; efficiency verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — 250K agent reasoning step checks is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch75-ministral-8b-m1-r3
1M high-volume IoT telemetry passes
model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=1M high-volume IoT telemetry passes; workload; prompt tokens; completion tokens; input cost; output cost; monthly spend; efficiency verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — 1M high-volume IoT telemetry passes is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch75-ministral-8b-m1-r4
long-output code generation pass
model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=long-output code generation pass; workload; prompt tokens; completion tokens; input cost; output cost; monthly spend; efficiency verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — long-output code generation pass is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch75-ministral-8b-m1-r5
batch processing queue (50% discount)
model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=batch processing queue (50% discount); workload; prompt tokens; completion tokens; input cost; output cost; monthly spend; efficiency verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — batch processing queue (50% discount) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch75-ministral-8b-m1-r6
unresolved billing currency
model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=unresolved billing currency; workload; prompt tokens; completion tokens; input cost; output cost; monthly spend; efficiency verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — unresolved billing currency has no matched, dated bilateral observation.FAIL CLOSED — manual, probe, or source evidence required

First-party provenance: Mistral AI model pricing; verification date 2026-09-08. Missing or conflicting joins fail closed.

Edge on-device versus managed cloud API latency audit

Frozen Batch 75 scenario board. Formula / deterministic rule: turnaround = ttft + (tokens_out / tps); edge provides zero network overhead Boundary: Owns on-device quantization and cloud API response time benchmarks.

Frozen scenario / field IDModel, identity, provider, and evidence fieldsResultState
batch75-ministral-8b-m2-r1
sub-50ms local edge classification
model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=sub-50ms local edge classification; environment; task; TTFT; generation speed; SLA compliance; deployment recommendation; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — sub-50ms local edge classification is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch75-ministral-8b-m2-r2
smart appliance embedded assistant (<100ms)
model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=smart appliance embedded assistant (<100ms); environment; task; TTFT; generation speed; SLA compliance; deployment recommendation; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — smart appliance embedded assistant (<100ms) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch75-ministral-8b-m2-r3
cloud API call with network transit (<250ms)
model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=cloud API call with network transit (<250ms); environment; task; TTFT; generation speed; SLA compliance; deployment recommendation; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — cloud API call with network transit (<250ms) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch75-ministral-8b-m2-r4
high-concurrency edge sensor stream
model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=high-concurrency edge sensor stream; environment; task; TTFT; generation speed; SLA compliance; deployment recommendation; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — high-concurrency edge sensor stream is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch75-ministral-8b-m2-r5
quantization accuracy degradation canary
model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=quantization accuracy degradation canary; environment; task; TTFT; generation speed; SLA compliance; deployment recommendation; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — quantization accuracy degradation canary is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch75-ministral-8b-m2-r6
unsupported embedded runtime
model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=unsupported embedded runtime; environment; task; TTFT; generation speed; SLA compliance; deployment recommendation; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — unsupported embedded runtime has no matched, dated bilateral observation.FAIL CLOSED — manual, probe, or source evidence required

First-party provenance: Mistral AI documentation; verification date 2026-09-08. Missing or conflicting joins fail closed.

Local VRAM deployment break-even: RTX 4090 vs Cloud API

Frozen Batch 75 scenario board. Formula / deterministic rule: cloud_spend = monthly_tokens * 0.15 / 1M; hardware_cost = (gpu_depreciation + power) / mo Boundary: Owns local hardware capital expenditure vs managed cloud API consumption.

Frozen scenario / field IDModel, identity, provider, and evidence fieldsResultState
batch75-ministral-8b-m3-r1
low edge volume (<5M tokens/mo)
model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=low edge volume (<5M tokens/mo); monthly token volume; cloud API spend; local RTX 4090 monthly TCO; financial break-even; deployment verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — low edge volume (<5M tokens/mo) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch75-ministral-8b-m3-r2
25M monthly tokens (cloud optimal)
model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=25M monthly tokens (cloud optimal); monthly token volume; cloud API spend; local RTX 4090 monthly TCO; financial break-even; deployment verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — 25M monthly tokens (cloud optimal) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch75-ministral-8b-m3-r3
100M tokens/month (hardware break-even)
model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=100M tokens/month (hardware break-even); monthly token volume; cloud API spend; local RTX 4090 monthly TCO; financial break-even; deployment verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — 100M tokens/month (hardware break-even) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch75-ministral-8b-m3-r4
500M high-volume saturation (local optimal)
model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=500M high-volume saturation (local optimal); monthly token volume; cloud API spend; local RTX 4090 monthly TCO; financial break-even; deployment verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — 500M high-volume saturation (local optimal) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch75-ministral-8b-m3-r5
unplanned hardware failure and downtime
model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=unplanned hardware failure and downtime; monthly token volume; cloud API spend; local RTX 4090 monthly TCO; financial break-even; deployment verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — unplanned hardware failure and downtime has no matched, dated bilateral observation.FAIL CLOSED — manual, probe, or source evidence required
batch75-ministral-8b-m3-r6
unresolved local electricity tariff
model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=unresolved local electricity tariff; monthly token volume; cloud API spend; local RTX 4090 monthly TCO; financial break-even; deployment verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — unresolved local electricity tariff has no matched, dated bilateral observation.FAIL CLOSED — manual, probe, or source evidence required

First-party provenance: Mistral AI model pricing; verification date 2026-09-08. Missing or conflicting joins fail closed.

How fast is Ministral 8B?

Tokens / sec
158
TTFT
210 ms
Rank
#8 of 31
$ / M ÷ t/s
$0.0009
Measured with 5 runs on a fixed prompt — see the full methodology.

How much does Ministral 8B cost at scale?

Tokens / monthEst. cost (blended 3:1)
100,000$0.01
1,000,000$0.15
10,000,000$1.50
100,000,000$15.00

How does Ministral 8B compare with other models?

Mistral Small 3.1$0.26/MCodestral$0.45/MMistral Large 3$0.75/MMistral Medium 3$3.00/MGPT-5 Nano$0.14/MGPT-OSS 20B$0.13/MMuse Spark 1.3 Contributor$0.13/M
See all Mistral models →

What is Ministral 8B best for?

#5 for Writing & Content#6 for Coding#9 for Structured Data Extraction

What are common questions about Ministral 8B?

Is Ministral 8B cheaper than GPT-5 Nano?

Ministral 8B costs $0.15/M blended tokens, GPT-5 Nano costs $0.14/M — GPT-5 Nano is cheaper.

How much does 1 million tokens cost with Ministral 8B?

At a 3:1 input:output ratio, 1 million blended tokens costs approximately $0.15. Pure input costs $0.15/M; pure output costs $0.15/M.

What does Ministral 8B cost at high volume?

At 100 million blended tokens a month, Ministral 8B costs approximately $15.00. See the cost-at-scale table below for other volumes.

Try Ministral 8B for free

Run real prompts against Ministral 8B and every other model on this page in one workspace.

Try Ministral 8B Free