// PRICING

Pay for what you actually use.

No seats. No subscriptions. No idle servers draining your balance. Pick the tier your model needs and pay by the second it runs.

How many requests?
1K10K100K1M10M
Standard · 100K requests
$45.90≈ ~1.2s/req est.
Estimated from typical request latency. Actual cost depends on your model and response length. Scales to zero, so idle endpoints cost nothing.
START FREE →

Inference runs on serverless GPU infrastructure. It scales up with demand and back down to zero when idle, so you only pay while requests are being served.

READY TO LAUNCH?

Join the engineers already training on Fleet.

GET STARTED FOR FREE →
★ FLEET PLATFORM ONLINE★ GPU SCHEDULING ACTIVE★ ALL SYSTEMS GO★ INFERENCE ENDPOINTS READY★ MISSION CONTROL STANDING BY★ LAUNCH IN T-MINUS ZERO★ FLEET PLATFORM ONLINE★ GPU SCHEDULING ACTIVE★ ALL SYSTEMS GO★ INFERENCE ENDPOINTS READY★ MISSION CONTROL STANDING BY★ LAUNCH IN T-MINUS ZERO★ FLEET PLATFORM ONLINE★ GPU SCHEDULING ACTIVE★ ALL SYSTEMS GO★ INFERENCE ENDPOINTS READY★ MISSION CONTROL STANDING BY★ LAUNCH IN T-MINUS ZERO★ FLEET PLATFORM ONLINE★ GPU SCHEDULING ACTIVE★ ALL SYSTEMS GO★ INFERENCE ENDPOINTS READY★ MISSION CONTROL STANDING BY★ LAUNCH IN T-MINUS ZERO★ FLEET PLATFORM ONLINE★ GPU SCHEDULING ACTIVE★ ALL SYSTEMS GO★ INFERENCE ENDPOINTS READY★ MISSION CONTROL STANDING BY★ LAUNCH IN T-MINUS ZERO★ FLEET PLATFORM ONLINE★ GPU SCHEDULING ACTIVE★ ALL SYSTEMS GO★ INFERENCE ENDPOINTS READY★ MISSION CONTROL STANDING BY★ LAUNCH IN T-MINUS ZERO