Fast, cost-efficient inference and fine-tuning platform for open-source models, optimised for production compound-AI systems.
What They Do
Fireworks AI provides serverless inference for 100+ open-weight models with industry-leading latency, achieved through custom CUDA kernels and speculative decoding. The platform specialises in compound AI systems — structured generation, function calling, and JSON mode.
Mission
Enable developers to build production AI applications with fast, reliable, and cost-effective open-model inference.
Available Models
| Model | Family | Context | Input /M | Output /M |
|---|---|---|---|---|
| accounts/fireworks/models/deepseek-v4-flash | — | — | — | |
| accounts/fireworks/models/deepseek-v4-flash-0731 | — | — | — | |
| accounts/fireworks/models/deepseek-v4-flash-vision-exp | — | — | — | |
| accounts/fireworks/models/deepseek-v4-pro | — | — | — | |
| accounts/fireworks/models/deepseek-v4-pro-0813 | — | — | — | |
| accounts/fireworks/models/flux-1-schnell-fp8 | — | — | — | |
| accounts/fireworks/models/glm-5p1 | — | — | — | |
| accounts/fireworks/models/glm-5p2 | — | — | — | |
| accounts/fireworks/models/glm-5p3 | — | — | — | |
| accounts/fireworks/models/glm-5p3-flash | — | — | — | |
| accounts/fireworks/models/gpt-oss-120b | — | — | — | |
| accounts/fireworks/models/gpt-oss-20b | — | — | — | |
| accounts/fireworks/models/inkling | — | — | — | |
| accounts/fireworks/models/kimi-k2p5 | — | — | — | |
| accounts/fireworks/models/kimi-k2p6 | — | — | — | |
| accounts/fireworks/models/kimi-k2p7-code | — | — | — | |
| accounts/fireworks/models/kimi-k3 | — | — | — | |
| accounts/fireworks/models/minimax-m2p7 | — | — | — | |
| accounts/fireworks/models/minimax-m3 | — | — | — | |
| accounts/fireworks/models/muse-glimmer-30b | — | — | — | |
| accounts/fireworks/models/nemotron-3-ultra-nvfp4 | — | — | — | |
| accounts/fireworks/models/nemotron-lightning-3p5-30b-a3b | — | — | — | |
| accounts/fireworks/models/qwen3-embedding-8b | — | — | — | |
| accounts/fireworks/models/qwen3-reranker-8b | — | — | — | |
| accounts/fireworks/models/qwen3p7-plus | — | — | — | |
| accounts/fireworks/models/qwen3p8-2p4t-a95b | — | — | — | |
| accounts/fireworks/models/qwen3p8-max | — | — | — | |
| accounts/fireworks/routers/glm-5p1-fast | — | — | — | |
| accounts/fireworks/routers/glm-5p2-fast | — | — | — | |
| accounts/fireworks/routers/glm-5p3-fast | — | — | — | |
| accounts/fireworks/routers/kimi-k2p6-turbo | — | — | — | |
| accounts/fireworks/routers/kimi-k2p7-code-fast | — | — | — | |
| accounts/fireworks/routers/kimi-k3-fast | — | — | — |
FAQ
Lin Qiao (CEO, former Meta/PyTorch engineering director), Dmytro Dzhulgakov, and Praveen Tiwari co-founded Fireworks AI in 2022 with backing from Sequoia and other investors.