> ## Documentation Index
> Fetch the complete documentation index at: https://docs.timbal.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# Fireworks

> Open-source models via Fireworks serverless inference with specs, pricing, and capabilities

<Note>Source: [Fireworks model docs](https://fireworks.ai/models). All model IDs use the prefix `fireworks/accounts/fireworks/models/`. Only serverless models are listed here — other Fireworks models require a dedicated deployment.</Note>

## All Models

<CardGroup cols={2}>
  <Card title="deepseek-v4-pro">
    <Icon icon="lightbulb" size={14} /> <Icon icon="lightbulb" size={14} /> <Icon icon="lightbulb" size={14} /> <Icon icon="lightbulb" size={14} /> <Icon icon="lightbulb" size={14} /> Reasoning · <Icon icon="bolt" size={14} /> <Icon icon="bolt" size={14} /> Speed

    `fireworks/accounts/fireworks/models/deepseek-v4-pro`

    DeepSeek V4 Pro on Fireworks serverless: frontier open MoE for coding, reasoning, and up to \~1M token context with function calling.

    * \$1.74 / \$3.48
    * <Icon icon="window-maximize" size={14} /> 1M context
    * <Icon icon="keyboard" size={14} /> Text input
  </Card>

  <Card title="deepseek-v4-flash">
    <Icon icon="lightbulb" size={14} /> <Icon icon="lightbulb" size={14} /> <Icon icon="lightbulb" size={14} /> <Icon icon="lightbulb" size={14} /> Reasoning · <Icon icon="bolt" size={14} /> <Icon icon="bolt" size={14} /> <Icon icon="bolt" size={14} /> <Icon icon="bolt" size={14} /> <Icon icon="bolt" size={14} /> Speed

    `fireworks/accounts/fireworks/models/deepseek-v4-flash`

    DeepSeek V4 Flash on Fireworks serverless: fast, cost-efficient MoE with near-Pro reasoning at 1M context.

    * \$0.14 / \$0.28
    * <Icon icon="window-maximize" size={14} /> 1M context
    * <Icon icon="keyboard" size={14} /> Text input
  </Card>

  <Card title="qwen3p7-plus">
    <Icon icon="lightbulb" size={14} /> <Icon icon="lightbulb" size={14} /> <Icon icon="lightbulb" size={14} /> <Icon icon="lightbulb" size={14} /> Reasoning · <Icon icon="bolt" size={14} /> <Icon icon="bolt" size={14} /> <Icon icon="bolt" size={14} /> Speed

    `fireworks/accounts/fireworks/models/qwen3p7-plus`

    Alibaba Qwen 3.7 Plus on Fireworks serverless: multimodal flagship with strong agentic and coding benchmarks.

    * \$0.40 / \$1.60
    * <Icon icon="window-maximize" size={14} /> 262K context
    * <Icon icon="keyboard" size={14} /> Text, Image input
  </Card>

  <Card title="qwen3p6-plus">
    <Icon icon="lightbulb" size={14} /> <Icon icon="lightbulb" size={14} /> <Icon icon="lightbulb" size={14} /> <Icon icon="lightbulb" size={14} /> Reasoning · <Icon icon="bolt" size={14} /> <Icon icon="bolt" size={14} /> <Icon icon="bolt" size={14} /> Speed

    `fireworks/accounts/fireworks/models/qwen3p6-plus`

    Qwen 3.6 multimodal plus tier on Fireworks for vision-language and general agent tasks.

    * \$0.50 / \$3.00
    * <Icon icon="window-maximize" size={14} /> 262K context
    * <Icon icon="keyboard" size={14} /> Text, Image input
    * <Icon icon="triangle-exclamation" size={14} /> Serverless deprecated — prefer qwen3p7-plus
  </Card>

  <Card title="kimi-k2p6">
    <Icon icon="lightbulb" size={14} /> <Icon icon="lightbulb" size={14} /> <Icon icon="lightbulb" size={14} /> <Icon icon="lightbulb" size={14} /> Reasoning · <Icon icon="bolt" size={14} /> <Icon icon="bolt" size={14} /> <Icon icon="bolt" size={14} /> Speed

    `fireworks/accounts/fireworks/models/kimi-k2p6`

    Moonshot Kimi K2.6 on Fireworks: multimodal MoE for high-quality tool use and long-context workloads.

    * \$0.95 / \$4.00
    * <Icon icon="window-maximize" size={14} /> 262K context
    * <Icon icon="keyboard" size={14} /> Text, Image input
  </Card>

  <Card title="kimi-k2p7-code">
    <Icon icon="lightbulb" size={14} /> <Icon icon="lightbulb" size={14} /> <Icon icon="lightbulb" size={14} /> <Icon icon="lightbulb" size={14} /> Reasoning · <Icon icon="bolt" size={14} /> <Icon icon="bolt" size={14} /> Speed

    `fireworks/accounts/fireworks/models/kimi-k2p7-code`

    Moonshot Kimi K2.7 Code on Fireworks serverless for long-context coding agents with thinking mode.

    * \$0.95 / \$4.00
    * <Icon icon="window-maximize" size={14} /> 262K context
    * <Icon icon="keyboard" size={14} /> Text, Image input
    * <Icon icon="brain" size={14} /> Thinking
  </Card>

  <Card title="kimi-k2p5">
    <Icon icon="lightbulb" size={14} /> <Icon icon="lightbulb" size={14} /> <Icon icon="lightbulb" size={14} /> <Icon icon="lightbulb" size={14} /> Reasoning · <Icon icon="bolt" size={14} /> <Icon icon="bolt" size={14} /> <Icon icon="bolt" size={14} /> Speed

    `fireworks/accounts/fireworks/models/kimi-k2p5`

    Moonshot Kimi K2.5 on Fireworks serverless: multimodal 1T-parameter MoE with strong agentic tool use.

    * \$0.60 / \$3.00
    * <Icon icon="window-maximize" size={14} /> 256K context
    * <Icon icon="keyboard" size={14} /> Text, Image input
    * <Icon icon="triangle-exclamation" size={14} /> Serverless deprecated — prefer kimi-k2p6
  </Card>

  <Card title="glm-5p1">
    <Icon icon="lightbulb" size={14} /> <Icon icon="lightbulb" size={14} /> <Icon icon="lightbulb" size={14} /> <Icon icon="lightbulb" size={14} /> Reasoning · <Icon icon="bolt" size={14} /> <Icon icon="bolt" size={14} /> <Icon icon="bolt" size={14} /> Speed

    `fireworks/accounts/fireworks/models/glm-5p1`

    Z.ai GLM-5.1 on Fireworks serverless: post-training upgrade with stronger coding, reasoning, and agentic tool use.

    * \$1.40 / \$4.40
    * <Icon icon="window-maximize" size={14} /> 203K context
    * <Icon icon="keyboard" size={14} /> Text input
  </Card>

  <Card title="glm-5p2">
    <Icon icon="lightbulb" size={14} /> <Icon icon="lightbulb" size={14} /> <Icon icon="lightbulb" size={14} /> <Icon icon="lightbulb" size={14} /> <Icon icon="lightbulb" size={14} /> Reasoning · <Icon icon="bolt" size={14} /> <Icon icon="bolt" size={14} /> <Icon icon="bolt" size={14} /> Speed

    `fireworks/accounts/fireworks/models/glm-5p2`

    Z.ai GLM-5.2 on Fireworks serverless: 1M-token context, strongest open coding model with prompt caching (cached input \$0.14 / 1M).

    * \$1.40 / \$4.40
    * <Icon icon="window-maximize" size={14} /> 1M context
    * <Icon icon="keyboard" size={14} /> Text input
  </Card>

  <Card title="minimax-m2p5">
    <Icon icon="lightbulb" size={14} /> <Icon icon="lightbulb" size={14} /> <Icon icon="lightbulb" size={14} /> <Icon icon="lightbulb" size={14} /> Reasoning · <Icon icon="bolt" size={14} /> <Icon icon="bolt" size={14} /> <Icon icon="bolt" size={14} /> <Icon icon="bolt" size={14} /> Speed

    `fireworks/accounts/fireworks/models/minimax-m2p5`

    MiniMax M2.5 MoE (230B total, 10B active) with SOTA coding and agentic tool use on Fireworks serverless.

    * \$0.30 / \$1.20
    * <Icon icon="window-maximize" size={14} /> 200K context
    * <Icon icon="keyboard" size={14} /> Text input
    * <Icon icon="triangle-exclamation" size={14} /> Serverless deprecated — prefer minimax-m2p7 or minimax-m3
  </Card>

  <Card title="minimax-m2p7">
    <Icon icon="lightbulb" size={14} /> <Icon icon="lightbulb" size={14} /> <Icon icon="lightbulb" size={14} /> <Icon icon="lightbulb" size={14} /> Reasoning · <Icon icon="bolt" size={14} /> <Icon icon="bolt" size={14} /> <Icon icon="bolt" size={14} /> Speed

    `fireworks/accounts/fireworks/models/minimax-m2p7`

    MiniMax M2.7 MoE on Fireworks serverless: improved agent harnesses, complex skills, and dynamic tool search.

    * \$0.30 / \$1.20
    * <Icon icon="window-maximize" size={14} /> 196K context
    * <Icon icon="keyboard" size={14} /> Text input
  </Card>

  <Card title="minimax-m3">
    <Icon icon="lightbulb" size={14} /> <Icon icon="lightbulb" size={14} /> <Icon icon="lightbulb" size={14} /> <Icon icon="lightbulb" size={14} /> Reasoning · <Icon icon="bolt" size={14} /> <Icon icon="bolt" size={14} /> <Icon icon="bolt" size={14} /> Speed

    `fireworks/accounts/fireworks/models/minimax-m3`

    MiniMax M3 multimodal MoE on Fireworks serverless for chat, agents, and long-context workloads.

    * \$0.30 / \$1.20
    * <Icon icon="window-maximize" size={14} /> 512K context
    * <Icon icon="keyboard" size={14} /> Text, Image input
  </Card>

  <Card title="gpt-oss-120b">
    <Icon icon="lightbulb" size={14} /> <Icon icon="lightbulb" size={14} /> <Icon icon="lightbulb" size={14} /> <Icon icon="lightbulb" size={14} /> Reasoning · <Icon icon="bolt" size={14} /> <Icon icon="bolt" size={14} /> <Icon icon="bolt" size={14} /> <Icon icon="bolt" size={14} /> Speed

    `fireworks/accounts/fireworks/models/gpt-oss-120b`

    OpenAI's open-weight 120B MoE achieving near-parity with o4-mini on reasoning benchmarks. Apache 2.0.

    * \$0.15 / \$0.60
    * <Icon icon="window-maximize" size={14} /> 128K context
    * <Icon icon="keyboard" size={14} /> Text input
  </Card>

  <Card title="gpt-oss-20b">
    <Icon icon="lightbulb" size={14} /> <Icon icon="lightbulb" size={14} /> <Icon icon="lightbulb" size={14} /> Reasoning · <Icon icon="bolt" size={14} /> <Icon icon="bolt" size={14} /> <Icon icon="bolt" size={14} /> <Icon icon="bolt" size={14} /> <Icon icon="bolt" size={14} /> Speed

    `fireworks/accounts/fireworks/models/gpt-oss-20b`

    OpenAI's compact 20B MoE similar to o3-mini, running on edge devices with 16GB memory. Apache 2.0.

    * \$0.07 / \$0.30
    * <Icon icon="window-maximize" size={14} /> 128K context
    * <Icon icon="keyboard" size={14} /> Text input
  </Card>
</CardGroup>
