> ## Documentation Index
> Fetch the complete documentation index at: https://docs.timbal.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# Groq

> Ultra-low latency inference via Groq LPU with specs, pricing, and capabilities

<Note>Source: [Groq model docs](https://console.groq.com/docs/models). All model IDs use the prefix `groq/`. Ultra-low latency inference via custom LPU hardware.</Note>

## All Models

<CardGroup cols={2}>
  <Card title="qwen/qwen3.6-27b">
    <Icon icon="lightbulb" size={14} /> <Icon icon="lightbulb" size={14} /> <Icon icon="lightbulb" size={14} /> <Icon icon="lightbulb" size={14} /> Reasoning · <Icon icon="bolt" size={14} /> <Icon icon="bolt" size={14} /> <Icon icon="bolt" size={14} /> <Icon icon="bolt" size={14} /> <Icon icon="bolt" size={14} /> Speed

    `groq/qwen/qwen3.6-27b`

    Qwen3.6 27B with hybrid thinking mode, delivered at Groq's ultra-low latency. Preview tier replacing retired Qwen3 32B / Llama 4 Scout.

    * \$0.60 / \$3.00
    * <Icon icon="window-maximize" size={14} /> 131K context
    * <Icon icon="keyboard" size={14} /> Text input
    * <Icon icon="brain" size={14} /> Hybrid thinking
  </Card>

  <Card title="openai/gpt-oss-120b">
    <Icon icon="lightbulb" size={14} /> <Icon icon="lightbulb" size={14} /> <Icon icon="lightbulb" size={14} /> <Icon icon="lightbulb" size={14} /> Reasoning · <Icon icon="bolt" size={14} /> <Icon icon="bolt" size={14} /> <Icon icon="bolt" size={14} /> <Icon icon="bolt" size={14} /> <Icon icon="bolt" size={14} /> Speed

    `groq/openai/gpt-oss-120b`

    OpenAI's open-weight MoE model with 120B total parameters (5.1B active per token), running at Groq speeds. Near-parity with o4-mini on reasoning benchmarks. Apache 2.0.

    * \$0.15 / \$0.60
    * <Icon icon="window-maximize" size={14} /> 128K context
    * <Icon icon="keyboard" size={14} /> Text input
    * <Icon icon="brain" size={14} /> Thinking
  </Card>

  <Card title="openai/gpt-oss-20b">
    <Icon icon="lightbulb" size={14} /> <Icon icon="lightbulb" size={14} /> <Icon icon="lightbulb" size={14} /> Reasoning · <Icon icon="bolt" size={14} /> <Icon icon="bolt" size={14} /> <Icon icon="bolt" size={14} /> <Icon icon="bolt" size={14} /> <Icon icon="bolt" size={14} /> Speed

    `groq/openai/gpt-oss-20b`

    OpenAI's compact open-weight MoE model with 20B total parameters (3.6B active), delivering results similar to o3-mini at Groq's ultra-low latency. Apache 2.0.

    * \$0.075 / \$0.30
    * <Icon icon="window-maximize" size={14} /> 128K context
    * <Icon icon="keyboard" size={14} /> Text input
    * <Icon icon="brain" size={14} /> Thinking
  </Card>

  <Card title="llama-3.3-70b-versatile">
    <Icon icon="lightbulb" size={14} /> <Icon icon="lightbulb" size={14} /> <Icon icon="lightbulb" size={14} /> Reasoning · <Icon icon="bolt" size={14} /> <Icon icon="bolt" size={14} /> <Icon icon="bolt" size={14} /> <Icon icon="bolt" size={14} /> <Icon icon="bolt" size={14} /> Speed

    `groq/llama-3.3-70b-versatile`

    Multilingual instruction-tuned model with 70B parameters, optimized for versatile tasks with Groq's ultra-low latency inference.

    * \$0.59 / \$0.79
    * <Icon icon="window-maximize" size={14} /> 131K context
    * <Icon icon="keyboard" size={14} /> Text input
    * <Icon icon="triangle-exclamation" size={14} /> Deprecated — shutdown August 16, 2026
  </Card>

  <Card title="llama-3.1-8b-instant">
    <Icon icon="lightbulb" size={14} /> <Icon icon="lightbulb" size={14} /> Reasoning · <Icon icon="bolt" size={14} /> <Icon icon="bolt" size={14} /> <Icon icon="bolt" size={14} /> <Icon icon="bolt" size={14} /> <Icon icon="bolt" size={14} /> Speed

    `groq/llama-3.1-8b-instant`

    The most compact Llama 3.1 model with 8B parameters, optimized for instant responses on Groq's LPU hardware.

    * \$0.05 / \$0.08
    * <Icon icon="window-maximize" size={14} /> 131K context
    * <Icon icon="keyboard" size={14} /> Text input
    * <Icon icon="triangle-exclamation" size={14} /> Deprecated — shutdown August 16, 2026
  </Card>
</CardGroup>
