Model directory

Explore 26 open-weight models. Compare deployment specs across current releases and established baselines.

All models 26

Select up to 3 models to compare
Multimodal
Alibaba / Dense · vision

Qwen3.8 27B

A mid-sized vision-language model for reasoning, coding, and agent workloads.

Parameters
27B
Context
256K native
Minimum
GPU / VRAM · pending
Weight memory estimatePending
Distilled
Xiaomi / Dense · vision

MiMo V2.6 Distill 9B

A compact Qwen-based MiMo distillation for a smaller deployment footprint.

Parameters
~9B
Context
Under review
Minimum
GPU / VRAM · pending
Weight memory estimatePending
Multimodal
Google / Dense · multimodal

Gemma 4 12B

Unified text, image, and audio understanding in a compact Gemma 4 model.

Parameters
11.95B
Context
256K
Minimum
GPU / VRAM · pending
Weight memory estimatePending
Agentic
Alibaba / MoE · vision

Qwen3.8 Flash-Next

A sparse model with extra embedding memory for long-context agent workloads.

Parameters
125B+ / 6B active
Context
256K native
Minimum
GPU / VRAM · pending
Weight memory estimatePending
Agentic
Xiaomi / MoE · multimodal

MiMo V2.6 Flash

MiMo's multimodal Flash model with sparse experts and a 1M context window.

Parameters
309B+ / 15B active
Context
1M
Minimum
GPU / VRAM · pending
Weight memory estimatePending
Multimodal
Z.ai / MoE · vision

GLM 5.3 Flash

A multimodal GLM model combining sparse experts with hybrid attention.

Parameters
320B / 18B active
Context
Under review
Minimum
GPU / VRAM · pending
Weight memory estimatePending
Multimodal
Alibaba / Dense · vision

Qwen3.5 9B

A smaller Qwen vision-language model for comparing compact deployments.

Parameters
~9B
Context
Under review
Minimum
GPU / VRAM · pending
Weight memory estimatePending
Agentic
Alibaba / MoE · vision

Qwen3.6 35B-A3B

A smaller sparse Qwen model for coding agents and vision-language tasks.

Parameters
35B+ / 3B active
Context
256K native
Minimum
GPU / VRAM · pending
Weight memory estimatePending
Multimodal
Google / MoE · vision

Gemma 4 26B-A4B

Gemma's sparse vision-language model, a useful counterpart to the dense 31B.

Parameters
~26B / 3.8B active
Context
256K
Minimum
GPU / VRAM · pending
Weight memory estimatePending
Multimodal
Google / Dense · vision

Gemma 4 31B

A dense Gemma 4 model for text and image understanding at a larger scale.

Parameters
~31B
Context
256K
Minimum
GPU / VRAM · pending
Weight memory estimatePending
On-device
Google / Dense · multimodal

Gemma 4 E4B

An edge-focused Gemma model with text, image, and audio inputs.

Parameters
8B+
Context
128K
Minimum
GPU / VRAM · pending
Weight memory estimatePending
Agentic
NVIDIA / Hybrid MoE

Nemotron 3.5 Lightning

A hybrid NVIDIA model with an official NVFP4 checkpoint for agent inference.

Parameters
30B / 3B active
Context
1M
Minimum
GPU / VRAM · pending
Weight memory estimatePending
Coding
Alibaba / Hybrid MoE

Qwen3-Coder-Next

A coding-focused sparse model for long-running agents and local development.

Parameters
80B / 3B active
Context
256K
Minimum
GPU / VRAM · pending
Weight memory estimatePending
Reasoning
Mistral AI / MoE · vision

Mistral Small 4

A multimodal MoE unifying instruction following, reasoning, and coding.

Parameters
119B / 6.5B active
Context
256K
Minimum
GPU / VRAM · pending
Weight memory estimatePending
Reasoning
DeepSeek / MoE · vision

DeepSeek V4.1 Flash

A multimodal model using encoder-decoder attention and KV cache compression.

Parameters
552B+
Context
1M
Minimum
GPU / VRAM · pending
Weight memory estimatePending
Agentic
Xiaomi / MoE · multimodal

MiMo V2.6 Pro

MiMo's large multimodal model for long-context, tool-using agent workloads.

Parameters
1.02T+ / 42B active
Context
1M
Minimum
GPU / VRAM · pending
Weight memory estimatePending
Multimodal
MiniMax / MoE · vision

MiniMax M3

A native multimodal model with sparse attention for million-token contexts.

Parameters
~428B / 23B active
Context
1M
Minimum
GPU / VRAM · pending
Weight memory estimatePending
Agentic
Moonshot AI / MoE · vision

Kimi K3

A large-scale vision-language MoE for coding and long-horizon agent tasks.

Parameters
2.8T / 104B active
Context
1M
Minimum
GPU / VRAM · pending
Weight memory estimatePending
Coding
Z.ai / MoE

GLM 5.3

A large GLM checkpoint for coding, with a separate license from Flash.

Parameters
~753B*
Context
Under review
Minimum
GPU / VRAM · pending
Weight memory estimatePending
Reasoning
Alibaba / MoE

Qwen3.8 2.4T-A95B

A large-scale Qwen model for distributed text-generation deployments.

Parameters
~2.4T / 95B active
Context
Under review
Minimum
GPU / VRAM · pending
Weight memory estimatePending
Baseline
Alibaba / Dense

Qwen3 8B

A compact starting point for reasoning, chat, and your first self-hosted deployment.

Parameters
8.2B
Context
32K native
Minimum
GPU / VRAM · pending
16-bit weight estimate16.4 GB
Baseline
Xiaomi / MoE

MiMo V2 Flash

Sparse compute, substantial memory. A closer look at the economics of a large MoE.

Parameters
309B / 15B active
Context
256K
Minimum
GPU / VRAM · pending
16-bit weight estimate618 GB
Baseline
Meta / Dense

Llama 3.1 8B

An established instruction-tuned baseline for a practical deployment comparison.

Parameters
~8B
Context
128K
Minimum
GPU / VRAM · pending
16-bit weight estimate16 GB
Baseline
Google / Dense · vision

Gemma 3 12B

Text and image understanding, with a memory budget that deserves a closer look.

Parameters
~12B
Context
128K
Minimum
GPU / VRAM · pending
16-bit weight estimate24 GB
Baseline
Alibaba / Dense

Qwen3 32B

A larger dense reasoning model for exploring precision and memory trade-offs.

Parameters
32.8B
Context
32K native
Minimum
GPU / VRAM · pending
16-bit weight estimate65.6 GB
Baseline
Google / Dense · vision

Gemma 3 4B

A smaller multimodal model to explore when your memory budget comes first.

Parameters
~4B
Context
128K
Minimum
GPU / VRAM · pending
16-bit weight estimate8 GB

Specifications from official model cards. Memory figures are calculated estimates, not measured VRAM. How to read the data