🌱⚡
GPU Garden
Construye tu propio poder de cómputo
¡Enlace copiado al portapapeles! Listo para compartir.

¿Puede mi GPU ejecutar IA de Código Abierto?

Estimación precisa de VRAM en el navegador para LLaMA 3.1, Qwen 2.5, DeepSeek y FLUX. Considera pesos cuantizados, Grouped Query Attention (GQA) KV-Cache y búferes del controlador CUDA.

Escenarios rápidos:

GGUF / Ollama / vLLM
8k tokens
Precisión KV-Cache:
Veredicto del Hardware
Se ejecuta con holgura

VRAM Total Requerida
7.64 GB
Capacidad VRAM de GPU
8.00 GB
Margen Disponible
+0.36 GB
Rendimiento Estimado
~68 tok/s
Desglose de Asignación de VRAM 100% capacidad
Pesos: 4.74 GB
KV-Cache: 1.00 GB
CUDA/Búfer: 1.90 GB
Margen libre: 0.36 GB
1. Fórmula de Pesos del Modelo 4.74 GB
Params * (BPW / 8) * overhead
8.03B params × (4.50 BPW / 8) × 1.05 overhead = 4.74 GB
2. Fórmula de KV-Cache 1.00 GB
2 * Layers * KV_Heads * Head_Dim * Context_Tokens * Precision_Bytes
2 × 32 layers × 8 KV heads × 128 dim × 8,192 ctx × 2B (FP16) = 1.00 GB
3. Búfer de Activación Transitorio & Base del Controlador (1.50 GB) 1.90 GB
Transient Activation Buffer & Driver Baseline (1.50 GB)
Activations (0.40 GB) + Driver Baseline (1.50 GB) = 1.90 GB
4. VRAM Total Requerida vs Capacidad Disponible & Margen Libre 7.64 GB
Total Required VRAM vs Available Capacity & Headroom
Requerido: 4.74 GB + 1.00 GB + 1.90 GB = 7.64 GB
Disponible: 8.00 GB Margen: +0.36 GB
Chuleta de Referencia

Compatibilidad VRAM de GPUs Populares & Configuraciones Ideales

Encuentra los requisitos exactos de memoria para IA abierta en tu hardware. Haz clic en cualquier tarjeta para probar parámetros y KV-Cache en la calculadora.

Actualizado para LLaMA 3.2, Qwen 2.5 & FLUX.1
24GB GDDR6X 1,008 GB/s

NVIDIA GeForce RTX 4090

El campeón indiscutible de consumo. Ejecuta Qwen 2.5 Coder 32B en Q4 con 32k de contexto, FLUX.1 [dev] en FP16 sin comprimir y LLaMA 3.1 8B FP16 a más de 120 tokens/seg.

Amazon →
48GB VRAM (Dual) 1,872+ GB/s

Dual NVIDIA RTX 3090 / 4090 Rig

El estándar de oro para homelabs en r/LocalLLaMA. 48GB de VRAM combinada ejecutan Meta LLaMA 3.3 70B y Qwen 2.5 72B en Q4_K_M con 32k de contexto sin descargar nada a CPU.

Amazon →
16GB GDDR6X 672 GB/s

NVIDIA GeForce RTX 4070 Ti Super

La tarjeta reina en relación calidad-precio con 16GB. Dispone de bus de 256 bits ideal para Qwen 2.5 14B, LLaMA 3.2 11B Vision, Mistral Small 24B (Q4) y FLUX Schnell.

Amazon →
12GB GDDR6 360 GB/s

NVIDIA GeForce RTX 3060 12GB

El rey indiscutible del presupuesto por debajo de 300$. Sus generosos 12GB de VRAM permiten correr LLaMA 3.1 8B con contextos enormes de 64k y modelos 14B en Q4_K_M sin fallos OOM.

Amazon →
~48GB Allocatable 400 GB/s

Apple M3 / M4 Max (64GB Unified)

La estación de trabajo silenciosa para desarrolladores. La arquitectura Metal asigna ~48GB de RAM unificada para llama.cpp y MLX, ejecutando modelos 70B en Q4_K_M con 128k de contexto.

Amazon →
16GB GDDR6 288 GB/s

NVIDIA GeForce RTX 4060 Ti 16GB

El billete de acceso más asequible a 16GB de VRAM moderna (~449$). Opera a unos frescos 165W TDP, moviendo FLUX.1 Schnell NF4 y Qwen 2.5 14B con total soltura.

Amazon →
Matriz de Referencia

Guía de Requisitos de VRAM & Matriz de Compatibilidad de IA

Requisitos exactos de VRAM en precisiones de 4-Bit (Q4_K_M), 8-Bit (Q8_0) y 16-Bit (FP16) con configuraciones de hardware recomendadas.

Quantized GGUF • AWQ • FP16 / bfloat16
Modelo & Arquitectura Parámetros 4-Bit (Q4_K_M) VRAM 8-Bit (Q8_0) VRAM 16-Bit (FP16) VRAM VRAM Mínima GPU Recomendada Acción
LLaMA 3.3 70B
Meta AI • Flagship LLM
70.6B Dense GQA
128k context
~41.7 GB
46.1 GB w/ 8k KV
~77.3 GB
81.7 GB w/ 8k KV
~144.0 GB
148.4 GB w/ 8k KV
48 GB
Dual RTX 3090 / 4090
48GB VRAM (Dual GPU)
Qwen 2.5 Coder 32B
Alibaba Cloud • SOTA Coding
32.5B Dense GQA
128k context
~19.2 GB
23.1 GB w/ 8k KV
~35.6 GB
39.5 GB w/ 8k KV
~66.3 GB
70.2 GB w/ 8k KV
24 GB
RTX 4090 24GB
1,008 GB/s (Consumer King)
DeepSeek V2.5 / V3 MoE
DeepSeek • MLA MoE
236B MoE MLA
21B active params
~139.4 GB
142.5 GB w/ 8k KV
~258.3 GB
261.4 GB w/ 8k KV
~481.4 GB
484.6 GB w/ 8k KV
64 GB+ (Offload)
Apple M3 Max 64GB
Unified RAM / Dual 3090
Mistral Small 24B
Mistral AI • Math & Reasoning
23.6B Dense
128k context
~14.2 GB
17.8 GB w/ 8k KV
~26.3 GB
29.9 GB w/ 8k KV
~49.0 GB
52.6 GB w/ 8k KV
16 GB
RTX 4070 Ti Super 16GB
672 GB/s (256-bit bus)
LLaMA 3.2 11B Vision
Meta AI • Multimodal Vision
13.8B Multimodal
128k context
~8.2 GB
11.1 GB w/ 8k KV
~15.1 GB
18.0 GB w/ 8k KV
~28.2 GB
31.1 GB w/ 8k KV
12 GB - 16 GB
RTX 4070 Ti Super 16GB
Full 16GB Headroom
LLaMA 3.1 8B
Meta AI • Open Benchmark
8.03B Dense
128k context
~4.7 GB
7.6 GB w/ 8k KV
~8.8 GB
11.7 GB w/ 8k KV
~16.4 GB
19.3 GB w/ 8k KV
8 GB
RTX 3060 12GB
Budget King (<$300)
FLUX.1 [dev]
Black Forest Labs • SOTA DiT
12.0B DiT
+4.9B T5-XXL / CLIP
~10.2 GB
15.5 GB w/ Act
~18.7 GB
24.0 GB w/ Act
~34.6 GB
39.9 GB w/ Act
16 GB (Q4) / 24 GB
RTX 4090 24GB
Native FP16 / FP8
SDXL 1.0
Stability AI • UNet 1024px
2.6B UNet
+0.8B CLIP-L/G
~3.3 GB
7.0 GB w/ Act
~4.7 GB
8.4 GB w/ Act
~7.1 GB
10.8 GB w/ Act
8 GB - 12 GB
RTX 3060 12GB
Full LoRA + ControlNet Headroom