🌱⚡
GPU Garden
构建你自己的算力
链接已复制到剪贴板!随时可以分享。

我的显卡能否运行 开源大模型?

面向 LLaMA 3.1、Qwen 2.5、DeepSeek 与 FLUX 的精准客户端显存推算。全面考量 量化模型权重、分组查询注意力 (GQA) KV-Cache 与 CUDA 底层驱动缓冲。

快捷配置预设:

GGUF / Ollama / vLLM
8k tokens
KV-Cache 精度:
硬件适配结论
轻松流畅运行

所需总显存
7.64 GB
显卡显存容量
8.00 GB
剩余显存余量
+0.36 GB
预估生成吞吐量
~68 tok/s
显存占用详细分布 100% 容量
模型权重: 4.74 GB
KV-Cache: 1.00 GB
CUDA/缓冲: 1.90 GB
可用余量: 0.36 GB
1. 模型权重显存公式 4.74 GB
Params * (BPW / 8) * overhead
8.03B params × (4.50 BPW / 8) × 1.05 overhead = 4.74 GB
2. KV-Cache 显存公式 1.00 GB
2 * Layers * KV_Heads * Head_Dim * Context_Tokens * Precision_Bytes
2 × 32 layers × 8 KV heads × 128 dim × 8,192 ctx × 2B (FP16) = 1.00 GB
3. 激活值临时缓冲与驱动预留 (1.50 GB) 1.90 GB
Transient Activation Buffer & Driver Baseline (1.50 GB)
Activations (0.40 GB) + Driver Baseline (1.50 GB) = 1.90 GB
4. 所需总显存对比可用显存与剩余余量 7.64 GB
Total Required VRAM vs Available Capacity & Headroom
需求显存: 4.74 GB + 1.00 GB + 1.90 GB = 7.64 GB
可用容量: 8.00 GB 显存余量: +0.36 GB
常用参考速查表

主流 GPU 显存兼容性与推荐 Sweet-Spot 甜品卡

查找开源 AI 模型在你显卡上的精确显存需求。点击任意卡片即可在上方计算器中即时测试参数与 KV-Cache 余量。

已更新支持 LLaMA 3.2、Qwen 2.5 与 FLUX.1
24GB GDDR6X 1,008 GB/s

NVIDIA GeForce RTX 4090

消费级无可争议的绝对卡皇。支持 Q4 精度 32k 上下文运行 Qwen 2.5 Coder 32B、非压缩原生 FP16 运行 FLUX.1 [dev],并能以 120+ tokens/秒全速运行 LLaMA 3.1 8B FP16。

Amazon →
48GB VRAM (Dual) 1,872+ GB/s

Dual NVIDIA RTX 3090 / 4090 Rig

r/LocalLLaMA 开源社区公认的黄金工作站配置。48GB 汇总显存可在零内存交换的前提下,以 Q4_K_M 精度及 32k 上下文原生运行 Meta LLaMA 3.3 70B 与 Qwen 2.5 72B。

Amazon →
16GB GDDR6X 672 GB/s

NVIDIA GeForce RTX 4070 Ti Super

16GB 显存价位兼具性能与性价比的优选。具备 256-bit 显存位宽,完美契合 Qwen 2.5 14B、LLaMA 3.2 11B Vision、Mistral Small 24B (Q4) 与 FLUX Schnell。

Amazon →
12GB GDDR6 360 GB/s

NVIDIA GeForce RTX 3060 12GB

300 美元以内当之无愧的预算之王。其充裕的 12GB 显存可支持 LLaMA 3.1 8B 展开高达 64k 的长上下文推理,并在 Q4_K_M 精度下零 OOM 运行 14B 模型。

Amazon →
~48GB Allocatable 400 GB/s

Apple M3 / M4 Max (64GB Unified)

静音全能开发者移动工作站。macOS Metal 架构直接为 llama.cpp 与 MLX 分配约 48GB 统一内存,支持全量 128k 上下文运行 70B Q4_K_M 模型。

Amazon →
16GB GDDR6 288 GB/s

NVIDIA GeForce RTX 4060 Ti 16GB

步入现代 16GB 显存大门的最低门槛卡(约 449 美元)。运行功耗极低(仅 165W TDP),轻松应对 FLUX.1 Schnell NF4 与 Qwen 2.5 14B。

Amazon →
参数基准矩阵

开源 AI 模型显存需求指南与硬件兼容矩阵

涵盖 4-Bit (Q4_K_M)、8-Bit (Q8_0) 与 16-Bit (FP16) 精度的精确显存需求,提供权威官方甜品硬件配置推荐。

Quantized GGUF • AWQ • FP16 / bfloat16
模型与架构 参数规模 4-Bit (Q4_K_M) VRAM 8-Bit (Q8_0) VRAM 16-Bit (FP16) VRAM 最低推荐显存 最佳甜品配置 操作
LLaMA 3.3 70B
Meta AI • Flagship LLM
70.6B Dense GQA
128k context
~41.7 GB
46.1 GB w/ 8k KV
~77.3 GB
81.7 GB w/ 8k KV
~144.0 GB
148.4 GB w/ 8k KV
48 GB
Dual RTX 3090 / 4090
48GB VRAM (Dual GPU)
Qwen 2.5 Coder 32B
Alibaba Cloud • SOTA Coding
32.5B Dense GQA
128k context
~19.2 GB
23.1 GB w/ 8k KV
~35.6 GB
39.5 GB w/ 8k KV
~66.3 GB
70.2 GB w/ 8k KV
24 GB
RTX 4090 24GB
1,008 GB/s (Consumer King)
DeepSeek V2.5 / V3 MoE
DeepSeek • MLA MoE
236B MoE MLA
21B active params
~139.4 GB
142.5 GB w/ 8k KV
~258.3 GB
261.4 GB w/ 8k KV
~481.4 GB
484.6 GB w/ 8k KV
64 GB+ (Offload)
Apple M3 Max 64GB
Unified RAM / Dual 3090
Mistral Small 24B
Mistral AI • Math & Reasoning
23.6B Dense
128k context
~14.2 GB
17.8 GB w/ 8k KV
~26.3 GB
29.9 GB w/ 8k KV
~49.0 GB
52.6 GB w/ 8k KV
16 GB
RTX 4070 Ti Super 16GB
672 GB/s (256-bit bus)
LLaMA 3.2 11B Vision
Meta AI • Multimodal Vision
13.8B Multimodal
128k context
~8.2 GB
11.1 GB w/ 8k KV
~15.1 GB
18.0 GB w/ 8k KV
~28.2 GB
31.1 GB w/ 8k KV
12 GB - 16 GB
RTX 4070 Ti Super 16GB
Full 16GB Headroom
LLaMA 3.1 8B
Meta AI • Open Benchmark
8.03B Dense
128k context
~4.7 GB
7.6 GB w/ 8k KV
~8.8 GB
11.7 GB w/ 8k KV
~16.4 GB
19.3 GB w/ 8k KV
8 GB
RTX 3060 12GB
Budget King (<$300)
FLUX.1 [dev]
Black Forest Labs • SOTA DiT
12.0B DiT
+4.9B T5-XXL / CLIP
~10.2 GB
15.5 GB w/ Act
~18.7 GB
24.0 GB w/ Act
~34.6 GB
39.9 GB w/ Act
16 GB (Q4) / 24 GB
RTX 4090 24GB
Native FP16 / FP8
SDXL 1.0
Stability AI • UNet 1024px
2.6B UNet
+0.8B CLIP-L/G
~3.3 GB
7.0 GB w/ Act
~4.7 GB
8.4 GB w/ Act
~7.1 GB
10.8 GB w/ Act
8 GB - 12 GB
RTX 3060 12GB
Full LoRA + ControlNet Headroom