Estimation carte × modèle

Qwen2.5 14B sur RTX 4050 Laptop GPU Q4_K_M

trop juste

Sur une RTX 4050 Laptop GPU (6 Go), Qwen2.5 14B en Q4_K_M demande environ 9,9 Go de mémoire vidéo : c'est trop juste, il faudrait décharger une partie du modèle en mémoire système (beaucoup plus lent).

Pas encore mesuré : les chiffres ci-dessous sont des estimations, calculées à partir des modèles déjà mesurés sur cette carte. Mesurer ma carte

—

Génération (estimée)

≥ 9,9 Go

VRAM conseillée (6 Go dispo.)

—

Conso (modèle de réf.)

—

Coût élec. / M tokens · 0,25 €/kWh

Pas d'estimation de vitesse : le modèle ne tient pas en mémoire vidéo, une partie passerait en mémoire système et la vitesse s'effondrerait (souvent moins de 5 tok/s).

Et avec un contexte plus long ?

ContexteCache KVVRAM estiméeTient en 6 Go ?Vitesse estimée
4 0960,8 Go9,6 Gonon—
8 1921,5 Go10,4 Gonon—
16 3843,0 Go11,9 Gonon—
32 7686,0 Go14,9 Gonon—

VRAM estimée = fichier + cache KV (couches à attention complète, f16) + ~0,5 Go de buffers, hors mémoire prise par le système — d'où la « VRAM conseillée », un peu plus haute, qui garde cette marge. Vitesse ≈ vitesse estimée × poids lus ÷ (poids lus + cache KV ajouté).

Qwen2.5 14B sur les autres cartes

RTX 3050 Laptop GPU 4 Go trop justeRTX 3050 Ti Laptop GPU 4 Go trop justeRTX 3060 Laptop GPU 6 Go trop justeRTX 4050 Laptop GPU 6 Go trop justeRTX 3050 8 Go trop justeRTX 3060 Ti 8 Go trop justeRTX 3070 8 Go trop justeRTX 3070 Laptop GPU 8 Go trop justeRTX 3070 Ti 8 Go trop justeRTX 3070 Ti Laptop GPU 8 Go trop justeRTX 3080 Laptop GPU 8 Go trop justeRTX 4060 8 Go trop justeRTX 4060 Laptop GPU 8 Go trop justeRTX 4060 Ti 8 Go trop justeRTX 4070 Laptop GPU 8 Go trop justeRTX 5050 8 Go trop justeRTX 5050 Laptop GPU 8 Go trop justeRTX 5060 8 Go trop justeRTX 5060 Laptop GPU 8 Go trop justeRTX 5070 Laptop GPU 8 Go trop justeRTX 3080 10 Go devrait tenirRTX 3060 12 Go devrait tenirRTX 3080 Ti 12 Go devrait tenirRTX 4070 12 Go devrait tenirRTX 4070 SUPER 12 Go devrait tenirRTX 4070 Ti 12 Go devrait tenirRTX 4080 Laptop GPU 12 Go devrait tenirRTX 5070 12 Go devrait tenirRTX 5070 Ti Laptop GPU 12 Go devrait tenirRTX 3080 Ti Laptop GPU 16 Go devrait tenirRTX 4070 Ti SUPER 16 Go devrait tenirRTX 4080 16 Go devrait tenirRTX 4080 SUPER 16 Go devrait tenirRTX 4090 Laptop GPU 16 Go devrait tenirRTX 5060 Ti 16 Go devrait tenirRTX 5070 Ti 16 Go devrait tenirRTX 5080 16 Go devrait tenirRTX 5080 Laptop GPU 16 Go devrait tenirRTX 3090 24 Go devrait tenirRTX 3090 Ti 24 Go devrait tenirRTX 4090 24 Go devrait tenirRTX 5090 Laptop GPU 24 Go devrait tenirRTX 5090 32 Go devrait tenir
Fiche Qwen2.5 14BFiche RTX 4050 Laptop GPURessentir la vitesse Télécharger le GGUF (8,4 Go)

Estimations fondées sur les mesures réelles d'autres modèles sur cette carte et sur les données publiques du modèle (Qwen). Dès qu'une mesure existe, cette page affiche les vrais chiffres.