Meta

Llama 3.1 8B

8 Md

Paramètres

4,6 Go

Fichier Q4_K_M

≥ 6,1 Go

VRAM conseillée

131 072

Contexte max

Vitesse par carte graphique

Simuler dans le « Configurateur » →

Bench standard llama-bench (prompt 512 / génération 128 tokens), modèle entièrement en VRAM. Cliquez sur une carte pour le détail. Coût électrique au tarif par défaut (0,25 €/kWh).

Carte · Q4_K_MVRAMGénérationLecture promptVRAM utiliséeConso€ élec. / M tokPrix
RTX 5070 Ti16 Go151 tok/s6 8185,4 Go161 W0,07 €/M tok1 400 €
RTX 4090démo24 Go132 tok/s5 9006,2 Go285 W0,15 €/M tok—
RTX 5080démo16 Go124 tok/s5 1006,0 Go250 W0,14 €/M tok1 850 €
RTX 4080démo16 Go103 tok/s4 7006,1 Go230 W0,16 €/M tok780 €
RTX 4070 Ti12 Go89,6 tok/s5 9605,6 Go158 W0,12 €/M tok927 €
RTX 407012 Go82,3 tok/s4 3366,8 Go138 W0,12 €/M tok595 €
RTX 3060démo12 Go48,0 tok/s1 5005,9 Go155 W0,22 €/M tok260 €

Fiche technique

Publication
2024-07-18
Architecture
32 couches · 8 têtes KV · dimension 128
Attention
Classique : chaque couche garde tout le contexte en mémoire.
Cache de contexte (f16)
≈ 125 Mo par 1 000 tokens · 4,0 Go pour 32 768 tokens
Fichier GGUF
bartowski/Meta-Llama-3.1-8B-Instruct-GGUF · Meta-Llama-3.1-8B-Instruct-Q4_K_M.gguf Télécharger (4,6 Go)

Données publiques Hugging Face (config.json officiel, dépôt GGUF). Le cache de contexte ne compte que les couches à attention complète.