Meta
Llama 3.1 8B
8 Md
Paramètres
4,6 Go
Fichier Q4_K_M
≥ 6,1 Go
VRAM conseillée
131 072
Contexte max
Vitesse par carte graphique
Simuler dans le « Configurateur » →Bench standard llama-bench (prompt 512 / génération 128 tokens), modèle entièrement en VRAM. Cliquez sur une carte pour le détail. Coût électrique au tarif par défaut (0,25 €/kWh).
| Carte · Q4_K_M | VRAM | Génération | Lecture prompt | VRAM utilisée | Conso | € élec. / M tok | Prix |
|---|---|---|---|---|---|---|---|
| RTX 5070 Ti | 16 Go | 151 tok/s | 6 818 | 5,4 Go | 161 W | 0,07 €/M tok | 1 400 € |
| RTX 4090démo | 24 Go | 132 tok/s | 5 900 | 6,2 Go | 285 W | 0,15 €/M tok | — |
| RTX 5080démo | 16 Go | 124 tok/s | 5 100 | 6,0 Go | 250 W | 0,14 €/M tok | 1 850 € |
| RTX 4080démo | 16 Go | 103 tok/s | 4 700 | 6,1 Go | 230 W | 0,16 €/M tok | 780 € |
| RTX 4070 Ti | 12 Go | 89,6 tok/s | 5 960 | 5,6 Go | 158 W | 0,12 €/M tok | 927 € |
| RTX 4070 | 12 Go | 82,3 tok/s | 4 336 | 6,8 Go | 138 W | 0,12 €/M tok | 595 € |
| RTX 3060démo | 12 Go | 48,0 tok/s | 1 500 | 5,9 Go | 155 W | 0,22 €/M tok | 260 € |
Fiche technique
- Publication
- 2024-07-18
- Architecture
- 32 couches · 8 têtes KV · dimension 128
- Attention
- Classique : chaque couche garde tout le contexte en mémoire.
- Cache de contexte (f16)
- ≈ 125 Mo par 1 000 tokens · 4,0 Go pour 32 768 tokens
- Fichier GGUF
- bartowski/Meta-Llama-3.1-8B-Instruct-GGUF · Meta-Llama-3.1-8B-Instruct-Q4_K_M.gguf Télécharger (4,6 Go)
- Dépôt officiel
- meta-llama/Llama-3.1-8B-Instruct
Données publiques Hugging Face (config.json officiel, dépôt GGUF). Le cache de contexte ne compte que les couches à attention complète.