Meta

Llama 3.3

Choisissez une taille : la mémoire vidéo indiquée correspond au fichier Q4_K_M (la quantisation du protocole) plus environ 1,5 Go pour un contexte de 4 000 tokens.

70B

> 32 Go
Paramètres
70,6 Md
Fichier Q4_K_M
39,6 Go
VRAM conseillée
≥ 41,1 Go
Contexte max
131 072

Pas encore mesuré

MoE (« 30B-A3B ») : toute la mémoire d'un 30B, mais la vitesse d'un modèle de 3 Md de paramètres actifs. « > 32 Go » : plusieurs cartes, ou une partie du modèle en mémoire système (bien plus lent).