DeepSeek

Coder V2 Lite 16B-A2.4B

codeMoE

15,7 Md

Paramètres · 2,4 Md actifs

9,7 Go

Fichier Q4_K_M

≥ 11,2 Go

VRAM conseillée

163 840

Contexte max

Vitesse par carte graphique

Simuler dans le « Configurateur » →

Bench standard llama-bench (prompt 512 / génération 128 tokens), modèle entièrement en VRAM. Cliquez sur une carte pour le détail. Coût électrique au tarif par défaut (0,25 €/kWh).

Carte · Q4_K_MVRAMGénérationLecture promptVRAM utiliséeConso€ élec. / M tokPrix
RTX 4070 Ti12 Go189 tok/s7 06810,6 Go96 W0,04 €/M tok—

Pas encore mesuré sur ces cartes — cliquez pour une estimation :

Fiche technique

Publication
2024-06-14
Architecture
27 couches · 16 têtes KV · dimension 128
Attention
Latente (MLA) : le cache de contexte est compressé — beaucoup plus léger que la formule classique.
Fichier GGUF
bartowski/DeepSeek-Coder-V2-Lite-Instruct-GGUF · DeepSeek-Coder-V2-Lite-Instruct-Q4_K_M.gguf Télécharger (9,7 Go)

Données publiques Hugging Face (config.json officiel, dépôt GGUF). Le cache de contexte ne compte que les couches à attention complète.