Alibaba

Qwen2.5 Coder 7B

code

7,6 Md

Paramètres

4,4 Go

Fichier Q4_K_M

≥ 5,9 Go

VRAM conseillée

32 768

Contexte max

Vitesse par carte graphique

Simuler dans le « Configurateur » →

Bench standard llama-bench (prompt 512 / génération 128 tokens), modèle entièrement en VRAM. Cliquez sur une carte pour le détail. Coût électrique au tarif par défaut (0,25 €/kWh).

Carte · Q4_K_MVRAMGénérationLecture promptVRAM utiliséeConso€ élec. / M tokPrix
RTX 5070 Ti16 Go162 tok/s7 4925,9 Go138 W0,06 €/M tok—
RTX 4070 Ti12 Go96,7 tok/s6 5745,1 Go151 W0,11 €/M tok—

Pas encore mesuré sur ces cartes — cliquez pour une estimation :

Fiche technique

Publication
2024-09-17
Architecture
28 couches · 4 têtes KV · dimension 128
Attention
Classique : chaque couche garde tout le contexte en mémoire.
Cache de contexte (f16)
≈ 55 Mo par 1 000 tokens · 1,8 Go pour 32 768 tokens
Fichier GGUF
bartowski/Qwen2.5-Coder-7B-Instruct-GGUF · Qwen2.5-Coder-7B-Instruct-Q4_K_M.gguf Télécharger (4,4 Go)

Données publiques Hugging Face (config.json officiel, dépôt GGUF). Le cache de contexte ne compte que les couches à attention complète.