Alibaba

Qwen2.5 Coder 1.5B

code

1,5 Md

Paramètres

0,9 Go

Fichier Q4_K_M

≥ 2,4 Go

VRAM conseillée

32 768

Contexte max

Vitesse par carte graphique

Simuler dans le « Configurateur » →

Bench standard llama-bench (prompt 512 / génération 128 tokens), modèle entièrement en VRAM. Cliquez sur une carte pour le détail. Coût électrique au tarif par défaut (0,25 €/kWh).

Carte · Q4_K_MVRAMGénérationLecture promptVRAM utiliséeConso€ élec. / M tokPrix
RTX 5070 Ti16 Go481 tok/s26 5202,3 Go73 W0,01 €/M tok—

Pas encore mesuré sur ces cartes — cliquez pour une estimation :

Fiche technique

Publication
2024-09-18
Architecture
28 couches · 2 têtes KV · dimension 128
Attention
Classique : chaque couche garde tout le contexte en mémoire.
Cache de contexte (f16)
≈ 27 Mo par 1 000 tokens · 0,9 Go pour 32 768 tokens
Fichier GGUF
bartowski/Qwen2.5-Coder-1.5B-Instruct-GGUF · Qwen2.5-Coder-1.5B-Instruct-Q4_K_M.gguf Télécharger (0,9 Go)

Données publiques Hugging Face (config.json officiel, dépôt GGUF). Le cache de contexte ne compte que les couches à attention complète.