Alibaba

Qwen2.5 Coder 0.5B

code

0,5 Md

Paramètres

0,4 Go

Fichier Q4_K_M

≥ 1,9 Go

VRAM conseillée

32 768

Contexte max

Vitesse par carte graphique

Simuler dans le « Configurateur » →

Bench standard llama-bench (prompt 512 / génération 128 tokens), modèle entièrement en VRAM. Cliquez sur une carte pour le détail. Coût électrique au tarif par défaut (0,25 €/kWh).

Carte · Q4_K_MVRAMGénérationLecture promptVRAM utiliséeConso€ élec. / M tokPrix
RTX 5070 Ti16 Go805 tok/s55 5861,7 Go42 W0,00 €/M tok—

Pas encore mesuré sur ces cartes — cliquez pour une estimation :

Fiche technique

Publication
2024-11-06
Architecture
24 couches · 2 têtes KV · dimension 64
Attention
Classique : chaque couche garde tout le contexte en mémoire.
Cache de contexte (f16)
≈ 12 Mo par 1 000 tokens · 0,4 Go pour 32 768 tokens
Fichier GGUF
bartowski/Qwen2.5-Coder-0.5B-Instruct-GGUF · Qwen2.5-Coder-0.5B-Instruct-Q4_K_M.gguf Télécharger (0,4 Go)

Données publiques Hugging Face (config.json officiel, dépôt GGUF). Le cache de contexte ne compte que les couches à attention complète.