Alibaba

Qwen3.5 4B

4,7 Md

Paramètres

2,8 Go

Fichier Q4_K_M

≥ 4,3 Go

VRAM conseillée

262 144

Contexte max

Vitesse par carte graphique

Simuler dans le « Configurateur » →

Bench standard llama-bench (prompt 512 / génération 128 tokens), modèle entièrement en VRAM. Cliquez sur une carte pour le détail. Coût électrique au tarif par défaut (0,25 €/kWh).

Carte · Q4_K_MVRAMGénérationLecture promptVRAM utiliséeConso€ élec. / M tokPrix
RTX 5070 Ti16 Go196 tok/s8 6244,0 Go135 W0,05 €/M tok—

Pas encore mesuré sur ces cartes — cliquez pour une estimation :

Fiche technique

Publication
2026-02-27
Architecture
32 couches · 4 têtes KV · dimension 256
Attention
Hybride : 8 couches sur 32 utilisent l'attention classique, les autres un mécanisme à mémoire fixe (Mamba, attention linéaire) — cache très léger.
Cache de contexte (f16)
≈ 31 Mo par 1 000 tokens · 1,0 Go pour 32 768 tokens
Fichier GGUF
bartowski/Qwen_Qwen3.5-4B-GGUF · Qwen_Qwen3.5-4B-Q4_K_M.gguf Télécharger (2,8 Go)
Dépôt officiel
Qwen/Qwen3.5-4B

Données publiques Hugging Face (config.json officiel, dépôt GGUF). Le cache de contexte ne compte que les couches à attention complète.