Alibaba
Qwen3.5 4B
4,7 Md
Paramètres
2,8 Go
Fichier Q4_K_M
≥ 4,3 Go
VRAM conseillée
262 144
Contexte max
Vitesse par carte graphique
Simuler dans le « Configurateur » →Bench standard llama-bench (prompt 512 / génération 128 tokens), modèle entièrement en VRAM. Cliquez sur une carte pour le détail. Coût électrique au tarif par défaut (0,25 €/kWh).
| Carte · Q4_K_M | VRAM | Génération | Lecture prompt | VRAM utilisée | Conso | € élec. / M tok | Prix |
|---|---|---|---|---|---|---|---|
| RTX 5070 Ti | 16 Go | 196 tok/s | 8 624 | 4,0 Go | 135 W | 0,05 €/M tok | — |
Pas encore mesuré sur ces cartes — cliquez pour une estimation :
Fiche technique
- Publication
- 2026-02-27
- Architecture
- 32 couches · 4 têtes KV · dimension 256
- Attention
- Hybride : 8 couches sur 32 utilisent l'attention classique, les autres un mécanisme à mémoire fixe (Mamba, attention linéaire) — cache très léger.
- Cache de contexte (f16)
- ≈ 31 Mo par 1 000 tokens · 1,0 Go pour 32 768 tokens
- Fichier GGUF
- bartowski/Qwen_Qwen3.5-4B-GGUF · Qwen_Qwen3.5-4B-Q4_K_M.gguf Télécharger (2,8 Go)
- Dépôt officiel
- Qwen/Qwen3.5-4B
Données publiques Hugging Face (config.json officiel, dépôt GGUF). Le cache de contexte ne compte que les couches à attention complète.