DeepSeek
R1 0528 (Qwen3) 8B
raisonnement
8,2 Md
Paramètres
4,7 Go
Fichier Q4_K_M
≥ 6,2 Go
VRAM conseillée
131 072
Contexte max
Vitesse par carte graphique
Simuler dans le « Configurateur » →Bench standard llama-bench (prompt 512 / génération 128 tokens), modèle entièrement en VRAM. Cliquez sur une carte pour le détail. Coût électrique au tarif par défaut (0,25 €/kWh).
| Carte · Q4_K_M | VRAM | Génération | Lecture prompt | VRAM utilisée | Conso | € élec. / M tok | Prix |
|---|---|---|---|---|---|---|---|
| RTX 4070 Ti | 12 Go | 90,1 tok/s | 5 994 | 5,2 Go | 154 W | 0,12 €/M tok | — |
Pas encore mesuré sur ces cartes — cliquez pour une estimation :
Fiche technique
- Publication
- 2025-05-29
- Architecture
- 36 couches · 8 têtes KV · dimension 128
- Attention
- Classique : chaque couche garde tout le contexte en mémoire.
- Cache de contexte (f16)
- ≈ 141 Mo par 1 000 tokens · 4,5 Go pour 32 768 tokens
- Fichier GGUF
- bartowski/deepseek-ai_DeepSeek-R1-0528-Qwen3-8B-GGUF · deepseek-ai_DeepSeek-R1-0528-Qwen3-8B-Q4_K_M.gguf Télécharger (4,7 Go)
- Dépôt officiel
- deepseek-ai/DeepSeek-R1-0528-Qwen3-8B
Données publiques Hugging Face (config.json officiel, dépôt GGUF). Le cache de contexte ne compte que les couches à attention complète.