Modèles

Catalogue des modèles

Les modèles ouverts qu'on fait tourner en local, rangés par famille, version et taille. Pour chacun : la mémoire vidéo nécessaire, et les vitesses mesurées quand il a été benchmarké.

11 familles · 45 versions · 112 tailles · 6 mesurées

Qwen

Alibaba

La famille la plus déclinée : du 0,6B pour un portable aux gros MoE, avec des versions code et raisonnement.

Qwen3.8Qwen3.6Qwen3.5Qwen3 Coder+5

9 versions · 39 tailles · 2 tailles mesurées

Meta Llama

Meta

La référence historique des modèles ouverts : le 8B de Llama 3.1 est le modèle de référence du protocole TokenBench.

Llama 4Llama 3.3Llama 3.2Llama 3.1

4 versions · 8 tailles · 2 tailles mesurées

Google Gemma

Google

Les modèles ouverts de Google, très bons en multilingue ; les versions « E » sont pensées pour les petites machines.

Gemma 4Gemma 3nGemma 3Gemma 2

4 versions · 15 tailles

DeepSeek

DeepSeek

Célèbre pour R1 et ses versions « distillées » : le raisonnement de R1 transféré dans des modèles Qwen et Llama plus petits.

DeepSeek V4 FlashR1 0528 (Qwen3)R1 / V3R1 Distill+1

5 versions · 10 tailles · 1 taille mesurée

Mistral

Mistral AI

Le champion français : des modèles efficaces, dont Devstral pour le code et Ministral pour les petites configurations.

Devstral Small 2Ministral 3Magistral SmallMistral Small 3.2+3

7 versions · 10 tailles

Microsoft Phi

Microsoft

De « petits » modèles entraînés sur des données très soignées : beaucoup de raisonnement pour leur taille.

Phi-4 reasoningPhi-4Phi-3.5

3 versions · 6 tailles · 1 taille mesurée

gpt-oss

OpenAI

Les modèles ouverts d'OpenAI, des MoE livrés directement en 4 bits (MXFP4).

gpt-oss

1 version · 2 tailles

GLM

Z.ai

Les modèles de Z.ai (ex-Zhipu), réputés pour le code et les agents ; les versions « Flash » visent le local.

GLM-5.3 FlashGLM-4.7 FlashGLM-4.5 AirGLM-4 0414

4 versions · 5 tailles

NVIDIA Nemotron

NVIDIA

Les modèles de NVIDIA, souvent hybrides (Mamba + attention) : un cache de contexte bien plus léger.

Nemotron 3.5 LightningNemotron 3Nemotron Nano v2

3 versions · 5 tailles

IBM Granite

IBM

Les modèles d'IBM, sous licence Apache 2.0, pensés pour l'entreprise ; Granite 4 est hybride.

Granite 4.1Granite 4.0 HGranite 3.3

3 versions · 8 tailles

Petits modèles

Liquid AI · Hugging Face

Des modèles de moins de 10B conçus pour tourner partout, même sans carte graphique dédiée.

LFM2.5SmolLM3

2 versions · 4 tailles

Caractéristiques et fichiers issus de Hugging Face (dépôts officiels et GGUF publics). Les vitesses, elles, ne viennent que de mesures réelles.