Protocole TokenBench
Benchmarker sa carte
Une seule commande. Elle télécharge llama.cpp (release officielle) et le modèle de référence (~4,9 Go, une seule fois, cache dans ~/.tokenbench), lance le protocole standard, relève la télémétrie, puis publie le résultat.
Téléchargez notre logiciel
Bibliothèque de modèles, télémétrie en direct, tests soutenus avec courbes : téléchargez, double-cliquez, benchez.
Windows SmartScreen peut avertir au premier lancement (application non signée) : « Informations complémentaires » puis « Exécuter quand même ».
Vous ne voulez pas passer par le logiciel ? Suivez ces instructions
Prérequis
Node.js LTS et un GPU NVIDIA avec des pilotes à jour. C'est tout.
Windows : une fois, avant le premier lancement
PowerShell bloque les scripts par défaut (npx compris). Autorise-les pour ton compte — pas besoin d'être administrateur :
Set-ExecutionPolicy -ExecutionPolicy RemoteSigned -Scope CurrentUser
La commande
Windows (PowerShell), macOS ou Linux :
npx https://tokenbench.fr/tokenbench-0.4.1.tgz --token 'VOTRE-JETON'
Le jeton est OPTIONNEL : sans lui, la commande fonctionne à l'identique (retirez simplement --token) et votre mesure arrive « en attente de modération ». Avec une clé API de votre compte (Mon compte → Clés API), le run est publié sous votre pseudo. Guillemets simples autour de la clé : les caractères spéciaux ne survivent pas au shell sans eux.
Benchmarker un autre modèle
Au-delà du protocole, n'importe quel modèle du catalogue (Qwen, Llama, Gemma, Mistral, DeepSeek…) peut être mesuré : repérez son identifiant, puis lancez-le. La mesure est rattachée automatiquement à sa fiche sur le site. Parcourir le catalogue →
# 1. Trouver l'identifiant (et vérifier que le modèle tient sur votre carte) npx https://tokenbench.fr/tokenbench-0.4.1.tgz --list-catalog qwen3 # 2. Le télécharger, le mesurer et publier le résultat npx https://tokenbench.fr/tokenbench-0.4.1.tgz --token 'VOTRE-JETON' --catalog qwen3-8b
Le fichier (quantisation Q4_K_M) est téléchargé une seule fois dans ~/.tokenbench ; sa suppression vous est proposée à la fin. Dans l'application, c'est la section « Ajouter un modèle » de la bibliothèque.
Options utiles
--gpu-index 1 # machine multi-GPU : benchmarker la 2e carte --ref-only # uniquement le modèle de référence (rapide) --list-catalog [mots] # lister les modèles du catalogue (filtre facultatif) --catalog <id> # benchmarker un modèle du catalogue (ex : gemma-3-12b) --replay result.json # republier un résultat dont l'envoi a échoué --no-upload # mesurer sans publier --help # tout le reste
Ce qui est mesuré
Vitesse de génération et de lecture du prompt (llama-bench, pp512/tg128, 5 répétitions), pic de VRAM, températures et consommation électrique (nvidia-smi, échantillonné pendant le run). Rien n'est saisi à la main : ce qui entre en base a été mesuré.