Protocole TokenBench

Benchmarker sa carte

Une seule commande. Elle télécharge llama.cpp (release officielle) et le modèle de référence (~4,9 Go, une seule fois, cache dans ~/.tokenbench), lance le protocole standard, relève la télémétrie, puis publie le résultat.

Téléchargez notre logiciel

Bibliothèque de modèles, télémétrie en direct, tests soutenus avec courbes : téléchargez, double-cliquez, benchez.

⬇ Télécharger (.exe)⬇ Version portable

Windows SmartScreen peut avertir au premier lancement (application non signée) : « Informations complémentaires » puis « Exécuter quand même ».

Vous ne voulez pas passer par le logiciel ? Suivez ces instructions

Prérequis

Node.js LTS et un GPU NVIDIA avec des pilotes à jour. C'est tout.

Windows : une fois, avant le premier lancement

PowerShell bloque les scripts par défaut (npx compris). Autorise-les pour ton compte — pas besoin d'être administrateur :

Set-ExecutionPolicy -ExecutionPolicy RemoteSigned -Scope CurrentUser

La commande

Windows (PowerShell), macOS ou Linux :

npx https://tokenbench.fr/tokenbench-0.4.1.tgz --token 'VOTRE-JETON'

Le jeton est OPTIONNEL : sans lui, la commande fonctionne à l'identique (retirez simplement --token) et votre mesure arrive « en attente de modération ». Avec une clé API de votre compte (Mon compte → Clés API), le run est publié sous votre pseudo. Guillemets simples autour de la clé : les caractères spéciaux ne survivent pas au shell sans eux.

Benchmarker un autre modèle

Au-delà du protocole, n'importe quel modèle du catalogue (Qwen, Llama, Gemma, Mistral, DeepSeek…) peut être mesuré : repérez son identifiant, puis lancez-le. La mesure est rattachée automatiquement à sa fiche sur le site. Parcourir le catalogue →

# 1. Trouver l'identifiant (et vérifier que le modèle tient sur votre carte)
npx https://tokenbench.fr/tokenbench-0.4.1.tgz --list-catalog qwen3

# 2. Le télécharger, le mesurer et publier le résultat
npx https://tokenbench.fr/tokenbench-0.4.1.tgz --token 'VOTRE-JETON' --catalog qwen3-8b

Le fichier (quantisation Q4_K_M) est téléchargé une seule fois dans ~/.tokenbench ; sa suppression vous est proposée à la fin. Dans l'application, c'est la section « Ajouter un modèle » de la bibliothèque.

Options utiles

--gpu-index 1          # machine multi-GPU : benchmarker la 2e carte
--ref-only             # uniquement le modèle de référence (rapide)
--list-catalog [mots]  # lister les modèles du catalogue (filtre facultatif)
--catalog <id>         # benchmarker un modèle du catalogue (ex : gemma-3-12b)
--replay result.json   # republier un résultat dont l'envoi a échoué
--no-upload            # mesurer sans publier
--help                 # tout le reste

Ce qui est mesuré

Vitesse de génération et de lecture du prompt (llama-bench, pp512/tg128, 5 répétitions), pic de VRAM, températures et consommation électrique (nvidia-smi, échantillonné pendant le run). Rien n'est saisi à la main : ce qui entre en base a été mesuré.