EN/FR
Outil gratuit

Combien de GPU, combien de mémoire, combien de kilowatts

±20 %. Un ordre de grandeur, pas un plan de salle.

Inférence, fine-tuning ou pré-entraînement, chez NVIDIA, AMD ou Intel : de la DGX Spark posée sur un bureau au GB300 NVL72, le calculateur vous donne le nombre de GPU, la mémoire, le parallélisme, le débit et les kilowatts.

  • 3 charges de travail
  • 15 accélérateurs, du bureau au NVL72
  • Dans votre navigateur, zéro email
Le calculateur

Combien de GPU, vraiment ?

Choisissez un mode, un modèle, une cible. Le moteur fait le reste : mémoire, parallélisme, racks, watts, et ce qui coince en premier.

Servir un modèle à N utilisateurs avec un débit cible.

Charge

utilisateurs
tok/s
Réglages avancés
tok
tok

Précision du cache KV

Précision

Verdict :8× H100 SXM

Il vous fautNVIDIA

8GPU

H100 SXM

Forme du cluster

1nœud

1 rack · TP4 · PP1 · DP1

Limité par : la bande passante (décodage)estimé

Nombre de GPU fixé par la mémoire

Contrainte mémoire : 8 GPU

Contrainte débit : 8 GPU

Mémoire GPU totale

161 GB

Puissance par rack

10,7 kW

Débit total

6 000 tok/s

Temps au premier token

0,17 s

Mémoire

dérivé
Poids
70 GB
Cache KV
75 GB
Marge d’exécution
16 GB
Mémoire GPU totale
161 GB

Parallélisme

dérivé
TP (tenseur)
4
PP (pipeline)
1
DP (données)
1
Répliques
1

Réseau & stockage

dérivé
Domaine de scale-up
8 · NVLink
Interconnexion
Aucune (nœud unique)
Débit stockage
16 GB/s · NVMe local

Racks & énergie

dérivé
Nœuds
1
Racks
1
Refroidissement
Air
Puissance appelée
15,5 kW

Dérivé : calculé à partir d’une fiche technique constructeur. Estimé : repose sur une hypothèse de rendement. Mesuré : relevé sur un benchmark publié.

Chargement du graphique…

Estimation au premier ordre, ±20 %. Hypothèses : MBU 50 % · PUE 1,45. Un vrai dimensionnement passe par un benchmark sur votre charge.

Les calculs

D’où sortent ces chiffres ?

Six calculs, pas de magie. Les mêmes que ceux qu’on pose au tableau avant de commander quoi que ce soit.

Combien de mémoire pour les poids ?

Chaque paramètre du modèle occupe un nombre fixe d’octets selon la précision : 2 en BF16, 1 en FP8, 0,5 en FP4. Un modèle de 70 milliards de paramètres pèse donc 140 GB en BF16 et 70 GB en FP8. Pour un modèle MoE, tous les experts restent en mémoire, même si peu d’entre eux travaillent à chaque token.

poids_GB = params_B x octets/param(precision)
octets/param : bf16 = 2, fp8 = 1, fp4 = 0.5
exemple : 70B en fp8 = 70 GB

Le cache KV, c’est quoi, et pourquoi c’est énorme ?

Pour ne pas recalculer toute la conversation à chaque nouveau token, le GPU garde en mémoire les clés et valeurs de chaque token déjà vu. Ça coûte quelques centaines de kilo-octets par token et par utilisateur. À 200 utilisateurs avec 2 000 tokens de contexte, ce cache dépasse souvent le poids du modèle lui-même. C’est lui qui dimensionne l’inférence, pas les poids.

kv/token = 2 x couches x tetes_kv x dim_tete x octets_kv
kv_total = kv/token x utilisateurs x contexte_vif
contexte_vif = tokens_entree + tokens_sortie / 2

Comment on estime le temps d’entraînement ?

La quantité de calcul est presque une constante physique : environ 6 opérations par paramètre et par token (4 en LoRA). Ensuite, aucun GPU ne tient sa fiche technique : en pratique on obtient 28 à 47 % du pic, c’est le MFU. On divise l’un par l’autre et on obtient le temps. Attention : NVIDIA comme AMD publient des chiffres avec sparsité 2:4, on utilise partout les TFLOPS denses, soit la moitié.

FLOPs = 6 x params_actifs x tokens  (LoRA : 4 x)
temps = FLOPs / (nb_gpu x TFLOPS_dense x MFU)
MFU typique : 0,28 à 0,47 selon la génération, l’interconnexion et la pile logicielle

TP, PP, DP : comment on découpe le modèle ?

Quand le modèle ne tient pas sur un GPU, on le découpe. Le tensor parallel (TP) coupe chaque couche entre GPU voisins : très bavard, donc réservé au domaine de scale-up, NVLink, Infinity Fabric ou Ethernet intégré selon le constructeur. Le pipeline parallel (PP) empile des tranches de couches. Le data parallel (DP) duplique le tout pour absorber plus de trafic ou de données. Le moteur prend le plus petit TP qui fait tenir le modèle, puis complète avec PP et DP.

TP = min {1, 2, 4, 8, ...} tel que poids + marge <= TP x 0.9 x mem_gpu
DP = nb_gpu / (TP x PP)

Pourquoi les kilowatts font partie du calcul ?

Un nœud à 8 accélérateurs tire 10,2 à 15,5 kW, châssis HGX NVIDIA, baseboard OAM AMD et Gaudi 3 confondus. Un rack NVL72 tire 120 à 137 kW, refroidissement liquide obligatoire. On ajoute ensuite le refroidissement du bâtiment via le PUE : 1,45 en air, 1,15 en liquide. Une machine de bureau, elle, tire 240 W sur une prise murale et n’a pas de PUE du tout. Sur beaucoup de projets, la vraie contrainte n’est pas le nombre de cartes, c’est le nombre de kilowatts que votre salle peut livrer.

charge_IT_kW = noeuds x kW_noeud x 1.05 (réseau)
facility_kW = charge_IT x PUE (air 1.45, liquide 1.15)
poste de bureau : PUE = 1, pas de rack

Chaque chiffre vient d’où, exactement ?

Chaque bloc de résultat porte son niveau de preuve. Dérivé : le chiffre sort d’une constante publiée par le constructeur, mémoire, TDP, bande passante, et d’un calcul en forme fermée. Estimé : le chiffre repose en plus sur une hypothèse de rendement, la bande passante utile en inférence ou le MFU en entraînement, et c’est là que se logent la plupart des ±20 %. Mesuré : le chiffre vient d’un benchmark publié, et il n’y en a qu’un seul dans tout le moteur.

dérivé  = constante constructeur + formule fermée
estimé  = dérivé x hypothèse de rendement (MBU 0.50, MFU 0.28 à 0.47)
mesuré  = benchmark publié (DGX Spark : 43,6 tok/s prédits vs 43,7 mesurés)
Architectures de référence

Trois façons de remplir un rack

Tous les clusters IA se construisent avec les mêmes briques, quel que soit le logo sur la carte. Les voici, avec leurs vrais chiffres.

Nœud à 8 accélérateurs (HGX / OAM)

La brique standard du datacenter IA, chez les trois constructeurs.

Accélérateurs
8× H100 à B300, MI300X à MI355X ou Gaudi 3
Mémoire
640 GB à 2,3 TB HBM par nœud
Scale-up
NVLink, Infinity Fabric ou Ethernet intégré
Puissance
10,2 à 15,5 kW par nœud
Refroidissement
air ou liquide (DLC)

Inférence de modèles jusqu’à ~400B (FP8), fine-tuning jusqu’à quelques nœuds.

GB200 / GB300 NVL72

72 GPU qui se prennent pour un seul.

GPU
72× B200 ou B300 + Grace
Mémoire
13,4 à 20,7 TB HBM par rack
NVLink
1 800 GB/s, domaine 72 GPU
Puissance
120 à 137 kW par rack
Refroidissement
liquide (DLC) obligatoire

Pré-entraînement, MoE géants (671B et plus), inférence à très fort trafic. Rien d’équivalent en volume chez AMD ou Intel : leurs plateformes s’arrêtent à 8 accélérateurs par baseboard.

oui, un seul rack tire vraiment 120 kW

Serveurs PCIe (L40S, RTX PRO 6000)

Du sérieux, refroidi à l’air, sans plomberie.

GPU
8× L40S ou RTX PRO 6000
Mémoire
48 à 96 GB GDDR par GPU
NVLink
aucun (PCIe seul)
Puissance
4,5 à 6,5 kW par nœud
Refroidissement
air

Modèles jusqu’à ~24B, RAG interne, salles sans refroidissement liquide.

Dimensionner, c’est la partie facile. Le faire tourner, c’est notre métier.

Déploiement d’IA privée sur une infra que vous contrôlez : matériel, réseau, modèles, supervision. Vous gardez les données, on garde l’astreinte.

FAQ

Questions fréquentes, réponses honnêtes

C’est fiable à quel point ?

±20 % dans le meilleur des cas. Le moteur calcule au premier ordre à partir des valeurs de pic constructeur et des rendements observés sur le terrain (MFU de 28 à 47 %, bande passante mémoire à ~50 %). Assez précis pour bâtir un budget et arbitrer entre options, pas assez pour signer un bon de commande. Un vrai dimensionnement passe par un benchmark sur votre charge réelle.

Pourquoi aucun prix nulle part ?

Parce qu’un prix affiché ici serait faux avec aplomb. Les tarifs GPU bougent chaque trimestre, le prix réellement pratiqué dépend du volume et de la relation commerciale, et les tarifs cloud varient d’un facteur dix entre fournisseurs et niveaux d’engagement. Ce qui se transporte d’un devis à l’autre, c’est le dimensionnement physique : le nombre de GPU, les téraoctets de mémoire, les kilowatts. Ces chiffres-là, nous les assumons ; le reste, votre fournisseur le chiffrera mieux que nous, et sur la bonne semaine.

Peut-on vraiment obtenir des B300 ou des NVL72 en 2026 ?

Oui, mais pas en claquant des doigts. Les serveurs HGX B200/B300 se livrent en quelques semaines via les OEM. Les racks NVL72 partent d’abord chez les hyperscalers : comptez plusieurs mois et un vrai engagement de volume. Les H100 et H200 se trouvent partout, y compris d’occasion, et restent d’excellents chevaux de trait pour l’inférence.

Et les accélérateurs AMD et Intel ?

Ils sont dans le moteur, avec leurs vraies constantes : MI300X, MI325X, MI350X, MI355X et Gaudi 3. Ce qu’un dimensionnement multi-constructeur vous donne, c’est la physique : octets par paramètre, cache KV, bande passante mémoire, kilowatts, la même arithmétique quel que soit le logo sur la carte. Ce qui ne se transporte pas, c’est la pile logicielle : ROCm tient très bien les familles répandues (Llama, Qwen, Mistral, DeepSeek) en amont dans vLLM et SGLang, la pile Gaudi passe par un plugin vLLM qui suit avec quelques semaines de décalage, et une architecture publiée le mois dernier arrive d’abord chez NVIDIA. Dans la plupart des dossiers, c’est ce décalage-là qui tranche, pas le nombre de cartes. Le calculateur vous dit combien de mémoire et combien de kilowatts ; il ne vous dira pas si votre modèle démarre du premier coup.

Mes données quittent-elles mon navigateur ?

Non. Tout le calcul tourne en JavaScript dans votre onglet : vos saisies ne le quittent jamais, aucun email demandé. Fermez l’onglet, il ne reste rien. Le site compte les pages vues, sans cookie, et ce compteur ne voit jamais vos chiffres.

Vous construisez ce que ce calculateur dimensionne ?

Oui, c’est le métier. Audit, choix du matériel, installation, déploiement des modèles et supervision, sur votre infra ou votre cloud privé. Le bouton de réservation transmet votre dimensionnement avec l’appel : la conversation commence directement au chiffre près.

Vous savez maintenant combien. Reste à le construire.

30 minutes avec un ingénieur, pas un commercial. Venez avec votre dimensionnement, repartez avec un plan.

on vient avec le tournevis