Aller au contenu
Contactez-nous
  1. Accueil
  2. /
  3. Blog
  4. /
  5. GPU acheté ou jetons facturés : le calcul que personne ne fait

Entreprise
Performance

GPU acheté ou jetons facturés : le calcul que personne ne fait

28 septembre 2026

8 min de lecture

Sommaire
Ce que coûte le jeton, vraiment
Ce que coûte la carte, tous postes confondus
Le poste que les devis ignorent
Le point de bascule
Les trois cas où le calcul ne décide de rien
La séquence qui évite de se tromper
Ce qu'on en retient
Sources

Un devis de serveur GPU face à trois mois de factures d'API : c'est sur cette comparaison que se prend, dans la plupart des entreprises, la décision d'acheter du matériel d'inférence. Elle a un défaut de construction, et il est de taille. D'un côté un prix d'achat, de l'autre un prix d'usage. Autant comparer le prix d'une voiture à celui d'un plein.

Posons le calcul complet, avec les prix publics du jour et les hypothèses déclarées. Les conclusions ne sont pas celles qu'on attend.

Ce que coûte le jeton, vraiment

Les tarifs publics se lisent par million de jetons, avec deux prix distincts : ce qui entre dans le modèle et ce qui en sort.

Au 21 septembre 2026, sur les tarifs publiés par Anthropic, un modèle de gamme intermédiaire comme Claude Sonnet 5 est facturé 2 dollars le million de jetons en entrée et 10 dollars en sortie. Un modèle rapide de gamme inférieure, Claude Haiku 4.5, descend à 1 dollar en entrée et 5 en sortie. Les autres fournisseurs se situent dans des ordres de grandeur comparables, avec les mêmes deux colonnes.

Deux mécanismes changent la facture d'un facteur deux ou plus, et ils sont systématiquement oubliés dans les estimations maison.

Le traitement par lots, pour tout ce qui n'a pas besoin d'une réponse immédiate, applique une remise de cinquante pour cent sur l'entrée comme sur la sortie. Classer trois mille tickets de la nuit, résumer des comptes rendus, extraire des champs de factures : aucune de ces tâches ne demande une réponse en deux secondes.

La mise en cache des parties répétées du contexte fait tomber leur relecture à dix pour cent du prix d'entrée. Une application qui renvoie la même consigne de cinq mille jetons à chaque requête paie donc un dixième pour cette partie, à condition de l'avoir activée. La plupart ne l'ont pas fait.

Une estimation faite sans ces deux mécanismes surévalue le coût de l'API, souvent du double. C'est la première raison pour laquelle le calcul maison penche à tort vers l'achat.

Ce que coûte la carte, tous postes confondus

Ici, les chiffres dépendent du matériel et du site. Prenons une hypothèse de travail explicite, qu'il faut remplacer par vos devis réels : une carte d'inférence professionnelle à 8 000 euros, dans un serveur à 3 000 euros, le tout amorti sur trois ans.

L'amortissement donne 2 667 euros par an pour la carte et 1 000 pour le serveur.

L'électricité se calcule. Une carte qui consomme 300 watts en charge continue tire 2 628 kilowattheures par an. Il faut y ajouter le refroidissement : dans une salle correctement conçue, compter environ moitié plus, soit près de 3 900 kilowattheures au total. Au tarif professionnel français de 2026, entre 180 et 250 euros le mégawattheure tout compris pour une PME raccordée en basse tension, la facture annuelle se situe entre 700 et 975 euros.

L'hébergement, si la machine ne dort pas dans un placard : une baie partagée, une alimentation redondée, un raccordement réseau. Quelques centaines à quelques milliers d'euros par an selon le site et le niveau de service.

Le total tourne donc autour de 5 000 à 7 000 euros par an pour une carte, hors main d'oeuvre. Et c'est cette dernière précision qui fait tout basculer.

Le poste que les devis ignorent

Un serveur d'inférence n'est pas un appareil électroménager. Il demande des montées de version qu'il faut tester, une supervision qui remonte la saturation avant les utilisateurs, une astreinte quand il tombe un mardi matin, et un jeu de cas de référence à rejouer après chaque changement, comme nous l'avons détaillé à propos des paramètres qui remplissent la mémoire d'un GPU.

Comptez, en régime établi et une fois le rodage passé, entre une demi-journée et deux journées par mois. Au coût chargé d'un ingénieur système, cela représente entre 4 000 et 15 000 euros par an. Ce poste dépasse souvent le matériel lui-même, et il n'apparaît sur aucun devis parce qu'il est payé en interne, en heures qui ne sont facturées à personne.

L'API, elle, ne coûte rien en exploitation. C'est sa vraie valeur, et elle est invisible dans une comparaison de prix unitaires.

Le point de bascule

Mettons les deux côtés face à face. Avec un usage réaliste mêlant deux tiers d'entrée et un tiers de sortie, le coût moyen sur un modèle intermédiaire ressort autour de 4,60 dollars le million de jetons, tarif plein, sans lot ni cache.

Pour que 6 000 euros de matériel annuel soient rentabilisés, il faut donc consommer de l'ordre de 1,3 milliard de jetons par an, soit environ 3,5 millions de jetons par jour.

Ramené à des échanges réels, un aller-retour moyen consommant deux mille jetons, cela représente près de 1 750 échanges quotidiens. Pour une entreprise de cinquante personnes, cela suppose que chacune sollicite le système trente-cinq fois par jour, tous les jours ouvrés. C'est un usage intensif, pas un usage exploratoire.

Et ce seuil est calculé au tarif plein. Activez le traitement par lots sur la moitié du volume et le cache sur les parties répétées, et il double : il faut alors deux à trois fois plus de trafic pour que la carte se justifie par le seul prix.

La conclusion est désagréable pour qui a déjà signé le bon de commande : dans la majorité des PME, le modèle auto-hébergé coûte plus cher que l'API, et l'écart se creuse quand on compte les heures.

Les trois cas où le calcul ne décide de rien

Le prix n'est pas toujours le critère, et c'est là que l'achat redevient rationnel.

La confidentialité, d'abord. Certains contenus ne sortent pas : dossiers du personnel, pièces d'un contentieux, données de santé, éléments couverts par une clause client explicite. Aucune promesse contractuelle de non-rétention ne vaut une machine qui n'a pas d'accès à Internet. Pour une organisation qui s'est engagée sur un hébergement souverain ou qui traite des données sensibles au sens du RGPD, le débat financier arrive après, s'il arrive.

La latence, ensuite. Un aller-retour vers un service distant coûte quelques centaines de millisecondes incompressibles. Pour un assistant conversationnel, c'est indolore. Pour un traitement inséré dans une chaîne industrielle qui doit répondre en dessous de cent millisecondes, c'est rédhibitoire.

La maîtrise dans la durée, enfin. Un modèle distant est retiré du catalogue quand son fournisseur le décide, et son remplaçant ne se comporte pas exactement pareil. Un modèle téléchargé et figé sur votre disque répondra dans cinq ans comme aujourd'hui. Pour un processus certifié ou contractualisé, cette stabilité a une valeur que le prix au jeton ne reflète pas.

La séquence qui évite de se tromper

Il existe un ordre de marche qui coûte peu et tranche la question sur des faits.

Commencer par l'API, derrière une passerelle qui compte la dépense par équipe. Le surcoût des premiers mois est modeste et vous achetez la seule donnée qui manque à tout le monde : le volume réel, par service, par cas d'usage.

Mesurer trois mois. Les usages projetés en réunion et les usages constatés n'ont presque jamais le même ordre de grandeur, et c'est en général dans le sens qui arrange le portefeuille.

Activer le lot et le cache avant de conclure quoi que ce soit, parce que ces deux réglages déplacent le seuil plus que n'importe quelle négociation commerciale.

Puis décider, sur le volume constaté et sur la liste des contenus qui n'ont pas le droit de sortir. Si la bascule se justifie, elle ne demande qu'un changement de configuration dans la passerelle, sans toucher aux applications, et le serveur GPU se dimensionne sur des chiffres connus plutôt que sur une intuition. Cette même discipline de mesure avant dépense est ce qui distingue un budget d'infrastructure tenu d'un budget subi, comme pour le pilotage financier d'une production.

Acheter d'abord et mesurer ensuite, c'est se retrouver avec une carte à 8 000 euros qui tourne à huit pour cent de sa capacité, et personne pour oser le dire en réunion.

Ce qu'on en retient

Le matériel se justifie par la confidentialité, la latence ou la stabilité dans le temps. Le prix, lui, ne le justifie qu'à partir d'un volume que la plupart des entreprises n'atteignent pas, et qu'elles atteindront encore moins vite si elles utilisent correctement les remises existantes.

Ce constat ne dispense de rien : passerelle, supervision, contrôle de ce qui sort du réseau et sauvegarde restent à monter dans les deux cas. C'est cette partie-là qui demande du métier, et nous la posons et l'exploitons sur les infrastructures que nous opérons, avec ou sans carte graphique au bout.

Sources

  • Tarifs publics de l'API Anthropic, prix par million de jetons, remise de 50 % sur le traitement par lots, lecture de cache à 10 % du prix d'entrée, relevés le 21 septembre 2026
  • Prix de l'électricité professionnelle en France, grille 2026 pour les PME raccordées en basse tension
  • Tarif Bleu professionnel 2026, évolution du tarif réglementé et fourchettes par profil de compteur
  • Documentation d'optimisation vLLM, pour le dimensionnement matériel qui sous-tend le calcul d'amortissement
Besoin d'aide sur ce sujet ?

Notre équipe d'experts est là pour vous accompagner dans vos projets d'infrastructure et d'infogérance.

Contactez-nous

Articles similaires

Recherche documentaire interne : le trajet réel d'un document
Base de données
Entreprise

Recherche documentaire interne : le trajet réel d'un document

Indexer les documents de l'entreprise et les interroger en langage naturel, sur PostgreSQL et pgvector : découpage, droits d'accès et pièges de licence.

25 sept. 2026

Lire plus

vLLM : ce qui remplit vraiment la mémoire de votre GPU
Infrastructure
Performance

vLLM : ce qui remplit vraiment la mémoire de votre GPU

Servir un modèle ouvert en production avec vLLM : le calcul mémoire réel, les quatre paramètres qui comptent et la préemption qu'il faut vraiment surveiller.

24 sept. 2026

Lire plus

LiteLLM : reprendre la main sur la facture des modèles
Infrastructure
Entreprise
Sécurité

LiteLLM : reprendre la main sur la facture des modèles

Passerelle unique devant tous les modèles d'IA : clés virtuelles, plafonds par équipe, repli entre fournisseurs et bascule vers un GPU local sans rien réécrire.

23 sept. 2026

Lire plus


SHPV, votre partenaire de confiance en infrastructure et infogérance informatique en France.

SHPV
Contactez-nousNous contacter
Expertise
InfrastructureDatacenterInfogéranceCloudHébergementTransit IP
Légales
Conditions Générales de VenteCPS - Contrat de ServicesCPS - Hébergement CloudCPS - Microsoft 365Accord sous-traitance RGPDTarifs interventions

SHPV © 2026 - Tous droits réservés

Mentions légalesPolitiques de confidentialité
SHPV FRANCE - SAS au capital de 16 000 € - 52 Rue Romain Rolland, 71230 Saint-Vallier - SIRET n°80886287400035 - R.C.S. Chalon-sur-Saône. Par téléphone 09 72 310 818 - Email: support@shpv.fr