Un serveur LLM sur site : de quoi avez-vous besoin ?

Mis à jour le · 5 min de lecture · Rédaction werqly

En bref

Pour un serveur LLM, il faut avant tout de la mémoire GPU. Un modèle de 70 milliards de paramètres tient dans environ 40 à 45 Go en quantification 4 bits, donc sur un GPU de datacenter de 48 Go, mais pour des dizaines d’utilisateurs simultanés et de longs documents il faut plusieurs GPU. S’y ajoutent un logiciel d’inférence, l’alimentation et le refroidissement de quelques kilowatts, et l’exploitation : accès, journalisation, mises à jour, supervision.

Le critère principal : la mémoire GPU

Un modèle de langage doit tenir entièrement dans la mémoire du GPU pour être rapide. Règle empirique : nombre de paramètres multiplié par le nombre d’octets par paramètre. Avec la quantification, les poids sont stockés sur moins de bits, avec une faible perte de qualité pour les grands modèles.

Modèle (taille)16 bits8 bits4 bits
8 milliards de paramètresenv. 16 Goenv. 8 Goenv. 5 Go
32 milliards de paramètresenv. 64 Goenv. 32 Goenv. 18 à 20 Go
70 milliards de paramètresenv. 140 Goenv. 70 Goenv. 40 à 45 Go

Ce n’est que le modèle. S’y ajoute le cache KV : la mémoire de travail par conversation, qui croît avec la longueur du texte et le nombre d’utilisateurs simultanés. Un modèle 70B en 4 bits tourne sur un GPU de 48 Go, mais avec peu de marge pour de longs documents ou de nombreuses requêtes simultanées.

Combien d’utilisateurs un serveur peut-il servir ?

Tous les collaborateurs ne posent pas une question au même moment. Ce qui compte, c’est le nombre de requêtes simultanées et la longueur des textes. Faire résumer un contrat de quarante pages consomme bien plus de mémoire que reformuler un court e-mail.

Les logiciels d’inférence modernes traitent les requêtes par lots, si bien qu’un GPU sert plusieurs utilisateurs à la fois. En pratique :

  • Un pilote avec une petite équipe peut tourner sur un GPU de datacenter de 48 Go.
  • Une organisation de quelques centaines de personnes, avec des pics de dizaines de questions simultanées et de longs documents, a besoin de plusieurs GPU dans un serveur.
  • Les grandes organisations montent en charge avec davantage de GPU par serveur ou plusieurs serveurs.

Testez toujours avec votre propre activité : la longueur de vos documents et les usages de vos équipes déterminent le dimensionnement, pas le seul effectif.

Quels modèles pouvez-vous exécuter ?

Sur site, on travaille avec des modèles open-weight, dont les poids sont publiés : notamment Llama (Meta), Mistral et Qwen (Alibaba). Pour choisir, surveillez trois points :

  • La licence. Tous les modèles open-weight ne sont pas utilisables commercialement sans limite. Lisez les conditions, surtout pour une grande organisation.
  • La langue. Testez la qualité en français et dans les langues de vos clients, avec vos propres types de textes. Les modèles de Mistral AI sont souvent un bon point de départ en français.
  • La tâche. Un petit modèle est plus rapide et moins coûteux pour classer et résumer ; un grand modèle raisonne et rédige mieux. Beaucoup d’organisations en exploitent plusieurs, par rôle ou par tâche.

Logiciel, énergie et refroidissement

Logiciel d’inférence. Pour un utilisateur sur un poste de travail, des outils comme Ollama ou llama.cpp suffisent. Pour une organisation, il faut un serveur qui traite efficacement de nombreuses requêtes en parallèle, comme vLLM, avec une API appelable par vos applications.

Énergie et refroidissement. Un GPU de datacenter consomme facilement 300 à 400 watts en charge ; un serveur à quatre GPU atteint quelques kilowatts avec le reste du matériel. Vérifiez que votre salle serveur ou votre baie supporte l’alimentation, le refroidissement et le poids. Beaucoup de salles serveur de bureaux ne sont pas conçues pour des serveurs GPU.

Réseau. Le serveur a sa place dans un segment isolé, accessible à vos utilisateurs et applications, sans connexions sortantes que vous n’avez pas autorisées vous-même.

La partie souvent oubliée : l’exploitation

Faire tourner un modèle, c’est un week-end de travail pour un bon ingénieur. Un environnement d’IA défendable pour toute une organisation, c’est autre chose. Il faut :

  • l’intégration à votre fournisseur d’identité et des droits par rôle ;
  • des garde-fous qui bloquent les motifs sensibles avant qu’ils n’atteignent un modèle ;
  • journalisation et piste d’audit, avec export vers votre SIEM ;
  • la gestion des modèles : tester, déployer et revenir en arrière sur les nouvelles versions ;
  • la supervision de l’usage, des temps d’attente et du matériel ;
  • une politique sur la visibilité de l’organisation sur l’usage.

C’est exactement ce que livre werqly : un nœud d’IA dédié dans votre salle serveur avec werqly AI Control comme console d’administration. Votre DSI l’exploite, ou werqly s’en charge avec l’infogérance werqly Pro. Sans salle serveur adaptée, le nœud est installé dans une baie fermée de notre datacenter européen, pour vous seul. Pourquoi les organisations font ce choix : Qu’est-ce que l’IA privée ?

Questions fréquentes

Questions sur ce sujet

Un modèle 70B peut-il tourner sur un seul GPU ?

Oui, en quantification 4 bits un modèle 70B tient dans environ 40 à 45 Go, donc sur un GPU de datacenter de 48 Go. Il reste alors peu de mémoire pour de longs documents et de nombreux utilisateurs simultanés ; pour toute une organisation, plusieurs GPU sont la norme.

Ollama convient-il à un usage professionnel ?

Pour des essais et un usage individuel, oui. Pour une organisation avec de nombreux utilisateurs simultanés, un logiciel d’inférence qui regroupe efficacement les requêtes, comme vLLM, est plus adapté. Il faut aussi l’exploitation : accès par rôle, journalisation et mises à jour.

Puis-je utiliser un serveur ordinaire avec une carte graphique de jeu ?

Pour un essai, oui. En production, les GPU de datacenter sont la norme : plus de mémoire, conçus pour un fonctionnement continu en baie et pris en charge par les constructeurs de serveurs. Vérifiez aussi les conditions de licence des cartes grand public en datacenter.

Combien consomme un serveur d’IA ?

Un GPU de datacenter consomme environ 300 à 400 watts en charge. Un serveur à quatre GPU, processeurs, mémoire et refroidissement compris, atteint quelques kilowatts. Vérifiez au préalable que votre salle serveur peut fournir cette puissance et ce refroidissement.

Sources

  1. Hugging Face — Llama 3.3 70B Instruct (fiche du modèle)
  2. vLLM — documentation
  3. NVIDIA — fiche technique L40S
  4. InsiderLLM — Running 70B models locally: VRAM by quantization

Cet article est une information générale, pas un conseil juridique. Les règles et les recommandations évoluent ; en cas de doute, consultez les sources citées ou votre juriste ou DPO.

Calculateur

Calculez vos coûts d’IA privée.

Saisissez votre adresse e-mail professionnelle et le nombre de collaborateurs. Nous calculons immédiatement quatre configurations : dans votre propre salle serveur ou dans notre centre de données, en gestion interne ou en infogérance werqly Pro. werqly n’est pas un abonnement IA bon marché : vous payez pour votre propre matériel et un contrôle total.

  1. 1Saisissez votre e-mail et le nombre de collaborateurs
  2. 2Comparez quatre propositions
  3. 3Demandez un devis directement

Nous envoyons le calcul à cette adresse et ne l’utilisons que pour vous recontacter au sujet de votre demande.