Een eigen LLM-server on-premise: wat heeft u nodig?

Bijgewerkt · 4 min lezen · Redactie werqly

Kort antwoord

Voor een eigen LLM-server hebt u vooral GPU-geheugen nodig. Een model van 70 miljard parameters past met 4-bits kwantisatie in ongeveer 40 tot 45 GB, dus op één datacenter-GPU met 48 GB, maar voor tientallen gelijktijdige gebruikers en lange documenten hebt u meerdere GPU’s nodig. Daarnaast hebt u inference-software, stroom en koeling voor enkele kilowatts, en beheer: toegang, logging, updates en monitoring.

De belangrijkste maat: GPU-geheugen

Een taalmodel moet in zijn geheel in het geheugen van de GPU passen om snel te zijn. De vuistregel: het aantal parameters maal het aantal bytes per parameter. Met kwantisatie slaat u de gewichten in minder bits op, met weinig kwaliteitsverlies bij grote modellen.

Model (grootte)16-bit8-bit4-bit
8 miljard parametersca. 16 GBca. 8 GBca. 5 GB
32 miljard parametersca. 64 GBca. 32 GBca. 18 tot 20 GB
70 miljard parametersca. 140 GBca. 70 GBca. 40 tot 45 GB

Dit is alleen het model zelf. Daarbovenop komt de KV-cache: het werkgeheugen per gesprek, dat groeit met de lengte van de tekst en het aantal gebruikers dat tegelijk bezig is. Een 70B-model in 4-bit draait op één GPU van 48 GB, maar dan met weinig ruimte voor lange documenten of veel gelijktijdige vragen.

Hoeveel gebruikers kan één server aan?

Niet elke medewerker stelt tegelijk een vraag. Wat telt, is het aantal gelijktijdige verzoeken en hoe lang de teksten zijn. Een medewerker die een contract van veertig pagina’s laat samenvatten, gebruikt veel meer geheugen dan iemand die een korte e-mail laat herschrijven.

Moderne inference-software verwerkt verzoeken in batches, zodat één GPU meerdere gebruikers tegelijk bedient. In de praktijk:

  • Een pilot met een klein team kan op één datacenter-GPU met 48 GB draaien.
  • Een organisatie van een paar honderd medewerkers, met pieken van tientallen gelijktijdige vragen en lange documenten, heeft meerdere GPU’s nodig in één server.
  • Grotere organisaties schalen met meer GPU’s per server of met meerdere servers.

Test altijd met uw eigen werk: de lengte van uw documenten en het gebruikspatroon van uw teams bepalen de maat, niet het aantal medewerkers alleen.

Welke modellen kunt u draaien?

On-premise werkt met open-weight modellen, waarvan de gewichten gepubliceerd zijn: onder meer Llama (Meta), Mistral en Qwen (Alibaba). Let bij de keuze op drie dingen:

  • De licentie. Niet elk open-weight model mag onbeperkt commercieel worden gebruikt. Lees de voorwaarden, zeker bij grote organisaties.
  • De taal. Test de kwaliteit in het Nederlands, en in de talen van uw klanten, met uw eigen soort teksten.
  • De taak. Een kleiner model is sneller en goedkoper voor classificeren en samenvatten; een groter model is beter in redeneren en schrijven. Veel organisaties draaien er meer dan één, per rol of taak.

Software, stroom en koeling

Inference-software. Voor één gebruiker op een werkstation volstaan tools als Ollama of llama.cpp. Voor een organisatie hebt u een server nodig die veel verzoeken tegelijk efficiënt afhandelt, zoals vLLM, met een API die uw applicaties kunnen aanroepen.

Stroom en koeling. Een datacenter-GPU verbruikt al snel 300 tot 400 watt onder belasting; een server met vier GPU’s komt samen met de rest van de hardware op enkele kilowatts. Controleer of uw serverruimte of rack de stroom, de koeling en het gewicht aankan. Veel kantoorserverruimtes zijn niet op GPU-servers ingericht.

Netwerk. De server hoort in een afgeschermd segment, bereikbaar voor uw gebruikers en applicaties, zonder uitgaande verbindingen die u niet zelf hebt toegestaan.

Het deel dat vaak wordt vergeten: beheer

Een model draaien is een weekend werk voor een handige engineer. Een verdedigbare AI-omgeving voor een hele organisatie is iets anders. Die vraagt:

  • koppeling met uw identity provider en rechten per rol;
  • safeguards die gevoelige patronen tegenhouden voordat ze een model bereiken;
  • logging en een audit trail, met export naar uw SIEM;
  • modelbeheer: nieuwe versies testen, uitrollen en terugdraaien;
  • monitoring van gebruik, wachttijden en hardware;
  • beleid over hoeveel inzicht de organisatie krijgt in het gebruik.

Dat is precies wat werqly levert: een dedicated AI-node in uw serverruimte met werqly AI Control als beheerconsole. Uw IT-afdeling beheert het zelf, of werqly doet het met werqly Pro beheer. Hebt u geen geschikte serverruimte, dan staat de node in een afgesloten rack in ons Europese datacenter, alleen voor u. Waarom organisaties die keuze maken, staat in Wat is private AI?

Veelgestelde vragen

Vragen over dit onderwerp

Kan een 70B-model op één GPU draaien?

Ja, met 4-bits kwantisatie past een 70B-model in ongeveer 40 tot 45 GB, dus op één datacenter-GPU met 48 GB. Er blijft dan weinig geheugen over voor lange documenten en veel gelijktijdige gebruikers; voor een hele organisatie zijn meerdere GPU’s gebruikelijk.

Is Ollama geschikt voor zakelijk gebruik?

Voor experimenten en individueel gebruik wel. Voor een organisatie met veel gelijktijdige gebruikers is inference-software die verzoeken efficiënt batcht, zoals vLLM, geschikter. Daarnaast hebt u beheer nodig: toegang per rol, logging en updates.

Kan ik een gewone server met een gaming-GPU gebruiken?

Voor een proef kan dat. Voor productie zijn datacenter-GPU’s gebruikelijk: ze hebben meer geheugen, zijn gemaakt voor continu gebruik in een rack en worden ondersteund door serverleveranciers. Let ook op de licentievoorwaarden van consumentenkaarten in datacenters.

Hoeveel stroom verbruikt een AI-server?

Een datacenter-GPU verbruikt onder belasting ongeveer 300 tot 400 watt. Een server met vier GPU’s komt inclusief processors, geheugen en koeling op enkele kilowatts. Controleer vooraf of uw serverruimte die stroom en koeling kan leveren.

Bronnen

  1. Hugging Face — Llama 3.3 70B Instruct (modelkaart)
  2. vLLM — documentatie
  3. NVIDIA — L40S datasheet
  4. InsiderLLM — Running 70B models locally: VRAM by quantization

Dit artikel is algemene informatie, geen juridisch advies. Regels en richtsnoeren veranderen; controleer bij twijfel de genoemde bronnen of vraag uw jurist of FG.

Rekentool

Bereken uw private AI-kosten.

Vul uw zakelijke e-mailadres en het aantal medewerkers in. We rekenen direct vier opzetten voor u door: in uw eigen serverruimte of in ons datacenter, in eigen beheer of met werqly Pro beheer. werqly is geen goedkoop AI-abonnement: u betaalt voor eigen hardware en volledige controle.

  1. 1Vul uw e-mailadres en het aantal medewerkers in
  2. 2Vergelijk vier voorstellen
  3. 3Vraag direct een offerte aan

We mailen de berekening naar dit adres en gebruiken het alleen om contact met u op te nemen over uw aanvraag.