Gids

Eigen LLM deployen met vLLM

Van een HuggingFace-model naar een warm, OpenAI-compatibel endpoint op een Europese GPU.

Op deze pagina

Router of dedicated instance?

De gedeelde Router is perfect om snel te starten en per token af te rekenen. Kies een dedicated instance wanneer je isolatie, voorspelbare latency of een specifiek model op eigen hardware wilt. Bij een dedicated instance draait vLLM op één Europese GPU die exclusief voor jou is.

Stap 1, Kies je model

Selecteer een model uit de Model Garden of plak een HuggingFace-ID, bijvoorbeeld Qwen/Qwen3-8B. Elk model heeft een VRAM-behoefte; de deploy-stap schat de minimale VRAM en voorkomt dat je een te kleine GPU kiest. Gated modellen (zoals sommige Llama-varianten) vragen wij centraal aan, zodat jij geen losse licenties hoeft te regelen.

qwen3-8b vLLM ready
NVIDIA A100 · 40GB · EU marketplace · eu-central
VRAM19.2 / 40 GB
GPU utilisation71%
42 ms
time-to-first-token
128
tokens / sec
62°C
temperature
POST /api/v1/chat/completions200 OK

Stap 2, Configureer de GPU

  • Kies de VRAM en een Europese GPU-regio
  • Wij regelen de capaciteit via Europese GPU-marketplaces
  • Wij genereren automatisch een vLLM-setupscript en starten de deploy

Stap 3, Wat er achter de schermen gebeurt

De GPU haalt het setupscript op via een ondertekende token en start vLLM met een eigen API-key (versleuteld opgeslagen), zodat je endpoint beveiligd is. We draaien readiness-probes op /health; zodra vLLM klaar is, belt de instance terug en springt de status op "warm". Je krijgt een OpenAI- én Anthropic-compatibele URL plus een API-key.

Stap 4, Stuur je eerste verzoek

Je spreekt de instance aan via de Router met de model-slug, of rechtstreeks op het instance-endpoint:

curl https://hostyourai.com/api/instances/<instance-id>/chat/completions \
  -H "Authorization: Bearer hyai-..." \
  -H "Content-Type: application/json" \
  -d '{"messages":[{"role":"user","content":"Hallo"}]}'

Omdat de instance OpenAI-compatibel is, werkt ook hier gewoon de OpenAI-SDK: zet de base-URL op de Router en kies je model-slug.

Kosten en beheer

Een dedicated instance rekent per uur af, maar idle't wanneer niemand online is: je betaalt niet voor ongebruikte tijd en de instance warmt vanzelf weer op bij het eerste verzoek. In je dashboard zie je de status, het gebruik en de logs. Wil je context uit je eigen documenten toevoegen, koppel dan een kennisbank aan de instance, zie de RAG-gids.

Richtwaarden voor VRAM per modelgrootte

Hoeveel VRAM je nodig hebt hangt af van het aantal parameters, de kwantisatie en de contextlengte. De tabel hieronder geeft praktische richtwaarden; de deploy-stap controleert de ondergrens automatisch, zodat je nooit een te kleine GPU kunt kiezen. Het actuele modelaanbod vind je in de Model Garden.

ModelgrootteVoorbeeldenRichtwaarde VRAM
1 tot 4BLlama 3.2 3B, Qwen kleine varianten, Gemma 4B8 tot 12 GB
7 tot 9BQwen3-8B, Llama 3.1 8B, Mistral 7B16 tot 24 GB
12 tot 14BGemma 12B, Qwen 14B24 tot 40 GB
30 tot 34BQwen 32B, DeepSeek distill-varianten48 tot 80 GB
70B en groterLlama 3.3 70B80 GB of meer

Problemen oplossen

Mijn deploy blijft lang op "warming" staan

Bij grote modellen moet de GPU eerst tientallen gigabytes aan weights downloaden en inladen; dat kan even duren. De instance meldt zich vanzelf zodra de readiness-check op /health slaagt. Blijft de status uren hangen, bekijk dan de logs in je dashboard.

De deploy weigert mijn GPU-keuze

Dan is de VRAM te klein voor het gekozen model. We schatten vooraf de minimale VRAM en blokkeren ondermaatse GPU's, omdat vLLM anders crasht tijdens het laden. Kies een GPU met meer geheugen of een kleiner model.

Ik krijg 401 op mijn instance-endpoint

Elke instance draait vLLM met een eigen, versleuteld opgeslagen API-key. Ga je via de Router, gebruik dan je hyai--key; die moet volledig en zonder spaties in de Authorization-header staan.

Mijn verzoeken geven 404

Controleer het endpoint: via de Router is de base-URL https://hostyourai.com/api/v1 met je model-slug, rechtstreeks gebruik je het instance-pad /api/instances/<instance-id>/chat/completions.

Vragen over deze gids

Hoe lang duurt een deploy?

Meestal enkele minuten. Grote modellen duren langer omdat de weights gedownload en ingeladen moeten worden. Je ziet de status live in je dashboard en in de Model Garden.

Betaal ik door als niemand het model gebruikt?

Nee. Een dedicated instance idle't bij inactiviteit en warmt weer op bij het eerste verzoek. Je rekent per uur af, pay-as-you-go; zie de prijzenpagina.

Welke modellen kan ik deployen?

Elk open model met een HuggingFace-ID, waaronder Llama, Qwen, Mistral, DeepSeek en Gemma. Meer over eigen hardware lees je op de pagina over dedicated GPU-instances.

Kan ik een kennisbank aan mijn instance koppelen?

Ja. Koppel een kennisbank en elke chat-aanroep krijgt automatisch context uit je eigen documenten, met bronvermelding bij niet-streamende antwoorden.

Wanneer is de gedeelde Router slimmer dan een eigen instance?

Bij wisselend of laag verkeer. Je betaalt dan per token en beheert niets; lees meer over de EU Inference Router.

Alles wat je nodig hebt voor AI

Van model-hosting tot een klantgerichte API, gebouwd voor developers en bedrijven die hun AI op infrastructuur willen draaien die ze echt beheren, binnen de EU.

100%
EU-gehost

Je data en je modellen blijven op Europese GPUs. GDPR-vriendelijk vanaf de basis.

200+
Geverifieerde modellen, klaar om te serveren

Llama, Qwen, DeepSeek, Mistral, FLUX en nog veel meer. Kies er een en hij is binnen minuten warm, zonder DevOps aan jouw kant.

2 SDK
OpenAI- en Anthropic-compatibel

Richt je bestaande client op de Router en behoud je tools. Geen herschrijven, geen lock-in.

Van nul naar een warm endpoint in minuten

Geen infra om te beheren. Kies een model, krijg een OpenAI-compatibele URL, ship.

1

Kies een model

Kies uit de Model Garden of plak een willekeurig HuggingFace-ID. Stel de VRAM in en kies een EU-GPU.

2

Krijg je endpoint

Wij deployen vLLM, draaien readiness-probes en geven je een warme OpenAI- en Anthropic-compatibele URL plus een API-key.

3

Route en ship

Richt je client op de Router. Die routeert automatisch naar een warme instance, zet GPUs idle als niemand online is en logt elk verzoek.

Gebouwd voor teams die data niet mogen wegsturen

Als een Amerikaanse cloud geen optie is, geeft HostYourAI je dezelfde developer-ervaring op Europese infrastructuur.

Overheid & publieke sector

Burgerdata die wettelijk in de EU moet blijven, volledig auditeerbaar.

Gereguleerde enterprise

Finance-, zorg- en juridische teams onder GDPR, DORA en de AI Act.

EU SaaS & scale-ups

Lever AI-functies waar je klanten op vertrouwen, zonder Amerikaanse sub-processor.

Agencies & integrators

Lever privé-AI voor klanten op infrastructuur waar je achter kunt staan.

Privé vanaf de basis

HostYourAI houdt je modellen, prompts en data op Europese GPUs. Gebouwd voor teams die geven om compliance, betrouwbaarheid en echte controle.

EU-gehostAVG-vriendelijkOpenAI-compatibelvLLMGeen lock-in
EU
Volledige datasoevereiniteit

GPU's en data binnen Europa. Je prompts verlaten de EU nooit.

Open
Modellen die je kunt auditen

Draai open-weight modellen zonder black boxes of verborgen telemetrie.

€0
Scale-to-zero

GPU's idlen als niemand online is, dus je betaalt alleen voor wat je draait.

Jouw
Geen vendor lock-in

Jouw infra, jouw keys, jouw modellen. Vertrek wanneer je wilt.

Model garden

Werkt met 390+ open modellen

Tekst- en beeldmodellen op dedicated EU GPU's. Elk model getest op onze eigen hardware.

Ook interessant

Verken meer over EU-gehoste AI op HostYourAI.

Host. Route. Ship.

Geen creditcard nodig. Betaal naar gebruik, stop wanneer je wilt.

Begin vandaag gratis met hosten