GPU & infra

vLLM Hosting Europa

High-performance LLM inference met vLLM, gehost op Europese GPU infrastructuur.

qwen3-8b vLLM ready
NVIDIA A100 · 40GB · EU marketplace · eu-central
VRAM19.2 / 40 GB
GPU utilisation71%
42 ms
time-to-first-token
128
tokens / sec
62°C
temperature
POST /api/v1/chat/completions200 OK

vLLM is in korte tijd de standaardmanier geworden om open taalmodellen te serveren, en dat is geen toeval. Twee technieken maken het verschil. Continuous batching laat nieuwe requests tussentijds aanhaken bij werk dat al op de GPU draait, in plaats van te wachten tot een batch klaar is. PagedAttention beheert het geheugen voor de attention-cache in kleine blokken, zoals een besturingssysteem met virtueel geheugen omgaat, waardoor er veel minder GPU-geheugen verloren gaat.

HostYourAI draait vLLM voor je op Europese GPU's. Je krijgt de serving-engine zonder het beheer, en het verkeer blijft binnen de EU, onder een verwerkersovereenkomst met een openbare subprocessor-lijst.

Waarom vLLM hosting in de EU

De serving-laag ziet elke prompt

Alles wat gebruikers aan het model vragen passeert de inference-laag. Wie die laag host, verwerkt dus je gevoeligste verkeer. Door vLLM in Europese datacenters te draaien valt die verwerking onder een AVG-keten die je kunt controleren, in plaats van onder buitenlandse wetgeving.

OpenAI-compatible zonder Amerikaanse jurisdictie

vLLM spreekt hetzelfde API-formaat als OpenAI. Je houdt je vertrouwde SDK's en tooling, maar de requests gaan naar een Nederlands bedrijf in plaats van naar een Amerikaanse provider die onder de CLOUD Act valt. Overstappen is vooral een kwestie van base-URL en key omwisselen.

Efficiëntie is kostenbeheersing

Hoeveel je uit een GPU haalt, bepaalt wat inference uiteindelijk kost. Continuous batching verhoogt de benutting zodra er parallelle requests binnenkomen, zonder dat jij iets hoeft te tunen. Je betaalt pay-as-you-go vanaf een prepaid creditsaldo; de opzet staat op de prijzenpagina.

python
from openai import OpenAI
client = OpenAI(
    base_url="https://hostyourai.com/api/v1",
    api_key="hyai-...")
client.chat.completions.create(
    model="llama-3.3-70b",
    messages=[{"role":"user","content":"Hallo!"}])

Wat vLLM anders maakt dan een kale GPU met een model erop

Wie zelf een model op een gehuurde GPU zet, begint meestal met een simpele server die requests één voor één afhandelt. Dat werkt, tot er twee gebruikers tegelijk komen: dan groeit de wachtrij en staat de GPU alsnog vaak stil. vLLM lost dat op met continuous batching en slim geheugenbeheer, en geeft je er SSE-streaming en een OpenAI-compatible endpoint bij. Op dedicated GPU-instances staat dit alles voorgeconfigureerd, afgeschermd met een eigen versleutelde API-key. Op de EU Inference Router profiteer je van dezelfde engine zonder eigen GPU, met een warm pool voor populaire modellen. Zelf een model kiezen en deployen? Volg de gids Eigen LLM deployen met vLLM.

BegripWat het betekent
Continuous batchingNieuwe requests schuiven aan bij lopende generaties, de GPU wacht niet op de langzaamste
PagedAttentionDe attention-cache wordt in blokken beheerd, waardoor minder GPU-geheugen verspild wordt
SSE-streamingTokens komen binnen terwijl het antwoord nog gegenereerd wordt, zoals in een chatinterface
OpenAI-compatible endpoint/v1/chat/completions, dus bestaande SDK's en tools werken direct
Warm poolPopulaire modellen op de Router blijven geladen, zodat je niet op een koude start wacht
qwen3-8b vLLM ready
NVIDIA A100 · 40GB · EU marketplace · eu-central
VRAM19.2 / 40 GB
GPU utilisation71%
42 ms
time-to-first-token
128
tokens / sec
62°C
temperature
POST /api/v1/chat/completions200 OK

Zo begin je

Streaming werkt out of the box. Dit JavaScript-voorbeeld print tokens zodra ze binnenkomen.

import OpenAI from "openai";

const base_url="https://hostyourai.com/api/v1";
const client = new OpenAI({ baseURL: base_url, apiKey: "hyai-jouw-key" });

const stream = await client.chat.completions.create({
  model: "llama-3.1-8b",
  messages: [{ role: "user", content: "Schrijf een korte productomschrijving voor een duurzame rugzak." }],
  stream: true,
});

for await (const chunk of stream) {
  process.stdout.write(chunk.choices[0]?.delta?.content ?? "");
}
One-click deployment
OpenAI-compatible API
4 EU datacenters
End-to-end encryptie
Dedicated GPU instances
Audit logging

Vragen over vLLM hosting

Wat is vLLM precies?

Een open source serving-engine voor grote taalmodellen. Het combineert continuous batching en PagedAttention met een OpenAI-compatible API, en is daarmee de gangbare keuze om open modellen in productie te draaien.

Moet ik vLLM zelf beheren of updaten?

Nee. Op dedicated instances staat vLLM voorgeconfigureerd en houdt het platform de serving-stack bij. Jij praat alleen met het endpoint.

Hoeveel sneller is vLLM dan een simpele serving-opzet?

Daar is geen eerlijk vast getal voor: het hangt af van model, GPU en verkeerspatroon. De winst zit vooral in doorvoer bij parallelle requests, omdat de GPU niet meer wacht tussen batches.

Ondersteunt het streaming?

Ja, via SSE op het chat completions endpoint. Zet stream op true en je ontvangt tokens zodra ze gegenereerd zijn.

Werkt het alleen met de OpenAI SDK?

Nee. Naast het OpenAI-formaat is er een Anthropic-compatible /v1/messages endpoint met gebufferde streaming en tekst-output, met x-api-key authenticatie. Elke HTTP-client werkt bovendien rechtstreeks.

Krijgt mijn dedicated instance een eigen API-key?

Ja. Elke instance draait vLLM met een eigen versleutelde API-key, zodat alleen jouw applicaties het endpoint kunnen aanspreken.

je vraag
doc-4f2a0.94
doc-9c1e0.91
doc-2b770.88

Alles wat je nodig hebt voor AI

Van model-hosting tot een klantgerichte API, gebouwd voor developers en bedrijven die hun AI op infrastructuur willen draaien die ze echt beheren, binnen de EU.

100%
EU-gehost

Je data en je modellen blijven op Europese GPUs. GDPR-vriendelijk vanaf de basis.

200+
Geverifieerde modellen, klaar om te serveren

Llama, Qwen, DeepSeek, Mistral, FLUX en nog veel meer. Kies er een en hij is binnen minuten warm, zonder DevOps aan jouw kant.

2 SDK
OpenAI- en Anthropic-compatibel

Richt je bestaande client op de Router en behoud je tools. Geen herschrijven, geen lock-in.

Van nul naar een warm endpoint in minuten

Geen infra om te beheren. Kies een model, krijg een OpenAI-compatibele URL, ship.

1

Kies een model

Kies uit de Model Garden of plak een willekeurig HuggingFace-ID. Stel de VRAM in en kies een EU-GPU.

2

Krijg je endpoint

Wij deployen vLLM, draaien readiness-probes en geven je een warme OpenAI- en Anthropic-compatibele URL plus een API-key.

3

Route en ship

Richt je client op de Router. Die routeert automatisch naar een warme instance, zet GPUs idle als niemand online is en logt elk verzoek.

Werkt met de tools die je al gebruikt

De Router spreekt de OpenAI- en Anthropic-API, dus hij past direct in de clients en SDKs die je team al draait. Verander alleen de base-URL.

Probeer HostYourAI gratis
docker
anthropic
huggingface
langchain
python
nodedotjs
curl
ollama
jetbrains
jupyter
vercel
zapier
postman
n8n

Gebouwd voor teams die data niet mogen wegsturen

Als een Amerikaanse cloud geen optie is, geeft HostYourAI je dezelfde developer-ervaring op Europese infrastructuur.

Overheid & publieke sector

Burgerdata die wettelijk in de EU moet blijven, volledig auditeerbaar.

Gereguleerde enterprise

Finance-, zorg- en juridische teams onder GDPR, DORA en de AI Act.

EU SaaS & scale-ups

Lever AI-functies waar je klanten op vertrouwen, zonder Amerikaanse sub-processor.

Agencies & integrators

Lever privé-AI voor klanten op infrastructuur waar je achter kunt staan.

Veelgestelde vragen

Kan ik dit in de EU draaien?

Ja. HostYourAI draait open modellen op GPU's in Europese datacenters via vLLM. Je prompts en outputs verlaten de EU niet en er zit geen Amerikaanse cloudprovider in de keten.

Is het AVG/GDPR-compliant?

Ja. Alle verwerking gebeurt binnen de EU, er is een verwerkersovereenkomst (DPA) beschikbaar en de subprocessor-lijst is openbaar. Open gewichten betekenen ook: geen training op jouw data.

Is de API compatibel met OpenAI?

Ja. Je richt je bestaande OpenAI- of Anthropic-client op onze Router (https://hostyourai.com/api/v1), alleen de base-URL en API-key wijzigen. Geen rewrite, geen lock-in.

Wat kost het?

Pay-as-you-go met één prepaid creditsaldo: de gedeelde router per token of een dedicated GPU per uur. Gratis te starten, geen minimum, geen vaste maandkosten.

Model garden

Werkt met 390+ open modellen

Tekst- en beeldmodellen op dedicated EU GPU's. Elk model getest op onze eigen hardware.

Ook interessant

Verken meer over EU-gehoste AI op HostYourAI.

Host. Route. Ship.

Geen creditcard nodig. Betaal naar gebruik, stop wanneer je wilt.

Begin vandaag gratis met hosten