High-performance LLM inference met vLLM, gehost op Europese GPU infrastructuur.
vLLM is in korte tijd de standaardmanier geworden om open taalmodellen te serveren, en dat is geen toeval. Twee technieken maken het verschil. Continuous batching laat nieuwe requests tussentijds aanhaken bij werk dat al op de GPU draait, in plaats van te wachten tot een batch klaar is. PagedAttention beheert het geheugen voor de attention-cache in kleine blokken, zoals een besturingssysteem met virtueel geheugen omgaat, waardoor er veel minder GPU-geheugen verloren gaat.
HostYourAI draait vLLM voor je op Europese GPU's. Je krijgt de serving-engine zonder het beheer, en het verkeer blijft binnen de EU, onder een verwerkersovereenkomst met een openbare subprocessor-lijst.
Alles wat gebruikers aan het model vragen passeert de inference-laag. Wie die laag host, verwerkt dus je gevoeligste verkeer. Door vLLM in Europese datacenters te draaien valt die verwerking onder een AVG-keten die je kunt controleren, in plaats van onder buitenlandse wetgeving.
vLLM spreekt hetzelfde API-formaat als OpenAI. Je houdt je vertrouwde SDK's en tooling, maar de requests gaan naar een Nederlands bedrijf in plaats van naar een Amerikaanse provider die onder de CLOUD Act valt. Overstappen is vooral een kwestie van base-URL en key omwisselen.
Hoeveel je uit een GPU haalt, bepaalt wat inference uiteindelijk kost. Continuous batching verhoogt de benutting zodra er parallelle requests binnenkomen, zonder dat jij iets hoeft te tunen. Je betaalt pay-as-you-go vanaf een prepaid creditsaldo; de opzet staat op de prijzenpagina.
from openai import OpenAI client = OpenAI( base_url="https://hostyourai.com/api/v1", api_key="hyai-...") client.chat.completions.create( model="llama-3.3-70b", messages=[{"role":"user","content":"Hallo!"}])
Wie zelf een model op een gehuurde GPU zet, begint meestal met een simpele server die requests één voor één afhandelt. Dat werkt, tot er twee gebruikers tegelijk komen: dan groeit de wachtrij en staat de GPU alsnog vaak stil. vLLM lost dat op met continuous batching en slim geheugenbeheer, en geeft je er SSE-streaming en een OpenAI-compatible endpoint bij. Op dedicated GPU-instances staat dit alles voorgeconfigureerd, afgeschermd met een eigen versleutelde API-key. Op de EU Inference Router profiteer je van dezelfde engine zonder eigen GPU, met een warm pool voor populaire modellen. Zelf een model kiezen en deployen? Volg de gids Eigen LLM deployen met vLLM.
| Begrip | Wat het betekent |
|---|---|
| Continuous batching | Nieuwe requests schuiven aan bij lopende generaties, de GPU wacht niet op de langzaamste |
| PagedAttention | De attention-cache wordt in blokken beheerd, waardoor minder GPU-geheugen verspild wordt |
| SSE-streaming | Tokens komen binnen terwijl het antwoord nog gegenereerd wordt, zoals in een chatinterface |
| OpenAI-compatible endpoint | /v1/chat/completions, dus bestaande SDK's en tools werken direct |
| Warm pool | Populaire modellen op de Router blijven geladen, zodat je niet op een koude start wacht |
Streaming werkt out of the box. Dit JavaScript-voorbeeld print tokens zodra ze binnenkomen.
import OpenAI from "openai";
const base_url="https://hostyourai.com/api/v1";
const client = new OpenAI({ baseURL: base_url, apiKey: "hyai-jouw-key" });
const stream = await client.chat.completions.create({
model: "llama-3.1-8b",
messages: [{ role: "user", content: "Schrijf een korte productomschrijving voor een duurzame rugzak." }],
stream: true,
});
for await (const chunk of stream) {
process.stdout.write(chunk.choices[0]?.delta?.content ?? "");
}Een open source serving-engine voor grote taalmodellen. Het combineert continuous batching en PagedAttention met een OpenAI-compatible API, en is daarmee de gangbare keuze om open modellen in productie te draaien.
Nee. Op dedicated instances staat vLLM voorgeconfigureerd en houdt het platform de serving-stack bij. Jij praat alleen met het endpoint.
Daar is geen eerlijk vast getal voor: het hangt af van model, GPU en verkeerspatroon. De winst zit vooral in doorvoer bij parallelle requests, omdat de GPU niet meer wacht tussen batches.
Ja, via SSE op het chat completions endpoint. Zet stream op true en je ontvangt tokens zodra ze gegenereerd zijn.
Nee. Naast het OpenAI-formaat is er een Anthropic-compatible /v1/messages endpoint met gebufferde streaming en tekst-output, met x-api-key authenticatie. Elke HTTP-client werkt bovendien rechtstreeks.
Ja. Elke instance draait vLLM met een eigen versleutelde API-key, zodat alleen jouw applicaties het endpoint kunnen aanspreken.
Van model-hosting tot een klantgerichte API, gebouwd voor developers en bedrijven die hun AI op infrastructuur willen draaien die ze echt beheren, binnen de EU.
Je data en je modellen blijven op Europese GPUs. GDPR-vriendelijk vanaf de basis.
Llama, Qwen, DeepSeek, Mistral, FLUX en nog veel meer. Kies er een en hij is binnen minuten warm, zonder DevOps aan jouw kant.
Richt je bestaande client op de Router en behoud je tools. Geen herschrijven, geen lock-in.
Geen infra om te beheren. Kies een model, krijg een OpenAI-compatibele URL, ship.
Kies uit de Model Garden of plak een willekeurig HuggingFace-ID. Stel de VRAM in en kies een EU-GPU.
Wij deployen vLLM, draaien readiness-probes en geven je een warme OpenAI- en Anthropic-compatibele URL plus een API-key.
Richt je client op de Router. Die routeert automatisch naar een warme instance, zet GPUs idle als niemand online is en logt elk verzoek.
De Router spreekt de OpenAI- en Anthropic-API, dus hij past direct in de clients en SDKs die je team al draait. Verander alleen de base-URL.
Probeer HostYourAI gratisAls een Amerikaanse cloud geen optie is, geeft HostYourAI je dezelfde developer-ervaring op Europese infrastructuur.
Burgerdata die wettelijk in de EU moet blijven, volledig auditeerbaar.
Finance-, zorg- en juridische teams onder GDPR, DORA en de AI Act.
Lever AI-functies waar je klanten op vertrouwen, zonder Amerikaanse sub-processor.
Lever privé-AI voor klanten op infrastructuur waar je achter kunt staan.
Ja. HostYourAI draait open modellen op GPU's in Europese datacenters via vLLM. Je prompts en outputs verlaten de EU niet en er zit geen Amerikaanse cloudprovider in de keten.
Ja. Alle verwerking gebeurt binnen de EU, er is een verwerkersovereenkomst (DPA) beschikbaar en de subprocessor-lijst is openbaar. Open gewichten betekenen ook: geen training op jouw data.
Ja. Je richt je bestaande OpenAI- of Anthropic-client op onze Router (https://hostyourai.com/api/v1), alleen de base-URL en API-key wijzigen. Geen rewrite, geen lock-in.
Pay-as-you-go met één prepaid creditsaldo: de gedeelde router per token of een dedicated GPU per uur. Gratis te starten, geen minimum, geen vaste maandkosten.
Tekst- en beeldmodellen op dedicated EU GPU's. Elk model getest op onze eigen hardware.
Verken meer over EU-gehoste AI op HostYourAI.
Host Phi 3.5 MoE op dedicated NVIDIA A100 40GB in Nederlandse datacenters. GDPR compliant, pay-as-you-go, OpenAI-compatible API.
Lees meer →Featherless biedt duizenden modellen, maar geen EU-datacenter-garantie. HostYourAI host open modellen op Europese GPU's met AVG, DPA en heldere prijzen.
Lees meer →OpenRouter routeert je prompts vaak naar Amerikaanse providers en EU-verwerking is enterprise-only. HostYourAI host zelf op EU GPU's, self-service.
Lees meer →Dedicated GPU hosting voor AI workloads. 100% GPU capaciteit, volledige isolatie, consistente performance.
Lees meer →Op zoek naar een Azure OpenAI alternatief dat in de EU draait? Drop-in OpenAI-compatibele API op open modellen, Europese GPUs en geen Amerikaanse cloud in de keten.
Lees meer →Host Command R op dedicated NVIDIA A100 40GB in Nederlandse datacenters. GDPR compliant, pay-as-you-go, OpenAI-compatible API.
Lees meer →Geen creditcard nodig. Betaal naar gebruik, stop wanneer je wilt.
Begin vandaag gratis met hosten