Huur dedicated GPU servers in Europese datacenters. Van uur tot maand, precies zo lang als je nodig hebt.
Een GPU-server huren voor LLM-inference hoeft geen project van weken te zijn met offertes, contracten en een rack in een datacenter. Bij HostYourAI huur je GPU-capaciteit per uur: je kiest een open model, het platform zet er een instance met vLLM onder, en even later heb je een OpenAI-compatible endpoint. Geen hardware kopen, geen drivers installeren.
De servers staan in Europese datacenters en je rekent af vanaf een prepaid creditsaldo. Staat je instance stil, dan schaalt hij naar idle, zodat je niet betaalt voor uren waarin niemand iets vraagt. Dat maakt huren per uur ook realistisch voor workloads die pieken en dalen.
Voor interactieve toepassingen zoals chat en assistenten telt elke schakel in de route. Een GPU in Europa houdt het netwerk kort voor Europese gebruikers, zeker bij streaming waar tokens stuk voor stuk binnenkomen.
Wie de server beheert, bepaalt onder welk recht je data valt. Gehuurde GPU's bij een Nederlands bedrijf uit Groningen vallen onder Europees recht, zonder de vraag of een buitenlandse overheid via de leverancier bij je data kan.
Je waardeert een saldo op via iDEAL, creditcard of SEPA en instances trekken daar per uur van af. Geen verrassingsfactuur achteraf: op is op, en idle-down voorkomt dat een vergeten testserver stilletjes doortikt. De tarieven staan op de prijzenpagina.
from openai import OpenAI client = OpenAI( base_url="https://hostyourai.com/api/v1", api_key="hyai-...") client.chat.completions.create( model="llama-3.3-70b", messages=[{"role":"user","content":"Hallo!"}])
Een deploy bestaat uit een paar stappen. Je kiest een model uit het modeloverzicht of geeft een eigen HuggingFace-ID op. Het platform dwingt vervolgens een VRAM-ondergrens af: je kunt geen GPU kiezen die te klein is voor het model, dus een mislukte deploy door geheugengebrek is uitgesloten. Daarna start de instance met vLLM en een eigen versleutelde API-key, en krijg je een OpenAI-compatible endpoint terug. De uitgebreide versie van deze stappen staat in de gids Eigen LLM deployen met vLLM, de productdetails bij dedicated GPU-instances.
| Modelgrootte | Geheugenbehoefte-klasse |
|---|---|
| Tot circa 8 miljard parameters | Instapklasse GPU, één kaart volstaat ruim |
| 9 tot 14 miljard parameters | Middenklasse GPU met ruimte voor context |
| Rond 30 miljard parameters | Zware middenklasse of A100-klasse |
| Rond 70 miljard parameters | A100- of H100-klasse |
| Nog groter, of grote MoE-modellen | Meerdere GPU's, of een gequantiseerde variant |
Zodra je instance draait, roep je hem aan zoals elke OpenAI-compatible API.
from openai import OpenAI
client = OpenAI(
base_url="https://hostyourai.com/api/v1",
api_key="hyai-jouw-key"
)
resp = client.chat.completions.create(
model="deepseek-r1",
messages=[{"role": "user", "content": "Denk stap voor stap: een team verwerkt 1200 documenten per dag, hoeveel zijn dat er per kwartaal van 13 weken?"}]
)
print(resp.choices[0].message.content)
De GPU-klasse die je huurt volgt uit het model dat je wilt serveren. Dit zijn de gangbare combinaties; de deploy dwingt een VRAM-ondergrens af, dus een te kleine kaart wordt automatisch geweigerd.
| GPU-klasse | VRAM | Wat er comfortabel op draait |
|---|---|---|
| H100-klasse | 80 GB HBM3 | 70B-modellen zoals Llama 70B of DeepSeek R1 Distill Llama 70B (gequantiseerd op één kaart, volledige precisie over twee), plus high-throughput serving van middelgrote modellen |
| A100 80 GB-klasse | 80 GB | 30B- tot 40B-modellen op volledige precisie, 70B gequantiseerd, workloads met lange context |
| A100 40 GB-klasse | 40 GB | 7B- tot 14B-modellen zoals Mistral 7B, Llama 8B of Qwen 14B, met ruimte voor context |
| L40S-klasse | 48 GB | Middelgrote modellen tot circa 30B, plus embedding- en visionworkloads |
Voor een altijd-aan productie-endpoint kijk je bij dedicated GPU hosting; hoe de serving-stack is opgezet lees je bij vLLM hosting in Europa.
Rechtstreeks bij HostYourAI. Je kiest een model, het platform zet een instance in H100-klasse klaar in een Europees datacenter, met vLLM voorgeconfigureerd en een OpenAI-compatible endpoint. Je betaalt per uur vanaf een prepaid saldo en kunt op elk moment stoppen, zonder langlopend contract. Meer op de pagina dedicated GPU hosting.
Nee. Instances schalen automatisch naar idle bij geen gebruik. Je betaalt per uur dat er daadwerkelijk capaciteit voor je draait, vanaf je prepaid saldo.
Dat hangt af van de modelgrootte. Het platform dwingt bij deploy een VRAM-ondergrens af, zodat de gekozen GPU altijd genoeg geheugen heeft; voor grote modellen kom je uit bij kaarten in de A100- of H100-klasse.
Ja. Op een dedicated instance kun je elk open model deployen dat vLLM ondersteunt, door het HuggingFace-ID op te geven.
Ja. Elke instance exposeert /v1/chat/completions met SSE-streaming. Code die tegen OpenAI is geschreven, werkt na het aanpassen van base URL en key direct door.
Nee. Het model is pay-as-you-go per uur vanaf een prepaid creditsaldo. Je kunt een instance starten voor een experiment van een middag en daarna gewoon weer stoppen.
Nee. Elke instance draait met een eigen versleutelde API-key. Zonder die key geeft je endpoint geen antwoorden.
Van model-hosting tot een klantgerichte API, gebouwd voor developers en bedrijven die hun AI op infrastructuur willen draaien die ze echt beheren, binnen de EU.
Je data en je modellen blijven op Europese GPUs. GDPR-vriendelijk vanaf de basis.
Llama, Qwen, DeepSeek, Mistral, FLUX en nog veel meer. Kies er een en hij is binnen minuten warm, zonder DevOps aan jouw kant.
Richt je bestaande client op de Router en behoud je tools. Geen herschrijven, geen lock-in.
Geen infra om te beheren. Kies een model, krijg een OpenAI-compatibele URL, ship.
Kies uit de Model Garden of plak een willekeurig HuggingFace-ID. Stel de VRAM in en kies een EU-GPU.
Wij deployen vLLM, draaien readiness-probes en geven je een warme OpenAI- en Anthropic-compatibele URL plus een API-key.
Richt je client op de Router. Die routeert automatisch naar een warme instance, zet GPUs idle als niemand online is en logt elk verzoek.
Als een Amerikaanse cloud geen optie is, geeft HostYourAI je dezelfde developer-ervaring op Europese infrastructuur.
Burgerdata die wettelijk in de EU moet blijven, volledig auditeerbaar.
Finance-, zorg- en juridische teams onder GDPR, DORA en de AI Act.
Lever AI-functies waar je klanten op vertrouwen, zonder Amerikaanse sub-processor.
Lever privé-AI voor klanten op infrastructuur waar je achter kunt staan.
HostYourAI houdt je modellen, prompts en data op Europese GPUs. Gebouwd voor teams die geven om compliance, betrouwbaarheid en echte controle.
GPU's en data binnen Europa. Je prompts verlaten de EU nooit.
Draai open-weight modellen zonder black boxes of verborgen telemetrie.
GPU's idlen als niemand online is, dus je betaalt alleen voor wat je draait.
Jouw infra, jouw keys, jouw modellen. Vertrek wanneer je wilt.
Ja. HostYourAI draait open modellen op GPU's in Europese datacenters via vLLM. Je prompts en outputs verlaten de EU niet en er zit geen Amerikaanse cloudprovider in de keten.
Ja. Alle verwerking gebeurt binnen de EU, er is een verwerkersovereenkomst (DPA) beschikbaar en de subprocessor-lijst is openbaar. Open gewichten betekenen ook: geen training op jouw data.
Ja. Je richt je bestaande OpenAI- of Anthropic-client op onze Router (https://hostyourai.com/api/v1), alleen de base-URL en API-key wijzigen. Geen rewrite, geen lock-in.
Pay-as-you-go met één prepaid creditsaldo: de gedeelde router per token of een dedicated GPU per uur. Gratis te starten, geen minimum, geen vaste maandkosten.
Tekst- en beeldmodellen op dedicated EU GPU's. Elk model getest op onze eigen hardware.
Verken meer over EU-gehoste AI op HostYourAI.
Host InternLM 2.5 20B op dedicated NVIDIA A100 40GB in Nederlandse datacenters. GDPR compliant, pay-as-you-go, OpenAI-compatible API.
Lees meer →Host Phi 3.5 MoE op dedicated NVIDIA A100 40GB in Nederlandse datacenters. GDPR compliant, pay-as-you-go, OpenAI-compatible API.
Lees meer →Een ChatGPT alternatief dat op open modellen en Europese GPUs draait. OpenAI-compatibele API, AVG-vriendelijk en zonder dat je data de EU verlaat.
Lees meer →Op zoek naar een AVG-conforme LLM API? HostYourAI draait open modellen in de EU met DPA, publieke subverwerkerslijst, zero retention en AES-256-encryptie.
Lees meer →vLLM hosting op Europese infrastructure. PagedAttention, continuous batching, maximale throughput.
Lees meer →Host Llama 3 en Llama 3.3 modellen op Europese GPU infrastructuur. One-click deployment, OpenAI-compatible API, GDPR compliant.
Lees meer →Geen creditcard nodig. Betaal naar gebruik, stop wanneer je wilt.
Begin vandaag gratis met hosten