Deploy open-source modellen met productieperformance en volledige datasoevereiniteit.
Een prototype dat op je laptop werkt is iets heel anders dan LLM-inference die elke dag duizenden verzoeken afhandelt. Voor productie heb je een endpoint nodig dat blijft staan onder druk: stabiele doorvoer, streaming antwoorden en inzicht in wat elk verzoek doet. HostYourAI serveert open modellen zoals Llama, Qwen, Mistral en DeepSeek via vLLM op Europese GPU's, achter een OpenAI-compatible API.
Waar die inference draait is geen detail. Prompts bevatten klantvragen, interne documenten en vaak persoonsgegevens. Draait je model in Europese datacenters, dan blijft die data onder Europees recht en hoef je geen doorgifte buiten de EU te verantwoorden.
Prompts en completions zijn al snel persoonsgegevens. Verwerk je die binnen de EU, dan vervalt de hele discussie over doorgiftemechanismen en aanvullende maatregelen. HostYourAI levert een verwerkersovereenkomst, publiceert een openbare subprocessorlijst en traint nooit op je data.
Bij Amerikaanse cloudproviders kan de Amerikaanse overheid via de CLOUD Act toegang tot data eisen, ook als die fysiek in Europa staat. Inference bij een Nederlands bedrijf op Europese infrastructuur haalt die juridische onzekerheid uit je architectuur.
Je verzoeken hoeven de oceaan niet over. Voor streaming interfaces, waar gebruikers het antwoord token voor token zien binnenkomen, merk je het verschil van verkeer dat binnen Europa blijft. Ook je eigen backend praat met een endpoint dichtbij.
Onder de motorkap draait vLLM, met continuous batching zodat gelijktijdige verzoeken elkaar niet blokkeren. Populaire modellen worden warm gehouden via een warm pool, zodat het eerste token snel komt in plaats van te wachten op een koude start. Het platform draait met een 99.9% uptime SLA, en per verzoek zie je in je activiteitenlog welk model is aangeroepen en hoeveel tokens het kostte.
Je kiest per workload de vorm. De EU Inference Router is gedeeld en betaal je per token: ideaal voor wisselend verkeer. Dedicated GPU-instances betaal je per uur en zijn van jou alleen: eigen versleutelde API-key, schalen naar idle bij stilte, en bij deploy wordt een VRAM-ondergrens afgedwongen zodat je GPU nooit te klein is voor het model. Beide vormen lopen vanaf hetzelfde prepaid creditsaldo, zie de prijzenpagina.
| Productie-eis | Invulling bij HostYourAI |
|---|---|
| Snel eerste token | Warm pool houdt populaire modellen geladen |
| Streaming antwoorden | SSE-streaming via /v1/chat/completions |
| Beschikbaarheid | 99.9% uptime SLA |
| Inzicht per verzoek | Activiteitenlog met model, tokens en verbruik |
| Passende hardware | VRAM-ondergrens bij elke deploy |
| Kostencontrole | Prepaid credits, per token of per uur |
from openai import OpenAI client = OpenAI( base_url="https://hostyourai.com/api/v1", api_key="hyai-...") client.chat.completions.create( model="llama-3.3-70b", messages=[{"role":"user","content":"Hallo!"}])
Maak een API-key aan en wijs de OpenAI SDK naar het EU-endpoint. Meer hoeft niet; hoe je bestaande code overzet lees je in de migratiegids.
from openai import OpenAI
client = OpenAI(
base_url="https://hostyourai.com/api/v1",
api_key="hyai-jouw-key",
)
stream = client.chat.completions.create(
model="llama-3.3-70b",
messages=[{"role": "user", "content": "Vat dit incidentrapport samen in drie punten: ..."}],
stream=True,
)
for chunk in stream:
print(chunk.choices[0].delta.content or "", end="")De catalogus telt ruim honderd open modellen, waaronder Llama, Qwen, Mistral, DeepSeek en Gemma. In het modeloverzicht zie je per model de status: warm, aan het opwarmen, serveerbaar of op aanvraag.
De Router past bij wisselend of laag volume: je betaalt per token en deelt de infrastructuur. Een dedicated instance past bij constante belasting, eigen fine-tunes of strikte isolatie-eisen: je betaalt per uur voor een GPU die alleen van jou is.
Ja. Het endpoint spreekt het OpenAI-formaat op /v1/chat/completions, dus de officiële OpenAI SDK's werken na het aanpassen van de base URL. Er is ook een Anthropic-compatible /v1/messages shim voor tekstverkeer.
vLLM batcht gelijktijdige verzoeken efficiënt en de warm pool houdt veelgebruikte modellen geladen. Zo voorkom je koude starts op de momenten dat je verkeer piekt.
Nee. Je prompts en completions worden niet gebruikt om modellen te trainen. Data staat met AES-256 versleuteld opgeslagen en gaat via TLS over de lijn.
Alles loopt vanaf één prepaid creditsaldo dat je opwaardeert via iDEAL, creditcard of SEPA. Routerverkeer wordt per token afgerekend, dedicated instances per uur.
Van model-hosting tot een klantgerichte API, gebouwd voor developers en bedrijven die hun AI op infrastructuur willen draaien die ze echt beheren, binnen de EU.
Je data en je modellen blijven op Europese GPUs. GDPR-vriendelijk vanaf de basis.
Llama, Qwen, DeepSeek, Mistral, FLUX en nog veel meer. Kies er een en hij is binnen minuten warm, zonder DevOps aan jouw kant.
Richt je bestaande client op de Router en behoud je tools. Geen herschrijven, geen lock-in.
Geen infra om te beheren. Kies een model, krijg een OpenAI-compatibele URL, ship.
Kies uit de Model Garden of plak een willekeurig HuggingFace-ID. Stel de VRAM in en kies een EU-GPU.
Wij deployen vLLM, draaien readiness-probes en geven je een warme OpenAI- en Anthropic-compatibele URL plus een API-key.
Richt je client op de Router. Die routeert automatisch naar een warme instance, zet GPUs idle als niemand online is en logt elk verzoek.
HostYourAI houdt je modellen, prompts en data op Europese GPUs. Gebouwd voor teams die geven om compliance, betrouwbaarheid en echte controle.
GPU's en data binnen Europa. Je prompts verlaten de EU nooit.
Draai open-weight modellen zonder black boxes of verborgen telemetrie.
GPU's idlen als niemand online is, dus je betaalt alleen voor wat je draait.
Jouw infra, jouw keys, jouw modellen. Vertrek wanneer je wilt.
De Router spreekt de OpenAI- en Anthropic-API, dus hij past direct in de clients en SDKs die je team al draait. Verander alleen de base-URL.
Probeer HostYourAI gratisJa. HostYourAI draait open modellen op GPU's in Europese datacenters via vLLM. Je prompts en outputs verlaten de EU niet en er zit geen Amerikaanse cloudprovider in de keten.
Ja. Alle verwerking gebeurt binnen de EU, er is een verwerkersovereenkomst (DPA) beschikbaar en de subprocessor-lijst is openbaar. Open gewichten betekenen ook: geen training op jouw data.
Ja. Je richt je bestaande OpenAI- of Anthropic-client op onze Router (https://hostyourai.com/api/v1), alleen de base-URL en API-key wijzigen. Geen rewrite, geen lock-in.
Pay-as-you-go met één prepaid creditsaldo: de gedeelde router per token of een dedicated GPU per uur. Gratis te starten, geen minimum, geen vaste maandkosten.
Tekst- en beeldmodellen op dedicated EU GPU's. Elk model getest op onze eigen hardware.
Verken meer over EU-gehoste AI op HostYourAI.
Chat met dedicated instances en Router-modellen in de Playground. Test prompts, vergelijk modellen en bekijk daarna per verzoek gebruik en latency.
Lees meer →Deploy elk open model op een dedicated Europese GPU met vLLM. Eigen endpoint, encrypted upstream-keys, idle wanneer niemand online is.
Lees meer →Bouw en deploy AI agents op Europese infrastructuur. Function calling, tool use, autonomous agents.
Lees meer →Eén OpenAI- en Anthropic-compatibele endpoint dat je verzoeken naar open modellen op Europese GPUs routeert. Drop-in, EU-gehost, geen lock-in.
Lees meer →Host AI chatbots op Europese infrastructuur. Custom chatbots, knowledge bases, GDPR compliant.
Lees meer →Fine-tune je eigen LLM modellen op Europese GPU infrastructuur. Custom training, dedicated resources, GDPR compliant.
Lees meer →Geen creditcard nodig. Betaal naar gebruik, stop wanneer je wilt.
Begin vandaag gratis met hosten