EU Router

LLM Inference Hosting in Europa

Deploy open-source modellen met productieperformance en volledige datasoevereiniteit.

Je app
OpenAI · Anthropic
EU Router
één base URL
Qwen3-8B
warm
Loes (NL)
soeverein
Llama-3.3
warm

Een prototype dat op je laptop werkt is iets heel anders dan LLM-inference die elke dag duizenden verzoeken afhandelt. Voor productie heb je een endpoint nodig dat blijft staan onder druk: stabiele doorvoer, streaming antwoorden en inzicht in wat elk verzoek doet. HostYourAI serveert open modellen zoals Llama, Qwen, Mistral en DeepSeek via vLLM op Europese GPU's, achter een OpenAI-compatible API.

Waar die inference draait is geen detail. Prompts bevatten klantvragen, interne documenten en vaak persoonsgegevens. Draait je model in Europese datacenters, dan blijft die data onder Europees recht en hoef je geen doorgifte buiten de EU te verantwoorden.

Waarom LLM-inference in de EU

AVG zonder kunstgrepen

Prompts en completions zijn al snel persoonsgegevens. Verwerk je die binnen de EU, dan vervalt de hele discussie over doorgiftemechanismen en aanvullende maatregelen. HostYourAI levert een verwerkersovereenkomst, publiceert een openbare subprocessorlijst en traint nooit op je data.

Buiten Amerikaanse jurisdictie

Bij Amerikaanse cloudproviders kan de Amerikaanse overheid via de CLOUD Act toegang tot data eisen, ook als die fysiek in Europa staat. Inference bij een Nederlands bedrijf op Europese infrastructuur haalt die juridische onzekerheid uit je architectuur.

Korte netwerkpaden naar je gebruikers

Je verzoeken hoeven de oceaan niet over. Voor streaming interfaces, waar gebruikers het antwoord token voor token zien binnenkomen, merk je het verschil van verkeer dat binnen Europa blijft. Ook je eigen backend praat met een endpoint dichtbij.

EU Inference Router

‹ Insight 1 of 28 ›
98.7% ↗ 12%
4,931 of 5,000 requests served warm
EU-hostedModels run on European GPUs
Drop-inOpenAI and Anthropic compatible
Scale to zeroGPUs idle when nobody is online

Wat productie-inference betrouwbaar maakt

Onder de motorkap draait vLLM, met continuous batching zodat gelijktijdige verzoeken elkaar niet blokkeren. Populaire modellen worden warm gehouden via een warm pool, zodat het eerste token snel komt in plaats van te wachten op een koude start. Het platform draait met een 99.9% uptime SLA, en per verzoek zie je in je activiteitenlog welk model is aangeroepen en hoeveel tokens het kostte.

Je kiest per workload de vorm. De EU Inference Router is gedeeld en betaal je per token: ideaal voor wisselend verkeer. Dedicated GPU-instances betaal je per uur en zijn van jou alleen: eigen versleutelde API-key, schalen naar idle bij stilte, en bij deploy wordt een VRAM-ondergrens afgedwongen zodat je GPU nooit te klein is voor het model. Beide vormen lopen vanaf hetzelfde prepaid creditsaldo, zie de prijzenpagina.

Productie-eisInvulling bij HostYourAI
Snel eerste tokenWarm pool houdt populaire modellen geladen
Streaming antwoordenSSE-streaming via /v1/chat/completions
Beschikbaarheid99.9% uptime SLA
Inzicht per verzoekActiviteitenlog met model, tokens en verbruik
Passende hardwareVRAM-ondergrens bij elke deploy
KostencontrolePrepaid credits, per token of per uur
python
from openai import OpenAI
client = OpenAI(
    base_url="https://hostyourai.com/api/v1",
    api_key="hyai-...")
client.chat.completions.create(
    model="llama-3.3-70b",
    messages=[{"role":"user","content":"Hallo!"}])

Zo begin je

Maak een API-key aan en wijs de OpenAI SDK naar het EU-endpoint. Meer hoeft niet; hoe je bestaande code overzet lees je in de migratiegids.

from openai import OpenAI

client = OpenAI(
    base_url="https://hostyourai.com/api/v1",
    api_key="hyai-jouw-key",
)

stream = client.chat.completions.create(
    model="llama-3.3-70b",
    messages=[{"role": "user", "content": "Vat dit incidentrapport samen in drie punten: ..."}],
    stream=True,
)

for chunk in stream:
    print(chunk.choices[0].delta.content or "", end="")
je vraag
doc-4f2a0.94
doc-9c1e0.91
doc-2b770.88

Vragen over LLM-inference

Welke modellen kan ik draaien?

De catalogus telt ruim honderd open modellen, waaronder Llama, Qwen, Mistral, DeepSeek en Gemma. In het modeloverzicht zie je per model de status: warm, aan het opwarmen, serveerbaar of op aanvraag.

Wanneer kies ik de Router en wanneer een dedicated instance?

De Router past bij wisselend of laag volume: je betaalt per token en deelt de infrastructuur. Een dedicated instance past bij constante belasting, eigen fine-tunes of strikte isolatie-eisen: je betaalt per uur voor een GPU die alleen van jou is.

Is de API compatibel met mijn bestaande code?

Ja. Het endpoint spreekt het OpenAI-formaat op /v1/chat/completions, dus de officiële OpenAI SDK's werken na het aanpassen van de base URL. Er is ook een Anthropic-compatible /v1/messages shim voor tekstverkeer.

Hoe blijft een druk model responsief?

vLLM batcht gelijktijdige verzoeken efficiënt en de warm pool houdt veelgebruikte modellen geladen. Zo voorkom je koude starts op de momenten dat je verkeer piekt.

Wordt er getraind op mijn prompts?

Nee. Je prompts en completions worden niet gebruikt om modellen te trainen. Data staat met AES-256 versleuteld opgeslagen en gaat via TLS over de lijn.

Hoe werkt de betaling?

Alles loopt vanaf één prepaid creditsaldo dat je opwaardeert via iDEAL, creditcard of SEPA. Routerverkeer wordt per token afgerekend, dedicated instances per uur.

qwen3-8b vLLM ready
NVIDIA A100 · 40GB · EU marketplace · eu-central
VRAM19.2 / 40 GB
GPU utilisation71%
42 ms
time-to-first-token
128
tokens / sec
62°C
temperature
POST /api/v1/chat/completions200 OK

Alles wat je nodig hebt voor AI

Van model-hosting tot een klantgerichte API, gebouwd voor developers en bedrijven die hun AI op infrastructuur willen draaien die ze echt beheren, binnen de EU.

100%
EU-gehost

Je data en je modellen blijven op Europese GPUs. GDPR-vriendelijk vanaf de basis.

200+
Geverifieerde modellen, klaar om te serveren

Llama, Qwen, DeepSeek, Mistral, FLUX en nog veel meer. Kies er een en hij is binnen minuten warm, zonder DevOps aan jouw kant.

2 SDK
OpenAI- en Anthropic-compatibel

Richt je bestaande client op de Router en behoud je tools. Geen herschrijven, geen lock-in.

Van nul naar een warm endpoint in minuten

Geen infra om te beheren. Kies een model, krijg een OpenAI-compatibele URL, ship.

1

Kies een model

Kies uit de Model Garden of plak een willekeurig HuggingFace-ID. Stel de VRAM in en kies een EU-GPU.

2

Krijg je endpoint

Wij deployen vLLM, draaien readiness-probes en geven je een warme OpenAI- en Anthropic-compatibele URL plus een API-key.

3

Route en ship

Richt je client op de Router. Die routeert automatisch naar een warme instance, zet GPUs idle als niemand online is en logt elk verzoek.

Privé vanaf de basis

HostYourAI houdt je modellen, prompts en data op Europese GPUs. Gebouwd voor teams die geven om compliance, betrouwbaarheid en echte controle.

EU-gehostAVG-vriendelijkOpenAI-compatibelvLLMGeen lock-in
EU
Volledige datasoevereiniteit

GPU's en data binnen Europa. Je prompts verlaten de EU nooit.

Open
Modellen die je kunt auditen

Draai open-weight modellen zonder black boxes of verborgen telemetrie.

€0
Scale-to-zero

GPU's idlen als niemand online is, dus je betaalt alleen voor wat je draait.

Jouw
Geen vendor lock-in

Jouw infra, jouw keys, jouw modellen. Vertrek wanneer je wilt.

Werkt met de tools die je al gebruikt

De Router spreekt de OpenAI- en Anthropic-API, dus hij past direct in de clients en SDKs die je team al draait. Verander alleen de base-URL.

Probeer HostYourAI gratis
docker
anthropic
huggingface
langchain
python
nodedotjs
curl
ollama
jetbrains
jupyter
vercel
zapier
postman
n8n

Veelgestelde vragen

Kan ik dit in de EU draaien?

Ja. HostYourAI draait open modellen op GPU's in Europese datacenters via vLLM. Je prompts en outputs verlaten de EU niet en er zit geen Amerikaanse cloudprovider in de keten.

Is het AVG/GDPR-compliant?

Ja. Alle verwerking gebeurt binnen de EU, er is een verwerkersovereenkomst (DPA) beschikbaar en de subprocessor-lijst is openbaar. Open gewichten betekenen ook: geen training op jouw data.

Is de API compatibel met OpenAI?

Ja. Je richt je bestaande OpenAI- of Anthropic-client op onze Router (https://hostyourai.com/api/v1), alleen de base-URL en API-key wijzigen. Geen rewrite, geen lock-in.

Wat kost het?

Pay-as-you-go met één prepaid creditsaldo: de gedeelde router per token of een dedicated GPU per uur. Gratis te starten, geen minimum, geen vaste maandkosten.

Model garden

Werkt met 390+ open modellen

Tekst- en beeldmodellen op dedicated EU GPU's. Elk model getest op onze eigen hardware.

Ook interessant

Verken meer over EU-gehoste AI op HostYourAI.

Host. Route. Ship.

Geen creditcard nodig. Betaal naar gebruik, stop wanneer je wilt.

Begin vandaag gratis met hosten