EU Router

EU Inference Router

Eén base-URL voor elk open model, draaiend op Europese GPU's die wij voor je beheren.

Op deze pagina

Wat is de EU Inference Router?

In het kort: wij hosten open AI-modellen op Europese GPU's en bieden ze aan achter één API. Jouw bestaande code werkt, je betaalt per token en je data blijft in de EU.

De Router is een gedeelde, OpenAI-compatibele gateway voor inference. Je richt je bestaande client op één base-URL en de Router stuurt elk verzoek naar een open model dat op Europese GPUs draait. Je verandert alleen de base-URL en de API-key; je code blijft hetzelfde.

Omdat de Router zowel de OpenAI- als de Anthropic-API spreekt, werkt hij direct met de SDK's en tools die je team al gebruikt. Geen herschrijven, geen vendor lock-in.

Hoe werkt het?

Een verzoek komt binnen op de Router, wordt geauthenticeerd met je API-key en doorgestuurd naar een model dat al warm draait. Antwoorden worden gestreamd teruggegeven, net als bij OpenAI. Populaire modellen worden via een warm-pool warm gehouden zodat een eerste verzoek niet op een koude start hoeft te wachten.

Per verzoek leg je gebruik, latency en kosten vast in je activity-log, zodat je precies ziet wat er gebeurt.

Je app
OpenAI · Anthropic
EU Router
één base URL
Qwen3-8B
warm
Loes (NL)
soeverein
Llama-3.3
warm

Waarom via de Router?

  • Drop-in OpenAI- en Anthropic-compatibel: alleen de base-URL wijzigt
  • Open modellen op Europese GPU's, door ons beheerd: jij hoeft niets te draaien
  • Je prompts en data verlaten de EU niet
  • Pay-as-you-go per token, één prepaid creditsaldo
  • Per-verzoek inzicht in gebruik, latency en kosten

Router of dedicated instance?

De Router is de snelste route naar productie: gedeelde capaciteit, betalen per token en niets te beheren. Wil je isolatie of voorspelbare performance, dan zet je er een dedicated GPU-instance naast. Beide werken via dezelfde base-URL en hetzelfde creditsaldo.

Gedeelde RouterDedicated instance
AfrekenenPer tokenPer uur
OpstarttijdDirect, populaire modellen zijn warmEnkele minuten bij deploy
IsolatieGedeelde capaciteitGPU alleen voor jou
ModellenGecureerde catalogusElk open model of eigen HuggingFace-ID
BeheerGeenZelf starten, stoppen en schalen
Beste voorStarten en wisselend verkeerVaste load of strenge compliance-eisen

Zo begin je

Maak een API-key aan, zet de base-URL in je bestaande client en kies een model uit de Model Garden. Streaming werkt zoals je gewend bent:

from openai import OpenAI

client = OpenAI(
    base_url="https://hostyourai.com/api/v1",
    api_key="hyai-...",
)

resp = client.chat.completions.create(
    model="llama-3.3-70b",
    messages=[{"role": "user", "content": "Hallo"}],
    stream=True,
)
for chunk in resp:
    print(chunk.choices[0].delta.content or "", end="")

Volledig stappenplan nodig? Volg de gids OpenAI migreren naar de EU Router.

Autopilot: één model-id dat zelf kiest

Wie niet elke week de catalogus wil bijhouden, zet hyai/auto in het model-veld van het verzoek en is klaar met kiezen. Autopilot leest de taak in plaats van de modelnaam die je zou moeten kennen: hoe lang de prompt is, in welke taal hij staat, of er tools meegaan, hoeveel context er nodig is en wat voor soort werk er gevraagd wordt. Daar zoekt hij het passende model bij.

De voorkeur gaat naar een model dat al warm draait, want dat scheelt de wachttijd van een koude start. Welk model uiteindelijk antwoordde staat gewoon in het model-veld van het antwoord, precies zoals bij een expliciete keuze. Wil je zelf sturen, dan vul je een modelnaam in en verandert er niets.

curl https://hostyourai.com/api/v1/chat/completions \
  -H "Authorization: Bearer hyai-..." \
  -H "Content-Type: application/json" \
  -d '{
    "model": "hyai/auto",
    "messages": [{"role": "user", "content": "Vat dit rapport samen"}]
  }'

Wat Autopilot kost

Je betaalt het tokentarief van het model dat het antwoord gaf, zonder opslag voor de keuze. Kiest Autopilot een groot model, dan betaal je dat grote model; kiest hij een lichter model, dan betaal je dat lichtere. Nooit meer dan wanneer je datzelfde model zelf had ingevuld.

Of het gemiddeld goedkoper uitpakt dan zelf kiezen, meten we per verzoek: naast elk verzoek leggen we vast welk model Autopilot gekozen zou hebben. Dat cijfer publiceren we pas als er genoeg verzoeken onder liggen om er iets aan te hebben.

Ook het kiezen blijft in Europa

Wie kiest, leest je prompt. Een kiezer verwerkt je gegevens dus net zo goed als het model dat antwoordt, en precies daar kan een auto-optie ongemerkt de EU uit lopen. Bij ons gebeurt de keuze binnen dezelfde Europese keten als het antwoord zelf: je prompt verlaat de EU niet, ook niet voor de keuze.

Het keuzelog bewaart alleen kenmerken van het verzoek, zoals taal, lengte en of er tools meegingen, nooit de tekst zelf. Werk je met een sovereignty-sleutel, dan kiest Autopilot uitsluitend uit modellen die aan die eis voldoen; wat daar niet aan voldoet komt niet eens op de kandidatenlijst.

Wanneer wordt een eigen GPU goedkoper?

De gedeelde Router rekent per token af en zakt tussen je verzoeken door terug naar nul: stuur je niets, dan betaal je niets. Een dedicated GPU werkt andersom. Die rekent per minuut en staat altijd aan, ook 's nachts en in het weekend, maar dan is de machine ook helemaal van jou: geen wachtrij achter andermans verzoeken, voorspelbare latentie en al het GPU-geheugen voor jouw model.

Waar het omslagpunt ligt hangt af van je maandvolume. In de rekenmodule hieronder schuif je dat volume langs de schaal en zie je per modelklasse welke van de twee op dat moment goedkoper is.

Rekenmodule: wanneer wordt dedicated goedkoper?

Schuif je maandelijkse tokenvolume naar de plek waar jouw werklast zit en kies een modelklasse. De module rekent met de tarieven die hierboven op deze pagina staan, dus met de prijzen waarmee we werkelijk afrekenen.

1,0 miljard tokens per maand
Gedeelde Router goedkoopst
€ 243 per maand
€ 0,17 invoer en € 0,40 uitvoer per miljoen tokens
Dedicated GPU goedkoopst
€ 2.613 per maand
1x A100 / H100 (80 GB), € 3,58 per uur, 730 uur per maand
Vanaf ongeveer 10,8 miljard tokens per maand is een dedicated GPU goedkoper dan de gedeelde Router voor Mistral Small 3.2 24B.
Bij 1,0 miljard tokens per maand betaal je het minst via de gedeelde Router: € 243 tegen € 2.613 voor een eigen GPU. Dat scheelt € 2.370 per maand.
Gerekend met 70 procent invoertokens en 30 procent uitvoertokens, een gangbare verhouding voor chat- en agentverkeer. Zit jouw werklast anders in elkaar, dan schuift het omslagpunt mee.
Dedicated staat altijd aan. Je betaalt de machine per minuut zolang hij draait, ook in het weekend en 's nachts. De gedeelde Router rekent alleen af wat je werkelijk verstuurt en zakt tussendoor terug naar nul.
Dit vergelijkt prijzen, geen capaciteit. Of één machine jouw volume ook werkelijk verwerkt hangt af van je verkeer: gelijktijdigheid, promptlengte en pieken. Bij grote volumes rekenen we dat met je door, zodat je weet hoeveel machines je nodig hebt. /contact
Dedicated geeft je de hele machine. Geen wachtrij achter andere klanten, een voorspelbare latentie en al het GPU-geheugen voor jouw model. Ook bij een gelijk bedrag kan dat de doorslag geven.
Uurprijzen komen uit dezelfde staffel als de tabel hierboven, die dagelijks opnieuw wordt ingelezen bij onze EU-providers. Tokenprijzen komen uit de catalogus waaruit je verbruik wordt afgerekend. Een maand telt hier 730 uur, het jaargemiddelde. Bedragen zijn exclusief btw.

Vragen over de EU Router

Is het echt drop-in met mijn OpenAI-code?

Ja. Je wijzigt alleen de base-URL en de API-key. Request- en responseformaat, streaming en parameters werken zoals bij OpenAI. Ook de Anthropic-SDK werkt, via de Anthropic-compatibele API.

Welke modellen kan ik aanroepen?

Open modellen zoals Llama, Qwen, Mistral, DeepSeek en Gemma. De actuele lijst met prijzen per miljoen tokens vind je in de modelcatalogus.

Moet ik wachten op een koude start?

Populaire modellen worden warm gehouden via een warm-pool. Is een model niet warm, dan zie je de opwarm-status live in de Model Garden.

Wat kost het?

Pay-as-you-go per token vanaf één prepaid creditsaldo, zonder abonnement of minimum. Tarieven per modelklasse staan op de prijzenpagina.

Waar draait mijn data?

Op GPUs in Europese datacenters. Je prompts en outputs verlaten de EU niet, er is een verwerkersovereenkomst beschikbaar en er wordt niet getraind op jouw data.

Zit ik vast aan HostYourAI?

Nee. Omdat de API OpenAI-compatibel is, wijzig je de base-URL en ben je weg. Geen vendor lock-in.

Alles wat je nodig hebt voor AI

Van model-hosting tot een klantgerichte API, gebouwd voor developers en bedrijven die hun AI op infrastructuur willen draaien die ze echt beheren, binnen de EU.

100%
EU-gehost

Je data en je modellen blijven op Europese GPUs. GDPR-vriendelijk vanaf de basis.

200+
Geverifieerde modellen, klaar om te serveren

Llama, Qwen, DeepSeek, Mistral, FLUX en nog veel meer. Kies er een en hij is binnen minuten warm, zonder DevOps aan jouw kant.

2 SDK
OpenAI- en Anthropic-compatibel

Richt je bestaande client op de Router en behoud je tools. Geen herschrijven, geen lock-in.

Van nul naar een warm endpoint in minuten

Geen infra om te beheren. Kies een model, krijg een OpenAI-compatibele URL, ship.

1

Kies een model

Kies uit de Model Garden of plak een willekeurig HuggingFace-ID. Stel de VRAM in en kies een EU-GPU.

2

Krijg je endpoint

Wij deployen vLLM, draaien readiness-probes en geven je een warme OpenAI- en Anthropic-compatibele URL plus een API-key.

3

Route en ship

Richt je client op de Router. Die routeert automatisch naar een warme instance, zet GPUs idle als niemand online is en logt elk verzoek.

Gebouwd voor teams die data niet mogen wegsturen

Als een Amerikaanse cloud geen optie is, geeft HostYourAI je dezelfde developer-ervaring op Europese infrastructuur.

Overheid & publieke sector

Burgerdata die wettelijk in de EU moet blijven, volledig auditeerbaar.

Gereguleerde enterprise

Finance-, zorg- en juridische teams onder GDPR, DORA en de AI Act.

EU SaaS & scale-ups

Lever AI-functies waar je klanten op vertrouwen, zonder Amerikaanse sub-processor.

Agencies & integrators

Lever privé-AI voor klanten op infrastructuur waar je achter kunt staan.

Privé vanaf de basis

HostYourAI houdt je modellen, prompts en data op Europese GPUs. Gebouwd voor teams die geven om compliance, betrouwbaarheid en echte controle.

EU-gehostAVG-vriendelijkOpenAI-compatibelvLLMGeen lock-in
EU
Volledige datasoevereiniteit

GPU's en data binnen Europa. Je prompts verlaten de EU nooit.

Open
Modellen die je kunt auditen

Draai open-weight modellen zonder black boxes of verborgen telemetrie.

€0
Scale-to-zero

GPU's idlen als niemand online is, dus je betaalt alleen voor wat je draait.

Jouw
Geen vendor lock-in

Jouw infra, jouw keys, jouw modellen. Vertrek wanneer je wilt.

Model garden

Werkt met 390+ open modellen

Tekst- en beeldmodellen op dedicated EU GPU's. Elk model getest op onze eigen hardware.

Ook interessant

Verken meer over EU-gehoste AI op HostYourAI.

Host. Route. Ship.

Geen creditcard nodig. Betaal naar gebruik, stop wanneer je wilt.

Begin vandaag gratis met hosten