Op deze pagina
Wat is de EU Inference Router?
In het kort: wij hosten open AI-modellen op Europese GPU's en bieden ze aan achter één API. Jouw bestaande code werkt, je betaalt per token en je data blijft in de EU.
De Router is een gedeelde, OpenAI-compatibele gateway voor inference. Je richt je bestaande client op één base-URL en de Router stuurt elk verzoek naar een open model dat op Europese GPUs draait. Je verandert alleen de base-URL en de API-key; je code blijft hetzelfde.
Omdat de Router zowel de OpenAI- als de Anthropic-API spreekt, werkt hij direct met de SDK's en tools die je team al gebruikt. Geen herschrijven, geen vendor lock-in.
Hoe werkt het?
Een verzoek komt binnen op de Router, wordt geauthenticeerd met je API-key en doorgestuurd naar een model dat al warm draait. Antwoorden worden gestreamd teruggegeven, net als bij OpenAI. Populaire modellen worden via een warm-pool warm gehouden zodat een eerste verzoek niet op een koude start hoeft te wachten.
Per verzoek leg je gebruik, latency en kosten vast in je activity-log, zodat je precies ziet wat er gebeurt.
Waarom via de Router?
- Drop-in OpenAI- en Anthropic-compatibel: alleen de base-URL wijzigt
- Open modellen op Europese GPU's, door ons beheerd: jij hoeft niets te draaien
- Je prompts en data verlaten de EU niet
- Pay-as-you-go per token, één prepaid creditsaldo
- Per-verzoek inzicht in gebruik, latency en kosten
Router of dedicated instance?
De Router is de snelste route naar productie: gedeelde capaciteit, betalen per token en niets te beheren. Wil je isolatie of voorspelbare performance, dan zet je er een dedicated GPU-instance naast. Beide werken via dezelfde base-URL en hetzelfde creditsaldo.
| Gedeelde Router | Dedicated instance | |
|---|---|---|
| Afrekenen | Per token | Per uur |
| Opstarttijd | Direct, populaire modellen zijn warm | Enkele minuten bij deploy |
| Isolatie | Gedeelde capaciteit | GPU alleen voor jou |
| Modellen | Gecureerde catalogus | Elk open model of eigen HuggingFace-ID |
| Beheer | Geen | Zelf starten, stoppen en schalen |
| Beste voor | Starten en wisselend verkeer | Vaste load of strenge compliance-eisen |
Zo begin je
Maak een API-key aan, zet de base-URL in je bestaande client en kies een model uit de Model Garden. Streaming werkt zoals je gewend bent:
from openai import OpenAI
client = OpenAI(
base_url="https://hostyourai.com/api/v1",
api_key="hyai-...",
)
resp = client.chat.completions.create(
model="llama-3.3-70b",
messages=[{"role": "user", "content": "Hallo"}],
stream=True,
)
for chunk in resp:
print(chunk.choices[0].delta.content or "", end="")
Volledig stappenplan nodig? Volg de gids OpenAI migreren naar de EU Router.
Autopilot: één model-id dat zelf kiest
Wie niet elke week de catalogus wil bijhouden, zet hyai/auto in het model-veld van het verzoek en is klaar met kiezen. Autopilot leest de taak in plaats van de modelnaam die je zou moeten kennen: hoe lang de prompt is, in welke taal hij staat, of er tools meegaan, hoeveel context er nodig is en wat voor soort werk er gevraagd wordt. Daar zoekt hij het passende model bij.
De voorkeur gaat naar een model dat al warm draait, want dat scheelt de wachttijd van een koude start. Welk model uiteindelijk antwoordde staat gewoon in het model-veld van het antwoord, precies zoals bij een expliciete keuze. Wil je zelf sturen, dan vul je een modelnaam in en verandert er niets.
curl https://hostyourai.com/api/v1/chat/completions \
-H "Authorization: Bearer hyai-..." \
-H "Content-Type: application/json" \
-d '{
"model": "hyai/auto",
"messages": [{"role": "user", "content": "Vat dit rapport samen"}]
}'
Wat Autopilot kost
Je betaalt het tokentarief van het model dat het antwoord gaf, zonder opslag voor de keuze. Kiest Autopilot een groot model, dan betaal je dat grote model; kiest hij een lichter model, dan betaal je dat lichtere. Nooit meer dan wanneer je datzelfde model zelf had ingevuld.
Of het gemiddeld goedkoper uitpakt dan zelf kiezen, meten we per verzoek: naast elk verzoek leggen we vast welk model Autopilot gekozen zou hebben. Dat cijfer publiceren we pas als er genoeg verzoeken onder liggen om er iets aan te hebben.
Ook het kiezen blijft in Europa
Wie kiest, leest je prompt. Een kiezer verwerkt je gegevens dus net zo goed als het model dat antwoordt, en precies daar kan een auto-optie ongemerkt de EU uit lopen. Bij ons gebeurt de keuze binnen dezelfde Europese keten als het antwoord zelf: je prompt verlaat de EU niet, ook niet voor de keuze.
Het keuzelog bewaart alleen kenmerken van het verzoek, zoals taal, lengte en of er tools meegingen, nooit de tekst zelf. Werk je met een sovereignty-sleutel, dan kiest Autopilot uitsluitend uit modellen die aan die eis voldoen; wat daar niet aan voldoet komt niet eens op de kandidatenlijst.
Wanneer wordt een eigen GPU goedkoper?
De gedeelde Router rekent per token af en zakt tussen je verzoeken door terug naar nul: stuur je niets, dan betaal je niets. Een dedicated GPU werkt andersom. Die rekent per minuut en staat altijd aan, ook 's nachts en in het weekend, maar dan is de machine ook helemaal van jou: geen wachtrij achter andermans verzoeken, voorspelbare latentie en al het GPU-geheugen voor jouw model.
Waar het omslagpunt ligt hangt af van je maandvolume. In de rekenmodule hieronder schuif je dat volume langs de schaal en zie je per modelklasse welke van de twee op dat moment goedkoper is.
Rekenmodule: wanneer wordt dedicated goedkoper?
Schuif je maandelijkse tokenvolume naar de plek waar jouw werklast zit en kies een modelklasse. De module rekent met de tarieven die hierboven op deze pagina staan, dus met de prijzen waarmee we werkelijk afrekenen.
Vragen over de EU Router
Is het echt drop-in met mijn OpenAI-code?
Ja. Je wijzigt alleen de base-URL en de API-key. Request- en responseformaat, streaming en parameters werken zoals bij OpenAI. Ook de Anthropic-SDK werkt, via de Anthropic-compatibele API.
Welke modellen kan ik aanroepen?
Open modellen zoals Llama, Qwen, Mistral, DeepSeek en Gemma. De actuele lijst met prijzen per miljoen tokens vind je in de modelcatalogus.
Moet ik wachten op een koude start?
Populaire modellen worden warm gehouden via een warm-pool. Is een model niet warm, dan zie je de opwarm-status live in de Model Garden.
Wat kost het?
Pay-as-you-go per token vanaf één prepaid creditsaldo, zonder abonnement of minimum. Tarieven per modelklasse staan op de prijzenpagina.
Waar draait mijn data?
Op GPUs in Europese datacenters. Je prompts en outputs verlaten de EU niet, er is een verwerkersovereenkomst beschikbaar en er wordt niet getraind op jouw data.
Zit ik vast aan HostYourAI?
Nee. Omdat de API OpenAI-compatibel is, wijzig je de base-URL en ben je weg. Geen vendor lock-in.