Model hosting

Self-Hosted LLM Platform

De voordelen van self-hosting zonder de complexiteit. Managed LLM infrastructure op Europese hardware.

qwen3-8b vLLM ready
NVIDIA A100 · 40GB · EU marketplace · eu-central
VRAM19.2 / 40 GB
GPU utilisation71%
42 ms
time-to-first-token
128
tokens / sec
62°C
temperature
POST /api/v1/chat/completions200 OK

Zelf een LLM hosten klinkt aantrekkelijk tot je aan de onderkant van de stack komt: GPU's regelen, drivers en CUDA-versies bijhouden, vLLM patchen, uitval opvangen. Een self-hosted LLM platform geeft je de zeggenschap van zelf hosten zonder dat je die onderkant zelf hoeft te dragen. Jij bepaalt welk model draait, HostYourAI draait de GPU-laag.

Concreet: je deployt elk open model, desnoods via een eigen HuggingFace-ID, op een dedicated GPU-instance in Europese datacenters. Het endpoint is OpenAI-compatible, dus je applicatiecode merkt niet dat je bent gaan self-hosten. Alleen je compliance-dossier merkt het, in positieve zin.

Waarom een self-hosted LLM platform in de EU

Eigen regie zonder eigen serverruimte

Digitale soevereiniteit gaat over kunnen kiezen: welk model, welke versie, wanneer je migreert. Op een gesloten Amerikaanse API kies je niets van dat alles. Op een Europees platform met open modellen hou je de regie, terwijl iemand anders de hardware warm houdt.

Open modellen voorkomen lock-in

De gewichten van Llama, Qwen of Mistral zijn openbaar. Bevalt het platform niet meer, dan neem je hetzelfde model ergens anders mee naartoe. Dat is een wezenlijk andere onderhandelingspositie dan bij een propriëtair model dat alleen bij één leverancier bestaat.

Aantoonbaarheid richting klanten en toezichthouders

Met een vaste modelversie op je eigen instance kun je precies documenteren welk systeem welke output gaf. Dat helpt bij AVG-verantwoording en bij je voorbereiding op de EU AI Act, waar je moet kunnen uitleggen hoe je AI-systeem in elkaar zit.

EU Inference Router

‹ Insight 1 of 28 ›
98.7% ↗ 12%
4,931 of 5,000 requests served warm
EU-hostedModels run on European GPUs
Drop-inOpenAI and Anthropic compatible
Scale to zeroGPUs idle when nobody is online

Wat jij beheert en wat HostYourAI beheert

De scheidslijn is simpel: alles boven de API is van jou, alles onder de API is van ons. Jij kiest het model in het modeloverzicht of via een HuggingFace-ID, schrijft je prompts en applicatielogica, en koppelt eventueel een kennisbank voor RAG. HostYourAI zorgt voor de GPU's, de vLLM-runtime, het automatisch schalen naar idle en de beveiliging van de keten. Hoe zo'n deploy er stap voor stap uitziet, staat in de gids Eigen LLM deployen met vLLM.

TaakWie beheert het
Modelkeuze en modelversieJij
Prompts, evaluatie en applicatielogicaJij
Kennisbank koppelen voor RAG-contextJij, het platform injecteert de context
GPU's, drivers en vLLM-runtimeHostYourAI
Schalen naar idle en VRAM-ondergrens bij deployHostYourAI
Encryptie at rest (AES-256) en TLSHostYourAI
python
from openai import OpenAI
client = OpenAI(
    base_url="https://hostyourai.com/api/v1",
    api_key="hyai-...")
client.chat.completions.create(
    model="llama-3.3-70b",
    messages=[{"role":"user","content":"Hallo!"}])

Zo begin je

Na de deploy praat je instance gewoon OpenAI-compatible, dus je test hem met een paar regels Python.

from openai import OpenAI

client = OpenAI(
    base_url="https://hostyourai.com/api/v1",
    api_key="hyai-jouw-key"
)

resp = client.chat.completions.create(
    model="qwen3-8b",
    messages=[{"role": "user", "content": "Leg in twee zinnen uit wat retrieval augmented generation is, voor een niet-technische collega."}]
)
print(resp.choices[0].message.content)
One-click deployment
OpenAI-compatible API
4 EU datacenters
End-to-end encryptie
Dedicated GPU instances
Audit logging

Vragen over een self-hosted LLM platform

Kan ik elk HuggingFace-model deployen?

Je kunt elk open model deployen dat vLLM kan serveren, door het HuggingFace-ID op te geven bij het aanmaken van een instance via dedicated GPU-instances.

Moet ik zelf iets van servers of drivers weten?

Nee. De GPU-laag, drivers en vLLM-runtime worden voor je beheerd. Jij werkt op API-niveau, met dezelfde interface als je van OpenAI gewend bent.

Wat als ik een GPU kies die te klein is voor mijn model?

Dat kan niet gebeuren: bij deploy wordt een VRAM-ondergrens afgedwongen, zodat je instance altijd genoeg geheugen heeft voor het gekozen model.

Kan ik mijn eigen documenten laten meewegen in antwoorden?

Ja, je koppelt een kennisbank aan je instance en relevante context wordt automatisch in chat completions geïnjecteerd. Niet-streaming responses geven bronvermeldingen terug. Zie de gids RAG bouwen op EU-GPUs.

Hoe makkelijk stap ik later weer over?

Open modellen zijn overdraagbaar: dezelfde gewichten draaien ook elders. Je prompts en code zijn OpenAI-compatible, dus er is geen technische lock-in.

Wat betaal ik voor dit platform?

Instances rekenen per uur af vanaf een prepaid creditsaldo, pay-as-you-go. De details staan op de prijzenpagina.

je vraag
doc-4f2a0.94
doc-9c1e0.91
doc-2b770.88

Alles wat je nodig hebt voor AI

Van model-hosting tot een klantgerichte API, gebouwd voor developers en bedrijven die hun AI op infrastructuur willen draaien die ze echt beheren, binnen de EU.

100%
EU-gehost

Je data en je modellen blijven op Europese GPUs. GDPR-vriendelijk vanaf de basis.

200+
Geverifieerde modellen, klaar om te serveren

Llama, Qwen, DeepSeek, Mistral, FLUX en nog veel meer. Kies er een en hij is binnen minuten warm, zonder DevOps aan jouw kant.

2 SDK
OpenAI- en Anthropic-compatibel

Richt je bestaande client op de Router en behoud je tools. Geen herschrijven, geen lock-in.

Van nul naar een warm endpoint in minuten

Geen infra om te beheren. Kies een model, krijg een OpenAI-compatibele URL, ship.

1

Kies een model

Kies uit de Model Garden of plak een willekeurig HuggingFace-ID. Stel de VRAM in en kies een EU-GPU.

2

Krijg je endpoint

Wij deployen vLLM, draaien readiness-probes en geven je een warme OpenAI- en Anthropic-compatibele URL plus een API-key.

3

Route en ship

Richt je client op de Router. Die routeert automatisch naar een warme instance, zet GPUs idle als niemand online is en logt elk verzoek.

Gebouwd voor teams die data niet mogen wegsturen

Als een Amerikaanse cloud geen optie is, geeft HostYourAI je dezelfde developer-ervaring op Europese infrastructuur.

Overheid & publieke sector

Burgerdata die wettelijk in de EU moet blijven, volledig auditeerbaar.

Gereguleerde enterprise

Finance-, zorg- en juridische teams onder GDPR, DORA en de AI Act.

EU SaaS & scale-ups

Lever AI-functies waar je klanten op vertrouwen, zonder Amerikaanse sub-processor.

Agencies & integrators

Lever privé-AI voor klanten op infrastructuur waar je achter kunt staan.

Privé vanaf de basis

HostYourAI houdt je modellen, prompts en data op Europese GPUs. Gebouwd voor teams die geven om compliance, betrouwbaarheid en echte controle.

EU-gehostAVG-vriendelijkOpenAI-compatibelvLLMGeen lock-in
EU
Volledige datasoevereiniteit

GPU's en data binnen Europa. Je prompts verlaten de EU nooit.

Open
Modellen die je kunt auditen

Draai open-weight modellen zonder black boxes of verborgen telemetrie.

€0
Scale-to-zero

GPU's idlen als niemand online is, dus je betaalt alleen voor wat je draait.

Jouw
Geen vendor lock-in

Jouw infra, jouw keys, jouw modellen. Vertrek wanneer je wilt.

Veelgestelde vragen

Kan ik dit in de EU draaien?

Ja. HostYourAI draait open modellen op GPU's in Europese datacenters via vLLM. Je prompts en outputs verlaten de EU niet en er zit geen Amerikaanse cloudprovider in de keten.

Is het AVG/GDPR-compliant?

Ja. Alle verwerking gebeurt binnen de EU, er is een verwerkersovereenkomst (DPA) beschikbaar en de subprocessor-lijst is openbaar. Open gewichten betekenen ook: geen training op jouw data.

Is de API compatibel met OpenAI?

Ja. Je richt je bestaande OpenAI- of Anthropic-client op onze Router (https://hostyourai.com/api/v1), alleen de base-URL en API-key wijzigen. Geen rewrite, geen lock-in.

Wat kost het?

Pay-as-you-go met één prepaid creditsaldo: de gedeelde router per token of een dedicated GPU per uur. Gratis te starten, geen minimum, geen vaste maandkosten.

Model garden

Werkt met 390+ open modellen

Tekst- en beeldmodellen op dedicated EU GPU's. Elk model getest op onze eigen hardware.

Ook interessant

Verken meer over EU-gehoste AI op HostYourAI.

Host. Route. Ship.

Geen creditcard nodig. Betaal naar gebruik, stop wanneer je wilt.

Begin vandaag gratis met hosten