Model hosting

Open Source LLM Deployen

Van model selectie naar werkende API in 10 minuten. Deploy elk open source LLM zonder DevOps expertise.

qwen3-8b vLLM ready
NVIDIA A100 · 40GB · EU marketplace · eu-central
VRAM19.2 / 40 GB
GPU utilisation71%
42 ms
time-to-first-token
128
tokens / sec
62°C
temperature
POST /api/v1/chat/completions200 OK

Llama, Qwen, Mistral, DeepSeek, Gemma: open source taalmodellen zijn volwassen genoeg voor echte productietoepassingen. Wat teams meestal tegenhoudt is niet het model zelf, maar alles eromheen: een GPU regelen, drivers en dependencies op orde krijgen, een serving-laag opzetten en een API bouwen die je bestaande code begrijpt. HostYourAI haalt precies dat stuk weg. Je kiest een model, het platform regelt de rest.

Waar dat model draait is daarbij geen bijzaak. Zodra je prompts persoonsgegevens of bedrijfsinformatie bevatten, wil je kunnen uitleggen waar die verwerkt worden. Bij HostYourAI draait alles in Europese datacenters, bij een Nederlands bedrijf uit Groningen, met een verwerkersovereenkomst die je gewoon kunt tekenen.

Waarom open source LLM's deployen in de EU

Je prompts zijn productiedata

Een LLM-endpoint verwerkt al snel klantvragen, documenten en interne kennis. Onder de AVG blijf jij daarvoor verantwoordelijk, ook als de verwerking bij een leverancier gebeurt. Met verwerking binnen de EU, een DPA en een openbare subprocessor-lijst houd je die keten kort en uitlegbaar.

Open gewichten, geen lock-in

Bij open modellen zijn de gewichten publiek. Bevalt de leverancier niet, dan neem je hetzelfde model ergens anders mee naartoe. Je bouwt bovendien tegen een OpenAI-compatible API, dus ook je code blijft draagbaar. Dat is een wezenlijk verschil met gesloten API's, waar model en leverancier onlosmakelijk aan elkaar vastzitten.

Grip op kosten

Je betaalt vanaf een prepaid creditsaldo: per token op de gedeelde Router, per uur op een dedicated instance. Opwaarderen gaat via iDEAL, creditcard of SEPA, en er lopen geen verplichtingen door als je stopt. De details staan op de prijzenpagina.

One-click deployment
OpenAI-compatible API
4 EU datacenters
End-to-end encryptie
Dedicated GPU instances
Audit logging

Van modelkeuze naar endpoint

Deployen begint in het modeloverzicht: een catalogus met ruim 100 open modellen, inclusief de actuele status per model (warm, aan het opwarmen, serveerbaar of op aanvraag). Staat je model er niet tussen, dan plak je op een dedicated GPU-instance simpelweg een HuggingFace-ID. vLLM staat voorgeconfigureerd, en bij deploy wordt een VRAM-ondergrens afgedwongen zodat je nooit een GPU kiest die te klein is voor het model. Hoe dat er stap voor stap uitziet, lees je in de gids Eigen LLM deployen met vLLM.

StapWat jij doetWat het platform doet
1Model kiezen in de catalogus of een HuggingFace-ID plakkenControleert of het model serveerbaar is
2GPU selecterenDwingt de VRAM-ondergrens af voor dit model
3Deploy startenZet vLLM op met een eigen versleutelde API-key
4Testen in de PlaygroundServeert een OpenAI-compatible endpoint
5Live gaan met je applicatieSchaalt de instance naar idle bij geen gebruik
qwen3-8b vLLM ready
NVIDIA A100 · 40GB · EU marketplace · eu-central
VRAM19.2 / 40 GB
GPU utilisation71%
42 ms
time-to-first-token
128
tokens / sec
62°C
temperature
POST /api/v1/chat/completions200 OK

Zo begin je

Maak een API-key aan (die begint met hyai-) en wijs de OpenAI SDK naar het platform. Meer hoeft er aan je code niet te veranderen.

from openai import OpenAI

client = OpenAI(
    base_url="https://hostyourai.com/api/v1",
    api_key="hyai-jouw-key"
)

antwoord = client.chat.completions.create(
    model="llama-3.3-70b",
    messages=[{"role": "user", "content": "Vat de belangrijkste risico's in dit huurcontract samen."}]
)
print(antwoord.choices[0].message.content)
python
from openai import OpenAI
client = OpenAI(
    base_url="https://hostyourai.com/api/v1",
    api_key="hyai-...")
client.chat.completions.create(
    model="llama-3.3-70b",
    messages=[{"role":"user","content":"Hallo!"}])

Vragen over open source LLM's deployen

Welke modellen kan ik deployen?

De catalogus bevat ruim 100 open modellen, waaronder de families Llama, Qwen, Mistral, DeepSeek en Gemma. Op een dedicated instance kun je daarnaast elk door vLLM serveerbaar model van HuggingFace deployen via het model-ID.

Moet ik zelf vLLM installeren of configureren?

Nee. vLLM staat voorgeconfigureerd op elke dedicated instance en draait met een eigen versleutelde API-key. Je krijgt direct een werkend OpenAI-compatible endpoint terug.

Wat gebeurt er als ik een te kleine GPU kies?

Dat kan niet gebeuren: bij deploy wordt een VRAM-ondergrens afgedwongen op basis van het gekozen model. Een GPU die het model niet aankan, kun je niet selecteren.

Kan ik eerst testen zonder code te schrijven?

Ja. In de Playground in de app chat je direct met elk model, ook met je eigen deploy. Zo vergelijk je modellen op jouw eigen prompts voordat je iets integreert.

Blijft mijn instance draaien als ik hem niet gebruik?

Dedicated instances schalen naar idle wanneer er geen verkeer is. Voor laag of grillig volume is de gedeelde Router vaak logischer: daar betaal je per token en worden populaire modellen warm gehouden.

Wat kost het deployen van een open model?

Je betaalt pay-as-you-go vanaf één prepaid creditsaldo: per token op de Router, per uur voor een dedicated instance. De actuele tarieven staan op de prijzenpagina.

je vraag
doc-4f2a0.94
doc-9c1e0.91
doc-2b770.88

Alles wat je nodig hebt voor AI

Van model-hosting tot een klantgerichte API, gebouwd voor developers en bedrijven die hun AI op infrastructuur willen draaien die ze echt beheren, binnen de EU.

100%
EU-gehost

Je data en je modellen blijven op Europese GPUs. GDPR-vriendelijk vanaf de basis.

200+
Geverifieerde modellen, klaar om te serveren

Llama, Qwen, DeepSeek, Mistral, FLUX en nog veel meer. Kies er een en hij is binnen minuten warm, zonder DevOps aan jouw kant.

2 SDK
OpenAI- en Anthropic-compatibel

Richt je bestaande client op de Router en behoud je tools. Geen herschrijven, geen lock-in.

Van nul naar een warm endpoint in minuten

Geen infra om te beheren. Kies een model, krijg een OpenAI-compatibele URL, ship.

1

Kies een model

Kies uit de Model Garden of plak een willekeurig HuggingFace-ID. Stel de VRAM in en kies een EU-GPU.

2

Krijg je endpoint

Wij deployen vLLM, draaien readiness-probes en geven je een warme OpenAI- en Anthropic-compatibele URL plus een API-key.

3

Route en ship

Richt je client op de Router. Die routeert automatisch naar een warme instance, zet GPUs idle als niemand online is en logt elk verzoek.

Gebouwd voor teams die data niet mogen wegsturen

Als een Amerikaanse cloud geen optie is, geeft HostYourAI je dezelfde developer-ervaring op Europese infrastructuur.

Overheid & publieke sector

Burgerdata die wettelijk in de EU moet blijven, volledig auditeerbaar.

Gereguleerde enterprise

Finance-, zorg- en juridische teams onder GDPR, DORA en de AI Act.

EU SaaS & scale-ups

Lever AI-functies waar je klanten op vertrouwen, zonder Amerikaanse sub-processor.

Agencies & integrators

Lever privé-AI voor klanten op infrastructuur waar je achter kunt staan.

Privé vanaf de basis

HostYourAI houdt je modellen, prompts en data op Europese GPUs. Gebouwd voor teams die geven om compliance, betrouwbaarheid en echte controle.

EU-gehostAVG-vriendelijkOpenAI-compatibelvLLMGeen lock-in
EU
Volledige datasoevereiniteit

GPU's en data binnen Europa. Je prompts verlaten de EU nooit.

Open
Modellen die je kunt auditen

Draai open-weight modellen zonder black boxes of verborgen telemetrie.

€0
Scale-to-zero

GPU's idlen als niemand online is, dus je betaalt alleen voor wat je draait.

Jouw
Geen vendor lock-in

Jouw infra, jouw keys, jouw modellen. Vertrek wanneer je wilt.

Veelgestelde vragen

Kan ik dit in de EU draaien?

Ja. HostYourAI draait open modellen op GPU's in Europese datacenters via vLLM. Je prompts en outputs verlaten de EU niet en er zit geen Amerikaanse cloudprovider in de keten.

Is het AVG/GDPR-compliant?

Ja. Alle verwerking gebeurt binnen de EU, er is een verwerkersovereenkomst (DPA) beschikbaar en de subprocessor-lijst is openbaar. Open gewichten betekenen ook: geen training op jouw data.

Is de API compatibel met OpenAI?

Ja. Je richt je bestaande OpenAI- of Anthropic-client op onze Router (https://hostyourai.com/api/v1), alleen de base-URL en API-key wijzigen. Geen rewrite, geen lock-in.

Wat kost het?

Pay-as-you-go met één prepaid creditsaldo: de gedeelde router per token of een dedicated GPU per uur. Gratis te starten, geen minimum, geen vaste maandkosten.

Model garden

Werkt met 390+ open modellen

Tekst- en beeldmodellen op dedicated EU GPU's. Elk model getest op onze eigen hardware.

Ook interessant

Verken meer over EU-gehoste AI op HostYourAI.

Host. Route. Ship.

Geen creditcard nodig. Betaal naar gebruik, stop wanneer je wilt.

Begin vandaag gratis met hosten