Op deze pagina
Router of dedicated instance?
De gedeelde Router is perfect om snel te starten en per token af te rekenen. Kies een dedicated instance wanneer je isolatie, voorspelbare latency of een specifiek model op eigen hardware wilt. Bij een dedicated instance draait vLLM op één Europese GPU die exclusief voor jou is.
Stap 1, Kies je model
Selecteer een model uit de Model Garden of plak een HuggingFace-ID, bijvoorbeeld Qwen/Qwen3-8B. Elk model heeft een VRAM-behoefte; de deploy-stap schat de minimale VRAM en voorkomt dat je een te kleine GPU kiest. Gated modellen (zoals sommige Llama-varianten) vragen wij centraal aan, zodat jij geen losse licenties hoeft te regelen.
Stap 2, Configureer de GPU
- Kies de VRAM en een Europese GPU-regio
- Wij regelen de capaciteit via Europese GPU-marketplaces
- Wij genereren automatisch een vLLM-setupscript en starten de deploy
Stap 3, Wat er achter de schermen gebeurt
De GPU haalt het setupscript op via een ondertekende token en start vLLM met een eigen API-key (versleuteld opgeslagen), zodat je endpoint beveiligd is. We draaien readiness-probes op /health; zodra vLLM klaar is, belt de instance terug en springt de status op "warm". Je krijgt een OpenAI- én Anthropic-compatibele URL plus een API-key.
Stap 4, Stuur je eerste verzoek
Je spreekt de instance aan via de Router met de model-slug, of rechtstreeks op het instance-endpoint:
curl https://hostyourai.com/api/instances/<instance-id>/chat/completions \
-H "Authorization: Bearer hyai-..." \
-H "Content-Type: application/json" \
-d '{"messages":[{"role":"user","content":"Hallo"}]}'
Omdat de instance OpenAI-compatibel is, werkt ook hier gewoon de OpenAI-SDK: zet de base-URL op de Router en kies je model-slug.
Kosten en beheer
Een dedicated instance rekent per uur af, maar idle't wanneer niemand online is: je betaalt niet voor ongebruikte tijd en de instance warmt vanzelf weer op bij het eerste verzoek. In je dashboard zie je de status, het gebruik en de logs. Wil je context uit je eigen documenten toevoegen, koppel dan een kennisbank aan de instance, zie de RAG-gids.
Richtwaarden voor VRAM per modelgrootte
Hoeveel VRAM je nodig hebt hangt af van het aantal parameters, de kwantisatie en de contextlengte. De tabel hieronder geeft praktische richtwaarden; de deploy-stap controleert de ondergrens automatisch, zodat je nooit een te kleine GPU kunt kiezen. Het actuele modelaanbod vind je in de Model Garden.
| Modelgrootte | Voorbeelden | Richtwaarde VRAM |
|---|---|---|
| 1 tot 4B | Llama 3.2 3B, Qwen kleine varianten, Gemma 4B | 8 tot 12 GB |
| 7 tot 9B | Qwen3-8B, Llama 3.1 8B, Mistral 7B | 16 tot 24 GB |
| 12 tot 14B | Gemma 12B, Qwen 14B | 24 tot 40 GB |
| 30 tot 34B | Qwen 32B, DeepSeek distill-varianten | 48 tot 80 GB |
| 70B en groter | Llama 3.3 70B | 80 GB of meer |
Problemen oplossen
Mijn deploy blijft lang op "warming" staan
Bij grote modellen moet de GPU eerst tientallen gigabytes aan weights downloaden en inladen; dat kan even duren. De instance meldt zich vanzelf zodra de readiness-check op /health slaagt. Blijft de status uren hangen, bekijk dan de logs in je dashboard.
De deploy weigert mijn GPU-keuze
Dan is de VRAM te klein voor het gekozen model. We schatten vooraf de minimale VRAM en blokkeren ondermaatse GPU's, omdat vLLM anders crasht tijdens het laden. Kies een GPU met meer geheugen of een kleiner model.
Ik krijg 401 op mijn instance-endpoint
Elke instance draait vLLM met een eigen, versleuteld opgeslagen API-key. Ga je via de Router, gebruik dan je hyai--key; die moet volledig en zonder spaties in de Authorization-header staan.
Mijn verzoeken geven 404
Controleer het endpoint: via de Router is de base-URL https://hostyourai.com/api/v1 met je model-slug, rechtstreeks gebruik je het instance-pad /api/instances/<instance-id>/chat/completions.
Vragen over deze gids
Hoe lang duurt een deploy?
Meestal enkele minuten. Grote modellen duren langer omdat de weights gedownload en ingeladen moeten worden. Je ziet de status live in je dashboard en in de Model Garden.
Betaal ik door als niemand het model gebruikt?
Nee. Een dedicated instance idle't bij inactiviteit en warmt weer op bij het eerste verzoek. Je rekent per uur af, pay-as-you-go; zie de prijzenpagina.
Welke modellen kan ik deployen?
Elk open model met een HuggingFace-ID, waaronder Llama, Qwen, Mistral, DeepSeek en Gemma. Meer over eigen hardware lees je op de pagina over dedicated GPU-instances.
Kan ik een kennisbank aan mijn instance koppelen?
Ja. Koppel een kennisbank en elke chat-aanroep krijgt automatisch context uit je eigen documenten, met bronvermelding bij niet-streamende antwoorden.
Wanneer is de gedeelde Router slimmer dan een eigen instance?
Bij wisselend of laag verkeer. Je betaalt dan per token en beheert niets; lees meer over de EU Inference Router.