Gids

RAG bouwen op EU-GPUs

Koppel je kennisbank aan de Router en geef je modellen context uit je eigen documenten.

Op deze pagina

Wat RAG voor je doet

Met Retrieval Augmented Generation (RAG) baseer je antwoorden op je eigen documenten in plaats van alleen op de trainingskennis van het model. HostYourAI levert de open modellen en de EU-GPU-infrastructuur; jij bepaalt welke kennis erin gaat. Documenten, prompts en antwoorden blijven end-to-end binnen Europa.

Stap 1, Maak een kennisbank

Upload documenten (PDF, TXT, CSV, MD of DOCX) of laat een URL of sitemap crawlen. Je content wordt in stukken van ongeveer 1000 tekens geknipt met 100 tekens overlap, netjes op zinsgrens. Elk stuk krijgt een embedding (384-dimensionaal). Kleine bestanden (< 50MB) worden volledig vooraf geëmbed voor snelle retrieval; grote bestanden gebruiken een hybride modus met FULLTEXT plus embedding op aanvraag.

je vraag
doc-4f2a0.94
doc-9c1e0.91
doc-2b770.88

Stap 2, Koppel de kennisbank

Er zijn drie manieren om een kennisbank aan je chatverzoeken te koppelen:

  • Aan een instance koppelen (aanbevolen): POST /api/kb/{kbId}/link/{instanceId}. Alle chatverzoeken naar die instance krijgen daarna automatisch context, ook via een externe hyai--key.
  • Aan een agent koppelen: zet knowledge_base_id op de agent; de publieke chat gebruikt hem automatisch.
  • Expliciet per verzoek: geef knowledge_base_id mee in de body van je chat-completion.

Stap 3, Vraag met context

curl https://hostyourai.com/api/v1/chat/completions \
  -H "Authorization: Bearer hyai-..." \
  -H "Content-Type: application/json" \
  -d '{
    "model": "llama-3.3-70b",
    "messages": [{"role":"user","content":"Wat is ons retourbeleid?"}],
    "knowledge_base_id": 42
  }'

De Router zoekt de meest relevante stukken op met cosine-similarity (minimale drempel 0.3), injecteert de top 5 in de prompt en genereert een antwoord dat op jouw documenten is gebaseerd.

Bronvermelding

Niet-streamende antwoorden bevatten een extra sources-array met documentnaam, score, chunk-index en een fragment, zodat je elk antwoord kunt herleiden naar de bron. Bij streaming wordt de context wél geïnjecteerd, maar kunnen bronnen niet in de SSE-chunks worden meegegeven.

Robuust en compliant

Retrieval-fouten zijn graceful: mislukt het ophalen, dan gaat de chat gewoon door zonder context in plaats van te falen. En omdat alles op EU-GPU's draait, blijft je hele RAG-pipeline, van documenten tot antwoord, binnen Europa.

Referentie: de pipeline-instellingen op een rij

Deze waarden bepalen hoe je documenten worden verwerkt en teruggevonden. Ze staan vast, zodat de kwaliteit voorspelbaar is over al je kennisbanken.

InstellingWaarde
ChunkgrootteCirca 1000 tekens, geknipt op zinsgrens
Overlap100 tekens tussen opeenvolgende chunks
Embeddings384-dimensionale vectoren per chunk
SimilarityCosine-similarity, minimale drempel 0.3
Context per verzoekTop 5 meest relevante chunks
VerwerkingsmodusVolledig vooraf geëmbed onder 50MB, hybride daarboven

Problemen oplossen

Mijn antwoorden bevatten geen sources-array

Bronvermelding werkt alleen bij niet-streamende antwoorden. Zet stream uit voor verzoeken waarbij je de bronnen nodig hebt; bij streaming wordt de context wel geïnjecteerd maar passen de bronnen niet in de SSE-chunks.

Het model lijkt mijn documenten te negeren

Controleer eerst of de kennisbank echt gekoppeld is: aan de instance, aan de agent, of via knowledge_base_id in de request-body. Check daarna of je documenten klaar zijn met verwerken; vlak na een upload draait de verwerking nog in de wachtrij.

Ik krijg 401 Unauthorized

Je API-key moet met hyai- beginnen en volledig gekopieerd zijn, en de base-URL moet exact https://hostyourai.com/api/v1 zijn. Een key van een andere provider werkt niet.

Het eerste antwoord duurt lang

Waarschijnlijk is het gekozen model nog niet warm. In de Model Garden zie je of een model warm is of nog aan het opwarmen; daarna reageren vervolgverzoeken snel.

Vragen over deze gids

Welke bestandsformaten kan ik uploaden?

PDF, TXT, CSV, MD en DOCX. Daarnaast kun je een URL of complete sitemap laten crawlen; de pagina's doorlopen dezelfde verwerkingspipeline.

Werkt RAG ook op een dedicated instance?

Ja. Koppel de kennisbank aan je dedicated GPU-instance en elk chatverzoek krijgt automatisch context, ook via een externe API-key.

Wat kost RAG?

Je betaalt voor de inference zelf: pay-as-you-go per token via de Router, of per uur op een eigen instance. Zie de prijzenpagina.

Welk model kies ik voor RAG?

Open modellen zoals Llama, Qwen en Mistral doen het goed op vraag-antwoord over documenten. Vergelijk de opties in de Model Garden en test in de Playground.

Blijven mijn documenten binnen de EU?

Ja. Opslag, embeddings en inference draaien in Europese datacenters; documenten, prompts en antwoorden verlaten de EU niet.

Alles wat je nodig hebt voor AI

Van model-hosting tot een klantgerichte API, gebouwd voor developers en bedrijven die hun AI op infrastructuur willen draaien die ze echt beheren, binnen de EU.

100%
EU-gehost

Je data en je modellen blijven op Europese GPUs. GDPR-vriendelijk vanaf de basis.

200+
Geverifieerde modellen, klaar om te serveren

Llama, Qwen, DeepSeek, Mistral, FLUX en nog veel meer. Kies er een en hij is binnen minuten warm, zonder DevOps aan jouw kant.

2 SDK
OpenAI- en Anthropic-compatibel

Richt je bestaande client op de Router en behoud je tools. Geen herschrijven, geen lock-in.

Van nul naar een warm endpoint in minuten

Geen infra om te beheren. Kies een model, krijg een OpenAI-compatibele URL, ship.

1

Kies een model

Kies uit de Model Garden of plak een willekeurig HuggingFace-ID. Stel de VRAM in en kies een EU-GPU.

2

Krijg je endpoint

Wij deployen vLLM, draaien readiness-probes en geven je een warme OpenAI- en Anthropic-compatibele URL plus een API-key.

3

Route en ship

Richt je client op de Router. Die routeert automatisch naar een warme instance, zet GPUs idle als niemand online is en logt elk verzoek.

Privé vanaf de basis

HostYourAI houdt je modellen, prompts en data op Europese GPUs. Gebouwd voor teams die geven om compliance, betrouwbaarheid en echte controle.

EU-gehostAVG-vriendelijkOpenAI-compatibelvLLMGeen lock-in
EU
Volledige datasoevereiniteit

GPU's en data binnen Europa. Je prompts verlaten de EU nooit.

Open
Modellen die je kunt auditen

Draai open-weight modellen zonder black boxes of verborgen telemetrie.

€0
Scale-to-zero

GPU's idlen als niemand online is, dus je betaalt alleen voor wat je draait.

Jouw
Geen vendor lock-in

Jouw infra, jouw keys, jouw modellen. Vertrek wanneer je wilt.

Werkt met de tools die je al gebruikt

De Router spreekt de OpenAI- en Anthropic-API, dus hij past direct in de clients en SDKs die je team al draait. Verander alleen de base-URL.

Probeer HostYourAI gratis
docker
anthropic
huggingface
langchain
python
nodedotjs
curl
ollama
jetbrains
jupyter
vercel
zapier
postman
n8n
Model garden

Werkt met 390+ open modellen

Tekst- en beeldmodellen op dedicated EU GPU's. Elk model getest op onze eigen hardware.

Ook interessant

Verken meer over EU-gehoste AI op HostYourAI.

Host. Route. Ship.

Geen creditcard nodig. Betaal naar gebruik, stop wanneer je wilt.

Begin vandaag gratis met hosten