Op deze pagina
Wat RAG voor je doet
Met Retrieval Augmented Generation (RAG) baseer je antwoorden op je eigen documenten in plaats van alleen op de trainingskennis van het model. HostYourAI levert de open modellen en de EU-GPU-infrastructuur; jij bepaalt welke kennis erin gaat. Documenten, prompts en antwoorden blijven end-to-end binnen Europa.
Stap 1, Maak een kennisbank
Upload documenten (PDF, TXT, CSV, MD of DOCX) of laat een URL of sitemap crawlen. Je content wordt in stukken van ongeveer 1000 tekens geknipt met 100 tekens overlap, netjes op zinsgrens. Elk stuk krijgt een embedding (384-dimensionaal). Kleine bestanden (< 50MB) worden volledig vooraf geëmbed voor snelle retrieval; grote bestanden gebruiken een hybride modus met FULLTEXT plus embedding op aanvraag.
Stap 2, Koppel de kennisbank
Er zijn drie manieren om een kennisbank aan je chatverzoeken te koppelen:
- Aan een instance koppelen (aanbevolen):
POST /api/kb/{kbId}/link/{instanceId}. Alle chatverzoeken naar die instance krijgen daarna automatisch context, ook via een externehyai--key. - Aan een agent koppelen: zet
knowledge_base_idop de agent; de publieke chat gebruikt hem automatisch. - Expliciet per verzoek: geef
knowledge_base_idmee in de body van je chat-completion.
Stap 3, Vraag met context
curl https://hostyourai.com/api/v1/chat/completions \
-H "Authorization: Bearer hyai-..." \
-H "Content-Type: application/json" \
-d '{
"model": "llama-3.3-70b",
"messages": [{"role":"user","content":"Wat is ons retourbeleid?"}],
"knowledge_base_id": 42
}'
De Router zoekt de meest relevante stukken op met cosine-similarity (minimale drempel 0.3), injecteert de top 5 in de prompt en genereert een antwoord dat op jouw documenten is gebaseerd.
Bronvermelding
Niet-streamende antwoorden bevatten een extra sources-array met documentnaam, score, chunk-index en een fragment, zodat je elk antwoord kunt herleiden naar de bron. Bij streaming wordt de context wél geïnjecteerd, maar kunnen bronnen niet in de SSE-chunks worden meegegeven.
Robuust en compliant
Retrieval-fouten zijn graceful: mislukt het ophalen, dan gaat de chat gewoon door zonder context in plaats van te falen. En omdat alles op EU-GPU's draait, blijft je hele RAG-pipeline, van documenten tot antwoord, binnen Europa.
Referentie: de pipeline-instellingen op een rij
Deze waarden bepalen hoe je documenten worden verwerkt en teruggevonden. Ze staan vast, zodat de kwaliteit voorspelbaar is over al je kennisbanken.
| Instelling | Waarde |
|---|---|
| Chunkgrootte | Circa 1000 tekens, geknipt op zinsgrens |
| Overlap | 100 tekens tussen opeenvolgende chunks |
| Embeddings | 384-dimensionale vectoren per chunk |
| Similarity | Cosine-similarity, minimale drempel 0.3 |
| Context per verzoek | Top 5 meest relevante chunks |
| Verwerkingsmodus | Volledig vooraf geëmbed onder 50MB, hybride daarboven |
Problemen oplossen
Mijn antwoorden bevatten geen sources-array
Bronvermelding werkt alleen bij niet-streamende antwoorden. Zet stream uit voor verzoeken waarbij je de bronnen nodig hebt; bij streaming wordt de context wel geïnjecteerd maar passen de bronnen niet in de SSE-chunks.
Het model lijkt mijn documenten te negeren
Controleer eerst of de kennisbank echt gekoppeld is: aan de instance, aan de agent, of via knowledge_base_id in de request-body. Check daarna of je documenten klaar zijn met verwerken; vlak na een upload draait de verwerking nog in de wachtrij.
Ik krijg 401 Unauthorized
Je API-key moet met hyai- beginnen en volledig gekopieerd zijn, en de base-URL moet exact https://hostyourai.com/api/v1 zijn. Een key van een andere provider werkt niet.
Het eerste antwoord duurt lang
Waarschijnlijk is het gekozen model nog niet warm. In de Model Garden zie je of een model warm is of nog aan het opwarmen; daarna reageren vervolgverzoeken snel.
Vragen over deze gids
Welke bestandsformaten kan ik uploaden?
PDF, TXT, CSV, MD en DOCX. Daarnaast kun je een URL of complete sitemap laten crawlen; de pagina's doorlopen dezelfde verwerkingspipeline.
Werkt RAG ook op een dedicated instance?
Ja. Koppel de kennisbank aan je dedicated GPU-instance en elk chatverzoek krijgt automatisch context, ook via een externe API-key.
Wat kost RAG?
Je betaalt voor de inference zelf: pay-as-you-go per token via de Router, of per uur op een eigen instance. Zie de prijzenpagina.
Welk model kies ik voor RAG?
Open modellen zoals Llama, Qwen en Mistral doen het goed op vraag-antwoord over documenten. Vergelijk de opties in de Model Garden en test in de Playground.
Blijven mijn documenten binnen de EU?
Ja. Opslag, embeddings en inference draaien in Europese datacenters; documenten, prompts en antwoorden verlaten de EU niet.