Drop-in OpenAI- und Anthropic-API, gehostet in der EU

Hosten Sie Ihre KI in Europa.
Sicher, konform, drop-in.

Betreiben Sie Ihre eigenen KI-Modelle in Europa, auf einer dedizierten GPU oder über den gemeinsamen Router. Richten Sie Ihren OpenAI- oder Anthropic-Client auf eine Base-URL und Sie sind live.

Entwickelt und gehostet in der EU
Ihre App
OpenAI · Anthropic
EU Router
eine Base-URL
GLM 5.3
gemeinsames Gateway
Loes (NL)
dedizierte GPU
DeepSeek V4 Pro
Single-Tenant
drop-in warm · EU
Ihre Anfrage bleibt von Anfang bis Ende in der EU. Der Router leitet sie an ein warmes Modell weiter und streamt die Antwort direkt zurück.

Offene Modelle, bereitgestellt aus der EU auf Infrastruktur unter Ihrer Kontrolle

Loes GLM Alibaba CloudQwen DeepSeekDeepSeek Mistral AIMistral GoogleGemma FLUX.1 Kimi MiniMax vLLMvLLM Hugging FaceHuggingFace Europäische GPU-Marktplätze
0%
EU-gehostet

Ihre Daten und Ihre Modelle bleiben in der EU oder dem EWR. Keine Ausnahme für Preis oder Verfügbarkeit.

0+
Verifizierte Modelle, sofort einsatzbereit

GLM, Qwen, DeepSeek, Kimi, Mistral, FLUX und viele mehr. Wählen Sie eines aus und es ist in Minuten warm, ganz ohne DevOps auf Ihrer Seite.

0 SDKs
OpenAI- und Anthropic-kompatibel

Richten Sie Ihren bestehenden Client auf den Router und behalten Sie Ihre Tools. Kein Umschreiben, kein Lock-in.

Product

Eine Plattform, vom ersten Test bis zur Produktion

Router

Ein Endpoint, jedes offene Modell

Ändern Sie nur die Base-URL und behalten Sie Ihr OpenAI-Tooling.

chat.completions
# funktioniert mit Ihrem bestehenden OpenAI-Client curl https://hostyourai.com/api/v1/chat/completions \ -H "Authorization: Bearer hyai-..." \ -d '{ "model": "deepseek-ai/DeepSeek-V4-Flash", "messages": [{ "role": "user", ... }], "stream": true }' # oder Ihrem Anthropic SDK, derselbe Router curl https://hostyourai.com/api/v1/messages \ -H "x-api-key: hyai-..."
Model Garden

Durchsuchen, vergleichen, deployen

Mehr als 800 einsatzbereite offene Modelle mit Live-Status.

/models
GLM 5.3warmEU
DeepSeek V4 ProwarmEU
Kimi K3warmEU
MiniMax M3wärmt aufEU
Qwen3.5 397BwarmEU
Mistral Small 4EU
FLUX.1 schnellEU
Gemma 4 26BEU
Playground

Testen Sie jedes Modell sofort

Chatten Sie mit jedem Modell, bevor Sie eine einzige Zeile Code schreiben.

GLM 5.3 · streaming · EU
Fassen Sie unsere Rückgaberichtlinie in zwei Sätzen zusammen.
Rücksendungen werden innerhalb von 14 Tagen nach der Anfrage bearbeitet. Artikel müssen unbenutzt und mit dem Originalbeleg zurückgeschickt werden.
Und was gilt für reduzierte Artikel?
Reduzierte Artikel können innerhalb derselben Frist umgetauscht werden.
Activity

Verfolgen Sie jede Anfrage

Verbrauch, Latenz und Kosten pro Anfrage in Ihrem Activity-Log.

Anfragen diese WocheLatenz · Kosten
deepseek-v4-flash412 ms
glm-5.3890 ms
mistral-small-4365 ms
qwen3.5-397b508 ms
kimi-k31240 ms
Platform

Alles, was Sie für den Weg in die Produktion brauchen

Von Ihrer ersten Anfrage bis zum Produktionsverkehr: jedes Modell, jeder Endpoint und jede Auswertung, die Ihr Team braucht, an einem Ort.

EU Inference Router

Eine API. Jedes offene Modell.

Ein gemeinsames OpenAI-kompatibles Gateway, das Ihre Anfragen an offene Modelle auf europäischen GPUs leitet.

OpenAI-kompatible API
Automatisches Routing zu EU-GPU-Instanzen
Anthropic SDK drop-in
Verbrauch und Activity-Log pro Anfrage
Rabatt auf gecachte Tokens, automatisch
Router entdecken
EU Inference Router
Eingehende /v1/chat-Anfrage
Authentifizierung hyai- API-Key
Nächstgelegene warme Instanz wählen
vLLM streamt die Antwort
if (instance.warm === true)
TrueSofort servieren
FalseAufwärmen, dann routen
qwen3.5-9b vLLM bereit
NVIDIA A100 · 40GB · Europäischer GPU-Marktplatz · EU-Region
VRAM19.2 / 40 GB
GPU-Auslastung71%
42 ms
time-to-first-token
128
tokens / sec
62°C
Temperatur
POST /api/v1/chat/completions200 OK
Dedicated Instances

Ihre eigene GPU, Ihr eigenes Modell.

Deployen Sie LLMs (GLM, Qwen, DeepSeek, Kimi) und Bildmodelle (FLUX) auf dedizierten GPUs. In Minuten einsatzbereit.

Jedes HuggingFace-Modell per ID
vLLM auf europäischen GPU-Marktplätzen
Automatisch generierte Setup-Skripte
Abrechnung pro Minute, Löschen stoppt die Kosten sofort
Private, verschlüsselte Upstream-Keys
Eingebaute Readiness-Probes
Instanz deployen
Model Garden

Durchsuchen, vergleichen, deployen.

Ein kuratierter Katalog einsatzbereiter offener Modelle mit Live-Status: warm, EU und aufwärmend. Sie wissen immer, was bereitsteht.

Kuratierter, einsatzbereiter Katalog
Live-Status: warm / EU / aufwärmend
Eine Landingpage für jedes Modell
Verifiziert, bevor Sie bauen
Playground zum sofortigen Testen
Bild- und Chatmodelle an einem Ort
Model Garden entdecken
Model Garden
Chatmodelle
Bildmodelle
Embeddings
Jetzt warm↑
GLM-5.3
DeepSeek-V4-Flash
Kimi-K3
Kürzlich hinzugefügt↑
MiniMax-M3
Kimi-K2.7-Code
Einsatzbereit↑
FLUX.1-schnell
Qwen3.5-9B
So funktioniert es

Von null auf einen warmen Endpoint in Minuten

Keine Infrastruktur zu verwalten. Modell wählen, OpenAI-kompatible URL erhalten, loslegen.

01Modell wählen

Wählen Sie aus dem Model Garden oder fügen Sie eine HuggingFace-ID ein

Legen Sie den VRAM fest und wählen Sie eine europäische GPU. Mehr als 800 einsatzbereite offene Modelle stehen bereit.

02Endpoint erhalten

Wir deployen vLLM und führen Readiness-Probes aus

Sie erhalten eine warme OpenAI- und Anthropic-kompatible URL plus einen API-Key. Kein DevOps auf Ihrer Seite.

03Routen und liefern

Richten Sie Ihren Client auf den Router

Er routet automatisch zu einer warmen Instanz und spricht sowohl die OpenAI- als auch die Anthropic-API. Nur die Base-URL ändert sich.

04Verfolgen und skalieren

Jede Anfrage geloggt, Kosten pro Minute sichtbar

Sie sehen Verbrauch, Latenz und Kosten pro Anfrage. Eine dedizierte GPU zahlen Sie pro Minute, solange sie besteht. Löschen Sie sie, endet die Abrechnung sofort.

HostYourAI Code

Lass deinen Coding-Agent über unseren Router laufen

hyai ist eine kleine Open-Source-Kommandozeile. Sie startet OpenCode, Claude Code oder Codex über den Router, mit deinem Key im Schlüsselbund deines Systems und nur auf Modellen, die in dem Moment warm sind. Im Agenten wählst du einfach aus unseren Modellen.

Hast du eine eigene Dedicated-Box, startet hyai darauf, sodass dein Code auf Hardware landet, die sonst niemand nutzt. Und verknüpfst du deinen eigenen Anthropic- oder OpenAI-Key, stehen diese Modelle in derselben Liste daneben.

~/project · bash
# installieren, Node 20 oder neuer $ curl -fsSL https://hostyourai.com/cli/install.sh | sh # dein Router-Key, die Eingabe bleibt verborgen $ hyai login # in deinem Projekt starten $ hyai $ hyai run claude $ hyai run codex
Features

Alles, was Sie für KI brauchen

Vom Model-Hosting bis zur kundenorientierten API, gebaut für Entwickler und Unternehmen, die ihre KI innerhalb der EU betreiben wollen.

OpenAI-kompatibler Endpoint

Drop-in-Ersatz für das OpenAI SDK. Nur die Base-URL ändert sich.

POST /api/v1/chat/completions

Anthropic Messages drop-in

Auch Ihr Anthropic SDK funktioniert sofort, inklusive x-api-key-Auth.

POST /api/v1/messages

Streaming responses

Token für Token zurück in Ihre App, genau wie Sie es gewohnt sind.

stream: true

Eigene API-Keys

Erstellen Sie Keys mit dem hyai-Präfix und verwalten Sie sie pro Projekt.

Authorization: Bearer hyai-...

Katalog mit 800+ Modellen

GLM, Qwen, DeepSeek, Kimi und Mistral, mit Live-Status pro Modell.

hostyourai.com/models

Warm-pool

Ein warmes Modell steht immer bereit, Ihre erste Anfrage wartet also nie.

status: warm

Pay per minute

Eine dedizierte GPU zahlen Sie pro Minute. Löschen stoppt die Kosten sofort, in der App oder über die API.

Abrechnung pro Minute

Per-request activity log

Verbrauch, Latenz und Kosten für jede Anfrage, live in Ihrem Dashboard.

GET /router/traces

Autopilot

Fragen Sie hyai/auto an und der Router wählt pro Anfrage das Modell, das zur Aufgabe passt.

model: "hyai/auto"

Jedes HuggingFace-Modell

Fügen Sie eine Repo-ID ein und deployen Sie Ihr eigenes oder feingetuntes Modell auf einer EU-GPU.

org/model-name

Readiness-Probes

Jedes Deployment wird automatisch auf Gesundheit geprüft, bevor Sie Traffic darauf legen.

GET /health

Embedding-Modelle

Servieren Sie Embeddings vom selben Stack, für Suche und Klassifikation.

POST /api/v1/embeddings

Bildmodelle

Bildmodelle wie FLUX auf dedizierten GPUs, neben Ihren Chatmodellen.

FLUX

Ein Prepaid-Guthaben

Aufladen per Karte, SEPA oder iDEAL. Kein Abo, kein Minimum.

pay-as-you-go

Playground

Probieren Sie jedes Modell im Browser aus, bevor Sie es in Ihre App einbauen.

?model=deepseek-ai/DeepSeek-V4-Flash
Für wen

Gebaut für Teams, die Daten nicht aus der Hand geben dürfen

Wenn eine US-Cloud keine Option ist, bietet HostYourAI Ihnen dieselbe Developer-Experience auf europäischer Infrastruktur.

Klassisches Regierungsgebäude mit Säulen Öffentlicher Sektor

Behörden & öffentlicher Sektor

Bürgerdaten, die gesetzlich in der EU bleiben müssen, vollständig auditierbar.

Gesundheitswesen

Patientendaten bleiben in der EU, auf Infrastruktur mit AVV und öffentlicher Subprozessorenliste.

Regulierte Unternehmen

Finanz-, Gesundheits- und Rechtsteams unter DSGVO, DORA und AI Act.

EU SaaS & scale-ups

Liefern Sie KI-Funktionen, denen Ihre Kunden vertrauen können, ohne US-Subprozessor.

Agencies & integrators

Liefern Sie private KI für Ihre Kunden auf Infrastruktur, hinter der Sie stehen können.

Finance & legal

Offene Modelle, die Sie auditieren können, statt einer geschlossenen Blackbox.

Reihe europäischer Flaggen vor einem EU-Gebäude Souveränität

Europa ist Pflicht, keine Präferenz

Eine Maschine kommt nur infrage, wenn ihr Rechenzentrum in der EU oder dem EWR steht. Das Vereinigte Königreich und die Schweiz fallen heraus, bei unklarem Standort ebenfalls.

Compute mining

Verdiene mit deiner GPU

Jeder in Europa mit einer GPU kann mitmachen: verbinde deinen Rechner mit einem Befehl, hilf beim Training von Loes und verdiene pro Sekunde Rechenarbeit, zu marktbasierten Tarifen.

RTX 3060
€ 0,04
pro Arbeitsstunde
bis € 32 p/m
RTX 3090
€ 0,11
pro Arbeitsstunde
bis € 79 p/m
RTX 4090
€ 0,27
pro Arbeitsstunde
bis € 198 p/m
H100
€ 1,49
pro Arbeitsstunde
bis € 1.069 p/m
Sicherheit

Privat von Grund auf

HostYourAI hält Ihre Modelle, Prompts und Daten auf europäischen GPUs. Gebaut für Teams, denen Compliance, Zuverlässigkeit und echte Kontrolle wichtig sind.

DSGVO-konform AVV verfügbar AES-256 at rest TLS in transit 99.9% uptime SLA Europäische Rechenzentren

EU-Datenresidenz

Prompts und Outputs verlassen die EU nie. Die gesamte Inferenz läuft in europäischen Rechenzentren.

Verschlüsselung überall

AES-256 für Daten im Ruhezustand und TLS für den gesamten Datenverkehr unterwegs.

Kein Training mit Kundendaten

Ihre Prompts und Outputs werden nie zum Trainieren von Modellen verwendet.

AVV und Subprozessoren

Ein Auftragsverarbeitungsvertrag ist verfügbar und die Subprozessorenliste ist öffentlich.

99.9% uptime SLA

Mit einer öffentlichen Statusseite, damit Sie immer sehen, was warm ist.

Guides

Legen Sie selbst mit dem Router los

Praktische Schritte zum Migrieren, Deployen und Bauen auf EU-GPUs.

Host. Route. Ship.

Zahlen Sie nach Verbrauch und hören Sie auf, wann Sie wollen. Kein Abo, kein Minimum.