Auf dieser Seite
Was ist der EU Inference Router?
Kurz gesagt: Wir hosten offene KI-Modelle auf europäischen GPUs und stellen sie hinter einer API bereit. Dein bestehender Code funktioniert weiter, du zahlst pro Token, und deine Daten bleiben in der EU.
Der Router ist ein gemeinsames, OpenAI-kompatibles Gateway für Inference. Sie richten Ihren bestehenden Client auf eine einzige Basis-URL, und der Router schickt jede Anfrage an ein offenes Modell, das auf europäischen GPUs läuft. Sie ändern nur die Basis-URL und den API-Key, Ihr Code bleibt unverändert.
Weil der Router sowohl die OpenAI- als auch die Anthropic-API spricht, funktioniert er direkt mit den SDKs und Werkzeugen, die Ihr Team ohnehin einsetzt. Kein Umschreiben, kein Vendor-Lock-in.
Wie funktioniert das?
Eine Anfrage erreicht den Router, wird mit Ihrem API-Key authentifiziert und an ein Modell weitergereicht, das bereits warm läuft. Antworten kommen gestreamt zurück, genau wie bei OpenAI. Beliebte Modelle hält ein Warm-Pool bereit, damit die erste Anfrage nicht auf einen Kaltstart warten muss.
Pro Anfrage landen Verbrauch, Latenz und Kosten in Ihrem Activity-Log, sodass Sie genau sehen, was passiert.
Warum über den Router?
- Drop-in, OpenAI- und Anthropic-kompatibel: nur die Basis-URL ändert sich
- Offene Modelle auf europäischen GPUs, die Sie kontrollieren
- Ihre Prompts und Daten verlassen die EU nicht
- Pay-as-you-go pro Token, ein einziges Prepaid-Guthaben
- Einblick in Verbrauch, Latenz und Kosten pro Anfrage
Router oder dedizierte Instanz?
Der Router ist der schnellste Weg in die Produktion: gemeinsame Kapazität, Abrechnung pro Token und nichts zu verwalten. Wer Isolation oder planbare Performance braucht, stellt eine dedizierte GPU-Instanz daneben. Beide laufen über dieselbe Basis-URL und dasselbe Guthaben.
| Gemeinsamer Router | Dedizierte Instanz | |
|---|---|---|
| Abrechnung | Pro Token | Pro Stunde |
| Startzeit | Sofort, beliebte Modelle sind warm | Einige Minuten beim Deployment |
| Isolation | Gemeinsame Kapazität | GPU nur für Sie |
| Modelle | Kuratierter Katalog | Jedes offene Modell oder eigene HuggingFace-ID |
| Verwaltung | Keine | Selbst starten, stoppen und skalieren |
| Am besten für | Einstieg und schwankende Last | Konstante Last oder strenge Compliance-Vorgaben |
So legen Sie los
Legen Sie einen API-Key an, tragen Sie die Basis-URL in Ihren bestehenden Client ein und wählen Sie ein Modell aus dem Model Garden. Streaming funktioniert wie gewohnt:
from openai import OpenAI
client = OpenAI(
base_url="https://hostyourai.com/api/v1",
api_key="hyai-...",
)
resp = client.chat.completions.create(
model="llama-3.3-70b",
messages=[{"role": "user", "content": "Hallo"}],
stream=True,
)
for chunk in resp:
print(chunk.choices[0].delta.content or "", end="")
Sie möchten den vollständigen Ablauf? Folgen Sie der Anleitung Migrate your OpenAI client to the EU Router.
Autopilot: eine Modell-ID, die selbst wählt
Wer den Katalog nicht wöchentlich verfolgen möchte, trägt hyai/auto in das Modell-Feld der Anfrage ein und ist mit der Auswahl fertig. Autopilot liest die Aufgabe statt des Modellnamens, den Sie sonst kennen müssten: wie lang der Prompt ist, in welcher Sprache er steht, ob Tools mitgehen, wie viel Kontext gebraucht wird und um welche Art von Arbeit es geht. Dazu sucht er das passende Modell.
Bevorzugt wird ein Modell, das bereits warm läuft, denn das erspart die Wartezeit eines Kaltstarts. Welches Modell tatsächlich geantwortet hat, steht im Modell-Feld der Antwort, genau wie bei einer ausdrücklichen Wahl. Wer selbst steuern will, trägt weiterhin einen Modellnamen ein, und es ändert sich nichts.
curl https://hostyourai.com/api/v1/chat/completions \
-H "Authorization: Bearer hyai-..." \
-H "Content-Type: application/json" \
-d '{
"model": "hyai/auto",
"messages": [{"role": "user", "content": "Fasse diesen Bericht zusammen"}]
}'
Was Autopilot kostet
Sie zahlen den Tokenpreis des Modells, das geantwortet hat, ohne Aufschlag für die Auswahl. Wählt Autopilot ein großes Modell, zahlen Sie dieses große Modell; wählt er ein leichteres, zahlen Sie das leichtere. Nie mehr, als wenn Sie dasselbe Modell selbst eingetragen hätten.
Ob es im Durchschnitt günstiger ausfällt als die eigene Wahl, messen wir pro Anfrage: Neben jeder Anfrage halten wir fest, welches Modell Autopilot gewählt hätte. Diese Zahl veröffentlichen wir erst, wenn genug Anfragen darunter liegen, damit sie etwas aussagt.
Auch die Auswahl bleibt in Europa
Wer auswählt, liest Ihren Prompt. Eine Auswahlinstanz verarbeitet Ihre Daten also genauso wie das Modell, das antwortet, und genau dort kann eine Auto-Option unbemerkt die EU verlassen. Bei uns findet die Auswahl in derselben europäischen Kette statt wie die Antwort selbst: Ihr Prompt verlässt die EU nicht, auch nicht für die Auswahl.
Das Auswahlprotokoll speichert nur Merkmale der Anfrage, etwa Sprache, Länge und ob Tools mitgingen, niemals den Text selbst. Mit einem Sovereignty-Key wählt Autopilot ausschließlich aus Modellen, die diese Anforderung erfüllen; was sie nicht erfüllt, steht gar nicht erst auf der Kandidatenliste.
Wann wird eine eigene GPU günstiger?
Der gemeinsame Router rechnet pro Token ab und fällt zwischen Ihren Anfragen auf null zurück: Wer nichts sendet, zahlt nichts. Eine dedizierte GPU funktioniert umgekehrt. Sie wird pro Minute abgerechnet und läuft rund um die Uhr, auch nachts und am Wochenende, dafür gehört die Maschine ganz Ihnen: keine Warteschlange hinter fremden Anfragen, planbare Latenz und der gesamte GPU-Speicher für Ihr Modell.
Wo der Umschlagpunkt liegt, hängt von Ihrem Monatsvolumen ab. Im Rechner weiter unten schieben Sie dieses Volumen entlang der Skala und sehen pro Modellklasse, welche der beiden Varianten gerade günstiger ist.
Rechner: ab wann ist dediziert günstiger?
Schieben Sie Ihr monatliches Tokenvolumen dorthin, wo Ihre Last liegt, und wählen Sie eine Modellklasse. Der Rechner nutzt die Tarife weiter oben auf dieser Seite, also die Preise, die wir tatsächlich abrechnen.
Fragen zum EU Router
Ist das wirklich Drop-in mit meinem OpenAI-Code?
Ja. Sie ändern nur die Basis-URL und den API-Key. Anfrage- und Antwortformat, Streaming und Parameter verhalten sich wie bei OpenAI. Auch das Anthropic-SDK funktioniert, über die Anthropic-kompatible API.
Welche Modelle kann ich aufrufen?
Offene Modelle wie Llama, Qwen, Mistral, DeepSeek und Gemma. Die aktuelle Liste mit Preisen pro Million Token steht im Modellkatalog.
Muss ich auf einen Kaltstart warten?
Beliebte Modelle werden über einen Warm-Pool warm gehalten. Ist ein Modell nicht warm, sehen Sie seinen Aufwärmstatus live im Model Garden.
Was kostet das?
Pay-as-you-go pro Token aus einem einzigen Prepaid-Guthaben, ohne Abonnement und ohne Mindestumsatz. Die Tarife pro Modellklasse stehen auf der Preisseite.
Wo laufen meine Daten?
Auf GPUs in europäischen Rechenzentren. Ihre Prompts und Ausgaben verlassen die EU nicht, ein Auftragsverarbeitungsvertrag ist verfügbar, und mit Ihren Daten wird nicht trainiert.
Bin ich an HostYourAI gebunden?
Nein. Weil die API OpenAI-kompatibel ist, ändern Sie die Basis-URL und sind wieder weg. Kein Vendor-Lock-in.