EU Router

EU Inference Router

Eine Basis-URL für alle Ihre offenen Modelle, serviert aus der EU auf Infrastruktur, die Sie kontrollieren.

Auf dieser Seite

Was ist der EU Inference Router?

Kurz gesagt: Wir hosten offene KI-Modelle auf europäischen GPUs und stellen sie hinter einer API bereit. Dein bestehender Code funktioniert weiter, du zahlst pro Token, und deine Daten bleiben in der EU.

Der Router ist ein gemeinsames, OpenAI-kompatibles Gateway für Inference. Sie richten Ihren bestehenden Client auf eine einzige Basis-URL, und der Router schickt jede Anfrage an ein offenes Modell, das auf europäischen GPUs läuft. Sie ändern nur die Basis-URL und den API-Key, Ihr Code bleibt unverändert.

Weil der Router sowohl die OpenAI- als auch die Anthropic-API spricht, funktioniert er direkt mit den SDKs und Werkzeugen, die Ihr Team ohnehin einsetzt. Kein Umschreiben, kein Vendor-Lock-in.

Wie funktioniert das?

Eine Anfrage erreicht den Router, wird mit Ihrem API-Key authentifiziert und an ein Modell weitergereicht, das bereits warm läuft. Antworten kommen gestreamt zurück, genau wie bei OpenAI. Beliebte Modelle hält ein Warm-Pool bereit, damit die erste Anfrage nicht auf einen Kaltstart warten muss.

Pro Anfrage landen Verbrauch, Latenz und Kosten in Ihrem Activity-Log, sodass Sie genau sehen, was passiert.

Je app
OpenAI · Anthropic
EU Router
één base URL
Qwen3-8B
warm
Loes (NL)
soeverein
Llama-3.3
warm

Warum über den Router?

  • Drop-in, OpenAI- und Anthropic-kompatibel: nur die Basis-URL ändert sich
  • Offene Modelle auf europäischen GPUs, die Sie kontrollieren
  • Ihre Prompts und Daten verlassen die EU nicht
  • Pay-as-you-go pro Token, ein einziges Prepaid-Guthaben
  • Einblick in Verbrauch, Latenz und Kosten pro Anfrage

Router oder dedizierte Instanz?

Der Router ist der schnellste Weg in die Produktion: gemeinsame Kapazität, Abrechnung pro Token und nichts zu verwalten. Wer Isolation oder planbare Performance braucht, stellt eine dedizierte GPU-Instanz daneben. Beide laufen über dieselbe Basis-URL und dasselbe Guthaben.

Gemeinsamer RouterDedizierte Instanz
AbrechnungPro TokenPro Stunde
StartzeitSofort, beliebte Modelle sind warmEinige Minuten beim Deployment
IsolationGemeinsame KapazitätGPU nur für Sie
ModelleKuratierter KatalogJedes offene Modell oder eigene HuggingFace-ID
VerwaltungKeineSelbst starten, stoppen und skalieren
Am besten fürEinstieg und schwankende LastKonstante Last oder strenge Compliance-Vorgaben

So legen Sie los

Legen Sie einen API-Key an, tragen Sie die Basis-URL in Ihren bestehenden Client ein und wählen Sie ein Modell aus dem Model Garden. Streaming funktioniert wie gewohnt:

from openai import OpenAI

client = OpenAI(
    base_url="https://hostyourai.com/api/v1",
    api_key="hyai-...",
)

resp = client.chat.completions.create(
    model="llama-3.3-70b",
    messages=[{"role": "user", "content": "Hallo"}],
    stream=True,
)
for chunk in resp:
    print(chunk.choices[0].delta.content or "", end="")

Sie möchten den vollständigen Ablauf? Folgen Sie der Anleitung Migrate your OpenAI client to the EU Router.

Autopilot: eine Modell-ID, die selbst wählt

Wer den Katalog nicht wöchentlich verfolgen möchte, trägt hyai/auto in das Modell-Feld der Anfrage ein und ist mit der Auswahl fertig. Autopilot liest die Aufgabe statt des Modellnamens, den Sie sonst kennen müssten: wie lang der Prompt ist, in welcher Sprache er steht, ob Tools mitgehen, wie viel Kontext gebraucht wird und um welche Art von Arbeit es geht. Dazu sucht er das passende Modell.

Bevorzugt wird ein Modell, das bereits warm läuft, denn das erspart die Wartezeit eines Kaltstarts. Welches Modell tatsächlich geantwortet hat, steht im Modell-Feld der Antwort, genau wie bei einer ausdrücklichen Wahl. Wer selbst steuern will, trägt weiterhin einen Modellnamen ein, und es ändert sich nichts.

curl https://hostyourai.com/api/v1/chat/completions \
  -H "Authorization: Bearer hyai-..." \
  -H "Content-Type: application/json" \
  -d '{
    "model": "hyai/auto",
    "messages": [{"role": "user", "content": "Fasse diesen Bericht zusammen"}]
  }'

Was Autopilot kostet

Sie zahlen den Tokenpreis des Modells, das geantwortet hat, ohne Aufschlag für die Auswahl. Wählt Autopilot ein großes Modell, zahlen Sie dieses große Modell; wählt er ein leichteres, zahlen Sie das leichtere. Nie mehr, als wenn Sie dasselbe Modell selbst eingetragen hätten.

Ob es im Durchschnitt günstiger ausfällt als die eigene Wahl, messen wir pro Anfrage: Neben jeder Anfrage halten wir fest, welches Modell Autopilot gewählt hätte. Diese Zahl veröffentlichen wir erst, wenn genug Anfragen darunter liegen, damit sie etwas aussagt.

Auch die Auswahl bleibt in Europa

Wer auswählt, liest Ihren Prompt. Eine Auswahlinstanz verarbeitet Ihre Daten also genauso wie das Modell, das antwortet, und genau dort kann eine Auto-Option unbemerkt die EU verlassen. Bei uns findet die Auswahl in derselben europäischen Kette statt wie die Antwort selbst: Ihr Prompt verlässt die EU nicht, auch nicht für die Auswahl.

Das Auswahlprotokoll speichert nur Merkmale der Anfrage, etwa Sprache, Länge und ob Tools mitgingen, niemals den Text selbst. Mit einem Sovereignty-Key wählt Autopilot ausschließlich aus Modellen, die diese Anforderung erfüllen; was sie nicht erfüllt, steht gar nicht erst auf der Kandidatenliste.

Wann wird eine eigene GPU günstiger?

Der gemeinsame Router rechnet pro Token ab und fällt zwischen Ihren Anfragen auf null zurück: Wer nichts sendet, zahlt nichts. Eine dedizierte GPU funktioniert umgekehrt. Sie wird pro Minute abgerechnet und läuft rund um die Uhr, auch nachts und am Wochenende, dafür gehört die Maschine ganz Ihnen: keine Warteschlange hinter fremden Anfragen, planbare Latenz und der gesamte GPU-Speicher für Ihr Modell.

Wo der Umschlagpunkt liegt, hängt von Ihrem Monatsvolumen ab. Im Rechner weiter unten schieben Sie dieses Volumen entlang der Skala und sehen pro Modellklasse, welche der beiden Varianten gerade günstiger ist.

Rechner: ab wann ist dediziert günstiger?

Schieben Sie Ihr monatliches Tokenvolumen dorthin, wo Ihre Last liegt, und wählen Sie eine Modellklasse. Der Rechner nutzt die Tarife weiter oben auf dieser Seite, also die Preise, die wir tatsächlich abrechnen.

1,0 Milliarden Token pro Monat
Gemeinsamer Router am günstigsten
€ 243 pro Monat
€ 0,17 Eingabe und € 0,40 Ausgabe pro Million Token
Dedizierte GPU am günstigsten
€ 1.226 pro Monat
1x RTX PRO 6000 (96 GB), € 1,68 pro Stunde, 730 Stunden pro Monat
Ab etwa 5,1 Milliarden Token pro Monat ist eine dedizierte GPU günstiger als der gemeinsame Router für Mistral Small 3.2 24B.
Bei 1,0 Milliarden Token pro Monat zahlen Sie über den gemeinsamen Router am wenigsten: € 243 gegenüber € 1.226 für eine eigene GPU. Das spart € 983 pro Monat.
Gerechnet mit 70 Prozent Eingabe- und 30 Prozent Ausgabetoken, ein üblicher Anteil für Chat- und Agentenlast. Liegt Ihre Last anders, verschiebt sich der Umschlagpunkt entsprechend.
Dediziert läuft rund um die Uhr. Sie zahlen die Maschine pro Minute, solange sie läuft, auch am Wochenende und nachts. Der gemeinsame Router rechnet nur ab, was Sie wirklich senden, und fällt dazwischen auf null zurück.
Das vergleicht Preise, keine Kapazität. Ob eine Maschine Ihr Volumen tatsächlich bewältigt, hängt von Ihrem Verkehr ab: Gleichzeitigkeit, Promptlänge und Spitzen. Bei großen Volumina rechnen wir das mit Ihnen durch, damit Sie wissen, wie viele Maschinen Sie brauchen. /contact
Dediziert gibt Ihnen die ganze Maschine. Keine Warteschlange hinter anderen Kunden, vorhersehbare Latenz und der gesamte GPU-Speicher für Ihr Modell. Auch bei gleichem Betrag kann das den Ausschlag geben.
Stundenpreise stammen aus derselben Staffel wie die Tabelle oben, die täglich bei unseren EU-Anbietern neu eingelesen wird. Tokenpreise stammen aus dem Katalog, aus dem Ihr Verbrauch abgerechnet wird. Ein Monat zählt hier 730 Stunden, der Jahresdurchschnitt. Beträge ohne MwSt.

Fragen zum EU Router

Ist das wirklich Drop-in mit meinem OpenAI-Code?

Ja. Sie ändern nur die Basis-URL und den API-Key. Anfrage- und Antwortformat, Streaming und Parameter verhalten sich wie bei OpenAI. Auch das Anthropic-SDK funktioniert, über die Anthropic-kompatible API.

Welche Modelle kann ich aufrufen?

Offene Modelle wie Llama, Qwen, Mistral, DeepSeek und Gemma. Die aktuelle Liste mit Preisen pro Million Token steht im Modellkatalog.

Muss ich auf einen Kaltstart warten?

Beliebte Modelle werden über einen Warm-Pool warm gehalten. Ist ein Modell nicht warm, sehen Sie seinen Aufwärmstatus live im Model Garden.

Was kostet das?

Pay-as-you-go pro Token aus einem einzigen Prepaid-Guthaben, ohne Abonnement und ohne Mindestumsatz. Die Tarife pro Modellklasse stehen auf der Preisseite.

Wo laufen meine Daten?

Auf GPUs in europäischen Rechenzentren. Ihre Prompts und Ausgaben verlassen die EU nicht, ein Auftragsverarbeitungsvertrag ist verfügbar, und mit Ihren Daten wird nicht trainiert.

Bin ich an HostYourAI gebunden?

Nein. Weil die API OpenAI-kompatibel ist, ändern Sie die Basis-URL und sind wieder weg. Kein Vendor-Lock-in.

Alles, was Sie für KI brauchen

Vom Model-Hosting bis zur kundenseitigen API: gebaut für Entwickler und Unternehmen, die ihre KI auf Infrastruktur betreiben wollen, die sie wirklich kontrollieren, innerhalb der EU.

100%
In der EU gehostet

Ihre Daten und Modelle bleiben auf europäischen GPUs. DSGVO-freundlich von Grund auf.

200+
Verifizierte Modelle, sofort einsatzbereit

Llama, Qwen, DeepSeek, Mistral, FLUX und viele mehr. Modell wählen und in Minuten warm, ohne DevOps auf Ihrer Seite.

2 SDK
OpenAI- und Anthropic-kompatibel

Richten Sie Ihren bestehenden Client auf den Router und behalten Sie Ihre Tools. Kein Umschreiben, kein Lock-in.

Von null zum warmen Endpoint in Minuten

Keine Infrastruktur zu verwalten. Modell wählen, OpenAI-kompatible URL erhalten, ausliefern.

1

Modell wählen

Wählen Sie aus dem Model Garden oder fügen Sie eine beliebige HuggingFace-ID ein. VRAM festlegen und eine EU-GPU wählen.

2

Endpoint erhalten

Wir deployen vLLM, führen Readiness-Checks aus und übergeben Ihnen eine warme OpenAI- und Anthropic-kompatible URL plus API-Key.

3

Routen und ausliefern

Richten Sie Ihren Client auf den Router. Er routet automatisch zu einer warmen Instanz, legt GPUs bei Inaktivität schlafen und protokolliert jeden Request.

Gebaut für Teams, die Daten nicht aus der Hand geben dürfen

Wenn eine US-Cloud nicht infrage kommt, bietet HostYourAI dieselbe Developer Experience auf europäischer Infrastruktur.

Öffentlicher Sektor und Verwaltung

Bürgerdaten, die rechtlich in der EU bleiben müssen, mit voller Nachvollziehbarkeit.

Regulierte Unternehmen

Finanz-, Gesundheits- und Rechtsteams unter DSGVO, DORA und AI Act.

EU-SaaS und Scale-ups

Liefern Sie KI-Funktionen, denen Ihre Kunden vertrauen, ohne US-Unterauftragsverarbeiter.

Agenturen und Integratoren

Private KI für Ihre Kunden auf Infrastruktur, hinter der Sie stehen können.

Privat by Default

HostYourAI hält Ihre Modelle, Prompts und Daten auf europäischen GPUs. Gebaut für Teams, denen Compliance, Zuverlässigkeit und echte Kontrolle wichtig sind.

EU-hostedGDPR-friendlyOpenAI-compatiblevLLM-poweredNo lock-in
EU
Full data sovereignty

GPUs and data residency inside Europe. Your prompts never leave the EU.

Open
Models you can audit

Run open-weight models with no black boxes or hidden telemetry.

€0
Scale to zero

GPUs idle when nobody is online, so you only pay for what you run.

Yours
No vendor lock-in

Your infra, your keys, your models. Leave whenever you want.

Model garden

Funktioniert mit über 390 offenen Modellen

Text- und Bildmodelle auf dedizierten EU-GPUs. Jedes Modell auf unserer eigenen Hardware getestet.

Ebenfalls interessant

Mehr über EU-gehostete KI auf HostYourAI.

Hosten. Routen. Ausliefern.

Keine Kreditkarte nötig. Pay as you go, jederzeit kündbar.

Heute kostenlos starten