Sofort über den EU-Router oder als dediziertes GPU-Deployment. Ihre Daten bleiben in Europa.
[!Note] This model card is for the new versions of the Gemma 4 family optimized with Quantization-Aware Training (QAT), which allows preserving similar quality to bfloat16 while dramatically reducing the memory requirements to load the model. Four versions of the QAT checkpoints...
Gemeinsamer EU-Router, Pay-per-Token, Scale-to-Zero. Dedizierte GPU-Deployments werden stundenweise abgerechnet, siehe Preise.
✓ Funktionsfähig verifiziert am 13-07-2026, Antwort in 4780 ms auf unserer EU-Infrastruktur.
Drop-in-Ersatz für OpenAI: Ändern Sie nur die Base-URL und den API-Key. Auch das Anthropic-Format (/v1/messages) wird unterstützt.
curl https://hostyourai.com/api/v1/chat/completions \
-H "Authorization: Bearer hyai-..." \
-H "Content-Type: application/json" \
-d '{
"model": "google/gemma-4-31B-it-qat-w4a16-ct",
"messages": [{"role": "user", "content": "Hello!"}]
}'
Ja. HostYourAI betreibt gemma 4 31B it qat w4a16 ct auf GPUs in europäischen Rechenzentren über vLLM. Prompts und Outputs verlassen die EU nicht und es ist kein US-Cloud-Anbieter in der Kette.
Ja. Die gesamte Verarbeitung findet innerhalb der EU statt, ein Auftragsverarbeitungsvertrag (AVV) ist verfügbar und die Liste der Subprozessoren ist öffentlich. Open-Source-Gewichte bedeuten außerdem: kein Training mit Ihren Daten.
gemma 4 31B it qat w4a16 ct braucht mehrere GPUs gleichzeitig und läuft deshalb als dediziertes Deployment, das nach GPU-Stunden abgerechnet wird, nicht pro Token. Nennen Sie uns Ihr Volumen, dann rechnen wir es für Sie durch.
Ja. Sie verwenden die Standard-OpenAI-SDKs mit einer angepassten Base-URL (https://hostyourai.com/api/v1). Auch die Anthropic Messages API wird als Drop-in unterstützt.
Die Kontoerstellung dauert eine Minute. Testen Sie gemma 4 31B it qat w4a16 ct direkt im Playground.
Kostenlos starten