Zum Inhalt springen
StartseiteStart
EN
WhatsAppMailPhone
← Alle Artikel
Sechs KI-APIs mit Rechenzentrum in Deutschland und der EU im Vergleich
KI

Sechs KI-APIs mit Rechenzentrum in Deutschland und der EU im Vergleich

Foto: Brett Sayles / Pexels

IONOS AI Model Hub, STACKIT AI Model Serving, Hetzner Inference, Scaleway, OVHcloud und Mistral im Vergleich, Stand 21. September 2026. Mit Preisen je Million Token, Standort, Auftragsverarbeitungsvertrag, SLA und einer eigenen Messung mit demselben Modell bei Hetzner und Scaleway.

Eric MengeAutorEric MengeInhaber & Webentwickler bei EMIT Solution
Veröffentlicht
Lesezeitca. 9 Min.

Kurz gesagt

  • Dasselbe Modell kostet bei den EU-Anbietern sehr unterschiedlich viel. Für Qwen3.8-27B lag der Ausgabepreis am 21. September 2026 zwischen 0,65 Euro bei STACKIT und 3,30 Euro bei Scaleway je Million Token. Der höchste Preis ist damit rund fünfmal so hoch wie der niedrigste.
  • Einen Rechenzentrumsstandort in Deutschland mit Auftragsverarbeitungsvertrag und zugesagter Verfügbarkeit bieten IONOS AI Model Hub mit 99,9 Prozent und STACKIT AI Model Serving mit 99,5 Prozent.
  • Hetzner Inference ist kostenlos, aber ein Experiment ohne SLA und ohne ausgewiesenen Auftragsverarbeitungsvertrag. Für Kundendaten im Produktivbetrieb fehlt damit die Grundlage.
  • In meiner Messung am 21. September 2026 mit Qwen3.6-35B-A3B begann Scaleway im Median nach 0,49 Sekunden zu antworten, Hetzner erst nach 2,3 Sekunden. Beim Durchsatz gab es mit 43 und 50 Token pro Sekunde keinen klaren Sieger.

Wer ein Sprachmodell per API in eine eigene Anwendung einbauen will und die Daten dabei nicht in die USA schicken möchte, hat inzwischen eine echte Auswahl. Ich habe am 21. September 2026 sechs Anbieter mit Rechenzentrum in Deutschland oder der EU verglichen, ausschließlich anhand ihrer eigenen Preis- und Dokumentationsseiten. Dazu kommt eine kleine Messung, bei der Hetzner und Scaleway dasselbe Modell mit derselben Aufgabe bekommen haben.

Die Frage dahinter ist die, die sich eine Firma tatsächlich stellt. Wo bekomme ich ein Modell, das in der EU rechnet, mit Auftragsverarbeitungsvertrag, zu welchem Preis und was davon trägt einen Produktivbetrieb?

Ein Umstand macht den Vergleich einfacher. Das Modell Qwen3.8-27B, ein mittelgroßes offenes Sprachmodell mit 27 Milliarden Parametern, steht bei fünf der sechs Anbieter im Katalog. Damit lässt sich der Preis für genau dieselbe Leistung nebeneinanderstellen.

Die sechs Anbieter auf einen Blick

Alle sechs bieten eine OpenAI-kompatible Schnittstelle an. Das heißt, die Anfragen haben dieselbe Form wie bei OpenAI. Vorhandener Code braucht meist nur eine andere Adresse, einen anderen Schlüssel und einen anderen Modellnamen. Die Preise sind Listenpreise je 1 Million Token für Eingabe und Ausgabe, Stand 21. September 2026:

Anbieter Standort Qwen3.8-27B gpt-oss-120b AVV SLA
IONOS AI Model Hub Deutschland 0,40 / 2,70 € 0,15 / 0,65 € ja, Teil der AGB 99,9 %
STACKIT AI Model Serving Deutschland 0,45 / 0,65 € 0,45 / 0,65 € ja, eigener Vertrag 99,5 %
OVHcloud AI Endpoints Frankreich 0,40 / 2,70 € 0,08 / 0,40 € ja, Anhang zu den Vertragsbedingungen 99,98 %
Scaleway Generative APIs Frankreich 0,60 / 3,30 € 0,15 / 0,60 € ja, Standardvertrag 99,9 %
Mistral La Plateforme EU, US wählbar nicht im Angebot nicht im Angebot ja, Vertragsbestandteil nur Enterprise
Hetzner Inference EU kostenlos nicht im Angebot nicht ausgewiesen keins

AVV steht für den Auftragsverarbeitungsvertrag nach Art. 28 DSGVO, also den Vertrag, in dem der Anbieter zusichert, personenbezogene Daten nur in deinem Auftrag zu verarbeiten. Das SLA ist die vertraglich zugesagte Verfügbarkeit im Monat.

Bei der Frage, was mit den Inhalten passiert, liegen die Anbieter nah beieinander. IONOS, STACKIT, OVHcloud, Scaleway und Hetzner schreiben übereinstimmend, dass sie Prompts und Antworten nicht dauerhaft speichern und nicht für Training verwenden. Die Unterschiede stecken in den Details.

Dasselbe Modell kostet bis zum Fünffachen

Bei Qwen3.8-27B reicht der Ausgabepreis von 0,65 Euro bei STACKIT bis 3,30 Euro bei Scaleway. Rechnet man das auf eine realistische Menge hoch, etwa 10.000 Anfragen mit je 1.000 Token Eingabe und 400 Token Ausgabe, kommt man bei STACKIT auf 7,10 Euro, bei IONOS und OVHcloud auf 14,80 Euro und bei Scaleway auf 19,20 Euro. Beim gpt-oss-120b dreht sich die Reihenfolge fast um. Dieselbe Menge kostet bei OVHcloud 2,40 Euro, bei Scaleway 3,90 Euro, bei IONOS 4,10 Euro und bei STACKIT 7,10 Euro.

Der Grund für dieses Muster liegt bei STACKIT. Dort gibt es keine Preise je Modell, sondern drei Preisstufen. Alles in der Stufe Plus kostet gleich viel, egal ob Qwen3.8-27B, Llama 3.3 70B oder gpt-oss-120b. Für Modelle, die bei anderen teuer sind, ist das günstig, für solche, die anderswo billig sind, eher nicht. Einen Anbieter, der überall vorn liegt, gibt es also nicht. Es lohnt sich, erst das Modell zu wählen und dann den Anbieter.

Den größten Kostenhebel sieht man allerdings in keiner Preistabelle. Viele aktuelle Modelle denken vor der eigentlichen Antwort nach. Dieses Nachdenken wird als Ausgabe berechnet. Bei Scaleway ist das für Qwen3.6-35B-A3B standardmäßig eingeschaltet. Der Schalter, der bei Hetzner den Denkmodus abstellt, wurde bei Scaleway in meinen Tests ignoriert. Fünf Anfragen liefen jeweils bis zum Limit von 800 Ausgabe-Token und kamen ohne eine einzige Zeile Antwort zurück. Erst mit diesem Parameter antwortete das Modell direkt:

{
  "model": "qwen3.6-35b-a3b",
  "reasoning_effort": "none"
}

Danach brauchte dieselbe Mail rund 175 statt 800 Ausgabe-Token. Zum Listenpreis sind das 0,03 Cent statt 0,12 Cent je Anfrage. Nur die günstigere Variante liefert überhaupt ein Ergebnis. Auch gpt-oss-120b ist ein denkendes Modell, sein tatsächlicher Verbrauch liegt deshalb über dem, was am Ende als Antwort dasteht.

Kompass auf einer Europakarte Foto: Aliaksei Lepik / Pexels

Die Anbieter im Einzelnen

IONOS AI Model Hub

IONOS hat mit acht Sprachmodellen eine breite Auswahl klassischer offener Modelle, vom kleinen Llama 3.1 8B über Mistral Small 24B bis zum großen Qwen3.5-397B. Gerechnet wird in Deutschland. Laut Dokumentation landen Prompts und Antworten weder in Logs noch auf Festplatten, sie liegen nur während der Anfrage im Arbeits- und Grafikspeicher. Der Auftragsverarbeitungsvertrag ist seit Juli 2022 Teil der AGB, eine eigene Unterschrift braucht es dafür nicht. Für die Verfügbarkeit sagt IONOS 99,9 Prozent im Monatsmittel zu. Ein kostenloses Kontingent habe ich auf den Seiten von IONOS nicht gefunden. Die Preise stehen in der IONOS-Preisliste.

STACKIT AI Model Serving

STACKIT rechnet in der Region Germany South und hat sechs aktive Sprachmodelle im Angebot, darunter Qwen3.8-27B, Llama 3.3 70B, gpt-oss-120b und Gemma 4 31B. Anfragen werden laut FAQ nicht gespeichert und nicht zum Training genutzt. Im Leistungsschein steht ergänzend, dass E-Mail-Adresse und Nutzerkennung 30 Tage in den Logs bleiben. Zugesagt sind 99,5 Prozent Verfügbarkeit im Kalendermonat. Für die Planung wichtig ist die Regel zum Modellwechsel. STACKIT darf ein Modell mit sechs Monaten Vorlauf abkündigen, bei einem direkten Nachfolger mit drei Monaten. Zum Ausprobieren gibt es einen 30-Tage-Test, den Zugang schaltet STACKIT nach einer manuellen Prüfung innerhalb von 24 Stunden frei.

OVHcloud AI Endpoints

Beim gpt-oss-120b ist OVHcloud mit 0,08 Euro Eingabe und 0,40 Euro Ausgabe der günstigste Anbieter im Vergleich. Die Auswahl an reinen Textmodellen ist klein, dazu kommen mehrere Qwen-Modelle, die auch Bilder verstehen, darunter Qwen3.8-27B. Die Infrastruktur steht laut Dokumentation in Gravelines in Frankreich. OVHcloud verwendet Daten nach eigener Aussage nicht für Training und behält nur, was für die Abrechnung nötig ist. Für die Standardschnittstelle nennt OVHcloud 99,98 Prozent Verfügbarkeit, die Batch-Schnittstelle ist noch Beta und ohne Zusage. Testen geht sogar ohne Konto, dann mit zwei Anfragen pro Minute und Modell. Die Preise stehen im Modellkatalog.

Scaleway Generative APIs

Scaleway hatte am 21. September 2026 sechzehn Modelle im Katalog der Schnittstelle, darunter Llama 3.3 70B, Mistral Small 3.2, Mistral Medium 3.5, gpt-oss-120b, DeepSeek-V4-Flash, GLM-5.2 und mehrere Qwen-Varianten. Gerechnet wird in Paris. Inhalte speichert Scaleway laut Datenschutzseite nicht, mit einer Ausnahme. Stören Anfragen den Betrieb, etwa bei Serverfehlern, darf die vollständige Anfrage bis zu zwei Wochen zur Fehlersuche liegen bleiben. Training findet nicht statt. Die ersten 1.000.000 Token sind kostenlos, das SLA nennt 99,9 Prozent und Gutschriften bei Unterschreitung. Bei Qwen3.8-27B ist Scaleway der teuerste Anbieter, bei gpt-oss-120b und bei Mistral Small 3.2 mit 0,15 und 0,35 Euro dagegen sehr günstig.

Mistral La Plateforme

Mistral bietet über die eigene Plattform fast nur eigene Modelle an. Ein mittleres Modell wie Mistral Small 4 kostet 0,15 Dollar Eingabe und 0,60 Dollar Ausgabe, Mistral Large 3 liegt bei 0,50 und 1,50 Dollar. Die Daten liegen standardmäßig in der EU, wer ausdrücklich den US-Endpunkt wählt, landet in den USA. Der Auftragsverarbeitungsvertrag wird automatisch Teil des Vertrags. Zwei Punkte solltest du dir ansehen. Im Admin-Bereich gibt es einen Schalter, mit dem sich abstellen lässt, dass API-Aufrufe zur Verbesserung der Dienste genutzt werden. Und Zero Data Retention, also die Zusage, Ein- und Ausgaben gar nicht aufzubewahren, gibt es nur auf Antrag im Pay-as-you-go-Tarif. Ein SLA sieht Mistral nur für Enterprise-Kunden vor. Mehr zum Unternehmen dahinter steht in meinem Artikel über Mistral AI.

Hetzner Inference

Hetzner ist der Sonderfall. Die Inference-API ist ein kostenloses Experiment mit zwei Modellen, Qwen3.6-35B-A3B und Qwen3.8-27B. Laut Dokumentation speichert Hetzner weder Anfrage noch Antwort. Je Schlüssel sind pro Minute zehn Anfragen erlaubt, dazu vier Millionen Eingabe- und 100.000 Ausgabe-Token. Einen Auftragsverarbeitungsvertrag weist Hetzner für das Experiment nicht aus, ein SLA gibt es nicht. Hetzner rät selbst davon ab, Produktivumgebungen darauf zu bauen. Zum Entwickeln ist das ein sehr gutes Angebot, für Kundendaten fehlt die Grundlage.

Stoppuhr-App auf einem Smartphone Foto: Castorly Stock / Pexels

Hetzner und Scaleway mit demselben Modell gemessen

Hetzner und Scaleway bieten beide Qwen3.6-35B-A3B an, einmal kostenlos, einmal für 0,25 und 1,50 Euro je Million Token. Ich habe beiden am Nachmittag des 21. September 2026 dieselbe Aufgabe gestellt. Eine lockere Nachricht an einen Kunden über eine verschobene Lieferung sollte zu einer förmlichen Geschäftsmail werden. Je Anbieter liefen zwei Durchgänge mit fünf Anfragen, rund 25 Minuten auseinander. Gemessen habe ich zwei Werte. Die Zeit bis zum ersten Token zeigt, wie lange es dauert, bis überhaupt Text kommt. Der Durchsatz zeigt, wie schnell danach geschrieben wird.

Median aus 10 Läufen Hetzner Scaleway
Zeit bis zum ersten Token 2,3 s 0,49 s
Spanne 1,4 bis 6,3 s 0,28 bis 1,8 s
Durchsatz 50 Token/s 43 Token/s
Spanne 32 bis 74 Token/s 19 bis 62 Token/s
Dauer je Mail insgesamt 6,0 s 4,6 s

Scaleway fängt deutlich schneller an zu schreiben. Am Netz liegt das nicht, der Verbindungsaufbau dauerte zu beiden Servern rund 150 Millisekunden. Die Wartezeit entsteht also auf der Serverseite. Beim Durchsatz gibt es keinen klaren Sieger, die Werte schwankten bei beiden stark. Bei Hetzner halbierte sich der Durchsatz zwischen den beiden Durchgängen von 72 auf 36 Token pro Sekunde, gleichzeitig stieg die Wartezeit auf das erste Token von 1,7 auf 3,1 Sekunden. Das passt zu einem kostenlosen Dienst, den sich viele Nutzer teilen.

Sprachlich waren beide in Ordnung. In keiner der 20 Mails tauchten fremde Schriftzeichen auf, alle hatten Betreff, Anrede und einen sauberen Schluss.

Zusätzlich habe ich Qwen3.8-27B bei beiden angefragt. Bei Scaleway kam das erste Token nach rund einer halben Sekunde. Bei Hetzner trafen drei Antworten erst nach 141 bis 180 Sekunden ein, jeweils in einem einzigen Block, die vierte Anfrage lief nach 180 Sekunden in mein Zeitlimit. Zur selben Zeit antwortete Qwen3.6 am selben Endpunkt normal. Genau das meint Hetzner, wenn es von einem Experiment spricht.

Die gesamte Messung hat bei Scaleway rund 10.000 Token verbraucht und lag damit komplett im Freikontingent. Zum Listenpreis wären es gut ein Cent gewesen.

Hand unterschreibt ein Dokument Foto: Tima Miroshnichenko / Pexels

Ein EU-Rechenzentrum allein macht noch keine DSGVO-konforme Verarbeitung

Der Standort ist ein wichtiger Baustein, aber nur einer. Sobald personenbezogene Daten in die Anfragen gehen, also Namen, E-Mail-Adressen oder Kundennachrichten, brauchst du einen Auftragsverarbeitungsvertrag mit dem Anbieter, eine Rechtsgrundlage für die Verarbeitung und einen passenden Abschnitt in deiner Datenschutzerklärung. Außerdem lohnt ein Blick auf die Unterauftragsverarbeiter. Mistral schreibt zum Beispiel, dass Daten vorübergehend zu Unterauftragnehmern außerhalb der EU gehen können, die im Trust Center aufgeführt sind.

Für Hetzner Inference heißt das konkret, dass dort nur Testdaten ohne Personenbezug hingehören, solange kein Vertrag existiert. Wie die großen US-Anbieter mit gespeicherten Prompts umgehen und was Zero Data Retention dort bedeutet, habe ich in einem eigenen Artikel aufgeschrieben.

Welcher Anbieter für welchen Zweck

Zum Ausprobieren ist Hetzner Inference unschlagbar, solange keine echten Kundendaten im Spiel sind. Wer bereits mit dem Modell testen will, das später auch produktiv läuft, nimmt das Freikontingent von Scaleway, den 30-Tage-Test von STACKIT oder den kostenlosen Zugang von OVHcloud.

Für den Produktivbetrieb mit Kundendaten und dem Wunsch nach einem Standort in Deutschland bleiben IONOS und STACKIT. Beide haben einen Auftragsverarbeitungsvertrag, eine zugesagte Verfügbarkeit und rechnen in Deutschland. STACKIT ist bei Modellen der Stufe Plus mit viel Ausgabe die günstigere Wahl, IONOS hat die größere Auswahl, gerade bei kleinen und günstigen Modellen wie Mistral Small 24B für 0,10 und 0,30 Euro.

Für günstigen Massenbetrieb, etwa das Vorsortieren tausender Dokumente, führt beim gpt-oss-120b kaum ein Weg an OVHcloud vorbei. Scaleway ist mit gpt-oss-120b und Mistral Small 3.2 knapp dahinter. In beiden Fällen gilt, dass der Denkmodus bewusst eingestellt sein sollte, sonst frisst er die Ersparnis wieder auf.

Wenn du überlegst, welcher dieser Anbieter zu deiner Anwendung passt und wie du das Modell sauber in deine Abläufe einbindest, schreib mir gerne.

Häufige Fragen

Welche KI-API hat ein Rechenzentrum in Deutschland?+

Am 21. September 2026 verarbeiten IONOS AI Model Hub und STACKIT AI Model Serving die Anfragen nach eigener Aussage in Deutschland. Hetzner Inference läuft laut Hetzner in eigenen Rechenzentren in der EU, ohne genaue Ortsangabe. OVHcloud rechnet laut Dokumentation in Gravelines, Scaleway in Paris, beide also in Frankreich. Mistral hostet standardmäßig in der EU und bietet zusätzlich einen US-Endpunkt an.

Ist der IONOS AI Model Hub DSGVO-konform nutzbar?+

IONOS verarbeitet die Anfragen in Deutschland, schreibt laut Dokumentation weder Prompts noch Antworten in Logs und nutzt sie nicht für Training. Der Auftragsverarbeitungsvertrag ist seit dem 19. Juli 2022 Bestandteil der IONOS-AGB. Damit ist die Anbieterseite abgedeckt. Ob deine eigene Verarbeitung zulässig ist, hängt zusätzlich an der Rechtsgrundlage und an der Information der Betroffenen in deiner Datenschutzerklärung.

Gibt es eine kostenlose KI-API mit Servern in der EU?+

Ja, sogar mehrere. Hetzner Inference ist während des Experiments komplett kostenlos, Scaleway berechnet die ersten 1.000.000 Token nicht, OVHcloud erlaubt ohne Schlüssel zwei Anfragen pro Minute und Modell und STACKIT bietet einen 30-tägigen Test. Mistral nennt für seinen kostenlosen Tarif 10 Dollar API-Guthaben im Monat. Zum Ausprobieren reicht das, für Kundendaten braucht es einen bezahlten Tarif mit Vertrag.

Was kostet eine einzelne KI-Anfrage bei einem EU-Anbieter?+

Meist Bruchteile eines Cents. Eine umformulierte Geschäftsmail mit rund 150 Token Eingabe und 175 Token Ausgabe kostete in meiner Messung bei Scaleway mit Qwen3.6 zum Listenpreis etwa 0,03 Cent. Bleibt der Denkmodus des Modells an, verbraucht dieselbe Anfrage 800 Ausgabe-Token und liefert trotzdem keine Antwort. Bei vielen Modellen kostet die Ausgabe ein Vielfaches der Eingabe, deshalb lohnt der Blick auf diesen Schalter.

Du willst mehr erfahren?

In einem kostenlosen Erstgespräch besprechen wir, wie du diese Themen für dein Unternehmen nutzen kannst. Kein Verkaufsgespräch, sondern eine ehrliche Einschätzung.

Kostenloses Erstgespräch vereinbaren