Enterprise AI Infrastructure

Die Plattform, bevor das erste Modell produktiv geht

GPU-Knoten, Model Serving, AI Gateway, Identity, Observability und Kostenzuordnung — die Schicht, auf der interne AI-Anwendungen betrieben werden können, statt einzeln gegen die API eines Anbieters zu laufen. Als Beratungstag oder als Aufbauprojekt.

Ausgangslage

Wo Sie stehen

Organisationen kommen nicht in einem Schritt zu einer Plattform. Vier Stufen lassen sich unterscheiden, und jede legt eine andere nächste Maßnahme nahe. Die ehrliche Einordnung ist der schnellste Weg von „wir wollen etwas mit KI machen“ zu einer Aufgabe, über die man reden kann.

Stufe 0
Schatten-KI Es gibt keine Plattform. Nutzung findet statt, aber unsichtbar — über private oder team-eigene Zugänge. Kein Inventar, kein Audit-Log, keine Kostenzuordnung. Niemand kann sagen, wie viele Menschen im Haus KI tatsächlich nutzen.
Stufe 1
Zentraler Zugang Ein AI-Gateway bündelt den Zugriff. Identität, Kontingente und Protokollierung existieren, die Modelle laufen noch vollständig bei externen Anbietern. Hier entsteht Sichtbarkeit — und damit erstmals belastbare Zahlen für jede weitere Entscheidung.
Stufe 2
Hybrid Zusätzlich laufen eigene Modelle auf eigenen GPUs, und das Gateway entscheidet, welche Anfrage wohin geht. Ab hier braucht es den vollen GPU- und Serving-Stack. Meist erzwungen durch eine Datenklasse, die das Haus nicht verlassen darf.
Stufe 3
Plattform mit Governance Mehrere Teams nutzen dieselbe Plattform: Mandantentrennung, erzwungene Richtlinien, Kostenzuordnung je Team und nachvollziehbare Protokollierung dessen, welche Daten welches Modell erreichen.

Zusammenarbeit

Zwei Arten, mit mir zu arbeiten

Beratungstage

Ein Tag, an dessen Ende eine Entscheidung steht — nicht ein Angebot für das nächste Gespräch. Typische Anlässe:

  • Einordnung der eigenen Lage und die begründete nächste Maßnahme
  • Review einer geplanten Architektur, bevor Hardware bestellt wird
  • Kapazitäts- und Kostenrechnung für eine konkrete Nutzerzahl
  • Zweitmeinung zu einem laufenden Vorhaben
  • Make-or-Buy: eigene GPUs gegen externe Modellnutzung

Aufbauprojekte

Die Plattform bauen und an ein Team übergeben, das sie danach ohne mich betreibt. Umfang je nach Stufe und Größenordnung:

  • AI Gateway mit Identity, Kontingenten und Protokollierung
  • GPU-Knoten unter Kubernetes, Scheduling und Multi-Tenancy
  • Model Serving und Modellkatalog
  • Secrets, Observability, Kostenzuordnung je Team
  • GitOps-Auslieferung und Betriebsdokumentation

Reihenfolge

Oben anfangen, nach unten weiterbauen

Eine Plattform wächst in Stufen, und der Wechsel von einer in die nächste erfordert keinen Umbau. Das Gateway bleibt dasselbe, die Identität bleibt dieselbe, GitOps und Monitoring bleiben. Ergänzt wird jeweils eine Schicht darunter — eigene GPU-Knoten, sobald eine Datenklasse das Haus nicht verlassen darf; getrennte Pools nach Lastprofil, sobald ein zweiter Anwendungsfall mit unvereinbarem Profil dazukommt.

Das gilt allerdings nur in einer Richtung. Wer oben beginnt — beim Gateway —, baut nach unten weiter. Wer unten beginnt — bei den GPUs —, muss die Zugriffsschicht nachträglich einziehen, während bereits Anwendungen direkt auf die Modelle zugreifen. Das ist der teuerste vermeidbare Fehler in diesem Feld, und er wird fast immer aus Begeisterung für die Hardware gemacht.

Grundlage

Alles hier steht ausführlich im Buch

Umschlag des Lab Guide „Enterprise AI Platform“

Enterprise AI Platform — Lab Guide. 398 Seiten, kostenlos und ohne Anmeldung. Die Reifegrade und die Reihenfolge oben stammen daraus — zusammen mit den Referenzarchitekturen, der Kapazitätsplanung und den durchgerechneten Betriebskosten, die auf dieser Seite keinen Platz haben. Zum Buch

Wenn Sie sich in einer der Stufen wiedererkennen: Schreiben Sie mir, in welcher — das ist der schnellste Einstieg in ein sinnvolles erstes Gespräch.