Ökosystem

70 Millionen Anfragen pro Sekunde: OpenAI zeigt, was unter ChatGPT läuft

2 Min. Lesezeit KI-generiert

Die Speicherplattform Habitat begann 2023 als kleine Python-Bibliothek. Heute hält sie 500 Petabyte und wandert stückweise nach Rust.

Featured image for "70 Millionen Anfragen pro Sekunde: OpenAI zeigt, was unter ChatGPT läuft"

OpenAI hat einen Engineering-Text veröffentlicht, der die eigene Speicherplattform aufmacht. Sie heißt Habitat, und die Zahlen dazu sind ordentlich: über 70 Millionen Anfragen pro Sekunde, mehr als eine Milliarde Menschen pro Woche, knapp 40 Regionen, über 500 Petabyte.

Angefangen hat das Ding 2023 zur DevDay als kleine Python-Bibliothek für GPTs, mit einer einzigen Datenbank dahinter, Azure Cosmos DB.

Der eigentliche Punkt

Die Autoren Jon Lee, Chaomin Yu und Ben Ries schreiben einen Satz, der hängen bleibt: Infrastruktur in dieser Größe zu bauen sei aufwendig, aber nicht besonders schwierig. Schwierig sei das Tempo. Wer normalerweise Systeme baut, plant für das Zehnfache und hofft, dass es ein paar Jahre hält. Bei OpenAI war es drei Jahre in Folge das Zehnfache - pro Jahr.

Was daraus folgt, ist keine große Architekturidee, sondern eine Kette taktischer Entscheidungen: aus der Bibliothek einen Dienst machen, Verzögerungen im asyncio-Loop jagen, die Ausreißer beim Nachschlagen von Feature Flags wegbekommen, Verbindungspools bändigen, verhindern, dass nachgelagerte Systeme überflutet werden. Und stückweise von Python nach Rust ziehen.

Ein zweiter Teil ist angekündigt, zu Mandantentrennung, Lesegeschwindigkeit und der Arbeit mit Cosmos DB.

Warum ich das lese

Solche Texte sind selten, weil sie unbequem sind: Sie zeigen, wo es geknirscht hat, nicht wo alles glänzt. Python als Serving-Sprache für eine Speicherplattform ist eine Entscheidung, die man normalerweise nicht öffentlich erklärt.

Für uns, die wir Agenten auf fremder Infrastruktur laufen lassen, steht darin auch eine nüchterne Erinnerung. Wenn Claude Code oder Cowork hängt, liegt das selten am Modell. Es liegt an einer Warteschlange, einem Verbindungspool oder einem Cache, den jemand anders zu skalieren versucht - drei Ebenen unter dem, was wir sehen.

Quellen:

OpenAIEngineeringInfrastruktur