Praxisbericht: Die 120-Petabyte-Challenge
Europa baut sich eine Cloud, die es selbst kontrolliert. Im Rahmen der ApeiroRA-Initiative bauen SAP und Clyso das dazugehörige Speicher-Rückgrat — vollständig auf europäischer Hardware in europäischen Rechenzentren, ohne Hyperscaler, ohne proprietäre Appliances, ohne Ausnahmen. Das Ziel: 120 Petabyte verteilt auf 30 Regionen, vollständig quelloffen, vollständig selbst verwaltet.
Der eigentliche Test eines solchen Systems ist, ob es langweilig ist. Seit dem ersten Produktivstart im Mai 2024 ist die Flotte auf 10 Live-Regionen und rund 2.800 OSDs gewachsen — bei monatlichen Betriebssystem-Updates, vierteljährlichen Kubernetes- und Rook-Upgrades sowie einer vollständigen Ceph-Migration von Reef nach Squid. Ohne Ausfallzeiten für Kundinnen und Kunden, ohne Datenverlust. Ein Ceph-Major-Upgrade auf dem größten Cluster läuft in etwa zwei Tagen unbeaufsichtigt durch. Plattenausfälle sind Routine, keine Vorfälle.
Die Wette dahinter: Speicher als Kubernetes-Objekt behandeln, nicht als Appliance. Ein zentrales Helm-Blueprint legt globale Best Practices fest; schlanke regionsspezifische Overlays tragen das, was sich unterscheidet. Der Bare-Metal-Lebenszyklus (Gardener, Metal-API) liegt in einer eigenen Ebene, sodass sich Rook auf den Speicher selbst konzentrieren kann. Derselbe GitOps-Workflow bringt die kleinste Region und die größte hoch.
Vorkenntnisse
Technologien auf denen ausgebaut wird:
- Kubernetes-Grundlagen — Pods, Deployments, StatefulSets, CRDs und Helm. Sie müssen keine Operator-Autoren sein, sollten aber eine CRD-Spezifikation lesen können.
- Grundlegende Speicherkonzepte — der Unterschied zwischen Object-, Block- und File-Storage; wie eine S3-kompatible API aus Client-Sicht aussieht.
- Ein grobes mentales Modell von Ceph oder Rook ist hilfreich, aber nicht erforderlich. Wir führen die relevanten Bausteine (RADOS, OSD, RGW, MON/MGR, CRUSH) kurz ein, bevor wir in die Tiefe gehen. Vorherige produktive Ceph-Erfahrung wird nicht vorausgesetzt.
- Vertrautheit mit IaC, GitOps (Flux, Argo CD oder Ähnliches) hilft beim Abschnitt über das Helm-Blueprint mit regionalen Overlays — die Ideen lassen sich aber auf jeden deklarativen Workflow übertragen.
- IronCore (https://github.com/ironcore-dev)
Hauptzielgruppen sind Personen, die Interesse an skalierbaren und nachhaltigen IaaS-Storage-Themen haben.
Lernziele
Die Teilnehmenden erfahren, was mit modernen Ansätzen wie GitOps, IaC, Kubernetes und Co. möglich ist.