Scale-Up & -Out AI Data Center für lokale KI
KI-Anwendungen stellen neue Anforderungen an Rechen-, Speicher- und Netzwerkinfrastrukturen. Insbesondere beim Betrieb größerer Modelle spielen GPU-Ressourcen, schnelle Interconnects, Speicherbandbreite und die Kommunikation zwischen Beschleunigern eine zentrale Rolle.
Der Vortrag zeigt, welche Komponenten für (große) lokale KI-Infrastrukturen benötigt werden und wie sich klassische Rechenzentrumsarchitekturen dadurch verändern.
Anhand von Beispielen werden auch Themen wie GPU-Netzwerke, RDMA/RoCEv2, Ethernet und die Skalierung von KI-Clustern für Inferenz und Training betrachtet.
Vorkenntnisse
Grundkenntnisse in Serverbetrieb, RZ- und Netzwerkinfrastruktur.
Lernziele
- Die Teilnehmer lernen, welche Hardware für LLM-Inferenz/-Training für den jeweiligen Anwendungsfall nötig ist und wie man diese dimensioniert und miteinander verbindet.
- Es wird außerdem erläutert, wie Paketverluste sich auf die Leistung des GPU-Netzwerkes auswirken.