Erweiterbare Netzwerke für das KI-Zeitalter
Die AMD AI NIC™ Technologie baut auf jahrzehntelanger Innovationsarbeit auf und stellt programmierbare und offene High-Performance-Netzwerke bereit, mit denen Hyperscaler und Cloud-Dienstleister ihre KI-Infrastruktur zuverlässig skalieren können.
Höhere KI-Performance
Gesteigerte Cluster-Verfügbarkeit
Niedrigere CapEx-Kosten
Verbesserte operative Exzellenz
Überblick zu AMD Pensando™ Vulcano 800 AI NIC
Verkürzung der Zeit bis zum Erreichen erster Ergebnisse vom Training großer Modelle bis zur Einsatzbereitschaft.
Offene Systeme treiben eine noch kosteneffizientere und besser skalierbare KI-Infrastruktur voran.
Weitere Informationen zu AMD Pensando™ Vulcano 800 AI NIC
AMD Helios Rack-Scale-Lösung für Frontier-KI3
Die AMD Helios Rack-Scale-Lösung ist eine vollständig integrierte KI-Infrastruktur, die die neuesten AMD Instinct™ GPUs, AMD EPYC™ Server-CPUs sowie die AMD Pensando™ Netzwerktechnologie zusammenführt. Sie wurde auf Basis offener Industriestandards entwickelt und ermöglicht flächendeckende Inferenz sowie Training und Feinkalibrierung von Frontier-Modellen.
AMD Instinct™ MI350P PCIe® Karte
Die AMD Instinct MI350P PCIe-Karte bietet einen praktischen Weg zur branchenübergreifenden Skalierung generativer KI-Workloads mit nur geringen oder gar keinen Änderungen an der Infrastruktur. Diese PCIe-basierten Karten basieren auf der 4. Generation der AMD CDNA™ Architektur und bieten außergewöhnliche Effizienz und Performance für gängige Unternehmens-Workloads mit einem robusten, auf Unternehmen ausgerichteten Software-Stack, der die Bereitstellung vereinfacht.
Bereitstellung von KI-fähigen, erweiterbaren Netzwerken für KI-Workloads
So verbessern erweiterbare Netzwerke die GPU-Auslastung, beschleunigen KI-Aufträge und senken die Kosten für die Skalierung der KI-Infrastruktur.
Programmierbarkeit ermöglicht die Wahl des Protokolls
Die AMD AI NIC™ Technologie baut auf einer vollständig programmierbaren P4-Engine auf und ermöglicht Protokolle wie UEC-fähiges RDMA und MRC (Multipath Reliable Connection) sowie benutzerdefinierte Transportprotokolle mit Funktionen, die entsprechend der Weiterentwicklung von Standards angepasst und erweitert werden können.
- Intelligentes Packet Spray
- Außerplanmäßige Paketverarbeitung und Nachrichtenzustellung in der richtigen Reihenfolge
- Selektive erneute Übertragung
- Steuerung einer pfadabhängigen Überlastung
- Schnelle Fehlererkennung
Intelligentes Packet Spray
Mit dem intelligenten Packet Spray können Teams die Netzwerk-Performance nahtlos optimieren, indem damit der Lastausgleich verbessert sowie die Gesamteffizienz und Skalierbarkeit gesteigert werden. Eine verbesserte Netzwerk-Performance kann die GPU-zu-GPU-Kommunikationszeiten erheblich verkürzen, was zu einer schnelleren Job-Abwicklung und einer höheren Betriebseffizienz führt.
Außerplanmäßige Paketverarbeitung und Nachrichtenzustellung in der richtigen Reihenfolge
Stellen Sie sicher, dass Nachrichten in der richtigen Reihenfolge zugestellt werden, selbst wenn Multipathing- und Packet-Spray-Techniken eingesetzt werden. Die erweiterte Funktion für die außerplanmäßige Nachrichtenzustellung verarbeitet Datenpakete, die möglicherweise nicht in der richtigen Reihenfolge ankommen, und legt sie nahtlos direkt im GPU-Speicher ab, ohne dass eine Pufferung erforderlich ist.
Selektive erneute Übertragung
Steigern Sie die Netzwerk-Performance durch die erneute Übertragung mittels selektiver Bestätigung (Selective Acknowledgment, SACK), mit der sichergestellt wird, dass nur verlorene oder beschädigte Pakete erneut übertragen werden. SACK erkennt und sendet erneut verlorene oder beschädigte Pakete effizient und optimiert so die Bandbreitennutzung, reduziert die Latenz während der Wiederherstellung von Paketverlusten und minimiert redundante Datenübertragungen für außergewöhnliche Effizienz.
Steuerung einer pfadabhängigen Überlastung
Konzentrieren Sie sich mit Echtzeittelemetrie und netzwerkfähigen Algorithmen auf Workloads statt auf Netzwerküberwachung. Die Funktion zur Steuerung einer pfadabhängigen Überlastung vereinfacht die Verwaltung der Netzwerk-Performance, sodass Teams kritische Probleme schnell erkennen und beheben können und gleichzeitig die Auswirkungen von Incast-Szenarien gemindert werden.
Schnelle Fehlererkennung
Dank der schnellen Fehlererkennung können Teams Probleme innerhalb von Millisekunden lokalisieren, was eine nahezu sofortige Failover-Wiederherstellung ermöglicht und die Ausfallzeit der GPU erheblich reduziert. Profitieren Sie von einer höheren Beobachtbarkeit des Netzwerks mit Latenzmetriken in nahezu Echtzeit sowie Statistiken zu Überlastungen und Verlusten.
Produktportfolio
AMD KI-Netzwerktechnologie im Rampenlicht
Partner
- OEM und ODM
- Infrastrukturlösungen
- Festplattenspeicher
- Switching
- Ökosystem
Ressourcen
Kontakt
Die Zukunft von KI-Networking erschließen
Erfahren Sie, wie die AMD Pensando Pollara 400 AI NIC Ihre erweiterbare KI-Infrastruktur transformieren kann.
Lösungen für Rechenzentren
Entdecken Sie die komplette Suite von AMD Netzwerklösungen, die für moderne High-Performance-Rechenzentren entwickelt wurden.
Fußnoten
- Basierend auf Halbleitermodellierungen von AMD Engineering und synthetischen Benchmark-Simulationen von AMD wurde mithilfe des Benchmark-Tests MOE_4p5T hi_sparsity_ea9 die Beschleunigung der Zeit in Tagen von der Projektierung bis zur Lösung unter Einsatz des FP8-Trainingsdatentyps auf einem mit 8.000 AMD Instinct MI455X GPUs und (3) vs. (2) AMD Pensando Vulcano AI NIC ausgestatteten LLM-Systemmodell simuliert.
Die Ergebnisse spiegeln die Analyse der reinen Trainingsberechnungen (nur Dekodierungsschichten) wider. Die Konfiguration wurde mit einer globalen Batchgröße von 4096 und einer Sequenzlänge von 4K unter Einsatz der SwiGLU-Aktivierung bewertet. Die Ergebnisse berücksichtigen nicht den Overhead für die Auswertung und die Checkpoints. FlashAttention V3 mit matmul–softmax overlap wurde als gegeben angenommen. Die Kommunikationskosten für AllReduce und All2All wurden vollständig berücksichtigt und nicht mithilfe von Tiled Compute-Communication overlap verdeckt. Der Gradientenabgleich und das FSDP-Gewichte-Vorauslesen wurden für die Bewertung der Erweiterbarkeit bei unterschiedlichen Überlappungsgraden bewertet. Die Ergebnisse gehen von einem idealen und nicht vollständig optimierten Verhalten unter realen Bedingungen aus und können bei der Markteinführung der tatsächlichen Produkte abweichen. MI400-018. - PEN-022: Vergleich und Preisangaben von AMD mit Stand zum 18. Mai 2026 für die Kosten der Netzwerkstruktur für die Unterstützung von 32.000 GPUs. Vergleich einer als Teil eines Helios-Rack-Scale-Systems mit 1,6T Tomahawk 6-Switching mit 200G SerDes bereitgestellten Vulcano-basierten Netzwerkkarte (VULCANO-CUSTOM-2.4T) mit einer 800G-Netzwerkkarte mit 800G Tomahawk 6-Switching mit 100G SerDes eines Mitbewerbers. Beide Strukturen waren auf Tomahawk 5 800G-Switching-Plattformen aufgebaute Fat-Tree-Topologien, für die die Netzwerkkartenkosten als vergleichbar angesehen wurden. Weil das Vulcano-basierte Design eine kosteneffizientere Architektur mit weniger Switching-Plattformen, mehr Bandbreite pro Port im Netzwerk und einem geringeren Bedarf an Transceiver-Kabeln/optischen Komponenten ermöglicht, wurden für dieses Design Einsparungen von bis zu 33 % bei den Kosten für das Netzwerk-Switching angenommen.
TH6-100G SerDes Fat Tree (Mitbewerber):
Switching (TH6C BCM78914 – 128 x 800 GbE):
• Leaf-Switches 1.000
• Spine-Switches 500
• Switches insgesamt 1.500
• Stückpreis TH6 100G 79.587 USD
• Gesamtkosten Switches 60 Mio. USD
Kabel/Glasfasertechnologie:
• NIC-Transceiver (800G-DR8) 64.000 zu je 500 USD
• Leaf-/Spine-Transceiver (800G-DR8) 192.000 zu je 500 USD
• MPO-Kabel 256.000 zu je 89 USD
• Gesamtpreis Kabel/Glasfasertech. 64 Mio. USD
TH6-100G-Struktur-Gesamtkosten (Switches + Kabel / Glasfasertech.): 124 Mio. USD
TH6-200G SerDes Fat Tree (Vulcano-Custom2.4T/AMD Lösung):
Switching (TH6P BCM78910 – 64 x 1,6 TbE):
• Leaf-Switches 1.000
• Spine-Switches 500
• Switches insgesamt 1.500
• Stückpreis TH6 200G 66.336 USD
• Gesamtkosten Switches 50 Mio. USD
Kabel/Glasfasertechnologie:
NIC-Transceiver (1,6T-DR8) 32.000 zu je 900 USD (50 % weniger Einheiten im Vergleich zu Mitbewerbern)
Leaf-/Spine-Transceiver (1,6T-DR8) 64.000 zu je 900 USD
MPO-Kabel 128.000 zu je 89 USD (50 % weniger Einheiten im Vergleich zu Mitbewerbern)
Gesamtpreis Kabel/Glasfasertech. 43 Mio. USD
TH6-200G-Struktur-Gesamtkosten (Switches + Kabel / Glasfasertech.): 93 Mio. USD
CapEx-Einsparungen (nur Struktur):
Einsparungen in USD: 30,7 Mio. USD
Einsparungen in Prozent: 33,1 %
Quellen für die Preisangaben: Mit Nutzungsgenehmigung für die Daten von SemiAnalysis zum „Hyperscaler Networking Model“. Die vollständige Analyse ist im Rahmen eines SemiAnalysis-Abonnements verfügbar. Preise für Edgecore-Switches: Stand 17. Mai 2026. Die Ergebnisse können je nach Systemkonfiguration variieren. - Berechnungen durchgeführt vom AMD Leistungslabor im Juni 2025 basierend auf den prognostizierten Spezifikationen hinsichtlich der Speicherkapazität/Bandbreite sowie der Skalierungs-/Erweiterungsbandbreite des AMD Instinct™ MI455X 72xGPU „Helios“ KI-Racks im Vergleich zum offiziell angekündigten NVIDIA „Vera Rubin“ 72xGPU „Oberon“-KI-Rack. Serverhersteller wählen möglicherweise andere Konfigurationen, was zu anderen Ergebnissen führen kann. MI350-045A.
Berechnungen durchgeführt vom AMD Leistungslabor im September 2025 basierend auf den Datentypen FP8/FP4 und den prognostizierten Spezifikationen für das AMD Instinct™ MI455X 72xGPU „Helios“-KI-Rack im Vergleich zu den offiziell bekannt gegebenen Spezifikationen für das NVIDIA „Vera Rubin“ 72xGPU „Oberon“-KI-Rack. Die tatsächlichen Ergebnisse auf Basis von Chips aus der Produktion können abweichen. Serverhersteller wählen möglicherweise andere Konfigurationen, was zu anderen Ergebnissen führen kann. MI350-046B.