Rechenarchitekturen im Vergleich

CPU, GPU, NPU, TPU, FPGA und ASIC: Unterschiede erklärt

CPU, GPU, NPU, TPU, FPGA und ASIC unterscheiden sich grundlegend darin, wie sie Rechenleistung bereitstellen. Welche Unterschiede es gibt, wo die einzelnen Architekturen ihre Stärken ausspielen und warum moderne Systeme immer häufiger mehrere davon kombinieren.

9 min
Infografik vergleicht CPU, GPU, TPU, NPU, FPGA und ASIC mit Symbolen und Eigenschaften.
CPU, GPU, TPU, NPU, FPGA und ASIC verfolgen unterschiedliche Ansätze für die Verarbeitung von Daten und Rechenaufgaben. Ihre Stärken liegen je nach Architektur bei Flexibilität, Parallelität, Energieeffizienz oder Spezialisierung.

CPU, GPU, TPU, NPU, FPGA und ASIC verfolgen sehr unterschiedliche Ansätze, um Rechenleistung bereitzustellen. Während die CPU möglichst viele Aufgaben flexibel übernehmen kann, sind andere Architekturen gezielt für Parallelverarbeitung, künstliche Intelligenz, Echtzeit oder maximale Energieeffizienz ausgelegt. Welche Architektur ihre Stärken wo ausspielt und warum moderne Systeme immer häufiger mehrere davon kombinieren.

Warum ein Prozessor heute selten alles erledigt

Lange Zeit ließ sich die Architektur eines Computers stark vereinfacht mit drei Begriffen beschreiben: Prozessor, Arbeitsspeicher und Ein-/Ausgabe. Im Mittelpunkt stand die Central Processing Unit, kurz CPU. Sie führte Programme aus, koordinierte Peripherie und übernahm einen großen Teil der eigentlichen Berechnungen.

Für viele moderne Workloads reicht eine universelle CPU als alleinige Recheneinheit jedoch zunehmend nicht mehr aus, wenn Durchsatz, Energieeffizienz oder Latenz optimiert werden sollen. Machine Learning, Bildverarbeitung, Simulation, autonomes Fahren, industrielle Echtzeitsysteme und Cloud Computing erzeugen Rechenlasten, die sich teilweise grundlegend voneinander unterscheiden. Manche Programme bestehen aus komplexen, aufeinanderfolgenden Entscheidungen. Andere müssen dieselbe mathematische Operation Millionen- oder Milliardenfach parallel ausführen. Wieder andere verlangen Reaktionszeiten im Mikrosekundenbereich oder müssen mit wenigen Watt Leistungsaufnahme auskommen.

Die Folge ist eine zunehmende Spezialisierung der Hardware. Neben klassischen CPUs kommen GPUs, TPUs, NPUs, FPGAs und ASICs zum Einsatz. Dabei beschreiben diese Begriffe unterschiedliche Ebenen der Hardware. CPU, GPU, TPU und NPU charakterisieren vor allem die Art der Verarbeitung beziehungsweise Spezialisierung. FPGA und ASIC beziehen sich stärker auf die technische Realisierung eines Chips. Überschneidungen sind deshalb möglich: Eine TPU ist beispielsweise selbst ein speziell entwickelter ASIC.

Jede dieser Architekturen und Hardwareklassen verschiebt das Verhältnis zwischen Flexibilität, Parallelität, Energieeffizienz, Latenz und Entwicklungsaufwand.

Die entscheidende Frage lautet deshalb immer seltener: Welcher Prozessor ist am schnellsten? Wichtiger ist: Welche Rechenarchitektur passt zur jeweiligen Aufgabe?

CPU: Der universelle Allrounder

Die CPU ist die flexibelste Recheneinheit im Vergleich. Moderne CPUs verfügen über mehrere leistungsfähige Prozessorkerne, umfangreiche Cache-Hierarchien, ausgefeilte Sprungvorhersagen und komplexe Steuerlogik. Sie können sehr unterschiedliche Programme ausführen und reagieren gut auf häufig wechselnde Befehlsfolgen.

Infografik mit CPU-Prozessor, Erklärung von Eigenschaften, Anwendungen und Symbolen auf hellem Hintergrund.
Die CPU ist der universelle Allrounder unter den Recheneinheiten. Ihre Stärke liegt vor allem bei sequenziellen Abläufen, Steuerungsaufgaben und allgemeiner Software.

Ihre große Stärke liegt bei sequenziellen und verzweigten Abläufen. Betriebssysteme, Datenbanken, Steuerungssoftware oder klassische Desktop-Anwendungen enthalten zahlreiche Entscheidungen und voneinander abhängige Verarbeitungsschritte. Genau dafür sind CPUs optimiert.

Ein einzelner CPU-Kern kann komplexe Kontrollflüsse und sehr unterschiedliche Instruktionsfolgen effizient bearbeiten. Moderne Prozessoren nutzen dazu unter anderem Out-of-Order Execution, spekulative Ausführung, SIMD-Einheiten und mehrere Cache-Ebenen.

Diese Flexibilität kostet allerdings Chipfläche und Energie. Große Cache-Speicher, Decoder, Scheduler und Kontrolllogik belegen Transistoren, die bei spezialisierten Beschleunigern gezielter für Rechenwerke eingesetzt werden können.

Bei massiv parallelen Aufgaben gerät eine CPU deshalb häufig gegenüber spezialisierten Architekturen ins Hintertreffen. Für Betriebssysteme, Steuerung, komplexe Programmabläufe und allgemeine Anwendungen bleibt sie dennoch die zentrale Recheneinheit vieler Systeme.

GPU: Tausende Berechnungen gleichzeitig

Die Graphics Processing Unit entstand ursprünglich für die Berechnung von Computergrafik. Dabei müssen zahlreiche Pixel, Vertices und Matrizen mit ähnlichen mathematischen Operationen verarbeitet werden. Diese Aufgaben lassen sich hervorragend parallelisieren.

Genau daraus ergibt sich die Architektur moderner GPUs. Sie enthalten sehr viele Recheneinheiten, die gleichzeitig ähnliche Operationen durchführen können. Während eine CPU vergleichsweise wenige leistungsfähige Kerne besitzt, setzt eine GPU auf eine große Zahl kleinerer Recheneinheiten und einen hohen Datendurchsatz.

Das macht GPUs für Anwendungen interessant, bei denen sich eine Aufgabe in viele gleichartige Teilaufgaben zerlegen lässt. Neben Rendering gehören dazu wissenschaftliche Simulationen, High Performance Computing und insbesondere Machine Learning.

Grafikkarte neben einer deutschen Infografik über Grafikprozessoren und deren Einsatzbereiche.
GPUs kombinieren viele Recheneinheiten für massiv parallele Berechnungen. Damit eignen sie sich besonders für KI-Training, Simulationen, Rendering und High Performance Computing.

Beim Training neuronaler Netze müssen enorme Mengen an Matrix- und Vektoroperationen ausgeführt werden. Eine GPU kann viele dieser Multiplikationen und Additionen parallel berechnen und erreicht dadurch bei geeigneten Workloads eine deutlich höhere Rechenleistung als eine CPU.

Diese Architektur hat allerdings ihren Preis. Programme mit vielen Verzweigungen, ständig wechselnden Aufgaben oder streng sequenziellen Abhängigkeiten können die Recheneinheiten einer GPU nur schlecht auslasten. Für harte Echtzeitanforderungen mit exakt vorhersehbaren Latenzen sind GPUs häufig weniger geeignet als entsprechend ausgelegte FPGAs oder ASICs.

Die GPU ist deshalb besonders leistungsfähig, wenn sehr große Datenmengen mit vergleichbaren mathematischen Operationen verarbeitet werden müssen.

TPU: Wenn Machine Learning die Hardware bestimmt

Mit zunehmender Bedeutung künstlicher Intelligenz entstand eine weitere Klasse spezialisierter Beschleuniger. Tensor Processing Units, kurz TPUs, sind von Google entwickelte, anwendungsspezifische integrierte Schaltungen für Machine-Learning-Workloads. Damit gehören TPUs technisch zur Gruppe der ASICs.

Ihr Schwerpunkt liegt auf mathematischen Operationen, die bei neuronalen Netzen besonders häufig auftreten. Dazu gehören vor allem Matrixmultiplikationen und andere Tensoroperationen. Statt möglichst flexibel unterschiedliche Arten von Programmen auszuführen, werden große Teile der Hardware gezielt für diese Rechenmuster optimiert.

Typisch sind große Matrix-Recheneinheiten mit systolischen Arrays. Dabei werden Daten durch ein Netz aus Rechenelementen geleitet und mehrfach weiterverwendet. Dadurch lassen sich Speicherzugriffe reduzieren und viele Multiplikationen sowie Additionen gleichzeitig durchführen.

Infografik mit der Aufschrift TPU, einer Platine und Stichpunkten zu KI- und Rechenanwendungen.
TPUs sind auf Tensor- und Matrixoperationen spezialisiert, wie sie bei Machine-Learning-Anwendungen in großer Zahl auftreten. Dadurch können sie KI-Workloads besonders effizient verarbeiten.

Gerade bei großen KI-Modellen entsteht daraus ein erheblicher Effizienzvorteil. Ein solcher Beschleuniger kann einen großen Teil seiner Chipfläche unmittelbar für die mathematischen Kernoperationen einsetzen und benötigt weniger komplexe Steuerlogik als eine allgemeine CPU.

Auch reduzierte Zahlenformate spielen eine wichtige Rolle. Für viele KI-Berechnungen ist keine durchgehend hohe numerische Präzision erforderlich. Je nach Architektur und Generation kommen beispielsweise BF16, FP16, FP8 oder Integer-Formate zum Einsatz. Sie benötigen weniger Speicher und können mehr Rechenoperationen pro Chipfläche und Zeiteinheit ermöglichen.

Aktuelle TPUs eignen sich insbesondere für große Machine-Learning-Workloads, Training und skalierte Inferenz. Die genaue Ausrichtung hat sich über mehrere Generationen hinweg weiterentwickelt. Für klassische Software oder häufig wechselnde Algorithmen bieten universellere Architekturen mehr Flexibilität.

NPU: KI-Rechenleistung wandert an die Edge

Neural Processing Units, kurz NPUs, verfolgen einen ähnlichen Grundgedanken. Auch sie beschleunigen Operationen neuronaler Netze. Im Unterschied zur TPU handelt es sich bei NPU jedoch um einen allgemeinen Branchenbegriff und keine herstellerspezifische Produktfamilie.

NPUs finden sich inzwischen in Smartphones, Kameras, Embedded-Systemen, PCs und Automotive-SoCs. Dort übernehmen sie beispielsweise Bilderkennung, Sprachverarbeitung, Sensorfusion oder lokale generative KI.

Ein wichtiges Entwicklungsziel ist dabei die Energieeffizienz. Viele Edge-Geräte verfügen nur über begrenzte elektrische Leistung und Kühlung. Gleichzeitig sollen KI-Funktionen möglichst lokal und mit geringer Latenz ausgeführt werden.

Eine NPU kann deshalb Rechenoperationen übernehmen, die auf einer CPU deutlich mehr Energie beanspruchen würden. Auch eine leistungsfähige GPU muss dadurch für bestimmte KI-Workloads nicht dauerhaft aktiv sein. Wie groß der Effizienzvorteil tatsächlich ausfällt, hängt allerdings vom konkreten Modell, der unterstützten Software und der Auslastung der Hardware ab.

Ein weiterer Vorteil lokaler Verarbeitung besteht darin, dass Daten nicht zwingend zu einem Rechenzentrum übertragen werden müssen. Bei Kameradaten, Sprachverarbeitung oder Fahrzeugsensoren kann die KI direkt im Gerät reagieren.

Infografik mit NPU-Chip, Icons und Stichpunkten zu Eigenschaften und typischen Anwendungen.
NPUs beschleunigen neuronale Netze direkt im Endgerät. Ihre hohe Energieeffizienz macht sie vor allem für Edge-KI, Smartphones, Kameras und Embedded-Systeme interessant.

Die Grenzen zwischen NPU und anderen KI-Beschleunigern sind fließend. Hersteller verwenden unterschiedliche Begriffe und Architekturen. Gemeinsam ist ihnen die Spezialisierung auf Operationen neuronaler Netze und das Ziel, KI-Workloads effizienter als auf universellen Recheneinheiten auszuführen.

TPU und NPU: Wo liegt der Unterschied?

TPUs und NPUs ähneln sich auf den ersten Blick stark, da beide für KI-Berechnungen optimiert sind. Die Begriffe sind allerdings nicht direkt gleichrangig.

Tensor Processing Unit ist die Bezeichnung von Google für eine Familie speziell entwickelter KI-Beschleuniger. Technisch handelt es sich dabei um ASICs, deren Architektur gezielt auf Matrix- und Tensoroperationen für Training und Inferenz ausgelegt ist.

NPU ist dagegen ein allgemeinerer Branchenbegriff. Neural Processing Units sind spezialisierte Recheneinheiten für Machine-Learning- beziehungsweise Deep-Learning-Operationen und werden von unterschiedlichen Herstellern mit jeweils eigenen Architekturen entwickelt.

In der Praxis werden TPUs häufig mit großen Rechenzentrums-Workloads und skalierter Verarbeitung verbunden. NPUs sind besonders häufig Bestandteil heterogener SoCs in Smartphones, PCs, Fahrzeugen oder Embedded-Systemen, wo Energieverbrauch, Chipfläche und lokale Inferenz eine wichtige Rolle spielen.

Eine technische Trennlinie lässt sich daraus allerdings kaum ableiten. Auch NPUs können anspruchsvolle Modelle beschleunigen, während spezialisierte Tensorbeschleuniger grundsätzlich ebenso in kleineren Systemen eingesetzt werden können. Entscheidend sind Architektur, unterstützte Datenformate, Speicheranbindung, Software-Stack und Zielanwendung. Die Bezeichnung allein sagt deshalb nur begrenzt etwas über die tatsächliche Leistungsfähigkeit eines Chips aus.

FPGA: Wenn die Hardware selbst programmierbar wird

Beim Field-Programmable Gate Array ändert sich das Grundprinzip. Eine CPU oder GPU besitzt eine fest definierte Mikroarchitektur und führt darauf Software aus. Beim FPGA lässt sich dagegen ein großer Teil der Hardwarestruktur konfigurieren.

Ein FPGA besteht aus programmierbaren Logikblöcken, Flip-Flops, Speicherblöcken, DSP-Einheiten und einem Netz konfigurierbarer Verbindungen. Entwickler können daraus eigene digitale Datenpfade aufbauen.

Infografik mit FPGA-Platine, Anwendungsbereichen und Bewertungsübersicht auf hellem Hintergrund.
FPGAs ermöglichen frei konfigurierbare Datenpfade und parallele Hardwarestrukturen. Sie kommen vor allem dort zum Einsatz, wo geringe und deterministische Latenzen sowie hohe Anpassbarkeit gefragt sind.

Dadurch lässt sich die Hardware sehr genau an eine Aufgabe anpassen. Mehrere Verarbeitungsschritte können gleichzeitig arbeiten und Daten in einer Pipeline weiterreichen. Eine klassische Folge von Maschinenbefehlen ist dafür nicht zwingend erforderlich.

Bei entsprechendem Design lassen sich dadurch sehr niedrige und gut vorhersehbare Latenzen erreichen. Besonders interessant ist das in industrieller Automation, Kommunikationstechnik, Mess- und Prüfsystemen, Bildverarbeitung oder Finanzanwendungen.

Auch als Prototyping-Plattform spielen FPGAs eine wichtige Rolle. Entwickler können neue Hardwarearchitekturen erproben, bevor sie später möglicherweise als ASIC gefertigt werden.

Die hohe Flexibilität auf Hardwareebene erhöht allerdings den Entwicklungsaufwand. FPGA-Design verlangt Kenntnisse über digitale Schaltungen, Timing, Datenpfade und Hardwarebeschreibungssprachen beziehungsweise High-Level-Synthesis-Tools.

ASIC: Maximale Spezialisierung im Silizium

Am anderen Ende der Spezialisierung steht der Application-Specific Integrated Circuit. Ein ASIC wird gezielt für eine bestimmte Anwendung oder Funktionsgruppe entwickelt.

Datenpfade, Speicher, Schnittstellen und Rechenwerke können exakt auf den vorgesehenen Einsatz zugeschnitten werden. Dadurch lassen sich Chipfläche, Energieverbrauch und Rechenleistung sehr weit optimieren.

Infografik mit ASIC-Chip, technischen Stichpunkten und Symbolen auf hellem Hintergrund.
ASICs werden speziell für eine definierte Aufgabe entwickelt. Die geringe Flexibilität wird durch hohe Leistung und Energieeffizienz ausgeglichen, insbesondere bei großen Stückzahlen.

Wo eine CPU zahlreiche Funktionen für unterschiedlichste Programme bereithalten muss, kann ein ASIC ausschließlich die tatsächlich benötigten Strukturen enthalten. Das ermöglicht bei passenden Anwendungen eine besonders hohe Effizienz.

ASICs sind deshalb in vielen Produkten längst selbstverständlich. Netzwerkprozessoren, Mobilfunkchips, Bildsensor-Logik, Storage-Controller, Automotive-Komponenten oder spezielle KI-Beschleuniger können als anwendungsspezifische Schaltungen realisiert werden. Auch die TPU ist ein Beispiel für einen solchen KI-spezifischen ASIC.

Der entscheidende Nachteil liegt in Entwicklung und Produktion. Eine ASIC-Entwicklung erfordert umfangreiches Chipdesign, Verifikation, physikalische Implementierung und Fertigungsvorbereitung. Fehler können nach dem Tape-out nur mit erheblichem Aufwand korrigiert werden.

Die hohen einmaligen Entwicklungskosten lohnen sich deshalb besonders bei großen Stückzahlen oder bei Anwendungen, in denen Energieeffizienz, Leistung, Latenz oder Chipfläche wirtschaftlich entscheidend sind.

CPU, GPU, TPU, NPU, FPGA und ASIC im Vergleich

Die verschiedenen Architekturen und Hardwareansätze lassen sich entlang mehrerer Eigenschaften einordnen. Eine einfache Rangfolge gibt es dabei kaum, weil jede Optimierung Zielkonflikte mit sich bringt.

Kriterium CPU GPU TPU NPU FPGA ASIC
Flexibilität sehr hoch mittel gering bis mittel innerhalb von ML-Workloads gering bis mittel sehr hoch auf Hardwareebene sehr gering bis anwendungsspezifisch
Parallelität gering bis mittel sehr hoch sehr hoch hoch hoch anwendungsspezifisch
Energieeffizienz mittel workloadabhängig, mittel bis hoch hoch bei passenden ML-Workloads sehr hoch bei passenden KI-Workloads hoch bei optimiertem Design sehr hoch bei passender Anwendung
Latenz gut stark workload- und systemabhängig system- und workloadabhängig häufig niedrig sehr niedrig und deterministisch möglich sehr niedrig möglich
Entwicklungsaufwand gering bis mittel mittel mittel mittel hoch sehr hoch
Stärken universelle Verarbeitung massive Parallelität ML-Beschleunigung energieeffiziente KI Echtzeit und Anpassung maximale Spezialisierung

Diese Einordnung ist bewusst vereinfacht. Ein moderner High-End-Prozessor kann beispielsweise zahlreiche SIMD-Operationen parallel durchführen, während GPUs ebenfalls komplexe Kontroll- und Scheduling-Mechanismen besitzen. Auch zwischen KI-Beschleunigern, FPGAs und ASICs existieren zahlreiche Mischformen.

Vor allem Energieeffizienz und Latenz lassen sich nicht allein aus der Architekturklasse ableiten. Entscheidend ist, wie gut die jeweilige Hardware zum Workload passt und wie effizient Speicher, Software und Datenpfade zusammenspielen.

Flexibilität und Effizienz stehen in einem Spannungsverhältnis

Ein grundlegendes Muster zieht sich dennoch durch die unterschiedlichen Architekturen.

Je allgemeiner eine Recheneinheit ausgelegt ist, desto mehr Hardware muss sie für unterschiedliche mögliche Aufgaben bereithalten. Diese Flexibilität benötigt zusätzliche Transistoren für Steuerung, Speicherhierarchie und Scheduling.

Spezialisierte Architekturen können einen größeren Anteil ihrer Chipfläche für konkrete Rechenoperationen nutzen. Ein KI-Beschleuniger kann beispielsweise besonders viele Rechenwerke für Matrixoperationen integrieren und den übrigen Hardwareaufwand gezielt auf diesen Einsatz abstimmen.

Dadurch steigt bei passenden Workloads häufig die Energieeffizienz. Gleichzeitig sinkt die Freiheit, völlig andere Aufgaben auszuführen.

Der ASIC bildet dabei das Extrem. Seine Schaltung kann optimal auf einen konkreten Zweck ausgelegt werden. Ändert sich die Anwendung grundlegend, lässt sich die Hardware nur begrenzt anpassen.

FPGAs nehmen eine besondere Stellung ein. Sie ermöglichen eine hohe Anpassbarkeit der Hardware, bezahlen diese Flexibilität allerdings mit zusätzlicher Chipfläche und typischerweise einem höheren Energiebedarf gegenüber einer vollständig maßgeschneiderten ASIC-Lösung.

Moderne Systeme kombinieren mehrere Rechenarchitekturen

In realen Produkten stellt sich deshalb häufig gar nicht die Frage, welche einzelne Architektur die beste ist.

Ein moderner SoC kann mehrere unterschiedliche Recheneinheiten integrieren. Die CPU übernimmt Betriebssystem, Steuerung und allgemeine Software. Eine GPU berechnet Grafik und stark parallele Workloads. Eine NPU verarbeitet neuronale Netze. DSPs kümmern sich um Signalverarbeitung, während zusätzliche Hardwarebeschleuniger bestimmte Funktionen übernehmen.

Dieses Prinzip wird als Heterogeneous Computing bezeichnet.

Auch im Rechenzentrum ist eine solche Aufgabenteilung längst üblich. CPUs koordinieren Programme und Datenflüsse, GPUs oder KI-Beschleuniger übernehmen rechenintensive Abschnitte, SmartNICs beschleunigen Netzwerkfunktionen und spezialisierte Hardware verarbeitet Verschlüsselung oder Storage-Aufgaben.

Damit verschiebt sich die Herausforderung zunehmend von der einzelnen Recheneinheit auf das Gesamtsystem. Entscheidend wird, wie effizient Workloads auf unterschiedliche Beschleuniger verteilt und Daten zwischen ihnen bewegt werden.

Der Datentransport wird zum entscheidenden Faktor

Eine hohe theoretische Rechenleistung hilft wenig, wenn die Recheneinheiten ständig auf Daten warten müssen.

Besonders bei Machine Learning ist dieses Problem deutlich sichtbar. Große Modelle können aus Millionen, Milliarden oder inzwischen sogar deutlich mehr Parametern bestehen, die zwischen Speicher und Rechenwerken bewegt werden müssen. Der Transport dieser Daten kann einen erheblichen Teil der Energieaufnahme verursachen und die nutzbare Rechenleistung begrenzen.

Deshalb investieren Chipentwickler zunehmend in große On-Chip-Speicher, schnelle Cache-Hierarchien und High Bandwidth Memory. Auch die räumliche und elektrische Nähe zwischen Speicher und Recheneinheit gewinnt an Bedeutung.

Technologien wie Chiplets und Advanced Packaging ermöglichen es, Rechenlogik, Speicher und weitere Funktionsblöcke über sehr schnelle Verbindungen innerhalb eines Packages enger zusammenzuführen. Ansätze wie Near-Memory Computing oder Compute-in-Memory versuchen sogar, bestimmte Berechnungen näher am beziehungsweise direkt im Speicher auszuführen.

Damit verändert sich die Bewertung von Prozessorleistung. Neben der Anzahl theoretischer Rechenoperationen werden Speicherbandbreite, Speicherlatenz, Datenlokalität und die Effizienz der Verbindungen zwischen den einzelnen Recheneinheiten immer wichtiger.

Welche Architektur eignet sich für welche Anwendung?

Für eine erste Orientierung lassen sich typische Einsatzfelder dennoch relativ klar zuordnen.

CPU: Betriebssysteme, allgemeine Software, Steuerungsaufgaben, Datenbanken und komplexe Programmabläufe.

GPU: Rendering, Simulation, High Performance Computing, Datenanalyse sowie KI-Training und Inferenz mit hoher Parallelität.

TPU: große Machine-Learning-Workloads, Matrix- und Tensorberechnungen, Training und skalierte Inferenz innerhalb des Google-Ökosystems.

NPU: energieeffiziente KI-Inferenz in Smartphones, PCs, Kameras, Fahrzeugen und Embedded-Systemen.

FPGA: Echtzeitverarbeitung, individuell angepasste Datenpfade, Kommunikationstechnik, industrielle Systeme und Hardware-Prototyping.

ASIC: Anwendungen mit klar definierten Funktionen, hohen Stückzahlen und besonders hohen Anforderungen an Leistung, Energieeffizienz, Latenz oder Chipfläche.

Die Architekturentscheidung hängt damit weniger von maximalen Benchmarkwerten ab als von der konkreten Arbeitslast. Datenstruktur, Parallelisierbarkeit, Speicherbedarf, Energieverbrauch, Latenz, Entwicklungszeit, Software-Ökosystem und Stückzahlen bestimmen gemeinsam, welche Lösung technisch und wirtschaftlich sinnvoll ist.

Je heterogener Anwendungen werden, desto häufiger arbeiten mehrere Architekturen innerhalb eines Systems zusammen. (prm)