Am 20. September 2026 beschrieb NVIDIA seine Pläne für KI-Hardware zu Hause. Mitte September wurde außerdem Perplexity Portable Computer für Windows verfügbar. Zusammen ergeben die beiden Entwicklungen ein klareres Bild: Lokale KI soll nicht mehr nur ein Projekt für Entwickler mit viel Geduld sein, sondern auf eigener Hardware laufen, über Netzwerkdienste erreichbar sein und bei Bedarf einzelne Aufgaben in die Cloud auslagern.

Das ist kein pauschaler Abschied von Cloud-Modellen. Der konkrete Vorteil liegt vielmehr in der Wahlmöglichkeit: Dateien und Anfragen können im eigenen Netzwerk bleiben, während besonders anspruchsvolle Aufgaben nach Zustimmung weiterhin Cloud-Modelle nutzen.

Die lokale KI verlässt das Entwicklerlabor

NVIDIA positioniert lokale KI als Zusammenspiel aus Hardware, CUDA-Software, Laufzeitumgebungen und Agenten. Zum unterstützten Software-Stack gehören unter anderem Ollama, llama.cpp, TensorRT, SGLang, vLLM, WindowsML und PyTorch mit CUDA.

Der zentrale Unterschied zu einem gewöhnlichen PC ist dabei nicht allein die Rechenleistung. Entscheidend ist, wie viel Modell in den verfügbaren Speicher passt, wie schnell dieser Speicher Daten liefert und welche Laufzeitumgebung die jeweilige Anwendung verwendet.

Perplexity Portable Computer setzt an der Bedienung an. Die Windows-Version läuft auf kompatibler Hardware standardmäßig lokal und verwendet dabei das Modell PPLX 27B. Voraussetzung ist eine NVIDIA GeForce RTX oder RTX PRO mit mindestens 24 GB VRAM. Für einzelne Schritte kann die Anwendung nach einer ausdrücklichen Zustimmung Cloud-Modelle anfordern, etwa für anspruchsvolleres Schlussfolgern oder Web-Recherche. Dafür werden Computer-Credits verbraucht.

Damit wird lokale KI zu einem hybriden Modell: Die normale Verarbeitung bleibt auf dem eigenen Rechner, während der Nutzer einzelne Ausnahmen freigeben kann.

Was NVIDIA DGX Spark tatsächlich liefert

Lokale Coding-Workflows mit NVIDIA DGX Spark

NVIDIA DGX Spark ist ein kompakter Desktop-Rechner mit dem GB10 Grace Blackwell Superchip und 128 GB kohärentem gemeinsamem LPDDR5X-Speicher. NVIDIA nennt außerdem bis zu 1 PFLOP FP4-Leistung unter theoretischen Bedingungen mit Sparsity.

Für die Modellgrößen nennt NVIDIA zwei weitere Werte: DGX Spark soll Inferenz mit Modellen bis zu 200 Milliarden Parametern ermöglichen und das Feintuning von Modellen bis zu 70 Milliarden Parametern. Das sind Angaben zur vorgesehenen beziehungsweise unterstützten Größenordnung, keine Zusage für eine bestimmte Geschwindigkeit, Kontextlänge oder Ausgabequalität.

Die übrige Ausstattung ist entsprechend auf lokale Entwicklungsarbeit ausgelegt:

  • 20-Kern-Arm-Prozessor mit zehn Cortex-X925- und zehn Cortex-A725-Kernen
  • 273 GB/s Speicherbandbreite
  • 4 TB NVMe-Speicher
  • Wi-Fi 7 und 10-Gigabit-Ethernet
  • 200-Gbit/s-ConnectX-7-Netzwerkadapter
  • 240-W-Netzteil und 140-W-TDP des GB10
  • Gehäuse mit 150 × 150 × 50,5 mm und 1,2 kg Gewicht

Der große gemeinsame Speicher ist der eigentliche Trumpf. Er kann Modelle aufnehmen, die nicht vollständig in den Grafikspeicher einer einzelnen klassischen Consumer-GPU passen. Das bedeutet aber nicht automatisch hohe Token-Raten: Speicherkapazität, Speicherbandbreite und Durchsatz sind unterschiedliche Eigenschaften.

Ein Praxisbeispiel zeigt DGX Spark als lokalen Coding-Rechner: Modelle werden über LM Studio verwaltet, Entwicklungsaufgaben laufen mit Claude Code, und der Zugriff ist über Tailscale auch aus der Ferne möglich. So wird der kleine Rechner eher zum privaten KI-Server als zum typischen Desktop-PC.

Von DGX Spark zu RTX Spark: lokale KI unter Windows

NVIDIA RTX Spark überträgt das Grundprinzip auf Windows-11-Laptops und kompakte Desktops. Die Plattform kombiniert eine Blackwell-GeForce-RTX-GPU mit einem Grace-Prozessor und ist für KI-Entwicklung, Agenten, Spiele und klassische PC-Anwendungen vorgesehen.

Bei den Laptops nennt NVIDIA je nach Konfiguration bis zu 128 GB oder bis zu 64 GB LPDDR5X als gemeinsamen Speicher. Die dokumentierte Leistungsaufnahme liegt bei 45 bis 80 Watt TDP für die Laptop-Konfigurationen; für den RTX-Spark-Desktop nennt NVIDIA 140 Watt TDP.

SystemGemeinsamer SpeicherBetriebssystemDokumentierte RollePraktische Einordnung
NVIDIA DGX Spark128 GBNVIDIA DGX OSLokale Entwicklung, Inferenz und FeintuningHohe Speicherkapazität für größere Modelle in einem kompakten Desktop-System
NVIDIA RTX SparkBis zu 128 GB in der höheren Laptop-KonfigurationWindows 11Lokale KI, Agenten, Spiele und kreative AnwendungenWindows-Kompatibilität und mobile beziehungsweise kompakte Bauformen; die Ausstattung hängt von der jeweiligen Konfiguration ab

NVIDIA behandelt RTX Spark damit nicht als bloße kleinere Version von DGX Spark. Es ist eine Windows-Plattform mit mehreren Bauformen und Konfigurationen. Die höhere Speicherausstattung gilt nicht automatisch für jedes RTX-Spark-Gerät.

Das deutsche Preisbild bleibt anspruchsvoll

Die NVIDIA DGX Spark Founders Edition wurde in Deutschland für 5.629 Euro gelistet. Das macht die Plattform zu einer erheblichen Anschaffung für private Nutzer, bevor Stromverbrauch, zusätzlicher Speicher oder weitere Geräte im Heimnetz berücksichtigt werden.

Für die Entscheidung zählt deshalb nicht nur die maximale Modellgröße. Wer vor allem kleinere Modelle, Spiele und klassische GPU-Anwendungen nutzt, kann von einer dedizierten GeForce-RTX-Plattform profitieren. DGX Spark richtet sich dagegen an Nutzer, für die der große gemeinsame Speicher wichtiger ist als eine pauschale Durchsatzwertung.

PAIR verteilt Aufgaben, bündelt aber keinen Grafikspeicher

So verteilt NVIDIA PAIR lokale KI-Anfragen im Heimnetz

NVIDIA Personal AI Router, kurz NVIDIA PAIR, verbindet kompatible Rechner im lokalen Netzwerk. Die Software kann Anfragen an unterschiedliche Systeme weiterleiten und damit vorhandene Geräte gemeinsam für mehrere Aufgaben nutzbar machen.

PAIR erzeugt dabei keine virtuelle GPU. Der Grafikspeicher mehrerer Rechner wird nicht zu einem einzigen größeren Speicherpool zusammengeschaltet. Eine einzelne Anfrage läuft weiterhin auf dem Gerät, an das sie weitergeleitet wurde; der Nutzen liegt in der Verteilung von Aufgaben und parallelen Anfragen.

Die dokumentierten Plattformen umfassen Windows 11, NVIDIA DGX OS, Ubuntu und macOS Tahoe. NVIDIA nennt außerdem mindestens 8 GB Arbeitsspeicher sowie kompatible RTX-Systeme, DGX Spark und Macs mit M4 oder neuer. Als lokale Laufzeitumgebungen werden unter anderem Ollama und LM Studio unterstützt.

Was lokale KI zu Hause gewinnt – und was sie nicht ersetzt

Lokale Verarbeitung kann sensible Dateien und Prompts im eigenen Netzwerk halten. Sie bietet außerdem mehr Kontrolle über das verwendete Modell und vermeidet bei den lokal ausgeführten Aufgaben die Abhängigkeit von einer laufenden Internetverbindung.

Dafür müssen Nutzer Hardware, Speicher, Software und Modellverwaltung selbst zusammenbringen. Auch ein großes Speicherpolster garantiert keinen bestimmten Durchsatz. Bei anspruchsvoller Web-Recherche oder besonders komplexem Schlussfolgern bleibt die Cloud weiterhin relevant – bei Perplexity Portable Computer allerdings erst nach einer Zustimmung für den jeweiligen Schritt.

NVIDIA baut damit eine abgestufte Produktlandschaft auf: GeForce RTX für kleinere lokale Modelle, RTX PRO für größere professionelle Aufgaben, DGX Spark für besonders speicherintensive lokale Inferenz und RTX Spark für Windows-PCs mit integriertem KI-Fokus. Die Entwicklung macht lokale KI zu Hause praktischer, aber nicht zu einem universellen Ersatz für Cloud-Modelle.