Wer heute eine neue Grafikkarte für lokale KI-Modelle sucht, landet fast automatisch bei der RTX 5090. Sie kostet in Österreich aber oft über 5.000 Euro. Die RTX 5080 ist mit Straßenpreisen ab rund 1.249 Euro deutlich zugänglicher und bietet mit 16 GB GDDR7-Speicher genug Puffer für die meisten offenen Sprachmodelle, die Privatanwender und kleine Teams tatsächlich einsetzen. Dieser Artikel zeigt Schritt für Schritt, wie Sie die Karte für lokale KI-Inferenz einrichten, welche Modellgrößen realistisch laufen und wo die typischen Stolperfallen liegen.

Die Anleitung richtet sich an Entwicklerinnen und Entwickler sowie technisch versierte Anwender, die lieber selbst hosten statt Cloud-APIs zu bezahlen. Sie brauchen keine Vorkenntnisse in CUDA-Programmierung, aber Grundverständnis von Terminal-Befehlen ist hilfreich. Am Ende steht ein funktionierender lokaler KI-Chat-Server, den Sie über eine einfache Python-Schnittstelle ansprechen können.

Alle Angaben zu Preisen, Treiberversionen und Benchmark-Zahlen in diesem Artikel stammen aus aktuellen Quellen vom August 2026 und werden im Text mit Datum ausgewiesen. Da sich Software-Versionen schnell ändern, sollten Sie die genannten Nummern als Orientierung verstehen und vor der eigenen Installation kurz auf der jeweiligen Herstellerseite gegenprüfen.

Warum die RTX 5080 für lokale KI die pragmatische Wahl ist

Die RTX 5080 sitzt in Nvidias Blackwell-Generation zwischen der RTX 5070 Ti und der RTX 5090. Mit 10.752 CUDA-Cores bietet sie spürbar mehr Rechenleistung als der Vorgänger RTX 4080 mit 9.728 Cores, bleibt aber weit unter den 21.760 Cores der RTX 5090. Genau diese Mittelposition macht die Karte für lokale KI interessant: Sie liefert genug Bandbreite für flüssige Textgenerierung, kostet aber weniger als die Hälfte des großen Modells.

Ein Testbericht von StorageReview bezeichnet die RTX 5080 explizit als “Sweet Spot für KI-Workloads”, weil das Verhältnis aus Speicherbandbreite (960 GB/s), Speichergröße (16 GB) und Preis für gemischte Gaming- und KI-Nutzung ausgewogen ist. Eine RTX 5080 Super oder Ti existiert bislang nicht als Produkt. Aktuelle Preisvergleiche und Spezifikationsdatenbanken listen ausschließlich die 16-GB-GDDR7-Standardversion, Gerüchte über eine Super-Variante haben sich bis Ende August 2026 nicht materialisiert. Wer also jetzt kauft, wartet nicht auf ein Modell, das in den nächsten Wochen erscheint.

Wichtig für die Erwartungshaltung: 16 GB VRAM sind kein Nachteil, sondern eine Grenze, mit der Sie bewusst planen müssen. Ein dichtes 70-Milliarden-Parameter-Modell wie Llama 3 70B läuft in Q4_K_M-Quantisierung zwar auf der Karte, aber nur mit etwa 7 Tokens pro Sekunde. Für den produktiven Einsatz eignen sich eher Modelle bis 14 Milliarden Parameter dicht oder bis rund 30 Milliarden Parameter quantisiert. Genau darauf ist diese Anleitung ausgelegt.

Für wen lohnt sich also die RTX 5080 konkret? Wer Coding-Assistenten, Dokumentenzusammenfassungen oder Chatbots mit 7- bis 20-Milliarden-Parameter-Modellen betreiben will, bekommt hier die beste Kombination aus Preis und Geschwindigkeit im aktuellen Blackwell-Lineup. Wer dagegen regelmäßig mit 70B-Modellen arbeitet, etwa für komplexe Code-Refactorings über mehrere Dateien hinweg, sollte das Budget für eine RTX 5090 einplanen oder auf eine Cloud-Lösung mit stundenweiser Abrechnung ausweichen. Die RTX 5080 schließt genau die Lücke zwischen “Cloud-API mieten” und “High-End-Karte kaufen”, die für die meisten Einzelentwickler und kleinen Teams wirtschaftlich am sinnvollsten ist.

RTX 5080 im Detail: Technische Daten

Bevor Sie loslegen, lohnt sich ein Blick auf die reinen Spezifikationen. Sie bestimmen, welche Modelle überhaupt in den Speicher passen und wie schnell die Inferenz läuft.

SpezifikationRTX 5080
CUDA-Cores10.752
Architektur7 GPCs, 42 TPCs, 84 SMs, 128 Cores/SM
Boost-Takt2.617 MHz (Basis ca. 2.295 MHz)
FP32-Rechenleistungca. 56,28 TFLOPS
Speicher16 GB GDDR7
Speicherinterface256-Bit, 30 Gbps pro Pin
Speicherbandbreite960 GB/s
Total Graphics Power (TGP)360 W
Stromanschluss1x 16-Pin 12V-2×6 (ATX 3.1)
Straßenpreis Österreich (Aug. 2026)ab ca. 1.249 € (ASUS), ab ca. 1.350 € (Gigabyte)

Die Preise stammen von österreichischen Preisvergleichsseiten Ende August 2026 für Custom-Modelle von ASUS und Gigabyte. Nvidias eigene Founders-Edition-Preise liegen meist darunter, sind aber in Österreich selten lagernd. Rechnen Sie realistisch mit 1.250 bis 1.400 Euro für eine Karte mit gutem Kühler.

Der Sprung von GDDR6X auf GDDR7 ist für KI-Workloads wichtiger, als es auf den ersten Blick wirkt. GDDR7 nutzt PAM3-Signalisierung statt des bisherigen NRZ-Verfahrens und erreicht dadurch 28 bis 30 Gbps pro Pin, deutlich mehr als GDDR6X in der vorherigen Generation. Für die Textgenerierung mit großen Sprachmodellen ist genau diese Speicherbandbreite oft der limitierende Faktor, nicht die reine Rechenleistung in TFLOPS. Ein Modell muss bei jedem einzelnen Token alle aktiven Parameter aus dem VRAM lesen, weshalb die 960 GB/s Bandbreite der RTX 5080 direkten Einfluss auf die gemessenen Tokens-pro-Sekunde-Werte in dieser Anleitung haben.

Voraussetzungen: Was Sie vor dem Start brauchen

Sammeln Sie die folgenden Komponenten und Softwareversionen, bevor Sie mit Schritt 1 beginnen. Die Versionsnummern sind der Stand Ende August 2026 und ändern sich laufend, prüfen Sie vor der Installation die jeweils aktuelle Version auf der Herstellerseite.

  • Nvidia GeForce RTX 5080 (16 GB GDDR7)
  • Netzteil mit nativem ATX-3.0/3.1-Anschluss und mindestens 750 W, idealerweise 850 W bei zusätzlicher CPU-Last
  • Mainboard mit PCIe 5.0 x16 Slot (PCIe 4.0 funktioniert ebenfalls, limitiert die Bandbreite geringfügig)
  • Mindestens 32 GB System-RAM, 64 GB empfohlen für größere Kontextfenster
  • Windows 11 (Version 23H2 oder neuer) oder Ubuntu 24.04 LTS / 24.10
  • Nvidia GeForce Game Ready Driver 610.88 WHQL oder neuer (Stand 28. Juli 2026)
  • CUDA Toolkit 13.3.1 (Stand Juni 2026, aktuellste stabile Version)
  • Ollama Version 0.33.1 oder neuer
  • llama.cpp Build b10644 oder neuer, alternativ Release v0.3.0
  • LM Studio 0.4.21 oder neuer, falls Sie eine grafische Oberfläche bevorzugen
  • Python 3.11 oder neuer für das Beispielprojekt am Ende dieser Anleitung

Zeitaufwand für die komplette Einrichtung: rechnen Sie mit 60 bis 90 Minuten, davon entfällt der größte Teil auf Treiber- und CUDA-Installation sowie den ersten Modell-Download, der je nach Internetverbindung 15 bis 30 Minuten dauern kann.

Die genauen Versionsnummern sind bewusst so detailliert aufgeführt, weil Versions-Mismatches die häufigste Fehlerquelle bei lokalen KI-Setups sind. Ein zu alter Treiber erkennt die Blackwell-Architektur der RTX 5080 nicht korrekt, ein zu neues, noch nicht ausgereiftes CUDA-Toolkit führt bei manchen Inferenz-Frameworks zu Kompilierfehlern. Halten Sie sich für den ersten Durchlauf möglichst genau an die hier genannten Versionen und experimentieren Sie erst danach mit neueren Releases.

Schritt 1-2: Karte einbauen und Stromversorgung absichern

Schalten Sie den PC aus und trennen Sie ihn vom Stromnetz. Öffnen Sie das Gehäuse und setzen Sie die RTX 5080 in den obersten PCIe-x16-Slot. Der Anschluss ist ein einzelner 16-poliger 12V-2×6-Stecker nach ATX-3.1-Spezifikation, der bei voller Last bis zu 360 Watt liefern muss.

Hier passiert der häufigste Anfängerfehler: Das Kabel wird nicht vollständig eingerastet oder direkt am Stecker scharf geknickt. Beides erhöht das Risiko von Kontaktproblemen und im schlimmsten Fall von Schmelzschäden am Stecker, ein Problem, das bei den Vorgängergenerationen mehrfach dokumentiert wurde. Nutzen Sie nach Möglichkeit ein natives 12V-2×6-Kabel Ihres Netzteilherstellers statt eines Adapters mit mehreren PCIe-Steckern. Drücken Sie den Stecker gerade hinein, bis er hörbar einrastet, und lassen Sie mindestens 3,5 cm geraden Kabelverlauf vor der ersten Biegung.

Schließen Sie das Gehäuse, verbinden Sie Monitor und Strom neu und starten Sie den PC. Prüfen Sie im BIOS, ob “Resizable BAR” beziehungsweise “Above 4G Decoding” aktiviert ist. Diese Option verbessert den Datentransfer zwischen CPU und GPU und wird von modernen Inferenz-Frameworks vorausgesetzt.

Achten Sie zusätzlich auf den Airflow im Gehäuse, bevor Sie mit stundenlangen Inferenz-Sessions beginnen. Die RTX 5080 zieht unter Volllast bis zu 360 Watt und gibt diese Wärme über mehrere Stunden hinweg kontinuierlich ab, anders als beim kurzzeitigen Lastspitzen im Gaming. Zwei bis drei zusätzliche Gehäuselüfter mit positivem Druck (mehr Zuluft als Abluft) verhindern, dass sich warme Luft im Gehäuse staut und die Karte über die Zeit throttelt.

Schritt 3-4: Nvidia-Treiber installieren

Laden Sie den aktuellen Treiber von der offiziellen Nvidia-Treiberseite herunter. Für RTX-5080-Nutzer, die Wert auf Stabilität bei KI-Workloads legen, gibt es zwei Kandidaten: den Game Ready Driver (aktuell 610.88 WHQL, veröffentlicht am 28. Juli 2026) und den Studio Driver in derselben Versionsnummer und demselben Veröffentlichungsdatum. Für reine KI-Inferenz ohne Gaming-Nutzung ist der Studio-Treiber die konservativere Wahl, weil er seltener aktualisiert wird und stärker auf Stabilität statt auf Spiele-Optimierungen getestet ist.

Deinstallieren Sie vor der Installation alte Treiber vollständig, idealerweise mit dem Nvidia-eigenen Deinstallationsprogramm oder DDU im abgesicherten Modus. Ein Wechsel zwischen Game-Ready- und Studio-Treiber ohne saubere Deinstallation führt gelegentlich zu Konflikten, bei denen CUDA-Anwendungen die Karte nicht erkennen.

# Windows: Treiberversion nach Installation prüfen
nvidia-smi

# Erwartete Ausgabe (Auszug):
# Driver Version: 610.88    CUDA Version: 13.3
# GPU: NVIDIA GeForce RTX 5080    Memory: 16384MiB

Unter Linux installieren Sie den Treiber am saubersten über das offizielle Nvidia-Repository statt über den Ubuntu-eigenen Paketmanager, da dieser oft ältere Versionen führt, die Blackwell-Karten wie die RTX 5080 noch nicht vollständig unterstützen.

Nach dem Neustart sollte Windows die Karte automatisch im Geräte-Manager unter “Grafikkarten” korrekt als “NVIDIA GeForce RTX 5080” anzeigen, ohne Ausrufezeichen oder Warnsymbol. Öffnen Sie zusätzlich die Nvidia-App und prüfen Sie unter “Treiber”, ob der Update-Check keine ausstehende Version mehr meldet. Erst wenn beide Prüfungen sauber durchlaufen, macht es Sinn, mit der CUDA-Installation im nächsten Schritt fortzufahren.

Schritt 5: CUDA Toolkit installieren und verifizieren

Laden Sie das CUDA Toolkit 13.3.1 herunter, die aktuellste stabile Version mit Stand Juni 2026. Version 13.4.0 existiert zwar bereits als Preview, ist aber für den produktiven Einsatz noch nicht freigegeben und sollte für dieses Setup vermieden werden.

# Ubuntu 24.04: CUDA-Repository einbinden und Toolkit installieren
wget https://developer.download.nvidia.com/compute/cuda/repos/ubuntu2404/x86_64/cuda-keyring_1.1-1_all.deb
sudo dpkg -i cuda-keyring_1.1-1_all.deb
sudo apt update
sudo apt install cuda-toolkit-13-3

# Installation verifizieren
nvcc --version
# Erwartete Ausgabe: Cuda compilation tools, release 13.3, V13.3.1

Starten Sie das System nach der Installation neu. Führen Sie danach erneut nvidia-smi aus und prüfen Sie, ob die CUDA-Version korrekt angezeigt wird. Stimmt die Versionsnummer nicht mit der Toolkit-Installation überein, liegt meist ein PATH-Problem vor, dazu mehr im Troubleshooting-Abschnitt weiter unten.

Installieren Sie zusätzlich cuDNN, sofern Sie später eigene PyTorch- oder TensorRT-Workflows neben Ollama und llama.cpp nutzen wollen. Für die reine Textgenerierung mit den in dieser Anleitung genannten Tools reicht das CUDA Toolkit allein aus, cuDNN wird erst relevant, sobald Sie eigene Trainings- oder Fine-Tuning-Skripte schreiben. Vermeiden Sie es, mehrere CUDA-Versionen parallel zu installieren, ohne die Umgebungsvariablen sauber zu trennen, das ist die zweithäufigste Fehlerquelle nach Treiberproblemen.

Schritt 6-7: Ollama installieren und erstes Modell laden

Ollama ist der einfachste Einstieg für lokale Sprachmodelle, weil es Modell-Download, Quantisierung und API-Server in einem Befehl bündelt. Installieren Sie Ollama in Version 0.33.1 oder neuer, veröffentlicht am 26. August 2026.

# Linux/macOS Installation
curl -fsSL https://ollama.com/install.sh | sh

# Ollama-Version prüfen
ollama --version
# Erwartete Ausgabe: ollama version 0.33.1

# Erstes Modell laden und testen
ollama pull llama3.2:3b
ollama run llama3.2:3b "Erkläre in zwei Sätzen, was Quantisierung bei KI-Modellen bedeutet."

Beim ersten Start prüft Ollama automatisch, ob eine kompatible GPU vorhanden ist, und lädt die Modellschichten in den VRAM. Bei einem 3-Milliarden-Parameter-Modell wie Llama 3.2 3B sollte die Antwort nahezu ohne spürbare Verzögerung erscheinen. In Benchmarks vom 20. und 21. August 2026 erreichte Ollama 0.32.1 auf diesem Modell rund 319 Tokens pro Sekunde auf der RTX 5080, bei Batch-Größe 1 und Single-GPU-Betrieb.

Für anspruchsvollere Aufgaben laden Sie ein größeres Modell wie Qwen 2.5 14B, das in den genannten Benchmarks etwa 99 Tokens pro Sekunde erreichte, immer noch komfortabel für interaktive Chat-Nutzung. Ein Mixture-of-Experts-Modell mit rund 20 Milliarden aktiven Parametern kam im selben Test auf 196 Tokens pro Sekunde.

Ein Vorteil von Ollama, der bei reinen Geschwindigkeitsvergleichen oft untergeht: Die gesamte Kommunikation bleibt auf Ihrem Rechner. Kein Prompt, kein Dokument und keine Code-Zeile verlässt das Gerät in Richtung eines externen Servers, was lokale Inferenz gerade für sensible Firmendaten oder personenbezogene Informationen unter der DSGVO deutlich unkomplizierter macht als jede Cloud-API. Mit ollama list behalten Sie jederzeit den Überblick, welche Modelle lokal gespeichert sind, und mit ollama rm entfernen Sie nicht mehr benötigte Modelle, um Speicherplatz auf der Festplatte freizugeben.

Schritt 8: llama.cpp für maximale Performance kompilieren

Ollama ist bequem, aber nicht immer die schnellste Option. In denselben Benchmarks vom 20. bis 21. August 2026 lag llama.cpp (Build b10507) bei Llama 3.2 3B mit 338 Tokens pro Sekunde etwa 6 Prozent vor Ollama, bei komplexeren MoE-Modellen war der Abstand mit 235 bis 240 gegenüber 196 Tokens pro Sekunde noch deutlicher. Wer maximale Geschwindigkeit will, kompiliert llama.cpp direkt mit CUDA-Unterstützung.

# llama.cpp klonen und mit CUDA-Unterstützung bauen
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
cmake -B build -DGGML_CUDA=ON -DCMAKE_CUDA_ARCHITECTURES=120
cmake --build build --config Release -j

# Modell im GGUF-Format laden und Benchmark starten
./build/bin/llama-bench -m models/qwen2.5-14b-q4_k_m.gguf -ngl 99

Der Parameter -ngl 99 weist llama.cpp an, so viele Modellschichten wie möglich auf die GPU auszulagern. Bei 16 GB VRAM passt ein 14B-Modell in Q4_K_M-Quantisierung vollständig, bei größeren Modellen müssen Sie den Wert reduzieren und einen Teil der Schichten auf die CPU auslagern, was die Geschwindigkeit deutlich senkt.

Die Quantisierungs-Kürzel im Dateinamen eines GGUF-Modells verraten viel über den erwarteten Kompromiss zwischen Größe und Qualität. Q4_K_M steht für eine 4-Bit-Quantisierung mit gemischter Genauigkeit (“K-Quants”), die in der Praxis kaum wahrnehmbaren Qualitätsverlust gegenüber der Originalgewichtung zeigt, aber den Speicherbedarf gegenüber FP16 etwa vierteln. Q5_K_M liegt qualitativ näher am Original, braucht aber mehr VRAM, während Q3_K_M nur noch in Ausnahmefällen sinnvoll ist, wenn ein Modell partout nicht anders in den Speicher passt. Für die RTX 5080 ist Q4_K_M in den meisten Fällen der beste Kompromiss und deshalb auch die Standardempfehlung in dieser Anleitung.

Schritt 9: LM Studio für die grafische Oberfläche

Wer keine Terminal-Befehle mag, installiert stattdessen LM Studio, aktuell in Version 0.4.21 vom 12. August 2026. Die Anwendung bündelt Modellsuche, Download und einen lokalen API-Server mit grafischer Bedienung. Nach der Installation zeigt LM Studio automatisch an, welche GGUF-Modelle in den verfügbaren 16 GB VRAM passen, und warnt vor Modellen, die den Speicher überschreiten würden.

Öffnen Sie den Reiter “Discover”, suchen Sie nach einem Modell wie Qwen 2.5 14B Instruct, und wählen Sie die Q4_K_M-Quantisierung. LM Studio lädt das Modell herunter und bindet automatisch die GPU-Beschleunigung ein, sofern Treiber und CUDA korrekt installiert sind. Über den Reiter “Local Server” starten Sie einen OpenAI-kompatiblen API-Endpunkt auf Port 1234, den Sie später im Beispielprojekt weiterverwenden können.

Ein praktischer Vorteil von LM Studio gegenüber der reinen Kommandozeile: Die Anwendung zeigt vor dem Download eine Speicherschätzung an und markiert Modelle, die für 16 GB VRAM zu groß sind, farblich. Das verhindert genau den häufigen Anfängerfehler, ein 30B-Modell in voller Präzision herunterzuladen und erst nach zwanzig Minuten Download-Zeit festzustellen, dass es nicht in den Speicher passt. Für den Einstieg empfiehlt sich außerdem der eingebaute Chat-Modus, in dem Sie Systemprompts, Temperatur und Kontextlänge direkt über Schieberegler anpassen können, bevor Sie zur programmatischen API-Nutzung wechseln.

Schritt 10: Die richtige Modellgröße für 16 GB VRAM wählen

Die 16 GB VRAM der RTX 5080 sind der zentrale Engpass jeder Planung. Die folgende Tabelle fasst zusammen, welche Modellgrößen bei welcher Quantisierung realistisch nutzbar sind, basierend auf den gemessenen Werten für Llama-, Qwen- und MoE-Modelle sowie gängigen Quantisierungs-Faustregeln für 2026.

ModellgrößeEmpfohlene QuantisierungVRAM-Bedarf ca.GeschwindigkeitEinsatzzweck
3B (Llama 3.2)FP16 / Q8_04-6 GB~319-338 Tok/sSchnelle Chat-Antworten, Autocomplete
7-9B (Mistral, Gemma)Q5_K_M / Q8_06-9 GB~150-200 Tok/sInteraktiver Chat mit langem Kontext
14B (Qwen 2.5)Q4_K_Mca. 10 GB~99-101 Tok/sCoding-Assistenz, komplexe Antworten
~20B (MoE)Q4_K_Mca. 12-14 GB~196-240 Tok/sHohe Qualität bei guter Geschwindigkeit
30-34B (dicht)Q4_K_M / Q3_K_Mca. 15-16 GBzweistellig, langsamerExperimentelle Nutzung, Offline-Batches
70B (Llama 3)Q4_K_Mknapp unter 16 GBca. 7 Tok/sNur für geduldige Einzelanfragen

Als Faustregel gilt: Dichte Modelle bis 8 Milliarden Parameter laufen in FP16 oder leichter Quantisierung flüssig für interaktive Nutzung. Zwischen 14 und 34 Milliarden Parametern brauchen Sie Q4- bis Q5-Quantisierung, um im Speicher zu bleiben, verlieren dabei aber kaum merkbar an Antwortqualität. Alles über 34 Milliarden Parameter funktioniert nur noch als Kompromiss mit spürbar reduzierter Geschwindigkeit.

Schritt 11: Eigenen Benchmark durchführen

Verlassen Sie sich nicht nur auf fremde Zahlen, sondern messen Sie Ihre eigene Konfiguration. Treiberversion, Kühlung und Hintergrundprozesse beeinflussen die tatsächliche Geschwindigkeit spürbar.

# Ollama: Tokens pro Sekunde direkt in der Antwort anzeigen lassen
curl http://localhost:11434/api/generate -d '{
  "model": "qwen2.5:14b",
  "prompt": "Schreibe eine kurze Zusammenfassung von drei Sätzen über GDDR7-Speicher.",
  "stream": false
}' | python3 -c "import json,sys; d=json.load(sys.stdin); print(f\"Tokens/Sek: {d['eval_count']/(d['eval_duration']/1e9):.1f}\")"

Wiederholen Sie die Messung mindestens dreimal und bilden Sie den Mittelwert, da die erste Anfrage nach dem Laden eines Modells oft langsamer ausfällt. Vergleichen Sie den Wert mit den Zahlen aus den Tabellen dieser Anleitung: Liegen Sie mehr als 20 Prozent darunter, deutet das auf Thermal Throttling, eine zu alte Treiberversion oder unzureichende Stromversorgung hin.

Beobachten Sie während des Benchmarks parallel die GPU-Temperatur mit nvidia-smi -l 1. Bleibt die Karte unter 80 Grad Celsius und der Takt stabil auf dem Boost-Wert, arbeitet das Kühlsystem korrekt. Fällt der Takt nach wenigen Minuten spürbar ab, obwohl die Temperatur im grünen Bereich liegt, kann das auf ein zu knapp bemessenes Power-Limit im BIOS oder ein Netzteil hindeuten, das unter Last kurzzeitig einbricht.

Schritt 12: Vollständiges Projekt – eigener KI-Chat-Server mit Python

Zum Abschluss bauen Sie ein einfaches, aber vollständig funktionsfähiges Projekt: einen Python-Client, der über die lokale Ollama-API mit Ihrem Modell auf der RTX 5080 kommuniziert und die Antworten inklusive Geschwindigkeitsmessung protokolliert. Legen Sie eine neue Datei chat_server.py an.

import requests
import time

OLLAMA_URL = "http://localhost:11434/api/generate"
MODEL = "qwen2.5:14b"

def frage_stellen(prompt: str) -> None:
    start = time.time()
    antwort = requests.post(OLLAMA_URL, json={
        "model": MODEL,
        "prompt": prompt,
        "stream": False
    }, timeout=120)
    dauer = time.time() - start
    daten = antwort.json()

    tokens = daten.get("eval_count", 0)
    eval_ns = daten.get("eval_duration", 1)
    tokens_pro_sekunde = tokens / (eval_ns / 1e9) if eval_ns else 0

    print(f"\nAntwort ({dauer:.1f}s, {tokens_pro_sekunde:.1f} Tok/s):")
    print(daten.get("response", "").strip())

if __name__ == "__main__":
    print(f"Lokaler KI-Chat mit {MODEL} auf RTX 5080 (Ctrl+C zum Beenden)")
    while True:
        try:
            eingabe = input("\nSie: ")
            frage_stellen(eingabe)
        except KeyboardInterrupt:
            print("\nBeendet.")
            break

Starten Sie das Skript mit python3 chat_server.py, während Ollama im Hintergrund läuft. Jede Antwort zeigt Dauer und tatsächliche Tokens pro Sekunde an, sodass Sie live sehen, wie sich unterschiedliche Modelle und Prompt-Längen auf die Leistung Ihrer RTX 5080 auswirken. Für den produktiven Einsatz lässt sich dieses Grundgerüst leicht um eine FastAPI-Schnittstelle, Streaming-Antworten oder eine Weboberfläche wie Open WebUI erweitern.

Testen Sie das Skript mit unterschiedlichen Modellen aus der VRAM-Tabelle in Schritt 10, um ein Gefühl für den Zusammenhang zwischen Modellgröße und Antwortzeit auf Ihrer eigenen Karte zu bekommen. Tauschen Sie dazu einfach den Wert der Variable MODEL aus, etwa auf llama3.2:3b für schnelle Tests oder auf ein größeres 20B-Modell, sobald Sie die Antwortqualität gegen die Geschwindigkeit abwägen wollen. Wer das Projekt später erweitert, sollte Streaming-Antworten über "stream": true aktivieren, damit Nutzer den Text Wort für Wort sehen statt auf die komplette Antwort zu warten, das verbessert die gefühlte Reaktionsgeschwindigkeit erheblich, ohne die tatsächliche Tokens-pro-Sekunde-Rate zu verändern.

Preisvergleich: RTX 5080 vs. RTX 5090 vs. RTX 4090 in Österreich

Die Kaufentscheidung hängt stark vom Budget und der Zielmodellgröße ab. Die folgende Übersicht stellt die drei relevantesten Karten für lokale KI-Inferenz gegenüber.

ModellVRAMCUDA-CoresPreis Österreich (Aug. 2026)Praktisches Limit
RTX 409024 GB GDDR6X16.384ab ca. 1.900-2.200 €*Bis ca. 30-40B quantisiert
RTX 508016 GB GDDR710.752ab ca. 1.249 €Bis ca. 20-30B quantisiert
RTX 509032 GB GDDR721.760ab ca. 2.099 € (MSRP), Straßenpreis oft deutlich höherBis ca. 70B quantisiert, deutlich schneller

*Preisschätzung auf Basis der von DataForSEO ausgewerteten Suchnachfrage für “RTX 4090” in Österreich, da die Karte inzwischen auslaufend ist und Bestände unregelmäßig verfügbar sind. Die RTX 5090 wurde in einem früheren Test auf shattered.io mit rund 213 Tokens pro Sekunde bei vergleichbaren Modellen gemessen, spürbar mehr als die RTX 5080 bei kleineren Modellen liefert, aber auch zum entsprechend höheren Preis. Wer primär Modelle bis 14B nutzt, bekommt mit der RTX 5080 das bessere Preis-Leistungs-Verhältnis. Wer regelmäßig 70B-Modelle mit brauchbarer Geschwindigkeit laufen lassen will, kommt an der RTX 5090 kaum vorbei.

Stellen Sie den Kaufpreis den laufenden Kosten einer Cloud-API gegenüber, um die Investition realistisch einzuordnen. Wer täglich mehrere Stunden mit einem 14B-Modell arbeitet, etwa für Coding-Unterstützung im Team, erreicht bei üblichen Preisen pro Million Token gemieteter Cloud-Modelle oft innerhalb weniger Monate den Gegenwert der Anschaffungskosten einer RTX 5080. Danach läuft die lokale Inferenz de facto zum reinen Strompreis weiter, ohne Rate-Limits, ohne Abhängigkeit von der Verfügbarkeit eines externen Dienstes und ohne dass sich API-Preise während der Nutzung ändern können. Für Gelegenheitsnutzer mit wenigen Anfragen pro Woche rechnet sich die Anschaffung dagegen erst über einen längeren Zeitraum, hier bleibt eine Cloud-API oft die günstigere Option.

Sicherheit und Datenschutz: Warum lokale Inferenz einen Unterschied macht

Der wichtigste Grund, überhaupt eine eigene Grafikkarte für KI-Inferenz anzuschaffen, ist selten reine Geschwindigkeit, sondern Kontrolle über die eigenen Daten. Bei jeder Anfrage an eine Cloud-API wie ChatGPT, Claude oder Gemini verlassen Prompt, Kontext und oft auch angehängte Dokumente das eigene Netzwerk und landen auf Servern eines Drittanbieters, meist außerhalb der EU. Für Unternehmen, die unter die DSGVO fallen, bedeutet das zusätzlichen Aufwand bei Auftragsverarbeitungsverträgen, Datenschutz-Folgenabschätzungen und der Dokumentation, wohin personenbezogene Daten tatsächlich fließen.

Mit einem lokalen Setup auf der RTX 5080 entfällt dieses Risiko strukturell: Die Modellgewichte laufen vollständig im eigenen VRAM, die Inferenz passiert auf der eigenen Hardware, und es gibt keinen Netzwerk-Traffic, der Prompts nach außen sendet, sofern Sie den API-Server wie empfohlen nur an localhost binden. Das ist besonders relevant für Kanzleien, Arztpraxen, Steuerberater oder Software-Teams, die mit Kundencode oder vertraulichen Dokumenten arbeiten und keine Cloud-Nutzungsbedingungen akzeptieren wollen, die eine Verarbeitung der Eingaben zu Trainingszwecken erlauben.

Ein zweiter, oft übersehener Aspekt betrifft die Modelldateien selbst. Laden Sie GGUF-Dateien ausschließlich von vertrauenswürdigen Quellen wie der offiziellen Ollama-Modellbibliothek oder verifizierten Hugging-Face-Repositories der jeweiligen Modellentwickler. Prüfen Sie bei manuellem Download die veröffentlichte Prüfsumme (SHA-256), bevor Sie eine Datei ausführen. Manipulierte Modelldateien mit eingebetteten Schadroutinen sind zwar bislang selten, aber die Angriffsfläche wächst mit der Popularität lokaler KI-Setups, und ein einmal geladenes, kompromittiertes Modell lässt sich im laufenden Betrieb kaum von einem sauberen unterscheiden.

Energiekosten und Betriebsdauer im Alltag

Ein Argument, das bei der Anschaffungsentscheidung oft zu kurz kommt: Wie viel kostet der Dauerbetrieb tatsächlich? Die RTX 5080 liegt mit 360 Watt TGP spürbar unter der RTX 5090, was sich über Monate hinweg messbar auf der Stromrechnung bemerkbar macht, besonders wenn die Karte für Batch-Verarbeitung oder als dauerhaft laufender Chat-Server im Einsatz ist.

NutzungsszenarioAuslastungCa. Verbrauch/Stunde
Gelegentliche Chat-Anfragenniedrig, meist Leerlauf15-40 W
Interaktive Coding-Sessionmittel, wiederholte Anfragen120-220 W
Dauerhafte Inferenz / Batch-Jobshoch, nahezu Volllast300-360 W
Mit gesenktem Power-Limit (empfohlen)hoch, gedrosseltca. 260-300 W

Für einen typischen Einzelanwender, der die Karte einige Stunden pro Woche für KI-Aufgaben nutzt, bleiben die Stromkosten überschaubar und liegen deutlich unter dem, was eine vergleichbare Nutzung kostenpflichtiger Cloud-APIs verursachen würde. Wer die Karte dagegen im Dauerbetrieb als firmeninternen Inferenz-Server laufen lässt, sollte das gesenkte Power-Limit aus dem Tipps-Abschnitt fest einplanen, um Stromkosten und Abwärme im Server- oder Arbeitsraum im Griff zu behalten.

Die 7 häufigsten Fehler beim RTX-5080-KI-Setup

Diese Stolperfallen tauchen in Community-Foren und Support-Anfragen immer wieder auf. Wer sie kennt, spart sich Stunden der Fehlersuche.

  • Falsches Kabel am 12V-2×6-Anschluss: Adapter mit mehreren PCIe-Steckern statt eines nativen ATX-3.1-Kabels erhöhen das Risiko von Kontaktproblemen unter Dauerlast.
  • Zu kleines Netzteil: 360 Watt TGP plus CPU-Last unter Volllast überfordern manche 650-Watt-Netzteile, besonders ältere Modelle ohne ATX-3.0-Zertifizierung.
  • Modell zu groß für den VRAM gewählt: Ein unquantisiertes 30B-Modell in FP16 passt schlicht nicht in 16 GB und bricht mit einer CUDA-Out-of-Memory-Fehlermeldung ab.
  • Alter Treiber nach Windows-Update: Windows installiert gelegentlich automatisch einen älteren generischen Treiber, der Blackwell-Karten nicht vollständig unterstützt.
  • Ollama und llama.cpp parallel mit derselben GPU: Beide Prozesse konkurrieren um denselben VRAM, was zu Abstürzen oder drastisch verlangsamter Inferenz führt.
  • Zu langes Kontextfenster ohne Anpassung: Ein Kontext von 32.000 Tokens statt der Standardeinstellung von 4.096 kann den verfügbaren VRAM sprengen, selbst bei kleineren Modellen.
  • Fehlendes Resizable BAR im BIOS: Ohne aktivierte Option verschenken Sie messbar Transferleistung zwischen CPU und GPU, besonders beim Laden großer Modelle.

Die meisten dieser Fehler haben einen gemeinsamen Nenner: Sie entstehen, weil Nutzer die 16-GB-Grenze der RTX 5080 ignorieren und Konfigurationen von größeren Karten wie der RTX 5090 unverändert übernehmen. Planen Sie Modellgröße, Kontextlänge und parallele Prozesse von Anfang an für 16 GB VRAM, nicht für 24 oder 32 GB, dann treten die meisten dieser Probleme gar nicht erst auf.

Troubleshooting: 9 Probleme und Lösungen

Auch bei sorgfältiger Einrichtung tauchen gelegentlich Fehler auf. Die folgende Tabelle deckt die häufigsten Fälle ab, sortiert danach, wie oft sie in Foren wie r/LocalLLaMA und den GitHub-Issues von Ollama und llama.cpp gemeldet werden. Gehen Sie die Tabelle bei einem Problem von oben nach unten durch, bevor Sie eine komplette Neuinstallation in Erwägung ziehen, in den meisten Fällen liegt die Ursache an einer der hier gelisteten Stellen.

ProblemWahrscheinliche UrsacheLösung
“No CUDA device found”Treiber veraltet oder nicht korrekt installiertTreiber deinstallieren (DDU), Neustart, aktuellen 610.88-Treiber neu installieren
CUDA Out of MemoryModell oder Kontextfenster zu groß für 16 GBKleinere Quantisierung wählen (Q4 statt Q8), Kontextlänge reduzieren
GPU wird unter WSL2 nicht erkanntFalscher Treibertyp installiert (Linux-nativ statt WSL-Treiber)Windows-Host-Treiber verwenden, keinen separaten Linux-Treiber in WSL installieren
Sehr langsame Tokengenerierung trotz freiem VRAMModell wird teilweise auf CPU ausgelagert (Offloading)-ngl-Wert in llama.cpp erhöhen oder kleineres Modell wählen
Treiber stürzt unter Dauerlast ab (“Treiber wurde wiederhergestellt”)Instabile Stromversorgung oder ÜbertaktungWerkstakt zurücksetzen, Netzteil-Kapazität prüfen, WHQL-Treiber statt Beta nutzen
llama.cpp-Build schlägt fehlCUDA-Toolkit-Version passt nicht zur Compiler-KonfigurationCUDA 13.3.1 exakt laut Dokumentation installieren, Build-Cache löschen und neu bauen
Ollama lädt Modell, aber Antwort bleibt leerGGUF-Datei beschädigt oder unvollständig heruntergeladenModell löschen und mit ollama pull erneut laden, Prüfsumme kontrollieren
Hohe Lautstärke/Temperatur im DauerbetriebGehäuse-Airflow unzureichend für 360 W TGPGehäuselüfter optimieren oder Power-Limit über nvidia-smi senken
Nvidia-smi zeigt falsche CUDA-VersionPATH-Variable zeigt auf alte CUDA-InstallationPATH und LD_LIBRARY_PATH auf CUDA-13.3-Verzeichnis aktualisieren

Erweiterte Tipps für Fortgeschrittene

Sobald die Grundeinrichtung läuft, lohnen sich ein paar Optimierungen, die im Alltag spürbar Zeit und Nerven sparen.

Begrenzen Sie das Power-Limit der Karte über nvidia-smi -pl 300, um die TGP von 360 auf 300 Watt zu senken. In der Praxis kostet das oft nur wenige Prozent Geschwindigkeit, senkt aber Lautstärke und Abwärme spürbar, besonders in kleinen Gehäusen. Nutzen Sie außerdem Speculative Decoding in llama.cpp, bei dem ein kleines Entwurfsmodell Tokens vorschlägt, die ein größeres Modell nur noch bestätigt. Das kann die effektive Geschwindigkeit bei kompatiblen Modellpaaren spürbar erhöhen, ohne die Ausgabequalität zu verändern.

Wenn Sie mehrere Modelle parallel bereitstellen wollen, nutzt Ollama automatisch ein Least-Recently-Used-Prinzip beim Modell-Wechsel im VRAM, was bei 16 GB schnell an Grenzen stößt. Für produktivere Setups mit mehreren gleichzeitigen Nutzern lohnt sich ein Blick auf vLLM mit PagedAttention, das Speicher effizienter verwaltet als die Standard-Ollama-Pipeline. Öffnen Sie die lokale API zudem niemals ungeschützt nach außen: Binden Sie den Server ausschließlich an localhost oder sichern Sie ihn mit einem Reverse Proxy und Authentifizierung ab, bevor Sie ihn im Heimnetzwerk oder gar im Internet erreichbar machen.

Behalten Sie Temperatur und Taktverhalten der Karte im Dauerbetrieb im Blick, etwa mit nvidia-smi dmon, das im Sekundentakt Auslastung, Temperatur und Speicherverbrauch in der Konsole protokolliert. Richten Sie sich bei intensiver Nutzung ein einfaches Logging ein, das Zeitstempel, verwendetes Modell und gemessene Tokens pro Sekunde in eine CSV-Datei schreibt. Über mehrere Wochen gesammelt, zeigt ein solches Log zuverlässig, ob die Leistung nach Treiber-Updates stabil bleibt oder ob sich schleichende Probleme wie Staubablagerungen im Kühler durch sinkende Taktraten bemerkbar machen.

Fazit: Für wen sich die RTX 5080 wirklich lohnt

Die RTX 5080 ist keine Kompromisskarte, sondern eine bewusste Entscheidung für ein bestimmtes Nutzungsprofil. Mit 16 GB VRAM, 960 GB/s Bandbreite und einem Straßenpreis ab rund 1.249 Euro deckt sie den Bereich von 3B- bis etwa 30B-Parameter-Modellen zuverlässig ab und bleibt dabei deutlich günstiger als eine RTX 5090. Die Einrichtung dauert bei sauberer Vorbereitung unter zwei Stunden, und mit Ollama, llama.cpp und LM Studio stehen drei ausgereifte Werkzeuge bereit, die im August 2026 aktiv weiterentwickelt werden.

Wer regelmäßig mit sensiblen Daten arbeitet, häufig Coding-Modelle im 7B- bis 14B-Bereich nutzt oder einfach unabhängig von Cloud-Anbietern bleiben will, bekommt mit dieser Karte ein solides Fundament. Nur wer verlässlich große 70B-Modelle mit hoher Geschwindigkeit braucht, sollte direkt zur RTX 5090 greifen oder eine Multi-GPU-Konfiguration in Betracht ziehen.

Häufig gestellte Fragen

Reicht die RTX 5080 für ein 70B-Modell?

Technisch ja, mit Q4_K_M-Quantisierung läuft Llama 3 70B auf 16 GB VRAM, allerdings nur mit etwa 7 Tokens pro Sekunde. Das reicht für einzelne, geduldig abgewartete Anfragen, nicht für flüssigen Chat. Für regelmäßige Arbeit mit 70B-Modellen ist eine RTX 5090 mit 32 GB VRAM die deutlich bessere Wahl.

Brauche ich den Game-Ready- oder den Studio-Treiber für KI-Workloads?

Beide unterstützen CUDA gleichermaßen. Der Studio-Treiber wird seltener aktualisiert und gilt als stabiler, der Game-Ready-Treiber bringt dafür oft frühere Bugfixes für neue Kernel- und Bibliotheksversionen mit.

Ist die RTX 5080 Super schon erhältlich?

Nein, Stand Ende August 2026 existiert nur die reguläre RTX 5080 mit 16 GB GDDR7. Eine Super- oder Ti-Variante ist in keiner offiziellen Produktdatenbank gelistet.

Lohnt sich der Umstieg von einer RTX 4090?

Kaum. Die RTX 4090 bietet mit 24 GB mehr VRAM als die RTX 5080 und bleibt für lokale KI weiterhin sehr konkurrenzfähig. Ein Umstieg lohnt sich eher für Nutzer, die noch auf älteren Karten wie einer RTX 3080 oder RTX 3070 sitzen.

Läuft die Einrichtung auch unter Linux problemlos?

Ja, sogar oft stabiler als unter Windows, da CUDA und die meisten Inferenz-Frameworks primär für Linux entwickelt werden. Nutzen Sie das offizielle Nvidia-Repository statt der Distributions-Pakete, um die aktuellste Treiberversion zu erhalten. Ubuntu 24.04 LTS und 24.10 sind aktuell die am besten getesteten Distributionen für diesen Anwendungsfall.

Was ist schneller: Ollama oder llama.cpp?

In Benchmarks von August 2026 lag llama.cpp bei den getesteten Modellen zwischen 2 und 22 Prozent vor Ollama, je nach Modellgröße und -typ. Ollama punktet dafür mit einfacherer Bedienung und automatischem Modell-Management.

Kann ich die RTX 5080 gleichzeitig zum Gaming und für KI nutzen?

Ja, aber nicht gleichzeitig mit voller Leistung in beiden Bereichen. Beenden Sie laufende Ollama- oder llama.cpp-Prozesse vor ressourcenintensiven Spielen, da beide Anwendungen sonst um denselben VRAM konkurrieren.

Welche Stromkosten fallen im Dauerbetrieb an?

Bei 360 Watt TGP unter Volllast und österreichischen Strompreisen liegt der Verbrauch für mehrstündige Inferenz-Sessions im niedrigen einstelligen Cent-Bereich pro Stunde. Ein gesenktes Power-Limit von 300 Watt reduziert die Kosten zusätzlich bei minimalem Geschwindigkeitsverlust.