Hardware für lokale KI: Welche GPU braucht ein Sprachmodell im eigenen Betrieb?
Die erste Frage, die bei lokaler KI fast immer kommt, lautet: Was für einen Rechner brauche ich dafür? Die ehrliche Antwort ist: Das hängt davon ab, welches Modell für die geplanten Aufgaben gut genug ist und wie viele Menschen gleichzeitig damit arbeiten. Es gibt aber einige Grundregeln, mit denen sich die Größenordnung gut abschätzen lässt.
Entscheidend ist der Grafikspeicher
Ein Sprachmodell besteht aus Milliarden von Zahlen, den Parametern. Damit es schnell antwortet, müssen diese Zahlen vollständig in den Speicher der GPU passen, den sogenannten VRAM. Passt das Modell nicht hinein, weichen manche Programme wie llama.cpp oder Ollama auf den normalen Arbeitsspeicher aus, und die Antworten werden um ein Vielfaches langsamer; andere wie vLLM starten dann gar nicht.
Die wichtigste Kennzahl bei der Hardware-Auswahl ist deshalb nicht die Rechenleistung, sondern der Grafikspeicher.
Quantisierung: Modelle kleiner rechnen
Im Originalzustand speichert ein Modell jeden Parameter meist mit 16 Bit, also 2 Byte. Ein Modell mit 70 Milliarden Parametern bräuchte damit rund 140 GB. Durch Quantisierung werden die Parameter mit weniger Bits gespeichert, typischerweise 8 oder 4 Bit. Die Qualität sinkt dabei in vielen Fällen nur leicht, der Speicherbedarf aber deutlich.
Als Faustregel gilt bei 4-Bit-Quantisierung: rund 0,6 GB Grafikspeicher je Milliarde Parameter. Daraus ergeben sich grobe Richtwerte:
- Modell mit 8 Milliarden Parametern: etwa 5 GB
- Modell mit 30 Milliarden Parametern: etwa 18 GB
- Modell mit 70 Milliarden Parametern: etwa 40 GB
Dazu kommt Reserve für den sogenannten KV-Cache, in dem das Modell den bisherigen Gesprächsverlauf und die mitgegebenen Dokumente hält. Je länger die Texte und je mehr Anfragen gleichzeitig laufen, desto mehr Reserve wird gebraucht.
Einen Sonderfall bilden Mixture-of-Experts-Modelle wie gpt-oss-120b: Sie haben sehr viele Parameter, nutzen pro Antwort aber nur einen Teil davon. Sie brauchen viel Speicher, antworten aber schneller, als ihre Gesamtgröße vermuten lässt.
Speicherbandbreite bestimmt die Geschwindigkeit
Wie schnell ein Modell antwortet, hängt stark davon ab, wie schnell die GPU Daten aus ihrem Speicher lesen kann. Deshalb sind dedizierte Grafikkarten mit schnellem Speicher bei gleicher Speichergröße meist deutlich flotter als Systeme mit gemeinsamem Arbeits- und Grafikspeicher, wie sie etwa in kompakten KI-Rechnern oder Apple-Geräten verbaut sind. Diese fassen dafür oft größere Modelle zu einem günstigeren Preis. Was besser passt, hängt davon ab, ob Geschwindigkeit oder Modellgröße wichtiger ist.
Drei typische Größenklassen
Einstieg: 24 bis 32 GB Grafikspeicher. Eine Workstation mit einer GPU. Geeignet für Modelle bis rund 30 Milliarden Parameter und für einzelne Nutzer oder ein kleines Team. Gut für klar umrissene Aufgaben wie Zusammenfassen, Auslesen von Belegen und Transkribieren.
Team: 80 bis 128 GB. Eine Workstation-GPU mit 96 GB oder zwei GPUs mit je 48 GB oder mehr. Damit laufen Modelle der 70-Milliarden-Klasse oder große Mixture-of-Experts-Modelle, und mehrere Anfragen lassen sich parallel bearbeiten. Das ist eine typische Größe für eine Wissens-KI über den gesamten Dokumentenbestand eines Betriebs.
Betrieb: ab 160 GB. Ein Server mit mehreren Rechenzentrums-GPUs. Für viele gleichzeitige Nutzer, größere Modelle oder mehrere Anwendungen auf derselben Infrastruktur.
Diese Klassen sind Richtwerte. Welche tatsächlich nötig ist, zeigt erst ein Test mit den eigenen Aufgaben.
Gleichzeitige Nutzer
Ein Modell, das für eine Person flüssig antwortet, wird bei zehn gleichzeitigen Anfragen nicht zehnmal langsamer, wenn die richtige Software eingesetzt wird. Inferenz-Server wie vLLM bündeln Anfragen und verarbeiten sie parallel. Trotzdem gilt: Mehr Nutzer brauchen mehr Speicher für den KV-Cache und mehr Rechenleistung. Wie viele gleichzeitige Anfragen bei welcher Antwortzeit möglich sind, lässt sich messen, bevor gekauft wird.
Was außer der GPU dazugehört
- Arbeitsspeicher und Prozessor, die die GPU nicht ausbremsen, besonders beim Einlesen großer Dokumentbestände
- Schnelle SSDs für Modelle und Such-Index
- Netzteil und Kühlung, die auf Dauerlast ausgelegt sind; leistungsstarke GPUs brauchen viel Strom und erzeugen Wärme und Lärm
- Unterbrechungsfreie Stromversorgung und Datensicherung, wie bei jedem anderen Server im Betrieb
- Ein geeigneter Aufstellungsort, gut belüftet und nicht unbedingt neben dem Besprechungsraum
Erst messen, dann kaufen
Der teuerste Fehler bei lokaler KI ist Hardware, die nicht zur Aufgabe passt: zu klein, sodass das nötige Modell nicht läuft, oder zu groß, sodass viel Geld in ungenutzter Leistung steckt. Deshalb steht vor der Anschaffung ein Machbarkeits-Check. Passende offene Modelle werden auf gemieteter GPU-Rechenleistung in einem EU-Rechenzentrum, möglichst vergleichbar mit der geplanten Hardware, mit Beispiel- oder anonymisierten Dokumenten getestet. Aus der Antwortqualität und den Richtwerten zur Geschwindigkeit ergibt sich die Empfehlung.
Wie Goma-IT diese Dimensionierung und die anschließende Einrichtung übernimmt, steht auf der Seite Lokale KI (On-Premise). Ob lokal oder Cloud überhaupt die bessere Wahl ist, beleuchtet der Beitrag Lokale KI oder ChatGPT.
Häufige Fragen
Läuft ein Sprachmodell auch ohne GPU?
Kleine Modelle laufen auch auf dem Prozessor, aber deutlich langsamer. Für einzelne Tests reicht das, für den täglichen Einsatz im Team meist nicht. Eine GPU mit ausreichend Grafikspeicher ist für flüssige Antworten der übliche Weg.
Wie viel Grafikspeicher braucht ein Modell mit 70 Milliarden Parametern?
Bei 4-Bit-Quantisierung rechnet man grob mit 0,6 GB je Milliarde Parameter, also etwa 40 GB für das Modell selbst. Dazu kommt Reserve für den Gesprächsverlauf und gleichzeitige Anfragen. Für einzelne Nutzer mit kurzen Texten reicht knapp eine GPU mit 48 GB; für ein Team mit parallelen Anfragen und langen Dokumenten sind 80 GB und mehr realistisch.
Kann ich die Hardware später erweitern?
Das hängt vom Gehäuse, Netzteil und Mainboard ab. Wer absehbar wachsen will, plant Platz und Stromversorgung für eine zweite GPU gleich mit ein. Das ist bei der Dimensionierung zu klären.