KI lokal betreiben: Welche Hardware braucht man?
· 7 Minuten Lesezeit
Ein Sprachmodell lokal zu betreiben, klingt nach Rechenzentrum. Für die meisten Büros reicht aber ein einzelner KI-Server. Den Ausschlag gibt vor allem der Grafikspeicher: Er bestimmt, wie groß das Modell sein darf. Dazu kommen zwei Fragen: Wie viele Menschen nutzen die KI gleichzeitig, und wie viele Dokumente soll sie durchsuchen?
Der wichtigste Wert: Grafikspeicher
Sprachmodelle laufen am schnellsten auf Grafikprozessoren (GPUs). Wie groß das Modell sein darf, begrenzt vor allem der Grafikspeicher (VRAM). Das Modell muss vollständig hineinpassen, sonst wird es sehr langsam.
Als Faustregel braucht ein Modell pro Milliarde Parameter etwa 2 GB Speicher in voller Genauigkeit (16 Bit). Mit einer Quantisierung auf 4 Bit sinkt der Bedarf auf etwa ein Viertel, bei geringem Qualitätsverlust. Dazu kommt Speicher für den Kontext, also den Text, den das Modell gerade verarbeitet.
- Ein Modell mit 8 Milliarden Parametern braucht in 4 Bit etwa 5 bis 6 GB, in 16 Bit etwa 16 GB.
- Ein Modell mit 32 Milliarden Parametern braucht in 4 Bit etwa 20 GB.
- Ein Modell mit 70 Milliarden Parametern braucht in 4 Bit etwa 40 GB, also meist zwei Grafikkarten oder eine Karte mit sehr viel Speicher.
Gleichzeitige Nutzer und Kontextlänge
Ein Modell, das für eine Person flüssig antwortet, kann bei zehn gleichzeitigen Anfragen spürbar langsamer werden. Jede parallele Anfrage belegt zusätzlichen Speicher für ihren Kontext. Wer lange Dokumente auf einmal verarbeiten lässt, braucht ebenfalls mehr Speicher.
Für die Planung zählt deshalb nicht die Zahl der Mitarbeitenden, sondern wie viele von ihnen typischerweise gleichzeitig fragen und wie lang die Texte sind, mit denen sie arbeiten.
Arbeitsspeicher, Prozessor und Festplatte
- Arbeitsspeicher: mindestens so viel wie Grafikspeicher, besser das Doppelte. Er hält Modelldateien, Suchindex und Betriebssystem.
- Prozessor: weniger kritisch als die GPU. Er übernimmt vor allem Texterkennung, Indexierung und die Verwaltung der Anfragen.
- Festplatte: schnelle NVMe-SSDs mit genug Platz für Modelle, Originaldokumente und den Suchindex, der mit dem Dokumentenbestand wächst.
- Kühlung und Lautstärke: KI-Server erzeugen Wärme. Im Büro zählt ein leiser Betrieb, im Serverraum ein Gehäuse für das 19-Zoll-Rack.
Hardware allein reicht nicht
Ein Modell auf einer Grafikkarte beantwortet noch keine Fragen zu den eigenen Akten. Dafür braucht es weitere Bausteine:
- Eine Inferenz-Software, die das Modell ausführt, zum Beispiel vLLM oder llama.cpp.
- Eine Dokumentensuche (Retrieval Augmented Generation, RAG), die zu jeder Frage die passenden Textstellen findet und dem Modell mitgibt.
- Texterkennung für gescannte Unterlagen.
- Eine Oberfläche mit Anmeldung und Rechten, damit alle nur sehen, was sie sehen dürfen.
- Updates für Modell und Software, ohne dass Daten das Haus verlassen.
Eigenbau oder fertiger KI-Server
Wer eine eigene IT mit Erfahrung in Linux, GPU-Treibern und Machine Learning hat, kann einen KI-Server selbst aufbauen. Der Aufwand liegt weniger in der Hardware als in Auswahl, Einrichtung und Pflege der Software, und darin, dass die Antworten verlässlich mit Quellen belegt sind.
Eine vorkonfigurierte Appliance wie die Sinabox nimmt diese Arbeit ab: Hardware, Modell, Dokumentensuche und Oberfläche sind aufeinander abgestimmt und eingerichtet. Die Sinabox gibt es als Standard-Gerät und als 19-Zoll-Rack für den Serverraum. Wie groß sie sein muss, klären wir vorab anhand von Nutzerzahl und Dokumentenbestand.