Zum Inhalt springen

KI lokal betreiben: Welche Hardware braucht man?

· 7 Minuten Lesezeit

Ein Sprachmodell lokal zu betreiben, klingt nach Rechenzentrum. Für die meisten Büros reicht aber ein einzelner KI-Server. Den Ausschlag gibt vor allem der Grafikspeicher: Er bestimmt, wie groß das Modell sein darf. Dazu kommen zwei Fragen: Wie viele Menschen nutzen die KI gleichzeitig, und wie viele Dokumente soll sie durchsuchen?

Der wichtigste Wert: Grafikspeicher

Sprachmodelle laufen am schnellsten auf Grafikprozessoren (GPUs). Wie groß das Modell sein darf, begrenzt vor allem der Grafikspeicher (VRAM). Das Modell muss vollständig hineinpassen, sonst wird es sehr langsam.

Als Faustregel braucht ein Modell pro Milliarde Parameter etwa 2 GB Speicher in voller Genauigkeit (16 Bit). Mit einer Quantisierung auf 4 Bit sinkt der Bedarf auf etwa ein Viertel, bei geringem Qualitätsverlust. Dazu kommt Speicher für den Kontext, also den Text, den das Modell gerade verarbeitet.

  • Ein Modell mit 8 Milliarden Parametern braucht in 4 Bit etwa 5 bis 6 GB, in 16 Bit etwa 16 GB.
  • Ein Modell mit 32 Milliarden Parametern braucht in 4 Bit etwa 20 GB.
  • Ein Modell mit 70 Milliarden Parametern braucht in 4 Bit etwa 40 GB, also meist zwei Grafikkarten oder eine Karte mit sehr viel Speicher.

Gleichzeitige Nutzer und Kontextlänge

Ein Modell, das für eine Person flüssig antwortet, kann bei zehn gleichzeitigen Anfragen spürbar langsamer werden. Jede parallele Anfrage belegt zusätzlichen Speicher für ihren Kontext. Wer lange Dokumente auf einmal verarbeiten lässt, braucht ebenfalls mehr Speicher.

Für die Planung zählt deshalb nicht die Zahl der Mitarbeitenden, sondern wie viele von ihnen typischerweise gleichzeitig fragen und wie lang die Texte sind, mit denen sie arbeiten.

Arbeitsspeicher, Prozessor und Festplatte

  • Arbeitsspeicher: mindestens so viel wie Grafikspeicher, besser das Doppelte. Er hält Modelldateien, Suchindex und Betriebssystem.
  • Prozessor: weniger kritisch als die GPU. Er übernimmt vor allem Texterkennung, Indexierung und die Verwaltung der Anfragen.
  • Festplatte: schnelle NVMe-SSDs mit genug Platz für Modelle, Originaldokumente und den Suchindex, der mit dem Dokumentenbestand wächst.
  • Kühlung und Lautstärke: KI-Server erzeugen Wärme. Im Büro zählt ein leiser Betrieb, im Serverraum ein Gehäuse für das 19-Zoll-Rack.

Hardware allein reicht nicht

Ein Modell auf einer Grafikkarte beantwortet noch keine Fragen zu den eigenen Akten. Dafür braucht es weitere Bausteine:

  • Eine Inferenz-Software, die das Modell ausführt, zum Beispiel vLLM oder llama.cpp.
  • Eine Dokumentensuche (Retrieval Augmented Generation, RAG), die zu jeder Frage die passenden Textstellen findet und dem Modell mitgibt.
  • Texterkennung für gescannte Unterlagen.
  • Eine Oberfläche mit Anmeldung und Rechten, damit alle nur sehen, was sie sehen dürfen.
  • Updates für Modell und Software, ohne dass Daten das Haus verlassen.

Eigenbau oder fertiger KI-Server

Wer eine eigene IT mit Erfahrung in Linux, GPU-Treibern und Machine Learning hat, kann einen KI-Server selbst aufbauen. Der Aufwand liegt weniger in der Hardware als in Auswahl, Einrichtung und Pflege der Software, und darin, dass die Antworten verlässlich mit Quellen belegt sind.

Eine vorkonfigurierte Appliance wie die Sinabox nimmt diese Arbeit ab: Hardware, Modell, Dokumentensuche und Oberfläche sind aufeinander abgestimmt und eingerichtet. Die Sinabox gibt es als Standard-Gerät und als 19-Zoll-Rack für den Serverraum. Wie groß sie sein muss, klären wir vorab anhand von Nutzerzahl und Dokumentenbestand.

Bereit für KI ohne Cloud?

Sprechen Sie mit unserem Team über Einsatz, Konfiguration und ein individuelles Angebot für Ihre Organisation.

Häufige Fragen zum Thema

Kurz beantwortet, was dazu am häufigsten gefragt wird.

Als Faustregel etwa 2 GB pro Milliarde Parameter in 16 Bit und etwa ein Viertel davon mit 4-Bit-Quantisierung. Ein Modell mit 8 Milliarden Parametern läuft damit ab etwa 6 GB, eines mit 70 Milliarden Parametern braucht rund 40 GB.

Kleine Modelle laufen auch auf dem Prozessor, antworten aber deutlich langsamer. Für mehrere Nutzer im Büro und für die Arbeit mit vielen Dokumenten ist eine Grafikkarte praktisch Pflicht.

Nein. Nach der Einrichtung läuft ein lokales Sprachmodell vollständig offline. Die Sinabox braucht nach der Ersteinrichtung keine Internetverbindung und erzeugt keinen ausgehenden Datenverkehr.