Zum Inhalt springen
Lindner Tech

NeuLokale KI & RAG-Systeme

Lokale KI im Unternehmen: Welche Hardware brauchen Sie wirklich?

Lokale KI ohne Rechenzentrum: was Grafikkarte, Grafikspeicher, RAM und CPU leisten, Pilot oder Vollbetrieb, eigener Server oder EU-Rechenzentrum.

Markus Lindner · 7 Min. Lesezeit

„Brauchen wir für lokale KI ein Rechenzentrum im Keller?“ Diese Frage höre ich oft, wenn es um eine DSGVO-freundliche KI auf Firmendokumenten geht. Die ehrliche Antwort: meistens nicht. Ein RAG-System, das Ihre Verträge, Handbücher und Angebote durchsucht und daraus Antworten mit Quellenangabe formuliert, läuft für ein kleines Team auf einem einzelnen Server mit einer passenden Grafikkarte. Welche Komponente dabei was leistet, wann ein Pilot reicht und wann ein gemieteter Server in einem deutschen Rechenzentrum die bessere Wahl ist, erkläre ich hier Bauteil für Bauteil.

Warum überhaupt lokal: der Datenschutz in einem Absatz

Bei Cloud-KI wandern Ihre Fragen und Dokumente zu einem externen Anbieter, oft mit Sitz in den USA. Läuft das Sprachmodell dagegen auf Ihrer eigenen Hardware oder auf einem dedizierten Server in der EU, bleibt der Kreis der Beteiligten klein: kein externer KI-Anbieter, keine Übermittlung in ein Drittland, beim gemieteten Server ein Auftragsverarbeitungsvertrag mit dem Rechenzentrum. Eine Rechtsgrundlage, ein Rechtekonzept und Löschregeln brauchen Sie trotzdem. Wie das im Detail aussieht, steht im Artikel über DSGVO-konforme RAG-Systeme. Die rechtliche Bewertung treffen Sie gemeinsam mit Ihrem Datenschutzbeauftragten.

Sie möchten das in Ihrer Firma angehen?

Schreiben Sie mir kurz oder rufen Sie an. Ich melde mich werktags innerhalb von 24 Stunden.

Kostenloses Erstgespräch0162 8036 905

5,0 bei Google · 50 Bewertungen

15 Minuten, unverbindlich · Antwort werktags innerhalb von 24 Stunden

Grafikkarte und Grafikspeicher: der wichtigste Baustein

Ein Sprachmodell formuliert Antworten Wort für Wort, und dafür muss es möglichst vollständig im schnellen Speicher der Grafikkarte liegen. Deshalb entscheidet bei lokaler KI vor allem der Grafikspeicher (VRAM), weniger die reine Rechenleistung. Passt das Modell nicht ganz hinein, lagern Programme wie Ollama einen Teil in den normalen Arbeitsspeicher aus. Das funktioniert, die Antworten kommen dann aber spürbar langsamer.

Wie viel Speicher ein Modell braucht, lässt sich grob abschätzen. In voller 16-Bit-Genauigkeit belegt jede Milliarde Parameter rund 2 GB. Mit Quantisierung, also gröber gespeicherten Gewichten, sinkt der Bedarf deutlich: Ein Modell mit 8 Milliarden Parametern ist in der verbreiteten 4-Bit-Variante knapp 5 GB groß, ein Modell mit 70 Milliarden Parametern gut 40 GB. Die Qualität leidet bei 4 Bit oft nur wenig, das sollte aber an Ihren eigenen Fragen getestet werden.

Dazu kommt Speicher für den Kontext, also für die Frage, die gefundenen Textstellen und die entstehende Antwort. Bei RAG ist dieser Kontext größer als bei einem einfachen Chat, weil jedes Mal mehrere Dokumentabschnitte mitgeschickt werden. Die Faustregel lautet deshalb: Modellgröße plus Reserve für Kontext und gleichzeitige Nutzer.

Arbeitsspeicher, Festplatte und Prozessor

Die übrigen Komponenten sind weniger kritisch, aber nicht egal:

  • Arbeitsspeicher (RAM): Er hält Betriebssystem, Suchindex, Datenbank und die Verarbeitung neuer Dokumente. Bemessen Sie ihn großzügig, damit das Modell beim Laden Platz hat und im Notfall ausweichen kann.
  • Speicherplatz: Schnelle SSDs verkürzen das Laden der Modelle und die Suche im Index. Modelle belegen je nach Größe einige bis viele Gigabyte, der Index wächst mit Ihrem Dokumentenbestand, und Modellversionen zum Vergleich brauchen zusätzlich Platz.
  • Prozessor (CPU): Er zerlegt PDFs und Office-Dateien, liest gescannte Dokumente per Texterkennung und steuert die Abläufe. Ein aktueller Server-Prozessor reicht dafür meist, denn das Formulieren übernimmt die Grafikkarte.
  • Embedding-Modell: Es übersetzt Ihre Dokumente für die Suche in Zahlenvektoren und ist im Vergleich winzig. Ein verbreitetes Open-Source-Modell dafür ist kleiner als 300 MB und läuft neben dem Sprachmodell mit.

Pilot oder Vollbetrieb: was sich ändert

Im Pilot testen zwei, drei Personen einen Anwendungsfall mit echten Dokumenten. Fragen kommen selten gleichzeitig, kurze Wartezeiten stören niemanden. Dafür genügt oft vorhandene Hardware oder ein kleineres Modell, und genau das ist der Sinn: Sie sehen am echten Fall, ob die Antworten taugen, bevor Hardware gekauft wird.

Im Vollbetrieb ändern sich zwei Dinge. Erstens fragen mehrere Personen gleichzeitig, und jede parallele Anfrage braucht eigenen Speicher für ihren Kontext. Bei Ollama etwa wächst der Speicherbedarf mit der Zahl paralleler Anfragen mal der Kontextlänge. Für viele gleichzeitige Nutzer gibt es spezialisierte Server-Software wie vLLM, die diesen Speicher effizienter verwaltet. Zweitens steigen die Erwartungen: Antworten sollen zügig kommen, der Server soll verlässlich laufen, Zugriffe sollen protokolliert werden.

Wie Sie den richtigen ersten Anwendungsfall finden, beschreibt der Artikel KI im Mittelstand: wo sie wirklich Zeit spart.

Dimensionieren nach Nutzern und Anwendungsfall

Eine Tabelle nach dem Muster „so viele Mitarbeitende, so viel Grafikspeicher“ wäre unseriös, weil drei Größen zusammenspielen:

  • Wie viele Personen fragen gleichzeitig? Nicht die Zahl der Konten zählt, sondern die Spitzen, etwa morgens oder vor Abgabeterminen.
  • Wie lang sind Fragen und Antworten? Eine Vertragsfrage mit kurzer Antwort braucht weniger Kontext als ein mehrseitiger Angebotsentwurf.
  • Welche Sprache und welche Qualität? Viele kleinere Modelle schreiben ordentliches Deutsch, bei anspruchsvollen Texten kann ein größeres Modell den Unterschied machen.

Was Sie weiterverwenden können

Im Pilot messe ich deshalb: Wie schnell kommen Antworten, wie gut sind sie, wie viel Speicher ist belegt? Daraus ergibt sich die Ausstattung für den Betrieb, mit Reserve für den nächsten Anwendungsfall. Bei der BSU-Holding erstellt ein lokal betriebenes RAG-System aus Verträgen, Leistungsverzeichnissen und Altangeboten Angebotsentwürfe, die erst nach Freigabe das Haus verlassen. Lange Entwürfe wie diese stellen andere Anforderungen als eine kurze Auskunft aus dem Handbuch.

Weiterverwenden lässt sich oft mehr als gedacht: ein vorhandener Server oder eine Workstation mit Grafikkarte für den Pilot, das Netzlaufwerk, SharePoint oder DMS als Dokumentenquelle, die bestehende Datensicherung und die vorhandenen Benutzerkonten samt Berechtigungen. Neu dazu kommt dann häufig nur der KI-Server selbst.

Im eigenen Büro oder im EU-Rechenzentrum?

Ein KI-Server im Büro passt, wenn Sie einen Serverraum oder zumindest ein gut belüftetes Rack haben und die Daten das Gebäude gar nicht verlassen sollen. Unterschätzen Sie die Nebenwirkungen nicht: Eine leistungsfähige Grafikkarte unter Last braucht viel Strom und erzeugt Wärme und Lüftergeräusche. Neben dem Schreibtisch oder in einer Abstellkammer ohne Lüftung ist das keine gute Idee. Eine unterbrechungsfreie Stromversorgung und eine saubere Anbindung ans Firmennetz gehören dazu, das ist Teil meiner Netzwerk- und Servereinrichtung.

Ein dedizierter GPU-Server in einem deutschen oder EU-Rechenzentrum passt, wenn kein geeigneter Raum vorhanden ist, mehrere Standorte zugreifen oder Sie sich nicht um Hardware kümmern wollen. Strom, Kühlung und Hardwaretausch übernimmt das Rechenzentrum. Sie brauchen einen Auftragsverarbeitungsvertrag und eine verschlüsselte Verbindung. Wichtig ist das Wort „dediziert“: Der Server steht Ihnen allein zur Verfügung, und das Sprachmodell läuft darauf als Ihre Installation, nicht als Dienst eines KI-Anbieters.

Die Software ist in beiden Fällen dieselbe. Ein Pilot auf gemieteter Hardware und später ein eigener Server im Haus, oder umgekehrt, ist deshalb kein Neuanfang.

Betrieb: Updates, Backups und Kontrolle

Ein KI-Server ist ein Server wie jeder andere und braucht dieselbe Pflege: Sicherheitsupdates für Betriebssystem und Software, Treiber-Updates für die Grafikkarte mit Test vor dem Einspielen und eine Überwachung, die meldet, wenn Speicher oder Platte knapp werden. Neue Modellversionen spiele ich nicht blind ein, sondern prüfe sie vorher an einer Reihe echter Fragen.

Bei der Datensicherung zählt weniger das Modell, das sich jederzeit neu herunterladen lässt, als alles, was bei Ihnen entstanden ist: Konfiguration, Zugriffsregeln, Protokolle und der Index. Dafür gilt dieselbe 3-2-1-Regel wie für den Rest Ihrer IT, inklusive getesteter Wiederherstellung.

Und unabhängig von der Hardware: Eine KI kann sich irren, auch eine lokale. RAG macht Antworten prüfbar, weil jede Aussage ihre Quelle nennt. Prüfen muss sie trotzdem ein Mensch, vor allem bevor etwas das Haus verlässt.

Lokale KI braucht kein eigenes Rechenzentrum, aber eine Ausstattung, die zu Ihrem Anwendungsfall passt. Mein Rat: klein anfangen, mit einem Anwendungsfall und einem Pilot auf echten Dokumenten, und die Hardware erst nach der Messung festlegen. Ob Ihre vorhandene Technik dafür reicht oder ein EU-Server sinnvoller ist, klären wir im kostenlosen Erstgespräch. Danach bekommen Sie einen Festpreis für die Einrichtung Ihrer lokalen KI und eine ehrliche Einschätzung, welche Hardware Sie wirklich brauchen.

Lokale KI

KI in Ihrer Firma einsetzen?

Ich zeige Ihnen an einem echten Anwendungsfall, was lokale KI bei Ihnen leisten kann.

Kostenloses Erstgespräch

5,0 bei Google · 50 Bewertungen

15 Minuten, unverbindlich · Antwort werktags innerhalb von 24 Stunden