Lokale KI: Ihr eigenes Sprachmodell, auf Ihrer eigenen Hardware.
Wir planen, installieren und betreuen KI-Systeme, die in Ihrem Betrieb laufen — auf einem GPU-Server in Ihrem Serverraum statt in der Cloud eines US-Konzerns. Die KI verarbeitet Anfragen und Dokumente in Ihrem Netzwerk, ohne Cloud-Sprachmodell. Geplant und eingerichtet von Goma-IT aus Bludenz.
60-Sekunden-Analyse startenManche Daten gehören in keine fremde Cloud.
ChatGPT und Co. sind stark. Aber jede Eingabe landet im Rechenzentrum des Anbieters.
- Berufsgeheimnis: Kanzleien, Notariate, Arztpraxen und Steuerberatung sind zur Verschwiegenheit verpflichtet. Mandats-, Patienten- oder Klientendaten in einen Cloud-Dienst zu kopieren, ist dort oft keine Option.
- Geschäftsgeheimnisse: Konstruktionsdaten, Kalkulationen, Rezepturen oder Verträge sind das Kapital eines Betriebs. Kundenverträge und Geheimhaltungsvereinbarungen können die Weitergabe an Dritte ausdrücklich ausschließen.
- Abhängigkeit: Bei Cloud-Modellen bestimmt der Anbieter Preis, Modellversion und Nutzungsbedingungen — und US-Anbieter unterliegen US-Recht, auch mit Rechenzentrum in Europa.
Dieselben KI-Anwendungen — nur eben im eigenen Haus.
Wo lokale KI den Unterschied macht.
Beispiele für mögliche Abläufe, keine Kundenfälle: Was in Ihrem Betrieb sinnvoll ist, klären wir im Machbarkeits-Check.
Was in Ihrem Serverraum läuft, Schicht für Schicht.
Für Ihr Team zählt nur die oberste Schicht: ein Chatfenster und fertige Abläufe. Darunter liegt die Technik, die wir auswählen, einrichten und betreuen.
-
Anwendungen
Was Ihr Team sieht und nutzt
- Chat mit Fundstelle
- Dokumente auslesen
- Diktat → Text
- Mail-Entwürfe
- n8n-Workflows
-
Zugriff & Sicherheit
Wer was darf, und was protokolliert wird
- Anmeldung über Firmenkonto (SSO)
- Rollen & Rechte
- Protokollierung
-
Wissen
Ihre Unterlagen, durchsuchbar gemacht
- Vektordatenbank
- Dokumenten-Index
- Fileserver · DMS · Postfächer
-
Modelle
Offene Modelle, austauschbar
- Sprachmodell (Open-Weight)
- Embedding-Modell
- Reranker
- Spracherkennung (Whisper)
- Texterkennung (OCR)
-
Inferenz
Die Software, die Modelle schnell rechnet
- vLLM
- llama.cpp / Ollama
- Quantisierung 4–8 Bit
- Batching für mehrere Nutzer
- OpenAI-kompatible Schnittstelle
-
Hardware
In Ihrem Betrieb
- GPU mit ausreichend Grafikspeicher (VRAM)
- Server oder Workstation
- USV & Datensicherung
Wie viel Hardware braucht lokale KI?
Entscheidend ist der Grafikspeicher (VRAM) der GPU: Das Modell muss vollständig hineinpassen, dazu kommt Reserve für den Gesprächsverlauf und für gleichzeitige Anfragen.
- Gerät
- Workstation mit einer GPU
- Modelle
- Modelle bis rund 30 Mrd. Parameter (quantisiert)
- Geeignet für
- Einzelne Nutzer oder ein kleines Team, klar umrissene Aufgaben wie Zusammenfassen, Auslesen, Transkribieren
- Gerät
- Workstation-GPU mit 96 GB oder zwei GPUs mit je 48 GB oder mehr
- Modelle
- Modelle der 70-Mrd.-Klasse oder große Mixture-of-Experts-Modelle wie gpt-oss-120b
- Geeignet für
- Ein Team mit mehreren gleichzeitigen Anfragen, Wissens-KI über den gesamten Dokumentenbestand
- Gerät
- Server mit mehreren Rechenzentrums-GPUs
- Modelle
- Größere Modelle oder mehrere Modelle parallel
- Geeignet für
- Viele Nutzer gleichzeitig, mehrere Anwendungen auf derselben Infrastruktur
Faustregel: Bei 4-Bit-Quantisierung braucht ein Sprachmodell rund 0,6 GB Grafikspeicher je Milliarde Parameter — ein Modell mit 70 Milliarden Parametern also etwa 40 GB, plus Reserve.
Richtwerte. Welche Größe Ihr Anwendungsfall wirklich braucht, messen wir im Machbarkeits-Check — bevor Sie Hardware kaufen.
Cloud-KI, lokale KI oder beides?
Drei Grundsätze für lokale KI.
Vom ersten Gespräch zur KI im eigenen Serverraum.
Häufige Fragen
Was ist lokale KI (On-Premise-KI)?
Sind lokale Modelle so gut wie ChatGPT?
Welche Modelle setzen Sie ein?
Welche Hardware brauche ich?
Ist lokale KI automatisch DSGVO-konform?
Braucht das System eine Internetverbindung?
Wie viele Mitarbeitende können gleichzeitig damit arbeiten?
Was kostet lokale KI?
Gibt es die KI-Wissensdatenbank auch lokal?
Welche Pflichten habe ich nach dem AI Act?
Zum Weiterlesen
Fachartikel zu dieser Leistung — je Branche und Region einzeln erklärt: Lokale KI nach Branche und Thema
Klären Sie, ob lokale KI für Ihren Betrieb passt.
Die 60-Sekunden-Analyse gibt eine erste Orientierung, wo in Ihrem Betrieb Zeit verloren geht, und eine KI-erstellte Ersteinschätzung per E-Mail. Eine eigene Auswahl für lokale KI gibt es dort nicht: Wählen Sie „Ich bin mir noch nicht sicher“ oder vereinbaren Sie direkt ein kostenloses Erstgespräch (30 Minuten). Ob die Lösung lokal laufen muss, welche Modelle passen und welche Hardware es braucht, besprechen wir im Erstgespräch.
60-Sekunden-Analyse starten