Lokale KI · On-Premise

Lokale KI: Ihr eigenes Sprachmodell, auf Ihrer eigenen Hardware.

Wir planen, installieren und betreuen KI-Systeme, die in Ihrem Betrieb laufen — auf einem GPU-Server in Ihrem Serverraum statt in der Cloud eines US-Konzerns. Die KI verarbeitet Anfragen und Dokumente in Ihrem Netzwerk, ohne Cloud-Sprachmodell. Geplant und eingerichtet von Goma-IT aus Bludenz.

60-Sekunden-Analyse starten

Manche Daten gehören in keine fremde Cloud.

ChatGPT und Co. sind stark. Aber jede Eingabe landet im Rechenzentrum des Anbieters.

  • Berufsgeheimnis: Kanzleien, Notariate, Arztpraxen und Steuerberatung sind zur Verschwiegenheit verpflichtet. Mandats-, Patienten- oder Klientendaten in einen Cloud-Dienst zu kopieren, ist dort oft keine Option.
  • Geschäftsgeheimnisse: Konstruktionsdaten, Kalkulationen, Rezepturen oder Verträge sind das Kapital eines Betriebs. Kundenverträge und Geheimhaltungsvereinbarungen können die Weitergabe an Dritte ausdrücklich ausschließen.
  • Abhängigkeit: Bei Cloud-Modellen bestimmt der Anbieter Preis, Modellversion und Nutzungsbedingungen — und US-Anbieter unterliegen US-Recht, auch mit Rechenzentrum in Europa.
Lokale KI dreht das um: Das Sprachmodell kommt zu Ihren Daten, nicht Ihre Daten zum Sprachmodell.
Was lokal läuft

Dieselben KI-Anwendungen — nur eben im eigenen Haus.

Fragen an Ihre Unterlagen
Ihr Team fragt in normaler Sprache, die KI sucht in Fileserver, DMS oder Postfächern und nennt die Fundstelle. Technisch: Retrieval-Augmented Generation (RAG) mit lokalem Such-Index — ohne dass ein Dokument das Haus verlässt.
Dokumente und Belege auslesen
Texterkennung und Sprachmodell lesen Rechnungen, Verträge oder Formulare aus und legen die Daten als Entwurf in Ihren Programmen an. Geprüft und freigegeben wird von Ihrem Team.
Diktate und Besprechungen
Ein lokales Spracherkennungsmodell macht aus Diktaten und Besprechungsaufnahmen Text, das Sprachmodell daraus Protokoll oder Zusammenfassung. Die Aufnahme bleibt auf Ihrem Server.
Mails vorsortieren, Entwürfe schreiben
Eingehende Mails werden eingeordnet und an die zuständige Person geleitet, auf Wunsch mit Antwortentwurf. Verschickt wird erst nach Freigabe.
Ein interner KI-Assistent
Ein Chatfenster im Browser, wie man es von ChatGPT kennt — für Zusammenfassungen, Übersetzungen und Textentwürfe. Mit Anmeldung über Ihr Firmenkonto statt privater Cloud-Zugänge Ihrer Mitarbeitenden.
Automatisierte Abläufe
Die Automatisierungsplattform n8n läuft auf derselben Infrastruktur und nutzt das lokale Modell über eine Schnittstelle. So lassen sich auch ganze Abläufe ohne Cloud-KI aufbauen.
Typische Einsätze

Wo lokale KI den Unterschied macht.

Beispiele für mögliche Abläufe, keine Kundenfälle: Was in Ihrem Betrieb sinnvoll ist, klären wir im Machbarkeits-Check.

Kanzlei & Notariat
Akten befragen, ohne sie herzugeben
Wer einen Schriftsatz vorbereitet, fragt die KI nach früheren Stellungnahmen oder vereinbarten Fristen und bekommt die Fundstelle im Akt. Mandatsdaten bleiben auf dem Server der Kanzlei.
Gesundheit
Diktate in der eigenen Praxis verschriftlichen
Befund- und Briefdiktate werden lokal in Text umgewandelt und als Entwurf vorbereitet. Patientendaten gehen an keinen Cloud-Dienst; Ärztin oder Arzt prüft und gibt frei.
Industrie & Technik
Konstruktionswissen durchsuchbar machen
Zeichnungen, Prüfberichte und alte Angebote werden lokal indexiert. Wer wissen will, wie ein Sonderfall 2019 gelöst wurde, fragt nach — die Daten verlassen das Werksnetz nicht.
Architektur

Was in Ihrem Serverraum läuft, Schicht für Schicht.

Für Ihr Team zählt nur die oberste Schicht: ein Chatfenster und fertige Abläufe. Darunter liegt die Technik, die wir auswählen, einrichten und betreuen.

  1. Anwendungen

    Was Ihr Team sieht und nutzt

    • Chat mit Fundstelle
    • Dokumente auslesen
    • Diktat → Text
    • Mail-Entwürfe
    • n8n-Workflows
  2. Zugriff & Sicherheit

    Wer was darf, und was protokolliert wird

    • Anmeldung über Firmenkonto (SSO)
    • Rollen & Rechte
    • Protokollierung
  3. Wissen

    Ihre Unterlagen, durchsuchbar gemacht

    • Vektordatenbank
    • Dokumenten-Index
    • Fileserver · DMS · Postfächer
  4. Modelle

    Offene Modelle, austauschbar

    • Sprachmodell (Open-Weight)
    • Embedding-Modell
    • Reranker
    • Spracherkennung (Whisper)
    • Texterkennung (OCR)
  5. Inferenz

    Die Software, die Modelle schnell rechnet

    • vLLM
    • llama.cpp / Ollama
    • Quantisierung 4–8 Bit
    • Batching für mehrere Nutzer
    • OpenAI-kompatible Schnittstelle
  6. Hardware

    In Ihrem Betrieb

    • GPU mit ausreichend Grafikspeicher (VRAM)
    • Server oder Workstation
    • USV & Datensicherung
Dimensionierung

Wie viel Hardware braucht lokale KI?

Entscheidend ist der Grafikspeicher (VRAM) der GPU: Das Modell muss vollständig hineinpassen, dazu kommt Reserve für den Gesprächsverlauf und für gleichzeitige Anfragen.

Einstieg
24–32 GB VRAM
Gerät
Workstation mit einer GPU
Modelle
Modelle bis rund 30 Mrd. Parameter (quantisiert)
Geeignet für
Einzelne Nutzer oder ein kleines Team, klar umrissene Aufgaben wie Zusammenfassen, Auslesen, Transkribieren
Team
80–128 GB VRAM
Gerät
Workstation-GPU mit 96 GB oder zwei GPUs mit je 48 GB oder mehr
Modelle
Modelle der 70-Mrd.-Klasse oder große Mixture-of-Experts-Modelle wie gpt-oss-120b
Geeignet für
Ein Team mit mehreren gleichzeitigen Anfragen, Wissens-KI über den gesamten Dokumentenbestand
Betrieb
ab 160 GB VRAM
Gerät
Server mit mehreren Rechenzentrums-GPUs
Modelle
Größere Modelle oder mehrere Modelle parallel
Geeignet für
Viele Nutzer gleichzeitig, mehrere Anwendungen auf derselben Infrastruktur

Faustregel: Bei 4-Bit-Quantisierung braucht ein Sprachmodell rund 0,6 GB Grafikspeicher je Milliarde Parameter — ein Modell mit 70 Milliarden Parametern also etwa 40 GB, plus Reserve.

Richtwerte. Welche Größe Ihr Anwendungsfall wirklich braucht, messen wir im Machbarkeits-Check — bevor Sie Hardware kaufen.

Cloud-KI, lokale KI oder beides?

Cloud-Modell
Lokale KI
Hybrid
Wo Daten verarbeitet werden
Im Rechenzentrum des Anbieters, oft mit US-Bezug
In Ihrem Netzwerk
Vertrauliches lokal, Unkritisches in der Cloud
Qualität bei komplexen Aufgaben
Am höchsten
Gut bei klar umrissenen Aufgaben, bei komplexem Schlussfolgern schwächer
Je Aufgabe das passende Modell
Kosten
Laufend, nach Nutzung
Hardware einmalig, danach Strom und Betreuung
Beides, gezielt eingesetzt
Funktioniert ohne Internet
Nein
Ja
Teilweise
Abhängigkeit vom Anbieter
Hoch: Preise, Modelle und Bedingungen ändern sich
Gering: offene Modelle, austauschbar
Mittel
Startbereit
Sofort
Nach Beschaffung und Einrichtung
Nach Einrichtung

Drei Grundsätze für lokale KI.

Erst messen, dann kaufen
Bevor Sie Hardware anschaffen, testen wir passende offene Modelle mit Beispiel- oder anonymisierten Dokumenten aus Ihrem Alltag: Wie gut sind die Antworten, wie schnell kommen sie? Erst daraus ergibt sich, welche GPU Sie brauchen.
Offene Modelle, keine Bindung
Wir setzen auf Modelle mit offenen Gewichten und eine standardisierte Schnittstelle. Erscheint ein besseres Modell, wird es ausgetauscht, ohne die Anwendungen umzubauen. Die Lizenz prüfen wir je Modell, denn nicht jedes offene Modell ist für jeden Zweck freigegeben.
Ehrlich, wo die Cloud besser ist
Lokale Modelle sind bei komplexem Schlussfolgern schwächer als die größten Cloud-Modelle, und Hardware kostet vorab Geld, Strom und Platz. Wo keine vertraulichen Daten im Spiel sind, ist die Cloud oft die günstigere Wahl. Das sagen wir Ihnen auch so.
Ablauf

Vom ersten Gespräch zur KI im eigenen Serverraum.

Start
1
Erstgespräch
Im kostenlosen Erstgespräch (30 Minuten) — telefonisch, online oder vor Ort in Vorarlberg — klären wir, welche Daten lokal bleiben müssen und welche Aufgaben die KI übernehmen soll.
Check
2
Machbarkeits-Check
Wir testen passende offene Modelle auf gemieteter GPU-Rechenleistung in einem EU-Rechenzentrum, möglichst vergleichbar mit der geplanten Hardware, mit Beispiel- oder anonymisierten Dokumenten. Ergebnis: die gemessene Antwortqualität, Richtwerte zur Geschwindigkeit, eine Hardware-Empfehlung und eine Circa-Preisspanne für die Einrichtung.
Hardware
3
Beschaffung
Sie erhalten eine genaue Stückliste — GPU, Server, Netzteil, Kühlung, USV. Die Anschaffung stimmen wir mit Ihnen und auf Wunsch mit Ihrem IT-Partner ab.
Einrichtung
4
Installation und Test
Wir richten Betriebssystem, Treiber, Inferenz-Software, Modelle, Such-Index und Anwendungen ein, binden Ihre Ablagen und das Firmenkonto an und stimmen Antworten und Geschwindigkeit im Test mit Ihrem Team ab.
Laufend
5
Betrieb und Ausbau
Wir überwachen das System, spielen Updates ein und tauschen Modelle aus, wenn bessere erscheinen — über einen gesicherten Fernzugang, den Sie freigeben. Neue Anwendungen kommen dazu, wenn die ersten sich bewährt haben.

Häufige Fragen

Was ist lokale KI (On-Premise-KI)?
Ein Sprachmodell, das nicht über das Internet bei einem Anbieter wie OpenAI läuft, sondern auf einem Rechner mit Grafikprozessor (GPU) in Ihrem eigenen Betrieb. Anfragen und Dokumente werden dort verarbeitet und verlassen Ihr Netzwerk nicht. Für Ihr Team sieht die Bedienung ähnlich aus wie bei ChatGPT: ein Chatfenster im Browser.
Sind lokale Modelle so gut wie ChatGPT?
Nicht in jeder Hinsicht. Bei komplexem, mehrstufigem Schlussfolgern sind die größten Cloud-Modelle vorne. Für klar umrissene Aufgaben — Zusammenfassen, Auslesen, Einordnen, Fragen an eigene Dokumente, Transkribieren — liefern aktuelle offene Modelle oft brauchbare bis sehr gute Ergebnisse. Wie gut sie für Ihre Aufgaben sind, messen wir im Machbarkeits-Check, bevor Hardware gekauft wird.
Welche Modelle setzen Sie ein?
Modelle mit offenen Gewichten, etwa aus den Familien Llama, Mistral, Qwen, Gemma oder gpt-oss, dazu Embedding-Modelle für die Suche und Whisper für Spracherkennung. Welches Modell passt, hängt von Aufgabe, Sprache und Hardware ab. Die Lizenzbedingungen prüfen wir je Modell.
Welche Hardware brauche ich?
Entscheidend ist der Grafikspeicher (VRAM) der GPU. Für kleinere Modelle und einzelne Nutzer reicht eine Workstation mit einer GPU und 24–32 GB; für ein Team mit größeren Modellen sind 80–128 GB üblich. Die genaue Dimensionierung ergibt sich aus dem Machbarkeits-Check.
Ist lokale KI automatisch DSGVO-konform?
Nein, aber vieles wird einfacher: Es gibt keine Übermittlung an einen Cloud-Anbieter und keine Drittlandübermittlung. Pflichten wie Zugriffsrechte, Protokollierung, Löschkonzept und Information der Betroffenen bleiben. Wir richten die technische Seite dafür ein; die rechtliche Bewertung ersetzt das nicht.
Braucht das System eine Internetverbindung?
Für den laufenden Betrieb nicht, sofern Anmeldung und angebundene Ablagen ebenfalls im eigenen Netz laufen. Liegen Firmenkonten oder Postfächer in der Cloud, etwa bei Microsoft 365, braucht dieser Teil weiterhin Internet. Für Updates, neue Modelle und unsere Wartung braucht es einen gesicherten Zugang, den Sie freigeben. Auf Wunsch lässt sich das System so betreiben, dass es nur für Wartungsfenster erreichbar ist.
Wie viele Mitarbeitende können gleichzeitig damit arbeiten?
Das hängt von Modellgröße, GPU und Länge der Anfragen ab. Inferenz-Software wie vLLM verarbeitet mehrere Anfragen parallel. Im Machbarkeits-Check messen wir, wie viele gleichzeitige Anfragen bei welcher Antwortzeit möglich sind.
Was kostet lokale KI?
Die Kosten bestehen aus der Hardware, die Sie einmalig anschaffen, der Einrichtung und einer monatlichen Pauschale für Betrieb, Updates und Modellpflege. Dazu kommt der Strom. Laufende Kosten pro Anfrage wie bei Cloud-Modellen fallen nicht an. Eine Circa-Preisspanne erhalten Sie nach dem Machbarkeits-Check; das Erstgespräch dauert 30 Minuten und ist kostenlos.
Gibt es die KI-Wissensdatenbank auch lokal?
Die KI-Wissensdatenbank ist ein gehostetes Produkt mit eigener Instanz auf Servern in Deutschland. Eine Wissens-KI im eigenen Serverraum richten wir als individuelle Lösung nach demselben Prinzip ein: Fragen in normaler Sprache, Antworten mit Fundstelle, Rechte nach Rolle.
Welche Pflichten habe ich nach dem AI Act?
Wer KI-Systeme im Betrieb einsetzt, muss seit 2. Februar 2025 Maßnahmen treffen, die die KI-Kompetenz der Mitarbeitenden fördern (Art. 4 AI Act, seit Juli 2026 in der Fassung der VO (EU) 2026/1744); Art. 50 regelt zusätzlich Kennzeichnungspflichten, etwa bei Chatbots für Kunden. Für interne Assistenten zur Textarbeit sind die Pflichten meist überschaubar. Wir weisen Ihr Team in die Nutzung ein; eine Rechtsberatung ersetzt das nicht.

Zum Weiterlesen

Fachartikel zu dieser Leistung — je Branche und Region einzeln erklärt: Lokale KI nach Branche und Thema

Klären Sie, ob lokale KI für Ihren Betrieb passt.

Die 60-Sekunden-Analyse gibt eine erste Orientierung, wo in Ihrem Betrieb Zeit verloren geht, und eine KI-erstellte Ersteinschätzung per E-Mail. Eine eigene Auswahl für lokale KI gibt es dort nicht: Wählen Sie „Ich bin mir noch nicht sicher“ oder vereinbaren Sie direkt ein kostenloses Erstgespräch (30 Minuten). Ob die Lösung lokal laufen muss, welche Modelle passen und welche Hardware es braucht, besprechen wir im Erstgespräch.

60-Sekunden-Analyse starten