Status: in BetriebENDE

On-Premise-KI

Private KI auf eigener Hardware: Open-Weight-Modelle hinter Ihrer Firewall, Datensouveränität durch Architektur statt durch Vertrag.

Das Problem

Für manche Organisationen kommt es schlicht nicht infrage, Daten an eine Cloud-KI zu schicken - Mandatsgeheimnis, regulatorische Vorgaben, vertragliche Zusagen oder einfache Vorsicht schliessen es aus. Die übliche Schlussfolgerung: dann eben keine KI. Diese Schlussfolgerung ist veraltet. Open-Weight-Modelle sind ernsthaft leistungsfähig geworden, und Inferenz auf eigener Hardware ist ein gelöstes Engineering-Problem.

Souveränität ist hier architektonisch, nicht vertraglich. Ein Auftragsverarbeitungsvertrag verspricht, dass Ihre Daten gut behandelt werden; ein Server in Ihrem Gebäude macht die Frage gegenstandslos. Schweizer und EU-Datenschutzrecht werden deutlich einfacher, wenn die Daten Ihr Grundstück nie verlassen.

Zusammenarbeit

Wir beginnen bei Ihren Aufgaben und Ihren Auflagen - nicht bei der Hardware. Sie erhalten eine Machbarkeitseinschätzung an echten Beispielen: welche Aufgaben Open-Weight-Modelle heute bewältigen, welche nicht, und was Aufbau und Wartung an Hardware kosten. Lautet die Antwort «für Sie ist das Cloud-Modell die richtige Wahl», sagen wir das. Der Build selbst hat fixen Umfang: Deployment, Retrieval, Workflows, Leitplanken und eine Übergabe, die Ihre IT besitzt.

Der Einstieg läuft per E-Mail: was hineingehört, steht auf der Kontaktseite.

Was wir liefern

  • Hardware-Dimensionierung und Open-Weight-Modellwahl, passend zu Ihren realen Aufgaben
  • Inferenz-Deployment auf Ihren Servern - quantisiert, überwacht, aktualisierbar
  • Retrieval über Ihre privaten Dokumente, vollständig in Ihrem Netz
  • Human-in-the-Loop-Workflows für die Schritte, die Haftung tragen
  • Air-Gapped-Betrieb, wo nötig - ohne externe Aufrufe, nachprüfbar

Nachweis

Häufige Fragen

Welche Modelle setzen Sie ein?

Aktuelle Open-Weight-Modelle, gewählt pro Aufgabe - Text, Code, Extraktion und Retrieval bevorzugen jeweils andere, und die ehrliche Antwort ändert sich alle paar Monate. Wir benchmarken Kandidaten auf Ihren echten Dokumenten, bevor wir uns festlegen, und bauen das Deployment so, dass sich das Modell austauschen lässt, sobald bessere Gewichte erscheinen.

Welche Hardware braucht das?

Von einer einzelnen GPU-Workstation bis zum kleinen Server-Rack, abhängig von paralleler Last und Modellgrösse. Wir dimensionieren nach Ihrer gemessenen Arbeitslast, nicht nach der Referenzarchitektur eines Herstellers - viele klar umrissene Aufgaben laufen gut auf Hardware, die unter einen Schreibtisch passt.

Ist On-Premise-KI schwächer als die Frontier-Modelle in der Cloud?

Beim offenen Schlussfolgern ja - gehostete Frontier-Modelle liegen vorn. Für definierte Aufgaben über Ihren eigenen Dokumenten und Prozessen reichen gut gewählte offene Gewichte regelmässig aus, und der Unterschied hört oft auf, eine Rolle zu spielen. Auf welcher Seite dieser Linie Ihr Fall liegt, sagen wir Ihnen, bevor Sie Hardware kaufen.

Wer kann auf unsere Daten zugreifen?

Innerhalb Ihres Hauses: wer von Ihnen autorisiert ist. Ausserhalb: niemand - das ist der Sinn der Architektur. Nichts geht an uns, an Modellanbieter oder in eine Cloud; wo gefordert, liefern wir vollständig offline arbeitende Systeme, deren Funkstille Sie selbst nachprüfen können.

Wie funktionieren Updates ohne Cloud-Anbindung?

Als geplante Wartung unter Ihrer Kontrolle: Modellgewichte, Inferenz-Server und Evaluationssuite sind gemeinsam versioniert und werden über Installationsmedien oder ein kontrolliertes Netzfenster aktualisiert. Jedes Update durchläuft Ihre Abnahme-Benchmarks, bevor es live geht.

Branchen

zuletzt bearbeitet 02.07.2026