KI-Hosting

GPU-Betrieb für Sprachmodelle in München

GPU-Kapazität für Inferenz und Feinabstimmung im eigenen Rechenzentrum. Es geht keine Anfrage an einen externen Anbieter, und kein Trainingsdatensatz verlässt das Haus.

Inferenz

Der Inhalt der Anfrage verlässt das Rechenzentrum nicht

Eine Anfrage an ein Sprachmodell enthält oft den Vertrag, die Personalakte oder den Schadensfall, über den gerade entschieden wird.

Bei einem Dienst aus der Cloud geht dieser Inhalt an einen fremden Betreiber, und was dort mit ihm geschieht, regelt ein Vertrag, den Sie nicht verhandelt haben. Auf unserer Hardware bleibt er imRechenzentrum in München: Eingabe, Zwischenstand und Antwort werden auf Maschinen verarbeitet, die uns gehören.

Modellqualität kostet das nicht. Offene Modelle sind bei Klassifikation, Zusammenfassung und Extraktion längst nah genug an den großen Anbietern; welche davon in Frage kommen, steht unterLokale KI. Was Sie gewinnen, ist die Möglichkeit, den Weg der Daten gegenüber Revision und Datenschutzbeauftragtem vollständig zu beschreiben.

Kapazität rechnen

Sie nennen Aufgabe, Textlängen und Zahl der Nutzer, wir sagen Ihnen, wie viele Karten das braucht und ab wann sich eigene Hardware trägt.

Feinabstimmung

Training und Inferenz laufen auf getrennter Zuteilung

Inferenz ist eine Dauerlast aus vielen kleinen Anfragen, bei der die Antwortzeit darüber entscheidet, ob ein System benutzt wird. Eine Feinabstimmung belegt umgekehrt für Stunden viel Speicher auf der Karte und darf den produktiven Betrieb nicht ausbremsen. Beides läuft bei uns am selben Ort, aber auf getrennter Zuteilung.

Bei der Feinabstimmung ziehen wir ein vorhandenes Modell auf Ihren Unterlagen nach: auf den Formulierungen Ihres Hauses, Ihren Aktenzeichen, Ihren Kategorien. Was dabei entsteht, ist Ihr Modellstand, und Ihre Unterlagen fließen in keinen fremden ein. Häufig trägt die Aufgabe den Aufwand am Ende nicht, weil ein sauber gebauter Abruf aus Ihren eigenen Dokumenten dasselbe leistet; das sagen wir, bevor Rechenzeit dafür eingeplant wird.

Lieferumfang

Was Ihnen nach dem Aufbau gehört

Kapazitätsrechnung
Auslegung mit Modellgröße, Nutzerzahl und Antwortzeit
GPU-Betrieb in München
Zugang zur Umgebung mit getrennter Zuteilung
Feinabstimmung
Ihr Modellstand samt Trainingsprotokoll
Anbindung an die Fachanwendung
Schnittstelle mit Dokumentation
Laufender Betrieb
Protokoll, welcher Modellstand wann produktiv war
Betrieb

Anbindung an die Fachanwendung und Protokoll der Modellstände

Die meisten Vorhaben scheitern nicht am Modell, sondern daran, dass niemand es benutzt: Ein Chatfenster neben der Fachanwendung ist ein zusätzlicher Arbeitsschritt und wird nach zwei Wochen gelassen. Wir hängen die Modelle deshalb über Schnittstellen an die Systeme, in denen der Vorgang ohnehin bearbeitet wird, und halten im Betrieb fest, welcher Modellstand wann produktiv war. Ohne dieses Protokoll lässt sich später nicht mehr rekonstruieren, welches Modell eine bestimmte Antwort gegeben hat.

Modellstand, Konfiguration und Anweisungstexte gehören Ihnen und gehen bei einem Wechsel mit. Die rechtliche Bewertung nehmen eigene Karten Ihnen dagegen nicht ab: Die Pflicht zurKI-Kompetenz nach Artikel 4 des EU AI Act gilt für die Menschen, die mit dem System arbeiten, und lässt sich an keine Hardware delegieren. Wo das System selbst handelt und wo ein Mensch übernimmt, legen wir vorher schriftlich fest, sieheVerantwortung.

Vorhaben durchsprechen

Bringen Sie eine Aufgabe mit, die heute von Hand läuft. Wir prüfen mit Ihnen, ob ein offenes Modell sie übernehmen kann und was dagegen spricht — auch dann, wenn die Antwort gegen einen eigenen Betrieb ausfällt.

L&I IT-solutions · Werderstr. 4 · 69469 Weinheim