GPU-Betrieb für Sprachmodelle in München
GPU-Kapazität für Inferenz und Feinabstimmung im eigenen Rechenzentrum. Es geht keine Anfrage an einen externen Anbieter, und kein Trainingsdatensatz verlässt das Haus.
Der Inhalt der Anfrage verlässt das Rechenzentrum nicht
Eine Anfrage an ein Sprachmodell enthält oft den Vertrag, die Personalakte oder den Schadensfall, über den gerade entschieden wird.
Bei einem Dienst aus der Cloud geht dieser Inhalt an einen fremden Betreiber, und was dort mit ihm geschieht, regelt ein Vertrag, den Sie nicht verhandelt haben. Auf unserer Hardware bleibt er imRechenzentrum in München: Eingabe, Zwischenstand und Antwort werden auf Maschinen verarbeitet, die uns gehören.
Modellqualität kostet das nicht. Offene Modelle sind bei Klassifikation, Zusammenfassung und Extraktion längst nah genug an den großen Anbietern; welche davon in Frage kommen, steht unterLokale KI. Was Sie gewinnen, ist die Möglichkeit, den Weg der Daten gegenüber Revision und Datenschutzbeauftragtem vollständig zu beschreiben.
Sie nennen Aufgabe, Textlängen und Zahl der Nutzer, wir sagen Ihnen, wie viele Karten das braucht und ab wann sich eigene Hardware trägt.
Training und Inferenz laufen auf getrennter Zuteilung
Inferenz ist eine Dauerlast aus vielen kleinen Anfragen, bei der die Antwortzeit darüber entscheidet, ob ein System benutzt wird. Eine Feinabstimmung belegt umgekehrt für Stunden viel Speicher auf der Karte und darf den produktiven Betrieb nicht ausbremsen. Beides läuft bei uns am selben Ort, aber auf getrennter Zuteilung.
Bei der Feinabstimmung ziehen wir ein vorhandenes Modell auf Ihren Unterlagen nach: auf den Formulierungen Ihres Hauses, Ihren Aktenzeichen, Ihren Kategorien. Was dabei entsteht, ist Ihr Modellstand, und Ihre Unterlagen fließen in keinen fremden ein. Häufig trägt die Aufgabe den Aufwand am Ende nicht, weil ein sauber gebauter Abruf aus Ihren eigenen Dokumenten dasselbe leistet; das sagen wir, bevor Rechenzeit dafür eingeplant wird.
Was Ihnen nach dem Aufbau gehört
- Kapazitätsrechnung
- Auslegung mit Modellgröße, Nutzerzahl und Antwortzeit
- GPU-Betrieb in München
- Zugang zur Umgebung mit getrennter Zuteilung
- Feinabstimmung
- Ihr Modellstand samt Trainingsprotokoll
- Anbindung an die Fachanwendung
- Schnittstelle mit Dokumentation
- Laufender Betrieb
- Protokoll, welcher Modellstand wann produktiv war
Anbindung an die Fachanwendung und Protokoll der Modellstände
Die meisten Vorhaben scheitern nicht am Modell, sondern daran, dass niemand es benutzt: Ein Chatfenster neben der Fachanwendung ist ein zusätzlicher Arbeitsschritt und wird nach zwei Wochen gelassen. Wir hängen die Modelle deshalb über Schnittstellen an die Systeme, in denen der Vorgang ohnehin bearbeitet wird, und halten im Betrieb fest, welcher Modellstand wann produktiv war. Ohne dieses Protokoll lässt sich später nicht mehr rekonstruieren, welches Modell eine bestimmte Antwort gegeben hat.
Modellstand, Konfiguration und Anweisungstexte gehören Ihnen und gehen bei einem Wechsel mit. Die rechtliche Bewertung nehmen eigene Karten Ihnen dagegen nicht ab: Die Pflicht zurKI-Kompetenz nach Artikel 4 des EU AI Act gilt für die Menschen, die mit dem System arbeiten, und lässt sich an keine Hardware delegieren. Wo das System selbst handelt und wo ein Mensch übernimmt, legen wir vorher schriftlich fest, sieheVerantwortung.
Vorhaben durchsprechen
Bringen Sie eine Aufgabe mit, die heute von Hand läuft. Wir prüfen mit Ihnen, ob ein offenes Modell sie übernehmen kann und was dagegen spricht — auch dann, wenn die Antwort gegen einen eigenen Betrieb ausfällt.
L&I IT-solutions · Werderstr. 4 · 69469 Weinheim