branchway

Für KI-Anwendungen

Die meisten KI-Anwendungen bestehen zum größten Teil aus gewöhnlicher Software: ein Server, der Anfragen annimmt, Daten holt, ein Modell aufruft und das Ergebnis aufbereitet. Genau dieser Teil läuft hier.

Das Problem

Zwei Dinge werden regelmäßig verwechselt: das Modell zu betreiben und eine Anwendung zu betreiben, die ein Modell nutzt. Ersteres braucht Grafikkarten, letzteres nicht.

Dazu kommt der Datenschutz: In Eingaben an Sprachmodelle stehen oft personenbezogene Daten. Wer sie an einen Anbieter außerhalb der EU schickt, braucht dafür eine Grundlage – und sollte zumindest die eigene Protokollierung im Griff haben.

Was hier dafür da ist

  • Backend, API, Warteschlange und Oberfläche – der Teil deiner Anwendung, der dauerhaft läuft.
  • Vektordatenbank als PostgreSQL mit pgvector oder als eigene App aus einem Image.
  • Worker für lange Aufgaben: Ein Modellaufruf dauert Sekunden bis Minuten – das gehört nicht in die Webanfrage.
  • Nachvollziehbarkeit im eigenen Haus: Langfuse selbst betreiben, statt Prompts mit Kundendaten an einen weiteren Dienst zu geben.

Wo die Grenzen liegen

Es gibt keine GPUs. Eigene Modelle lassen sich hier nicht sinnvoll betreiben – weder trainieren noch mit vertretbarer Geschwindigkeit ausführen. Wer ein Modell selbst hosten muss, braucht einen Anbieter mit Grafikkarten. Für Anwendungen, die Modelle über eine Schnittstelle nutzen, spielt das keine Rolle.

Häufige Fragen

Kann ich ein kleines Modell auf der CPU laufen lassen?

Technisch ja, praktisch selten sinnvoll: Die Antwortzeiten sind für interaktive Anwendungen zu lang. Für Einbettungen kleiner Textmengen kann es reichen.

Wo speichere ich Einbettungen?

In PostgreSQL mit pgvector – für die allermeisten Anwendungen völlig ausreichend und eine Komponente weniger im Betrieb.

Weiterlesen