Architektur

Übersicht über alle Komponenten einer Outpost-Bereitstellung

Komponenten

Eine Outpost-Bereitstellung besteht aus mehreren Komponenten, die zusammenarbeiten, um Daten zu erfassen, zu verarbeiten und zu speichern. Die folgende Übersicht zeigt die Hauptkomponenten und ihre Funktionen.

Übersicht der Outpost-Bereitstellungskomponenten

Outpost

Der Outpost ist das Herzstück einer Outpost-Bereitstellung. Seine Hauptaufgabe ist es, Daten aus verschiedenen Quellen zu lesen, zu verarbeiten und in der Vektordatenbank zu speichern sowie Suchanfragen von meinGPT zu beantworten. Zu diesem Zweck werden die Daten mithilfe eines speziellen KI-Modells, dem Embedding-Modell, in Vektoren umgewandelt, die in der Vektordatenbank gespeichert werden. Dies ermöglicht eine effiziente Suche nach semantisch ähnlichen Textpassagen über Tausende von Dokumenten hinweg.

Der Outpost wird als Desktop-Anwendung für Windows, macOS (Apple Silicon) und Linux ausgeliefert — als Download, den ihr in meinGPT herunterladet. Server, Vektordatenbank und Embedding-Modell sind darin enthalten; es ist nichts zusätzlich zu installieren.

Achtung

Frühere Versionen wurden als Container-Verbund ausgeliefert. Diesen Weg veröffentlichen wir nicht mehr — ein neuer Outpost lässt sich so nicht mehr aufsetzen. Betreibt ihr noch eine solche Installation, beschreibt Umstieg, was dabei passiert; meldet Euch unter enterprise@meingpt.com, wir machen ihn gemeinsam mit Euch.

Vektordatenbank

Die Vektordatenbank speichert die vom Embedding-Modell erstellten Vektoren zusammen mit den zugehörigen Textabschnitten und beantwortet die Ähnlichkeitssuche.

Welche Datenbank dabei läuft, hängt von der Bereitstellungsart ab:

  • Outpost-Anwendung für Windows, macOS und Linux: SQLite für die Metadaten, LanceDB für die Vektoren. Beides läuft im Outpost-Prozess selbst und liegt als Dateien auf der Platte. Es ist im Installer enthalten — es wird kein separater Datenbankdienst installiert oder betrieben.
  • Server-Bereitstellungen — die Vorgängergeneration und die von uns betriebene Cloud: PostgreSQL mit der Erweiterung VectorChord. Metadaten und Vektoren liegen dort in derselben Datenbank.

In beiden Fällen kombiniert eine Suchanfrage die Vektorsuche mit einer Stichwortsuche (BM25), und jede Anfrage ist auf genau einen Data Pool eingegrenzt.

Embedding-Modell

Das Embedding-Modell ist ein KI-Modell, das Text in mathematische Vektoren (Embeddings) umwandelt. Diese Vektoren repräsentieren die Bedeutung des Textes in einem hochdimensionalen Raum, sodass semantisch ähnliche Texte auch ähnliche Vektoren erzeugen.

Die Qualität des Embedding-Modells hat direkten Einfluss auf die Qualität der Suchergebnisse:

  • Je besser das Modell, desto besser versteht es die Bedeutung der Texte
  • Je mehr Dimensionen die Vektoren haben, desto genauer können Bedeutungsnuancen dargestellt werden
  • Je größer das Modell, desto mehr Rechenleistung wird benötigt

Der Outpost verwendet dafür genau ein Embedding-Modell: das mehrsprachige E5 (intfloat/multilingual-e5-small). Es läuft lokal im Outpost-Prozess, ohne Internetverbindung. Es gibt keine Einstellung, ein anderes Modell oder einen externen Anbieter zu wählen.

War diese Seite hilfreich?