Suche & Antworten

Wie die Suche in Datenpools funktioniert, Freigabestufen, Quellenangaben und das 3-Stufen-Modell

Wie MeinGPT einen Datenpool durchsucht, was in einer Antwort landet und wie tief die KI bei Bedarf in eine einzelne Datei geht. Setup und Konfiguration einer Datenquelle: Datenquellen & RAG.

Wie die Suche funktioniert

Kunden-Wissensbestände sind oft groß. Hunderte oder tausende Gigabyte an Word-, PDF- und anderen Dateien sind keine Seltenheit. Jede Suchanfrage durch alle Dateien zu schicken wäre viel zu langsam. Deshalb wird vorab ein Suchindex aufgebaut. Funktioniert ähnlich wie Google, nur eben für Deine internen Dokumente.

Die initiale Indexierung kann je nach Datenmenge Stunden bis Tage dauern. Word-, PDF- und ähnliche Formate sind binär aufgebaut, der Text muss erst extrahiert werden. Dieser einmalige Aufwand zahlt sich danach in schnellen Suchergebnissen aus.

Du musst darauf aber nicht warten. Der Index wird in zwei Stufen aufgebaut: zuerst die Stichwortsuche, danach die Bedeutungssuche. Eine Datei ist deshalb schon durchsuchbar, sobald ihre Stichwortsuche steht — die Bedeutungssuche kommt im Hintergrund nach, Datei für Datei. Wie weit beide sind, siehst Du unter Indexierungsfortschritt.

Eigenschaften der Suche:

  • Stichwortsuche: Findet genau die Begriffe, die Du eingibst — Aktenzeichen, Artikelnummern, Eigennamen. Sie wird zuerst aufgebaut und steht immer zur Verfügung.
  • Semantisch: Dokumente werden in mathematische Repräsentationen umgewandelt (sogenannte Embeddings), die den inhaltlichen Sinn erfassen, nicht nur einzelne Wörter. Pro Datenquelle abschaltbar.
  • Sortierung nach Relevanz: Treffer werden nach inhaltlicher Passung sortiert, nicht nach Häufigkeit eines Suchbegriffs. Ein Dokument, das thematisch zur Frage passt, kann höher ranken als eines mit dem exakten Schlüsselwort.
  • Anzahl der Treffer: Standardmäßig werden die zehn relevantesten Quellen zurückgegeben. Die Anzahl ist in den Einstellungen konfigurierbar.
  • Dateinamen-Suche: Neben dem Inhalt kann auch gezielt nach Dateinamen gesucht werden, etwa "Zeig mir Datei XY".

Achtung

Kein Filtern nach eigenen Metadatenfeldern. Datenquellen durchsuchen Dateiinhalte (semantisch) und Dateinamen. Zusätzlich lässt sich nach eingebauten Dateieigenschaften filtern: Pfad, Dateiendung, MIME-Typ, Erstellungs-/Änderungsdatum. Eigene Metadatenfelder aus Quellsystemen werden nicht als eigene, filterbare Felder übernommen — sie stehen der KI höchstens als Text im Dokumentinhalt zur Verfügung und sind damit nur über die semantische Suche auffindbar, nicht zuverlässig filterbar.

Sucheinstellungen pro Datenquelle

Jede Datenquelle hat vier Einstellungen, die bestimmen, wie in ihr gesucht wird (Datenquelle öffnen → Tab Übersicht):

  • Bedeutungssuche — findet zusätzlich, was sinngemäß passt, aber anders formuliert ist. Standardmäßig an. Aus lohnt sich, wenn Du ohnehin nach exakten Begriffen suchst und der Bestand groß ist: die Indexierung ist dann deutlich schneller fertig und günstiger.
  • Textstellen pro Antwort — wie viele Fundstellen höchstens in eine Antwort einfließen (Standard 10, möglich sind 1 bis 100).
  • Tiefensuche (experimentell) — übergibt den Abruf an einen eigenen Such-Agenten, der mehrere Suchanfragen stellt und sie je nach Bedarf verfeinert oder verbreitert, statt eine einzelne direkte Suche auszuführen. Nur für Cloud-Datenquellen, und zusätzlich zur Freischaltung für Deine Organisation.
  • Trefferreihenfolge verbessernhat derzeit keine Wirkung. Der Schalter speichert einen Wert, der in keinem Suchpfad ausgewertet wird. Lass ihn aus.

Diese Einstellungen gelten pro Datenquelle, nicht pro Assistent — sie wirken unabhängig davon, ob die Datenquelle direkt in einem Chat oder über einen Assistenten genutzt wird.

Wann Du welchen Wert setzt, mit Empfehlungen je Dokumententyp: Sucheinstellungen am Datenpool.

Hinweis

Die Bedeutungssuche später auszuschalten löscht nichts. Es stoppt nur, dass neue Dateien eingebettet werden — was bereits eingebettet ist, bleibt durchsuchbar. Wieder einschalten baut die Bedeutungssuche ab dem nächsten Sync-Lauf nach und nach auf.

Indexierungsfortschritt

Oben auf der Detailseite einer Datenquelle steht Indexierung mit einem Balken je Stufe:

  • Stichwortsuche — wie viele Dateien bereits durchsuchbar sind. Sobald hier die ersten Dateien stehen, ist die Datenquelle nutzbar.
  • Bedeutungssuche — wie weit die Embeddings nachgezogen sind. Ist die Bedeutungssuche für diese Quelle aus, steht das hier statt eines Balkens.

Darunter siehst Du, wie viele Dateien nicht im Index gelandet sind: fehlgeschlagene und übersprungene, jeweils mit dem Grund — etwa „kein Text enthalten", „passwortgeschützt" oder „zu groß für die Grenzwerte". Dateien, deren Endung nicht auf der Liste der Dateiformate steht, zählen hier nicht mit: Der Sync nimmt sie gar nicht erst auf.

Bei einer Cloud-Datenquelle zeigt der Bereich zusätzlich vier Kennzahlen: Datei-Upload (Anzahl der ins CloudVault übernommenen Dateien), Durchsuchbar (Anzahl der aktuell durchsuchbaren Dateien), Chunks (Anzahl der indexierten Textabschnitte) und Letzte Synchronisierung (Zeitpunkt und Status des letzten Sync-Laufs). Diese vier Zahlen stammen aus zwei Statusabfragen an den CloudVault, nicht aus vier unabhängigen: Datei-Upload und Chunks stammen aus der einen Abfrage, Durchsuchbar und Letzte Synchronisierung aus der anderen. Schlägt eine Abfrage fehl, zeigen beide dazugehörigen Zahlen gemeinsam „Unbekannt". Stehen alle vier gleichzeitig auf „Unbekannt", hat meist dieselbe Ursache wie die Meldung „Indexierungsstand nicht abrufbar" weiter unten den ganzen Bereich betroffen. Kann die Plattform den Fortschritt gerade nicht abfragen, zeigt der Bereich stattdessen die Meldung „Indexierungsstand nicht abrufbar" — bei einer Cloud-Datenquelle (CloudVault), weil der CloudVault diese Statusabfrage nicht beantwortet hat, bei einer Outpost-Datenquelle, weil der Outpost offline oder nicht erreichbar ist.

Direkt nach dem Anlegen ist das normal

Diese Meldung kann erscheinen, bevor Du überhaupt eine erste Datei hochgeladen oder synchronisiert hast. Sie sagt nur, dass diese eine Statusabfrage fehlgeschlagen ist — nicht, dass etwas blockiert ist. Hochladen, Verbinden und eine bereits laufende Indexierung sind davon unabhängig und funktionieren weiter. Verschwindet die Meldung nicht nach wenigen Minuten von selbst, wende Dich an den MeinGPT-Support.

Quellenangaben in Antworten

Antworten aus einer Datenquelle enthalten nummerierte Quellenangaben als anklickbare Badges neben dem Text. Ein Klick öffnet eine Vorschau mit Titel, Fundstelle und Ausschnitt des jeweiligen Ursprungsdokuments - je nach Freigabestufe der Datenquelle zusätzlich mit einer Option, die Originaldatei zu öffnen oder herunterzuladen.

Achtung

Quellenangabe erscheint nicht anklickbar? Das ist kein bekanntes, gewolltes Verhalten. Wende Dich mit einem Link zum betroffenen Chat an support@meingpt.com, damit wir das gezielt prüfen können.

Freigabestufe: was aus einer Quelle herausgeht

Wie viel hinter einer Quellenangabe verfügbar ist, entscheidet eine Einstellung an der Datenquelle — nicht am Assistenten. Du findest sie unter Einstellungen → Datenquellen: Quelle anklicken, Tab Admin, Einstellung „Was Mitarbeiter aus dieser Quelle bekommen".

StufeWas aus der Quelle herausgeht
Nur TextausschnitteDie passenden Fundstellen und der Dateiname
Nur TextZusätzlich der vollständige Text der gefundenen Dokumente
OriginaldateienZusätzlich die Datei selbst

Erst Originaldateien schaltet Öffnen und Herunterladen der Originaldatei an der Quellenangabe frei — und erlaubt dem Assistenten, eine Originaldatei bei Bedarf in den Chat oder die Code-Sandbox zu laden.

Eine Cloud-Datenquelle übernimmt standardmäßig die Stufe des Cloud Vaults; die Auswahl zeigt, welche das gerade ist (derzeit Originaldateien). Eine eigene Stufe je Quelle brauchst Du nur, wenn eine Quelle weniger herausgeben soll als die übrigen. Bei einer Outpost-Datenquelle wird die Stufe ausschließlich in der Outpost-App festgelegt, dort ist Nur Text voreingestellt; die Plattform zeigt den gemeldeten Wert nur an.

Hinweis

Die Quellenangabe öffnet die in MeinGPT gespeicherte Kopie, keinen Deep-Link ins Quellsystem. Ein direkter Sprung in das Dokument in SharePoint oder Google Drive ist nicht Teil einer Quellenangabe aus einem Datenpool.

Wissenslandkarte

Jede Cloud-Datenquelle hat einen eigenen Tab Wissenslandkarte (Datenquelle öffnen → Wissenslandkarte). Er zeigt, wie die Dokumente in diesem Pool tatsächlich genutzt werden - nicht manuell kuratiert, sondern berechnet aus den letzten 30 Tagen echter Suchen:

  • Ordner-Aktivität: Die Ordner, in die der Assistent am häufigsten zurückkehrt.
  • Wissenslandkarte-Graph: Ein Netzwerk der am häufigsten gemeinsam abgerufenen Dokumente. Ein Klick auf ein Dokument zeigt seine Abrufzahl und verbundene Dokumente.

Hinweis

Der Tab braucht vorherige Suchaktivität. Solange in diesem Pool noch nicht gesucht wurde, zeigt der Tab einen Hinweis, dass Wissen indexiert wird - das ist kein Fehler. Der erste Snapshot erscheint meist innerhalb weniger Minuten, nachdem eine Suche in diesem Pool stattgefunden hat.

Wie MeinGPT mit Dateien arbeitet (3-Stufen-Modell)

Nicht jede Anfrage erfordert die gleiche Verarbeitungstiefe. MeinGPT entscheidet pro Anfrage automatisch, wie tief es gehen muss. Es gibt drei Stufen:

StufeWas passiertReicht für
1. SucheDie Plattform durchsucht alle konfigurierten Quellen und liefert Snippets sowie Dateinamen zurückEinfache Fragen wie "Gibt es ein Dokument zu Thema X?"
2. Volltext ladenDas Modell lädt den kompletten Inhalt einzelner Dateien, die nach Stufe 1 relevant erscheinenInhaltliche Fragen zu einzelnen, nicht zu großen Dokumenten
3. Code SandboxDie Originaldatei wird in einem abgeschotteten Bereich (Sandbox) geöffnet und mit Python verarbeitetBerechnungen, Auswertungen, Diagramme aus großen oder strukturierten Dateien (z. B. Excel mit vielen Zeilen)

Du brauchst nichts manuell zu konfigurieren. Mehr Details zur Sandbox: Code Sandbox.

Achtung

Volltext kann viel Kontext verbrauchen. Stufe 2 lädt den kompletten Inhalt einer Datei oder Confluence-Seite auf einmal in den Chat – nicht nur den relevanten Ausschnitt. Sind mehrere große Quellen an denselben Assistenten oder Chat angebunden (z. B. eine Datenquelle und ein Confluence Space), kann bereits eine einzelne Anfrage einen erheblichen Teil des Kontextfensters des Modells verbrauchen. Behalte dazu die Kontextfenster-Anzeige im Eingabefeld im Blick und bevorzuge bei sehr großen oder stark verschachtelten Seiten (z. B. Confluence-Seiten mit vielen eingebetteten Makros) gezielte, eng gefasste Fragen. Mehr dazu: Chat zu groß für das Modell.

Für On-Premise-Datenquellen gilt bei Stufe 3 eine zusätzliche Einschränkung:

Hinweis

Hinweis für On-Premise-Setups: Stufe 3 (Sandbox) lädt Originaldateien temporär in die MeinGPT Cloud, weil die Sandbox-Umgebungen dort laufen — aber nur, wenn der Outpost-Ordner auf Text und Originaldateien (ORIGINAL_FILES) steht. Bei Nur Text (FULL_TEXT) oder der älteren Stufe PASSAGES wird die Sandbox-Anfrage abgelehnt, bevor eine Originaldatei hochgeladen wird. Erlaubte Dateien werden nach der Verarbeitung sofort gelöscht. Bei datenschutzsensiblen Setups solltest Du das Deinen Stakeholdern transparent kommunizieren.

Freigabestufe: Was Mitarbeiter aus einer Quelle bekommen

Unabhängig davon, wer eine Datenquelle überhaupt nutzen darf (Zugriffskontrolle), legt die Freigabestufe fest, welche Form der Inhalte diese Quelle preisgibt - für Cloud- wie für Outpost-Datenquellen. Öffne dazu die Datenquelle unter Einstellungen → DatenquellenWas Mitarbeiter aus dieser Quelle bekommen:

  • Nur Text - aus dieser Quelle verlässt ausschließlich Text: der Inhalt der relevanten Dokumente, nicht die Dateien selbst. Quellenangaben in Chat-Antworten zeigen weiterhin Titel, Fundstelle und Ausschnitt - eine Option, die Originaldatei zu öffnen oder herunterzuladen, erscheint dabei nicht.
  • Originaldateien - zusätzlich zum Text auch die Datei selbst. Nutzer:innen können sie aus einer Quellenangabe heraus öffnen oder herunterladen.

Eine Cloud-Datenquelle übernimmt standardmäßig die Stufe des zugehörigen Cloud Vaults; pro Datenquelle lässt sich das überschreiben. Bei einer Outpost-Datenquelle ist dieses Feld schreibgeschützt - die Stufe wird ausschließlich in der Outpost-App am Ordner selbst festgelegt (Outpost).

Achtung

Die Freigabestufe wirkt für alle Nutzer:innen dieser Quelle gleich. Es gibt aktuell keine Möglichkeit, sie nach Rolle oder Nutzergruppe zu differenzieren - etwa Originaldateien für eine Gruppe freizugeben und für eine andere nur den Text. Wer Zugriff auf die Datenquelle hat, bekommt dieselbe Freigabestufe wie alle anderen mit Zugriff.

Weiterführend

War diese Seite hilfreich?