Unterstützte Dateiformate, E-Mails und Anhänge, Zugriffskontrolle für Datenpools
Welche Dateiformate ein Datenpool durchsuchbar macht und wer auf einen Datenpool zugreifen darf. Setup und Konfiguration einer Datenquelle: Datenquellen & RAG.
Tabellen: XLSX und XLS (mit Einschränkungen, siehe unten) sowie CSV
PDF
E-Mail-Dateien: EML und MSG (siehe „E-Mails und Anhänge“ unten)
TXT, Markdown, RTF, EPUB, HTML
Was beim Sync übersprungen wird
Nicht gelistete Dateiendungen. Nur die oben genannten Formate werden inhaltlich durchsuchbar gemacht. Dateien mit anderen Endungen (zum Beispiel .json) nimmt der Sync nicht in den Datenpool auf - sie erscheinen weder in der Dateiliste noch als Fehlermeldung in den Synchronisierungsprotokollen noch im Zähler der übersprungenen Dateien. Fehlt eine erwartete Datei, prüfe zuerst ihre Endung gegen die Liste oben.
Bilddateien. PNG, JPG und andere Bildformate stehen nicht auf der Liste und werden standardmäßig übersprungen. Bilder innerhalb von Dokumenten werden dagegen gelesen - wie das funktioniert, wie Du Bilder dafür ablegst und wie ein Bild im Chat sichtbar wird, steht unter Bilder aus einem Datenpool.
Verschlüsselte oder rechtegeschützte PDFs. Ist eine PDF-Datei mit einem Passwort verschlüsselt oder hat ein Rechteschutz-Profil (DRM), kann MeinGPT ihren Inhalt nicht auslesen und nicht durchsuchbar machen. Entferne den Passwortschutz bzw. exportiere das Dokument ohne DRM-Beschränkung, bevor Du es in den Datenpool aufnimmst.
Excel-Tabellen sind ein Sonderfall. Beim Aufteilen in durchsuchbare Abschnitte (sogenanntes Chunking) geht der Tabellenkontext verloren - eine einzelne Datenzeile ohne ihre Spaltenheader ergibt oft keinen Sinn mehr. Für Berechnungen, Auswertungen und Visualisierungen aus Excel-Dateien nutze stattdessen die Code-Sandbox, die die Originaldatei direkt verarbeitet.
OneNote-Workaround. OneNote-Dateien werden derzeit nicht direkt indexiert, weil das Format proprietär ist. Workaround: OneNote-Inhalte regelmäßig automatisiert exportieren, etwa via Make oder n8n, als PDF oder Text. Die exportierten Dateien lassen sich dann ganz normal als Quelle anbinden.
Achtung
OneNote-Notizbücher erscheinen nicht im Sync-Status - auch nicht als „übersprungen“. Wie alle nicht gelisteten Dateitypen tauchen OneNote-Notizbücher und -Abschnitte weder in der Dateiliste noch in den Fehlermeldungen der Synchronisierungsprotokolle noch in der Anzahl der übersprungenen Dateien auf (siehe Indexierungsfortschritt). Enthält die verbundene SharePoint-Quelle noch andere unterstützte Dateien, werden diese normal indexiert - der Sync-Status zeigt dann z. B. „1 indiziert - Keine Fehler“, obwohl das OneNote-Notizbuch selbst nicht im Index gelandet ist. Ein fehlerfreier Sync-Status ist deshalb kein Nachweis dafür, dass OneNote-Inhalte durchsuchbar sind. Prüfe stattdessen die Dateiliste der Datenquelle gezielt auf die erwarteten Dateien, oder nutze den oben beschriebenen Export-Workaround.
E-Mail-Dateien in den Formaten EML (offener Standard) und MSG (Outlook) kannst Du direkt in einen Datenpool legen. Betreff, Absender, Empfänger und der Nachrichtentext werden ausgelesen und durchsuchbar gemacht. Beide Formate werden gleichwertig unterstützt - eine vorherige Umwandlung von MSG nach EML ist nicht nötig.
Achtung
Anhänge in E-Mail-Dateien sind ein Sonderfall. Bei kleineren E-Mails wird der Inhalt von Anhängen (z. B. ein PDF) mitgelesen und indexiert. Bei größeren E-Mails werden Anhänge aus Performance-Gründen auf ihren Dateinamen reduziert - ihr Inhalt ist dann nicht durchsuchbar. Wenn ein PDF-Anhang genauso zuverlässig indexiert werden soll wie ein PDF, das direkt im Datenpool liegt, lege den Anhang zusätzlich als eigene Datei in den Datenpool.
Ein neu angelegter Datenpool ist zunächst privat für die Ersteller:in - niemand sonst hat automatisch Zugriff, auch nicht über einen verknüpften Assistenten. Um andere Zugriff zu geben, teilst Du den Datenpool gezielt: mit einzelnen Nutzer:innen, einem Team, oder workspace-weit für alle - aktuell jeweils als Lesezugriff ("Kann ansehen"). Zusätzlich lässt sich der Zugriff auf bestimmte Teams einschränken: Du legst Teams in der Admin-Oberfläche an und ordnest sie spezifischen Datenquellen zu. So steuerst Du, welche Nutzergruppen welche Daten sehen.
Details zum Anlegen und Verwalten von Teams: Team-Management.
Achtung
Assistenten-Freigabe hebt eine Zugriffsbeschränkung des Datenpools nicht auf. Ist ein Datenpool nicht für alle freigegeben - etwa nur für bestimmte Nutzer:innen, ein Team oder Admins -, gilt diese Einschränkung unabhängig davon, mit wem der zugehörige Assistent geteilt wurde. Ein:e Nutzer:in, die/der den Assistenten öffnen darf, aber keinen eigenen Zugriff auf den Datenpool hat, erhält bei Fragen zu diesem Datenpool keine Treffer - der Assistent meldet dann z. B. "keine passenden Dokumente gefunden", obwohl derselbe Datenpool für die Ersteller:in oder berechtigte Nutzer:innen normal funktioniert. Prüfe in diesem Fall die Freigabe des Datenpools unter Einstellungen → Datenquellen, nicht nur die Freigabe des Assistenten.
Wer diese Freigabe prüfen kann, hängt von der eigenen Rolle ab:
Hinweis
"Einstellungen → Datenquellen" ist ein Admin-Bereich. Nur Workspace-Admins sehen diesen Menüpunkt (unter „Wissen & Integrationen" in den Einstellungen) - er taucht nicht in den persönlichen Profileinstellungen eines Mitglieds auf, selbst wenn diese Person den betroffenen Assistenten selbst erstellt hat. Bist Du kein Admin, kannst Du die Freigabe eines Datenpools nicht selbst einsehen oder ändern - bitte in diesem Fall eine:n Admin, die Freigabe des betroffenen Datenpools zu prüfen.