---
title: "Daten vorbereiten"
description: "Ordner, Dateinamen, Formate und Inhalte so ablegen, dass die Suche in Datenquellen zuverlässig die richtigen Stellen findet"
canonical_url: "https://meingpt.com/docs/integrations/data-pools-rag/prepare-data"
language: de
---

# Daten vorbereiten

Wie gut MeinGPT in einer Datenquelle die richtigen Informationen findet, hängt stark davon ab, wie die Dateien abgelegt, benannt und aufgebaut sind. Diese Seite beschreibt, was Du dafür vor dem Anbinden oder beim Aufräumen tun kannst. Wie Du eine Datenquelle einrichtest, steht unter [Datenquellen & RAG](/docs/integrations/data-pools-rag), welche Bereiche Du für einen Pilot auswählst im [Guide: Datenqualität](/docs/integrations/guide-data-quality).

Die Hinweise gelten für Cloud-Datenquellen. Ein Outpost liest teils andere Formate und hat eigene Grenzen, siehe [Ordner auf diesem Rechner](/docs/integrations/vault/sources/local#was-gelesen-wird-und-was-nicht).

**Das Wichtigste in Kürze**

- Lege nur die aktuell gültige Fassung ab, und jede Datei nur einmal.
- Benenne Dateien so, dass der Name schon sagt, worum es geht.
- Versieh gescannte PDFs vorab mit einer Textebene.
- Wandle `.doc` und `.ppt` in `.docx` und `.pptx` um.
- Gliedere wichtige Dokumente mit echten Überschriften.

## Was die Suche sieht

Dokumente werden in kurze Textabschnitte zerlegt. Bei einer Frage sucht MeinGPT die passenden Abschnitte, nach Stichwörtern und nach Bedeutung ([Suche & Antworten](/docs/integrations/data-pools-rag/search#wie-die-suche-funktioniert)). Daraus folgt für die Vorbereitung:

- **Der Dateiname gehört zum durchsuchbaren Text.** Ein Name wie `Scan_0034.pdf` trägt nichts zur Suche bei.
- **Der Ordnerpfad ist sichtbar.** Er zeigt bei jeder Quelle, woher sie stammt, und die KI kann die Suche auf einzelne Ordner eingrenzen.
- **Durchsucht wird Text.** Scans ohne Texterkennung findet die Suche schlecht oder gar nicht, Bilder in Dokumenten nur über ihre Beschreibung ([Bilder aus einem Datenpool](/docs/integrations/data-pool-images)).
- **Eigene Metadaten wertet die Suche nicht aus**, etwa SharePoint-Spalten oder Tags. Das Änderungsdatum der Datei dagegen schon.

## Ablage und Benennung

### Ordnerstruktur

- Benenne Ordner nach fachlichen Themen wie Kunde, Produkt oder Prozess, nicht nach Personen.
- Halte die Struktur flach, höchstens drei bis vier Ebenen. Beispiel: `Vertrieb / Produktdatenblätter / Pumpen`.

### Dateinamen

- Lege einen Aufbau fest, zum Beispiel `Dokumenttyp_Thema_Jahr`: `Reisekostenrichtlinie_Inland_2025.pdf`, `Datenblatt_Pumpe-KX200.pdf`.
- Verwende die Begriffe, nach denen Mitarbeitende tatsächlich fragen. Interne Kürzel darfst Du zusätzlich nutzen, nicht stattdessen.
- Trenne Wörter mit `_` oder `-`.

### Versionen und Altbestände

Liegen alte und aktuelle Fassungen nebeneinander, kann MeinGPT eine veraltete Fassung zitieren. Deshalb:

- Lege am besten nur die aktuell gültige Fassung in die Datenquelle.
- Brauchst Du ältere Fassungen, kommen sie in einen Unterordner namens `Archiv` oder `Alt`. Auch `Archive`, `Old`, `Veraltet` und `Historie` erkennt MeinGPT. Inhalte dort werden in der Suche leicht nachrangig behandelt, bleiben aber auffindbar, wenn nichts anderes die Frage beantwortet.
- Liegen mehrere Fassungen im selben Ordner, kennzeichne sie eindeutig mit Jahr oder Versionsnummer im Namen, zum Beispiel `Preisliste_2024.pdf` und `Preisliste_2025.pdf` oder `Handbuch_v3.pdf`. MeinGPT erkennt sie dann als zusammengehörig und bevorzugt die neueste, solange die Frage keine bestimmte Fassung nennt.
- Vermeide Zusätze wie „final“, „neu“ oder „korrigiert“. Daran erkennt MeinGPT keine Reihenfolge.

Einzelne Dateien lassen sich auch von Hand als **Maßgeblich** oder **Veraltet** markieren, siehe [Dateien als maßgeblich oder veraltet markieren](/docs/integrations/knowledge-insights-glossary#dateien-als-maßgeblich-oder-veraltet-markieren).

### Keine Dubletten

Doppelte Dateien werden doppelt verarbeitet und verdrängen in den Ergebnissen andere Treffer. Lege jede Datei nur an einem Ort ab. Auf einem alten Laufwerk findet Deine IT Dubletten mit einem Werkzeug, das Dateien nach Inhalt vergleicht, etwa dem kostenlosen „dupeGuru“. Dasselbe gilt für Ordner, die in mehreren Datenquellen angebunden sind, siehe [Daten gezielt eingrenzen](/docs/integrations/data-pools-rag#daten-gezielt-eingrenzen).

## Dateiformate aufbereiten

Welche Formate und Grenzen gelten, steht unter [Formate & Zugriff](/docs/integrations/data-pools-rag/formats-and-access). Hier geht es darum, was Du vorab tun kannst.

### Gescannte PDFs durchsuchbar machen (Texterkennung)

Ein Scan ist für die Suche zunächst nur ein Bild. MeinGPT erkennt Text in Scans zwar automatisch, aber nur bis 50 Seiten pro Datei. Eine Texterkennung vorab liefert verlässlichere Ergebnisse.

**Prüfen, ob ein PDF Text enthält:** Öffne das PDF und suche mit Strg+F nach einem sichtbaren Wort. Wird es nicht gefunden oder lässt sich kein Text markieren, ist es ein reiner Scan.

So versiehst Du Scans mit einer Textebene:

- **Einzelne, kurze Dokumente:** Lade den Scan im Chat hoch und lass ihn von MeinGPT abschreiben (Prompt 1 unten). Prüfe das Ergebnis, füge es in Word ein und speichere es als `.docx`.
- **Adobe Acrobat (Pro):** Werkzeug „Scan & OCR“ → „Text erkennen“ → „In dieser Datei“, danach speichern. Für mehrere Dateien gibt es dort die Stapelverarbeitung.
- **Viele Dateien:** Deine IT kann das kostenlose Werkzeug „OCRmyPDF“ nutzen. Es versieht ganze Ordner automatisch mit einer Textebene.
- **Scans mit mehr als 50 Seiten:** Versieh sie vor dem Ablegen per OCR-Programm mit einer Textebene. Nur aufteilen in Abschnitte mit höchstens 50 Seiten reicht bei manchen Scans nicht (zum Aufteilen von Textdateien siehe „Sehr große Dokumente aufteilen“).

### Alte Office-Formate umwandeln

Die Formate `.doc`, `.ppt` und `.json` sowie OneNote nimmt eine Cloud-Datenquelle nicht auf.

- **Einzelne Datei:** Öffne sie in Word bzw. PowerPoint und wähle Datei → Speichern unter → „Word-Dokument“ (`.docx`) bzw. „PowerPoint-Präsentation“ (`.pptx`).
- **Viele Dateien:** Deine IT kann sie mit dem kostenlosen LibreOffice gesammelt umwandeln, zum Beispiel mit `soffice --headless --convert-to docx *.doc`.
- **OneNote:** Exportiere Abschnitte als PDF oder Word-Datei (Datei → Exportieren). Für einen regelmäßigen automatischen Export siehe den [OneNote-Workaround](/docs/integrations/data-pools-rag/formats-and-access#grenzen-pro-datei).

### Passwortschutz entfernen

Verschlüsselte oder passwortgeschützte PDFs kann MeinGPT nicht lesen. In Adobe Acrobat: Datei → Eigenschaften → Sicherheit → „Keine Sicherheit“, danach speichern. Das setzt voraus, dass Du das Passwort kennst und zum Entfernen berechtigt bist.

### Sehr große Dokumente aufteilen

Bei sehr umfangreichen Dateien, grob ab mehreren hundert Seiten Fließtext, erfasst die Bedeutungssuche nur eine Auswahl über die ganze Datei, die Stichwortsuche nur den Anfang. Die Datei zeigt dann den Hinweis **Teilweise indexiert**.

Teile Sammeldokumente nach Kapiteln oder Themen in einzelne Dateien und benenne jede Datei sprechend (siehe „Dateinamen“). Das geht in Adobe Acrobat (Seiten verwalten → Teilen) oder mit dem kostenlosen PDF24 (Funktion „PDF teilen“).

### Excel-Tabellen aufbauen

Eine Tabelle wird nicht Zeile für Zeile durchsucht. Erfasst werden ihr Aufbau (Blattnamen, Titelzeilen, Spaltenüberschriften, Beispielzeilen) und die ersten Datenzeilen, jeweils mit ihren Spaltenüberschriften. Das funktioniert nur bei klar aufgebauten Tabellen und bis zu bestimmten Größen.

- Lege **eine Tabelle pro Blatt** an, mit den Spaltenüberschriften in der ersten Zeile.
- Benenne Spalten und Blätter sprechend („Liefertermin“ statt „LT“).
- Beachte die Grenzen: höchstens 2.000 Zeilen pro Blatt, 5.000 Zeilen pro Datei und 64 Spalten. Bei sehr breiten Tabellen oder langen Zellen werden es weniger.

Größere Tabellen eignen sich besser für die Auswertung im Chat (Datei hochladen und analysieren lassen) oder in der [Code-Sandbox](/docs/platform/code-sandbox) als für die Suche in einer Datenquelle.

### E-Mails mit Anhängen ablegen

Bei abgelegten E-Mails (`.msg`, `.eml`) werden Anhänge nicht zuverlässig mit erfasst. Lege wichtige Anhänge zusätzlich als eigene Datei ab. In Outlook: Anhang anklicken → „Speichern unter“ oder „Alle Anlagen speichern“. Mehr dazu unter [E-Mails und Anhänge](/docs/integrations/data-pools-rag/formats-and-access#e-mails-und-anhänge).

## Inhalte gut lesbar machen

Dieser Teil lohnt sich vor allem für Dokumente, die häufig gefragt werden, zum Beispiel Richtlinien, Handbücher oder Produktinformationen.

### Mit echten Überschriften gliedern

Dokumente werden an Überschriften in Abschnitte geteilt. Echte Überschriften führen zu sinnvoll abgegrenzten Abschnitten. Verwende in Word die Formatvorlagen „Überschrift 1“, „Überschrift 2“ usw. (Registerkarte Start → Formatvorlagen), nicht nur fett oder größer gesetzten Text.

### Absätze, die für sich verständlich sind

MeinGPT findet einzelne kurze Textabschnitte. Steht dort nur „Sie beträgt 0,30 €“, fehlt der Bezug.

- Nenne den Gegenstand im Satz: „Die Kilometerpauschale für Dienstreisen beträgt 0,30 €“ statt „Sie beträgt 0,30 €“.
- Schreibe Fachbegriffe aus oder erkläre sie einmal pro Abschnitt.
- Bestehende Dokumente kann MeinGPT entsprechend überarbeiten (Prompt 2 unten). Prüfe das Ergebnis inhaltlich.

### Inhalte aus Bildern und Diagrammen als Text ergänzen

Bilder in Word- und PowerPoint-Dateien werden zwar automatisch beschrieben, wichtige Aussagen sind als Text aber zuverlässiger auffindbar. Setze unter wichtige Grafiken eine kurze Bildunterschrift oder Beschreibung. MeinGPT kann sie erstellen (Prompt 3 unten). Wie Bilder im Index ankommen und wie Du sie ablegst: [Bilder aus einem Datenpool](/docs/integrations/data-pool-images#best-practices).

## Umzug auf ein neues Laufwerk

MeinGPT berücksichtigt das Änderungsdatum der Dateien, zum Beispiel im Zeitraum-Filter im Chat. Tragen nach einem Umzug alle Dateien dasselbe Datum, lassen sich alte und aktuelle Dokumente daran nicht mehr unterscheiden.

- Verwende für den Umzug nach SharePoint oder OneDrive die Migrationswerkzeuge von Microsoft (SharePoint Migration Tool bzw. Migration Manager im SharePoint Admin Center). Diese übernehmen die Dateidaten.
- Prüfe nach dem Umzug stichprobenartig die Spalte „Geändert“ in der SharePoint-Bibliothek.

## Prompts für MeinGPT

Mit diesen Prompts hilft Dir MeinGPT bei der Aufbereitung. Prüfe jedes Ergebnis, bevor Du es ablegst.

**Prompt 1: Scan abschreiben**

```text
Schreibe den Text dieses gescannten Dokuments vollständig und wortgetreu ab. Übernimm Überschriften, Aufzählungen und Tabellen in ihrer Struktur. Fasse nichts zusammen und ergänze nichts. Markiere unleserliche Stellen mit [unleserlich].
```

**Prompt 2: Abschnitte eigenständig verständlich machen**

```text
Überarbeite dieses Dokument so, dass jeder Absatz auch ohne den Rest des Dokuments verständlich ist. Ersetze Verweise wie „sie“, „dies“ oder „siehe oben“ durch den konkreten Begriff. Gliedere den Text mit klaren Überschriften. Ändere keine Inhalte, Zahlen oder Aussagen.
```

**Prompt 3: Bild oder Diagramm beschreiben**

```text
Beschreibe dieses Diagramm in 2–4 Sätzen als Bildunterschrift für ein Fachdokument. Nenne alle Werte, Beschriftungen und die zentrale Aussage, die man daraus ablesen kann.
```

## Weiterführend

### [Formate & Zugriff](/docs/integrations/data-pools-rag/formats-and-access)

Unterstützte Formate, Grenzen pro Datei, Zugriffskontrolle.

### [Sync-Status & Fehlerbehebung](/docs/integrations/data-pools-rag/troubleshooting)

Prüfen, welche Dateien nicht durchsuchbar sind und warum.

### [Sucheinstellungen](/docs/integrations/data-pool-search-settings)

Mit Ausprobieren prüfen, was eine Frage in der Quelle findet.
