Öffne Einstellungen → Datenquellen, klicke auf Datenquelle hinzufügen und wähle Web-Crawler. Trage die Start-URL ein und klicke Verbinden — alle weiteren Felder sind optional und haben sinnvolle Standardwerte.
Der Web-Crawler läuft als Cloud-Datenquelle; ein eigener Outpost wird dafür nicht benötigt und wird von diesem Source-Typ aktuell nicht unterstützt.
| Feld | Standard | Beschreibung |
|---|
| Start-URL | — | Die URL, bei der der Crawler beginnt |
| Scraping-Methode | Basic (HTTP) | Basic nutzt HTTP-Anfragen, Browser aktiviert JavaScript-Rendering — nötig für Seiten, die Inhalte per JS nachladen |
| Maximale Tiefe | 3 | Wie viele Klicks tief der Crawler ausgehend von der Start-URL folgt |
| Maximale Seiten | 1000 | Obergrenze für die Zahl gecrawlter Seiten |
Für passwortgeschützte Intranets: Der Crawler meldet sich einmal an und bleibt für den gesamten Crawl angemeldet.
| Feld | Beschreibung |
|---|
| Login-URL | Ziel-URL des Login-Formulars — muss HTTPS verwenden |
| Benutzername / Passwort | Zugangsdaten für das Login-Formular |
| Feld | Standard | Beschreibung |
|---|
| Pfade einschließen / ausschließen | — | URL-Pfad-Regex-Muster, eine pro Zeile |
| Auf Selektor warten | — | Nur im Browser-Modus: CSS-Selektor, auf den vor der Extraktion gewartet wird |
| Seiten-Timeout | 30 s | Timeout pro Seite |
| Anfrageverzögerung | 1,0 s | Wartezeit zwischen Anfragen |
| Gleichzeitige Anfragen | 5 | Parallel laufende Crawl-Anfragen |
| Wiederholungsversuche | 2 | Erneute Versuche bei Fehlern |
| Ausgabeformat | Markdown | Markdown, HTML oder Text |
| Nur Hauptinhalt | An | Extrahiert nur den Hauptinhaltsbereich, ohne Navigation und Footer |
| Maximales Alter | 24 h | Seiten, die älter als dieser Schwellenwert sind, werden erneut gecrawlt |
| Proxy-Server / -Benutzername / -Passwort | — | Für Crawls über einen Proxy |
| User Agent | — | Eigener User-Agent-String |
- meinGPT crawlt ausgehend von der Start-URL und speichert extrahierten Inhalt pro gefundener Seite.
- Jeder Datenbestand wird alle 15 Minuten vom Sync-Scheduler geprüft (siehe Sync-Intervall); eine Seite wird aber erst neu gecrawlt, wenn die eingestellte maximale Alterszeit (Standard 24 Stunden) seit dem letzten Crawl abgelaufen ist.
- Nutze Pfad-Filter, um den Crawl-Umfang eng zu halten.