Web-Crawler

Öffentliche oder interne Websites direkt in meinGPT crawlen und durchsuchbar machen

In meinGPT einrichten

Öffne Einstellungen → Datenquellen, klicke auf Datenquelle hinzufügen und wähle Web-Crawler. Trage die Start-URL ein und klicke Verbinden — alle weiteren Felder sind optional und haben sinnvolle Standardwerte.

Der Web-Crawler läuft als Cloud-Datenquelle; ein eigener Outpost wird dafür nicht benötigt und wird von diesem Source-Typ aktuell nicht unterstützt.

Grundeinstellungen

FeldStandardBeschreibung
Start-URLDie URL, bei der der Crawler beginnt
Scraping-MethodeBasic (HTTP)Basic nutzt HTTP-Anfragen, Browser aktiviert JavaScript-Rendering — nötig für Seiten, die Inhalte per JS nachladen
Maximale Tiefe3Wie viele Klicks tief der Crawler ausgehend von der Start-URL folgt
Maximale Seiten1000Obergrenze für die Zahl gecrawlter Seiten

Login (optional)

Für passwortgeschützte Intranets: Der Crawler meldet sich einmal an und bleibt für den gesamten Crawl angemeldet.

FeldBeschreibung
Login-URLZiel-URL des Login-Formulars — muss HTTPS verwenden
Benutzername / PasswortZugangsdaten für das Login-Formular

Erweiterte Einstellungen

FeldStandardBeschreibung
Pfade einschließen / ausschließenURL-Pfad-Regex-Muster, eine pro Zeile
Auf Selektor wartenNur im Browser-Modus: CSS-Selektor, auf den vor der Extraktion gewartet wird
Seiten-Timeout30 sTimeout pro Seite
Anfrageverzögerung1,0 sWartezeit zwischen Anfragen
Gleichzeitige Anfragen5Parallel laufende Crawl-Anfragen
Wiederholungsversuche2Erneute Versuche bei Fehlern
AusgabeformatMarkdownMarkdown, HTML oder Text
Nur HauptinhaltAnExtrahiert nur den Hauptinhaltsbereich, ohne Navigation und Footer
Maximales Alter24 hSeiten, die älter als dieser Schwellenwert sind, werden erneut gecrawlt
Proxy-Server / -Benutzername / -PasswortFür Crawls über einen Proxy
User AgentEigener User-Agent-String

Synchronisierung

  • meinGPT crawlt ausgehend von der Start-URL und speichert extrahierten Inhalt pro gefundener Seite.
  • Jeder Datenbestand wird alle 15 Minuten vom Sync-Scheduler geprüft (siehe Sync-Intervall); eine Seite wird aber erst neu gecrawlt, wenn die eingestellte maximale Alterszeit (Standard 24 Stunden) seit dem letzten Crawl abgelaufen ist.
  • Nutze Pfad-Filter, um den Crawl-Umfang eng zu halten.
War diese Seite hilfreich?