---
title: "Web-Crawler"
description: "Öffentliche oder interne Websites direkt in meinGPT crawlen und durchsuchbar machen"
canonical_url: "https://meingpt.com/docs/integrations/sources/webcrawler"
language: de
---

# Web-Crawler

## In meinGPT einrichten

Öffne **Einstellungen → Datenquellen**, klicke auf **Datenquelle hinzufügen** und wähle Web-Crawler. Trage die **Start-URL** ein und klicke **Verbinden** — alle weiteren Felder sind optional und haben sinnvolle Standardwerte.

Der Web-Crawler läuft als Cloud-Datenquelle; ein eigener Outpost wird dafür nicht benötigt und wird von diesem Source-Typ aktuell nicht unterstützt.

## Grundeinstellungen

| Feld | Standard | Beschreibung |
| --- | --- | --- |
| **Start-URL** | — | Die URL, bei der der Crawler beginnt |
| **Scraping-Methode** | Basic (HTTP) | Basic nutzt HTTP-Anfragen, Browser aktiviert JavaScript-Rendering — nötig für Seiten, die Inhalte per JS nachladen |
| **Maximale Tiefe** | 3 | Wie viele Klicks tief der Crawler ausgehend von der Start-URL folgt |
| **Maximale Seiten** | 1000 | Obergrenze für die Zahl gecrawlter Seiten |

## Login (optional)

Für passwortgeschützte Intranets: Der Crawler meldet sich einmal an und bleibt für den gesamten Crawl angemeldet.

| Feld | Beschreibung |
| --- | --- |
| **Login-URL** | Ziel-URL des Login-Formulars — muss HTTPS verwenden |
| **Benutzername** / **Passwort** | Zugangsdaten für das Login-Formular |

## Erweiterte Einstellungen

| Feld | Standard | Beschreibung |
| --- | --- | --- |
| **Pfade einschließen / ausschließen** | — | URL-Pfad-Regex-Muster, eine pro Zeile |
| **Auf Selektor warten** | — | Nur im Browser-Modus: CSS-Selektor, auf den vor der Extraktion gewartet wird |
| **Seiten-Timeout** | 30 s | Timeout pro Seite |
| **Anfrageverzögerung** | 1,0 s | Wartezeit zwischen Anfragen |
| **Gleichzeitige Anfragen** | 5 | Parallel laufende Crawl-Anfragen |
| **Wiederholungsversuche** | 2 | Erneute Versuche bei Fehlern |
| **Ausgabeformat** | Markdown | Markdown, HTML oder Text |
| **Nur Hauptinhalt** | An | Extrahiert nur den Hauptinhaltsbereich, ohne Navigation und Footer |
| **Maximales Alter** | 24 h | Seiten, die älter als dieser Schwellenwert sind, werden erneut gecrawlt |
| **Proxy-Server / -Benutzername / -Passwort** | — | Für Crawls über einen Proxy |
| **User Agent** | — | Eigener User-Agent-String |

## Synchronisierung

- meinGPT crawlt ausgehend von der Start-URL und speichert extrahierten Inhalt pro gefundener Seite.
- Jeder Datenbestand wird alle 15 Minuten vom Sync-Scheduler geprüft (siehe [Sync-Intervall](/docs/integrations/data-pools-rag#eckdaten-der-cloud-datenquelle)); eine Seite wird aber erst neu gecrawlt, wenn die eingestellte maximale Alterszeit (Standard 24 Stunden) seit dem letzten Crawl abgelaufen ist.
- Nutze Pfad-Filter, um den Crawl-Umfang eng zu halten.
