Integration · Website
Website mit KI durchsuchen: DSGVO-konform mit meinGPT
Ausgewählte öffentliche Seiten in einen Cloud-Datenraum crawlen und für Assistenten durchsuchbar machen.
Der Website-Crawler ist eine Wissensquelle in meinGPT. Er folgt Seiten innerhalb eines festgelegten Bereichs, extrahiert den Hauptinhalt und synchronisiert ihn in einen Cloud-Datenraum, der in Chats und Assistenten durchsucht werden kann.
Ein Admin hinterlegt Start-URL, Tiefe, Seitenlimit sowie ein- und ausgeschlossene Pfade. Für JavaScript-lastige Seiten ist Browser-Rendering möglich. Spätere Läufe aktualisieren Inhalte entsprechend dem festgelegten Freshness-Fenster.
- Quelle
- Website
- Fähigkeit
- KI-Suche, Website-Q&A, Zusammenfassung und Workflow-Automatisierung
- Anbindung
- Start-URL und Crawl-Scope; optional Header, User-Agent oder Proxy
- Datenhaltung
- Cloud-Vault-Quelle; kein eigener Outpost erforderlich
Quelle, Berechtigung und Datenhaltung werden für jeden Connector separat dokumentiert.
Typische Abläufe
- Website-Inhalte semantisch durchsuchen
- Produkt- und Hilfeseiten als Support-Wissen nutzen
- Crawl-Scope auf relevante Bereiche eingrenzen
- Lange Seiten und Landingpages zusammenfassen
- Wettbewerbs- und Marktrecherche aufbereiten
- JavaScript-Seiten und dynamische Inhalte erfassen
Was mit der Integration möglich wird
01
Website-Inhalte semantisch durchsuchen
Mitarbeitende stellen Fragen an gecrawlte Seiten und erhalten Antworten mit Quell-URL, statt Navigation und Suche der Website manuell zu durchforsten.
02
Produkt- und Hilfeseiten als Support-Wissen nutzen
Ein Assistent beantwortet Anfragen aus der eigenen Doku-, Hilfe- oder Knowledge-Base-Seite und verweist auf die passende Unterseite.
03
Crawl-Scope auf relevante Bereiche eingrenzen
Über Include-/Exclude-Pfade, `max_depth` und `max_pages` wird nur der gewünschte Teil der Website (z. B. /docs oder /produkte) indexiert.
04
Lange Seiten und Landingpages zusammenfassen
Aus umfangreichen Inhaltsseiten Kernaussagen, Argumente und Call-to-Actions in eine strukturierte Übersicht extrahieren.
05
Wettbewerbs- und Marktrecherche aufbereiten
Öffentlich verfügbare Seiten gezielt crawlen und daraus Briefings, Vergleiche oder Faktentabellen mit Quellenangabe erzeugen.
06
JavaScript-Seiten und dynamische Inhalte erfassen
Mit `scraping_method: browser` und `wait_for_selector` auch Single-Page-Apps und nachgeladene Inhalte für die KI lesbar machen.
Prompt und Ergebnis offen prüfen
Durchsuche die gecrawlten Seiten unter /docs unserer Website. Fasse die wichtigsten Themen, die jeweilige Kernaussage und die offenen Lücken in einer Tabelle zusammen — mit Quell-URL und Abschnitt je Zeile.
Ergebnis
| Thema | Quelle (URL) | Kernaussage | Abdeckung | Lücke / nächster Schritt |
|---|---|---|---|---|
| Onboarding | /docs/getting-started | Schritt-für-Schritt-Setup in 5 Minuten | vollständig | Screenshots aktualisieren |
| API-Auth | /docs/api/authentication | Token-basierte Authentifizierung | teilweise | Beispiel für Refresh-Token fehlt |
| Limits | /docs/limits | Rate-Limits pro Plan | gering | Werte für Enterprise ergänzen |
Passt diese Anbindung zu eurem Use Case?
Wir klären am konkreten Use Case, welche Quelle, Rechte und Verbindung nötig sind. Wenn die vorhandene Integration passt, könnt ihr danach direkt mit der Einrichtung beginnen.
Sicherheit und Betrieb
Begrenzt den Crawl auf die benötigten Bereiche und prüft, welche Seiten in den Datenraum gelangen. Eigene Header oder Proxys sollten nur mit geklärten Zugriffsfolgen eingesetzt werden.
Bei der Auswahl prüfen
- Crawl-Scope — lassen sich Tiefe, Seitenanzahl und Pfade präzise eingrenzen?
- Datenresidenz — wo werden Anfragen und Inhalte verarbeitet und gespeichert?
- Aktualität — werden Seiten inkrementell und im Freshness-Fenster nachgecrawlt?
- Quellenanzeige — nennt jede Antwort die zugrunde liegende URL?
- Administrierbarkeit — zentrale Konfiguration, Re-Sync und Löschprozesse?
Bekannte Grenzen
- 01Die Crawl-Qualität hängt von Seitenstruktur und Rendering ab — JavaScript-lastige Seiten brauchen `browser`-Modus, sonst bleibt der Inhalt leer.
- 02Der Crawler folgt nur erreichbaren, verlinkten Seiten innerhalb des Scopes; durch robots.txt, Login-Walls oder fehlende Verlinkung blockierte Inhalte werden nicht erfasst.
- 03Indexierte Inhalte sind nur so aktuell wie der letzte Sync — bei häufig geänderten Seiten muss das Freshness-Fenster (`max_age_hours`) entsprechend eng gesetzt werden.
Häufige Fragen
Ja. Wenn die gewünschten Seiten kontrolliert gecrawlt und indexiert werden, kann eine Unternehmens-KI Fragen dazu beantworten und nur auf die im Scope erfassten Inhalte zugreifen.