urlsuma.de · Crawler-Information

Der urlsuma-Bot hat Ihre Website besucht

# Sie haben vermutlich diesen Eintrag in Ihren Server-Logs gesehen:

Mozilla/5.0 (compatible; urlsuma/2.0; +https://urlsuma.de/bot.html)

Auf dieser Seite erfahren Sie, wer diesen Crawler betreibt, was er macht, welche Daten er erhebt — und wie Sie ihn steuern oder vollständig blockieren können.

Was ist der urlsuma-Bot?

Der urlsuma-Bot ist der Webcrawler von urlsuma.de, einer allgemeinen Websuchmaschine. Der Bot besucht öffentlich erreichbare Websites, um einen Suchindex aufzubauen und aktuell zu halten — damit Ihre Website über die Suche gefunden werden kann.

Dabei erfasst er ausschließlich Inhalte, die jedem Besucher der Seite ohne Anmeldung zugänglich sind — typischerweise die Startseite einer Domain.

Wie verhält sich der Bot?

Welche Daten werden erhoben?

Vom öffentlich sichtbaren Inhalt der besuchten Seite erfasst der Bot:

Es werden keine Anmeldedaten, Formulardaten oder Inhalte hinter Zugangsbeschränkungen erfasst.

Bot steuern oder blockieren

Der einfachste und schnellste Weg ist Ihre robots.txt. Der Bot hört auf den Token urlsuma und befolgt außerdem generische User-agent: *-Regeln.

robots.txt — Bot vollständig aussperren:

User-agent: urlsuma
Disallow: /

robots.txt — nur bestimmte Bereiche sperren:

User-agent: urlsuma
Disallow: /intern/
Disallow: /shop/warenkorb/
Da der Bot Ihre robots.txt vor jedem Abruf neu liest, greift eine Sperre ab dem nächsten Besuch — Sie müssen nichts weiter tun und niemanden benachrichtigen.

Alternativ können Sie den Bot serverseitig anhand des User-Agent-Strings blockieren (z. B. per HTTP 403). Auch das respektiert der Bot: Seiten, die mit einem 4xx-Status antworten, werden als dauerhaft gesperrt behandelt und nicht erneut angefragt.

Wenn Sie möchten, dass bereits erfasste Daten Ihrer Website aus dem Index entfernt werden, schreiben Sie uns — Kontakt siehe unten. Bitte nennen Sie dabei die betroffene Domain.

Technische Eckdaten

User-Agent Mozilla/5.0 (compatible; urlsuma/2.0; +https://urlsuma.de/bot.html)
robots.txt-Token urlsuma (zusätzlich werden User-agent: *-Regeln befolgt)
robots.txt-Auswertung Vor jedem Seitenabruf, ohne Caching
Abrufe pro Besuch In der Regel 2 (robots.txt + eine Seite)
JavaScript Wird nicht ausgeführt
IP-Adressen Anfragen erfolgen von unseren Servern; auf Anfrage teilen wir Ihnen die aktuellen IP-Adressen gern mit.
Betreiber urlsuma.de — Angaben gemäß Impressum

Kontakt

Fragen zum Bot, Probleme mit dem Crawl-Verhalten oder Wunsch nach Entfernung aus dem Index:

bot@urlsuma.de

Bitte fügen Sie nach Möglichkeit die betroffene Domain und — bei technischen Problemen — einen Auszug aus Ihren Server-Logs bei (Zeitstempel, IP, angefragte URLs). Das beschleunigt die Bearbeitung erheblich.

Weitere Informationen zur Verarbeitung personenbezogener Daten finden Sie in unserer Datenschutzerklärung.

Information in English

urlsuma is the web crawler of urlsuma.de, a German general-purpose web search engine. It fetches publicly accessible pages (typically one page per domain plus robots.txt), identifies itself honestly via its user agent, executes no JavaScript, and re-reads your robots.txt before every request — changes take effect immediately.

To block the crawler entirely, add this to your robots.txt:

User-agent: urlsuma
Disallow: /

For questions or removal requests, contact bot@urlsuma.de and include the affected domain.