Impressum


Bot-Sperrlisten-Empfehlung



Nach einem Posting auf Hacker News zur Vorstellung des ScrapTrap HTTP-Header-Audits erfolgten innerhalb weniger Stunden weit über 1000 Zugriffe - durch diverse Bots, nicht durch Menschen. Dabei handelte es sich im Grunde in den allermeisten Fällen um völlig nutzlosen Traffic, der meist darauf abzielte, Daten ganz oder teilweise zu scrapen, E-Mail-Adressen abzugreifen oder den Link in sonst irgendeiner Weise zu eigenen, meist finanziellen Zwecken zu nutzen.
ScrapTrap als Layer-7-WAF und Bot-Abwehrsystem selbst arbeitet nicht mit Botlisten, die morgen sowieso bereits wieder veraltet sein können - eine einfache Änderung des User Agents reicht dazu aus, zudem ständig neue Bots hinzukommen, seitdem auch Nicht-Programmierer sich durch KI-Hilfe solche Skripte erstellen lassen können, nur um weiteren sinnlosen Traffic zu fabrizieren.
Jedoch gibt es andere, einfachere Abwehrsysteme, die auf solche Listen angewiesen sind, ebenso viele Eigenbaulösungen von Seitenbetreibern, die zumindest versuchen, der Bot-Plage, die praktisch keinerlei rechtlicher Regulierung unterliegt, Herr zu werden.
Für diesen Personenkreis, der versucht, die Souveränität über die eigenen Inhalte zu wahren, ist die nachfolgende Liste gedacht. Dabei wird jeweils eine Einschätzung zum jeweiligen Bots gegeben und eine Begründung, warum der Autor dieses Textes den Bot sperren bzw. blocken würde, wenn es ScrapTrap nicht gäbe. Einige dieser Bots werden allerdings durchaus gezielt vom ScrapTrap-System geblockt, nämlich all jene, die mittels des AI‑Bot‑Policy & Payment Enforcement Moduls an Content-Aggregation oder einfach: Inhaltsklau gehindert werden.

Dabei lassen sich die Bots / Scraper etc. der nachfolgenden Liste grob in folgende Kategorien einteilen:
Keiner dieser Bots bringt einem Seitenbetreiber Besucher, einem Shop-Betreiber Kunden oder einem Forum neue Mitglieder. Sie bzw. ihre Betreiber hebeln die grundsätzliche Idee des Gebens und Nehmens, das dem Internet einst zugrunde lag, komplett aus. Sie sind, ebenso wie das Gewinnstreben der Großkonzerne, mit dafür verantwortlich, dass Unmengen an Elektrizität völlig sinnlos verbraucht und die ohnehin schon fragile Umwelt zusätzlich belastet wird. Sie tragen weder zur kulturellen Entwicklung bei, noch helfen sie in irgendeiner Form Menschen weiter (von wenigen Ausnahmen abgesehen). Gleichwohl ist ihr Einsatz - sofern nicht vorsätzlich Schadcode ausgeführt wird - nicht illegal. Ob Seitenbetreiber sie blockieren oder nicht, liegt in deren freier Entscheidung. Wer also die nachfolgenden Liste für Sperrzwecke nutzen will, mag dies ungehindert tun - wer nicht, eben nicht.



001.2ip bot/1.1 (+https://2ip.io/bot/)Bekannter IP- und Netzwerk-Lookup-Dienst. Der Bot prüft meist die Erreichbarkeit oder sammelt Netzwerkinformationen. Unnötig, weg damit.
002.AboutUsTrustSignals/1.0 (+https://aboutus.com)Cloud-Computing-Dienste – Amazon Web Services (AWS). Liefert unzuverlässige Werte, weil der Bot eine WAF-Sperrung nicht bemerkt, aber dennoch behauptet, die Seite vollständig gerendert zu haben; in Wahrheit wohl timeout. Schrott, weg.
003.Agent incident monitor/0.1Wahrscheinlich internes DevOps- oder Monitoring-Tool zur Überwachung von Server- oder Webseiten-Ausfällen. Keinerlei Nutzen, Sperre.
004.ai-freebie-radar/0.1 (+https://github.com/)Wohl kleiner GitHub-Skript-Bot, der das Netz nach kostenlosen AI-Tools oder Angeboten durchsucht. Kein Mehrwert, weg.
005.AI-NewsBot/3.0 article-extractorSaugt wahrscheinlich Artikel ab, um sie ungefragt in irgendwelchen synthetischen Newslettern oder Feeds zu verwursten. Nutzlos, blocked.
006.AICUIScout/0.1 (+https://example.local; product research)Wahrscheinlich lokaler Prototyp oder Test-Bot für Produktrecherchen (Nutzt Dummy-Domain example.local). Weg damit.
007.AIToolCompareBot/1.0 (+https://sortaitech.com/bot)Verzeichnis-Crawler für ein KI-Tool-Vergleichsportal (sortaitech.com), scannt wohl nach Software-Neuvorstellungen. Muss man nicht haben.
008.AkoniLeadHuntBot/0.1 (+https://www.recruiting-systems.com)Versucht wahrscheinlich im Auftrag von Recruiting-Software Kontaktdaten abzugreifen.
009.Apache-HttpClient/5.3.1 (Java/25.0.4)Cookieübergabeversuch - checkCookieSession=true/. Block.
010.AppWatchBot/0.1 (+https://appwatch.ai/bot)Monitoring-Bot für Web-Apps (appwatch.ai), prüft laut UA-Angabe meist nur Erreichbarkeit ("liveness"/"freshness"), speichert eventuell keine Inhalte; trotzdem überflüssig.
011.AppWatchBot/0.1 (+https://appwatch.ai/bot; freshness check only)Monitoring-Bot für Web-Apps (appwatch.ai), prüft laut UA-Angabe meist nur Erreichbarkeit ("liveness"/"freshness"), speichert eventuell keine Inhalte; trotzdem überflüssig.
012.AppWatchBot/0.1 (+https://appwatch.ai/bot; liveness check only, no content stored)Monitoring-Bot für Web-Apps (appwatch.ai), prüft laut UA-Angabe meist nur Erreichbarkeit ("liveness"/"freshness"), speichert eventuell keine Inhalte; trotzdem überflüssig.
013.arschiv-ngx/1.0Archivierungsbot, genaue Funktion / Herkunft (bis jetzt) unbekannt. Suspekt, Sperre.
014.AteveSearchSourceUrlDiscovery/0.1 (+mailto:crawler@example.com)Eventuell Test-Crawler zur URL-Entdeckung (Verwendung generischer Dummy-Kontaktadresse). Unnötig, weg damit.
015.axios/1.13.5JavaScript-HTTP-Client (Axios) - wird meist von individuellen Skripten oder Apps für API-Abfragen oder Content-Aggregation genutzt. Völlig wertlos, blocked
016.bearblog-outreach/1.0 (personal writer-outreach research; contact via blog)Outreach-Bot der Blogging-Plattform "Bear Blog" - keinerlei Nutzen, weg.
017.BergamotToolRadarBot/0.1 (+https://bergamotadvisors.com)Business- und Tool-Radar-Bot (Bergamot Advisors), durchsucht wohl das Netz nach Software-Lösungen, Tools oder Marktdaten für Beratungszwecke. Für Leute, die nichts mit Software zu tun haben, völlig sinnlos.
018.BergaTools-ForumAggregator/1.0 (+https://github.com/BergaDev/PersonalTools)Privater Foren-Aggregator (Open-Source-Projekt auf GitHub), sammelt Beiträge für den Eigenbedarf. Keine Kunst, kann weg.
019.Bryf/1.0 (Article Processor)Artikel-Verarbeitungs-Skript, zieht sich anscheinend Webinhalte zur Weiterverarbeitung. Unnütz.
020.BubblemediaCrawler/1.0 (+https://bubblemedia.app/crawler)SEO- und Webanalysedienst-Crawler (Bubblemedia), scannt Websites für Auswertungen - nur dass der Seitenbetreiber nichts davon hat außer unnötigen Traffic. Block.
021.CalatheaNews/2.0 (+https://github.com/nbitslabs/calathea-content-curator)Open-Source Content-Curator (GitHub), sammelt Nachrichten für News-Feeds. Kein Mehrwert.
022.ClarFlow/2.0 (+https://clarflow.cn)Chinesische Daten- oder Workflow-Plattform, crawlt Webinhalte für deren Dienste. Für Europäer absolut wertlos, weg damit.
023.CheckMarkNetwork/1.0 (+http://www.checkmarknetwork.com/spider.html)Älterer Web-Spider zur Verzeichnisprüfung und Linkvalidierung. Unnötig.
024.CheKakStartupBot/1.0 (+https://startup.chekak.store/about)Startup-Verzeichnis-Bot, scannt nach neuen Gründungen oder Webseiten für eine Plattform - und verkauft das dann wahrscheinlich, ohne dass das Startup konkret etwas davon hat. Weg.
025.CodaBot/1.0Vermutlich Abruf-Bot für die Dokumentenplattform Coda (zum Laden von Web-Vorschauen / Inhalten). Ansichtssache.
026.CollectorBridge-SaaSProducer/1Wahrscheinlich nur ein weiterer automatisierter B2B-Daten- oder SaaS-Infrastruktur-Bot, der gezielt Webseiten nach Unternehmensdaten, Software-Stacks, APIs oder Kennzahlen abgrast, um sie für kommerzielle Software-as-a-Service-Plattformen oder Lead-Datenbanken aufzubereiten. Völlig sinnlos, raus.
027.crawlberg/1.3.0Kleiner, eigenständiger Web-Crawler (vermutlich Open-Source-Skript). Da niemand weiß, was mit den Daten passiert, weg damit.
028.curl/7.29.0Klassisches Kommandozeilen-Tool (cURL) / Proxy. Wird meist für manuelle Abfragen, API-Tests oder einfache Skripte genutzt. Wer keine Lust hat, seine Inhalte für ominöse Zwecke zur Verfügung stellen, wirft das raus.
029.curl/7.4.0Klassisches Kommandozeilen-Tool (cURL) / Proxy. Wird meist für manuelle Abfragen, API-Tests oder einfache Skripte genutzt. Wer keine Lust hat, seine Inhalte für ominöse Zwecke zur Verfügung stellen, wirft das raus.
030.curl/8.7.1Klassisches Kommandozeilen-Tool (cURL) / Proxy. Wird meist für manuelle Abfragen, API-Tests oder einfache Skripte genutzt. Wer keine Lust hat, seine Inhalte für ominöse Zwecke zur Verfügung stellen, wirft das raus.
031.curl-proxy/1.0Klassisches Kommandozeilen-Tool (cURL) / Proxy. Wird meist für manuelle Abfragen, API-Tests oder einfache Skripte genutzt. Wer keine Lust hat, seine Inhalte für ominöse Zwecke zur Verfügung stellen, wirft das raus.
032.directree-ingest/1.0 (+https://www.directree.io)Wahrscheinlich Datenabgriff für Vertriebs- oder Investment-Datenbanken. Völlig unnütz, raus.
033.directree-outreach/1.0 (+https://www.directree.io)Wahrscheinlich Datenabgriff für Vertriebs- oder Investment-Datenbanken. Völlig unnütz, weg damit.
034.DomainStatsBot/1.0 (https://domainstats.com/pages/our-bot)SEO- und Domain-Analyse-Bot (domainstats.com), sammelt Kennzahlen und Metadaten zu Webseiten. Kein Mehrwert.
035.Drakma/2.0.10 (SBCL 2.6.1; FreeBSD; 15.0-RELEASE-p10; http://weitz.de/drakma/)HTTP-Client-Bibliothek für Common Lisp (Drakma). Wird für individuelle Skripte oder Abfragen genutzt. Datennutzung ungewiss, also weg damit.
036.Earthshine/1.0 (earthshine.fibonacci.ai; contact: hello@fibonacci.ai)KI- und Daten-Crawler (fibonacci.ai), sammelt Webinhalte für maschinelles Lernen oder Analysen. ScrapTrap Payment Enforcement-Kandidat.
037.emerging-apps-monitor/2.0 (research; +https://hn.algolia.com/)Bot, der im Umfeld von Hacker-News-Daten (Algolia) nach neuen Apps und Projekten sucht. Höchstens für HN-Nutzer interessant.
038.EnrichHatBot/0.1 (+https://hatos.internal/bot; first-party enrichment)Interner Datenanreicherungs-Bot ("first-party enrichment"), meist für firmeneigene Datenbanken im geschlossenen Netz. Wahrscheinlich KI-Scraping. Raus.
039.FixBeforeLaunchBot/0.1 (+https://fixbeforelaunch.com/bot; readiness scanner)Will angeblich die Startreife prüfen, klopft aber meist ungefragt das Web ab. Sinnloser Traffic, blocked.
040.FlamingoBot (+https://hackernews.pink)Content-Aggregator für einen alternativen Hacker-News-Client (hackernews.pink). Für nicht HN-Nutzer komplett unnötig.
041.FoundryScope/1.0 (startup analysis bot; contact: amine.1.mestour@gmail.com)Wohl Datenabgriff für Venture-Capital- oder Investment-Datenbanken. Noch sinnloser kann Traffic kaum sein.
042.FreshRSS/1.29.1 (Linux; https://freshrss.org)Selbstgehosteter RSS-Feedreader (FreshRSS). Ruft Feeds ab, weil ein Nutzer die Website abonniert hat - angeblich jedenfalls. Schlägt aber auch auf Seiten auf, die mangels RSS gar nicht abonniert werden können. Suspektes Verhalten, also weg damit.
043.GeneralCrawlBot/0.1Generischer Test-Crawler oder unbenanntes Skript ohne feste Zuordnung. Zweck unklar. Also weg.
044.GitHubCopilotRuntime-WebFetchDer Copilot-Unterbau holt sich ungefragt den Kontext - fällt unter ScrapTrap Payment Enforcement.
045.Go-http-client/1.1Standard-HTTP-Bibliothek der Programmiersprache Go. Wird meist für manuelle Abfragen, API-Tests oder einfache Skripte genutzt. Wer keine Lust hat, seine Inhalte für ominöse Zwecke zur Verfügung stellen, wirft das raus.
046.go-resty/2.16.5 (https://github.com/go-resty/resty)HTTP-Client-Bibliothek für Go (Resty). Wird für individuelle API-Skripte und Automatisierungen mit meist unklarer Absicht genutzt. Reicht für Blocking.
047.Grammarly/1.0 (http://www.grammarly.com) Kommerziell, gehört zu Superhuman (Grammarly Inc., Coda Project LLC und Superhuman Labs LLC). KI-Kram. ScrapTrap Payment Enforcement-Block.
048.greedyhand/0.1Vermutlich kleiner Eigenbau-Scraper oder experimentelles Extraktions-Skript - weg damit, unnötig und suspekt.
049.GreenWebChecker/1.0 (https://www.thegreenwebfoundation.org/green-web-checker-faq/)Ökologie-Prüfer der Green Web Foundation. Überprüft, ob die Website mit grünem Hosting betrieben wird. Harmlos, aber unnötig. Außerdem überflüssiger Stromverbrauch - den Bot zu blocken ist echte Green IT.
050.GuzzleHttp/7Standard-HTTP-Client für PHP (Guzzle). Wird von unzähligen PHP-Anwendungen, Plugins oder Custom-Scripts verwendet - Zweck wieder unklar. Also raus.
051.HackerNews/1569 CFNetwork/3860.700.1 Darwin/25.6.0Apple-Client oder App für Hacker News (nutzt macOS/iOS-Frameworks), ruft Inhalte für mobile Vorschauen ab. Unnötiger Quatsch.
052.HakuLabCollector/0.1 (+https://n8n.hakulab.cc)Automatisierungs-Workflow (n8n-Instanz bei hakulab.cc), der automatisiert Daten von Websites mit völlig unklarer Absicht abgreift. Bilderbuch-Blockkandidat.
053.Harmonic-HN-Android/3.1.2/fossReleaseMobiler Android-Client für Hacker News ("Harmonic"), lädt Artikel-Vorschauen für App-Nutzer - nur für HN-Nutzer interessant.
054.Harmonic-HN-Android/3.1.2/playReleaseMobiler Android-Client für Hacker News ("Harmonic"), lädt Artikel-Vorschauen für App-Nutzer - nur für HN-Nutzer interessant.
055.Hello from Palo Alto Networks, find out more about our scans in https://docs-cortex.paloaltonetworks.com/r/1/Cortex-Xpanse/Scanning-activityInfrastruktur- und Sicherheits-Scanner von Palo Alto Networks (Cortex Xpanse). Klopft das Netz nach offenen Ports und Assets ab. Ziemlich penetrant, Block.
056.hermes-newsroom/0.1 (research project; +https://github.com/hermes-newsroom)Medien- und Nachrichtenanalyse. Kein Mehrwert für Seitenbetreiber.
057.Hermes-SallyPageFetch/1.0Wahrscheinlich Seiten-Abruf-Modul für das Hermes-Projekt, zieht Webinhalte für Auswertungen. Da wie immer ohne Vergütung gibt es nur einen Block. Taucht oft zusammen mit SallyProspecting/1.0 (public feedback qualification) auf.
058.http.rb/5.3.1HTTP-Client-Bibliothek für Ruby (http.rb). Wird von individuellen Ruby-Skripten für Web-Abfragen genutzt - und Ruby wiederum gerne für SQLi-Versuche. Braucht niemand auf seiner Seite.
059.httpx - Open-source project (github.com/projectdiscovery/httpx)Beliebtes Security- & Reconnaissance-Tool von ProjectDiscovery. Wird von nervigen Bug-Bounty-Jägern, aber eben auch massiv von Hackern zum Vorab-Scannen von Servern genutzt.
060.humanet-page-scraper/1.0Direkter Web-Scraper zur automatisierten Inhalts-Extraktion. Wer sich nicht beklauen lassen will, wirft das Ding sofort raus.
061.icon.horse/2.0Automatisierter Favicon-Extractor (icon.horse). Holt sich das Logo/Favicon einer Website für Web-Vorschauen. Harmlos, aber völlig überflüssig.
062.iHerd-surfer/0.1 (+https://i-herd.com; content discovery agent)Content-Discovery-Agent (i-herd.com), crawlt das Web auf der Suche nach neuen Inhalten für Aggregator-Dienste - also genau das, was auf jeden Fall geblockt werden sollte, wenn man seine Server-Ressourcen nicht unnötig verschwenden will.
063.Indexaro/1.0 (+https://indexaro.com)SEO- und Indexierungs-Dienst (indexaro.com), scannt Webseiten - angeblich - für die URL-Erfassung oder Linkprüfung. Keinerlei Nutzen für Seitenbetreiber.
064.InfomateBot/1.0 (+https://infomate.club)Content-Kuratierungs-Bot (infomate.club), sammelt Artikel und Web-Inhalte für News-Feeds. Ansichtssache.
065.InsuranceLeadMachine/1.0 (+lead discovery; contact: ops@insuranceleadmachine.com)Schnüffelt nach E-Mail-Adressen und Kontaktdaten, um sie in irgendwelche Cold-Outreach-Listen zu werfen. Blocked.
066.InterestingFindsBot/0.1 (+https://nikhilkulkarni1755.com/bot)Wohl privates Entwickler-Projekt, das nach bestimmten Inhalten im Netz sucht. Null Mehrwert / Nutzen.
067.IronReader/0.1 (+https://example.com; RSS reader)RSS-Feedreader (nutzt Test-Domain example.com im User-Agent), ruft abonnierte Feeds ab - auch auf Seiten, die keine Feeds haben und verursacht so unnötigen Traffic.
068.Java/21.0.11Standard-HTTP-Netzwerkbibliothek der Java-Laufzeitumgebung (Java 21). Wird von eigenen Backend-Skripten oder Enterprise-Tools genutzt. Und wieder aus undurchsichtigen Gründen. Blocked.
069.ken/0.1 (+https://github.com/zcag/ken)Kleines Open-Source-Skript oder Crawler von GitHub (zcag/ken). Kann problemlos geblockt werden.
070.KnisNewsCollector/1.0 (+local)Wohl ein lokales News-Sammel-Skript ("+local") für den Eigenbedarf. Überflüssig und ohne Mehrwert.
071.Ktor http-ClientHTTP-Client-Framework für Kotlin (Ktor). Wird für individuelle Apps, Backend-Dienste oder API-Skripte genutzt. Blocked.
072.LaravelReviewScanner/1.0 (+https://webauditscanner.de)Zombie-Bot. Seite nicht mehr verfügbar, der UA wird nun offensichtlich von irgendwem für etwas völlig anderes verwendet. Hochgradig verdächtig, blocked!
073.LaunchToWinBot/1.0 (+https://launchtowin.com)Ein Bot, der nach neuen Produkt-Launches oder Webseiten-Starts sucht (oft für Verzeichnisse oder Launch-Plattformen). Interessanterweise verweist er auf zwei verschiedene Domains. Suspekt, blocked.
074.LaunchToWinBot/1.0 (+https://www.theill.com)Ein Bot, der nach neuen Produkt-Launches oder Webseiten-Starts sucht (oft für Verzeichnisse oder Launch-Plattformen). Interessanterweise verweist er auf zwei verschiedene Domains. Suspekt, blocked.
075.LinkAce/2 (https://github.com/Kovah/LinkAce)Selbstgehosteter Open-Source-Bookmark-Manager (LinkAce). Ruft Metadaten ab, um gespeicherte Lesezeichen zu aktualisieren - verursacht nur unnötg Ressourcenverbrauch.
076.LivelapBot/0.2 (http://site.livelap.com/crawler)Web-Crawler für die Content- und Suchplattform Livelap. Ansichtssache.
077.LohiSoftBot/1.0 (+message@lohisoft.com)Wahrscheinlich Software- und Analyse-Bot eines Entwicklers (LohiSoft). Null Nutzen, raus.
078.Lumina-News/0.1 (+local triage)Lokales News-Triage-Skript zur Filterung und Sortierung von Artikeln. Nutzlos, blocked.
079.machines-outreach/1.0 (lead research; contact caledaptproductdelivery@zohomail.eu)Kein Hehl aus dem Zweck – stumpfe Lead-Recherche für automatisiertes Spam-Marketing.
080.MakerJury-Discovery/1.0 (+https://makerjury.com/contact)MakerJury ist eine Plattform für Indie-Hacker, Maker und neue Projekte. Der Bot sucht wohl nach neuen Webseiten, die dort gelistet oder bewertet werden könnten. Ansichtssache.
081.MalveonLeadBot/0.2 (+https://malveon.com; contact ladsonselvam1998@gmail.com)Schnüffelt wohl nach E-Mail-Adressen und Kontaktdaten, um sie in irgendwelche Cold-Outreach-Listen zu werfen. Raus.
082.markethunt2/0.1 (+research)Marktforschungs- oder Analyse-Skript unter dem Deckmantel von Forschungszwecken. Wertlos, unnötiger Traffic, blocked.
083.Mattermost-Bot/1.1Chat-Bot für die Plattform Mattermost. Generiert automatisiert Link-Vorschauen, wenn URLs in Chats geteilt werden - angeblich. Taucht aber auch auf, wenn das nicht der Fall ist. Suspekt, raus.
084.MetaInspector/5.16.0 (+https://github.com/jaimeiniesta/metainspector)Ruby-Bibliothek zum Auslesen von Webseiten-Metadaten (MetaInspector). Wird von Entwickler-Skripten für Scraping-Aufgaben genutzt - blocked.
085.MetaRabbitBot/2.0 (+https://www.metarabbit.dev/terms#automated-fetching)Automatisierter Fetcher-Bot (metarabbit.dev), ruft Webinhalte für App-Dienste ab - von denen der Seitenbetreiber nichts hat - raus.
086.MetaScopeBot/0.1 (+https://metascope.dev) fulltext-fetcherVolltext-Extraktions-Bot (MetaScope), liest komplette Artikel und Webinhalte für Analysen oder Indexierungen aus. Da der Endzweck unbekannt und das eigentlich nur normales Scraping ist, raus mit dem Müll.
087.MockposeLeadBot/1.0 (+https://mockpose.com)Automatisierter Schrott zur Generierung von vermeintlichen Vertriebskontakten.
088.ModelContextProtocol/1.0 (Autonomous; +https://github.com/modelcontextprotocol/servers)Autonomer Agent, der wohl versucht, Daten für LLM-Frameworks abzugreifen – quasi digitaler Futterautomat für Sprachmodelle. Fällt unter ScrapTrap Payment Enforcement.
089.Mozilla/5.0Generischer UA ohne erkennbaren Zweck. Hochgradig suspekt, blocked.
090.Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; Keenable-User/1.0; +https://keenable.ai/)KI- und Analyse-Crawler (keenable.ai), tarnt sich als Browser, um Webinhalte für maschinelles Lernen abzugreifen. ScrapTrap Payment Enforcement Block.
091.Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; LighthouseBot/1.2; +https://lighthouseapp.io/bot-info) Chrome/136.0.0.0 Safari/537.36Hat nichts mit Google Lighthouse zu tun. Content-Kuratierungs- und RSS-Reader-Bot (lighthouseapp.io), ruft abonnierte Inhalte und Artikel für die Plattform ab. Da der Artikelsteller nichts dafür bekommt außer unaufgeforderten Traffic wird das Ding gesperrt.
092.Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; SleepBot/1.0; +http://sleepbot.com/) Chrome/131.0.0.0 Safari/537.36Unklarer Bot-Crawler (SleepBot), nutzt veraltete oder umgeleitete Projektdomains. Unnütz und verdächtig, raus.
093.Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; YouBot/1.0; +https://docs.you.com/youbot; env:prod) Chrome/142.0.0.0 Safari/537.36Such- und Retrieval-Bot der KI-Suchmaschine You.com, sammelt Inhalte für Live-Suchantworten. ScrapTrap Payment Enforcement.
094.Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko) Chrome/123.0.6312.86 Safari/537.36 BitSightBot/1.0Sicherheits- und Risiko-Rating-Scanner (BitSight), bewertet die IT-Sicherheit von Domains von außen. Allerdings nicht für den Domaininhaber, sondern eher um die Daten zu verkaufen. Also blocked.
095.Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; SEOJuice-SearchBot/1.0; +https://seojuice.io/botSEO-Analyse-Bot (seojuice.io), crawlt Seiten für Link- und Strukturanalysen um die Daten zu verkaufen. Schmarotzer, keinerlei Nutzen.
096.Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; ShapBot/0.1.0Kleiner experimenteller oder unbekannter Bot-Crawler. Nutzlos, blocked.
097.Mozilla/5.0 compatible logDRILLER crawlerLogfile- und Analyse-Crawler, meist für interne Auswertungen oder Strukturprüfungen. Nutzlos, blocked.
098.Mozilla/5.0 EmergingAppsMonitor/2.0Monitoring-Crawler für neue Apps und Web-Projekte. Datenverwendung unklar, blocked.
099.Mozilla/5.0 Firefox/33.0Veralteter, gefälschter Firefox-Browser-String (Version von 2014), wird meist von simplen Scrapern genutzt. Also parasitär, blocked.
100.Mozilla/5.0 SirenHunt/1.0Sicherheits-, Threat-Intelligence- oder Überwachungs-Bot von SirenHunt (mysiren.ai), durchsucht das Netz nach spezifischen Daten oder Infrastrukturen. ScrapTrap Payment Enforcement-Block.
101.Mozilla/5.0 (compatible; AgentInfoVault/1.0)Bot- und Agenten-Erfassungsdienst, sammelt Informationen über Webseiten-Strukturen. Nettes Hobby, das woanders betrieben werden kann - raus damit.
102.Mozilla/5.0 (compatible; AhrefsBot/7.0; +http://ahrefs.com/robot/)Datenkrake ohne Mehrwert, zieht massig Ressourcen ab und bietet dem Seitenbetreiber direkt keinen echten Gegenwert, weshalb er von vielen Administratoren standardmäßig ausgesperrt wird. Blocked!
103.Mozilla/5.0 (compatible; AI-News-Aggregator/1.0)KI-News-Aggregator, saugt Artikel für automatisierte Nachrichtendienste ab. Parasit, ScrapTrap Payment Enforcement.
104.Mozilla/5.0 (compatible; aiii.news/1.0)Nachrichten-Aggregator (aiii.news), crawlt Inhalte für Feed-Einbindungen. Wertlos, raus.
105.Mozilla/5.0 (compatible; AkoniLeadHuntBot/1.0; +https://www.recruiting-systems.com) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/126.0 Safari/537.36Recruiting- und Lead-Scraping-Bot mit Browser-Tarnung (gleicher Betreiber wie AkoniLeadHuntBot). Und genauso überflüssig.
106.Mozilla/5.0 (compatible; archive.org_bot +http://archive.org/details/archive.org_bot) Zeno/d3712ae warc/v0.8.99Der offizielle Bot der Wayback Machine (Internet Archive). Erstellt historische Snapshots von Webseiten. Für die meisten unschädlich, solange man kein Problem damit hat, dass die Website ohne Erlaubnis archiviert wird. Hier blocked.
107.Mozilla/5.0 (compatible; BacklinksExtendedBot)SEO-Backlink-Checker, scannt das Netz nach Verknüpfungen zwischen Webseiten. Wertlos, blocked.
108.Mozilla/5.0 (compatible; bot/1.0)Extrem generischer, namenloser Test-Bot. Verdächtig und nutzlos.
109.Mozilla/5.0 (compatible; catchup-agent/1.0)Wahrscheinlich Zusammenfassungs- oder Catch-up-Agent, ruft wohl Webseiten ab, um sie für Nutzer auf den neuesten Stand zu bringen oder Inhalte nachzuholen. Ansichtssache.
110.Mozilla/5.0 (compatible; CensysInspect/1.1; +https://about.censys.io/)Offizielle beziehungsweise massenhafte Infrastruktur-Scanner, die Ports, Zertifikate und offene Dienste kartografieren. Für Seitenbetreiber wertloser, aufgezwungener Traffic. Raus.
111.Mozilla/5.0 (compatible; ch-domain-research/1.0)Unklarer Zweck, Forschung kann jeder behaupten. Suspekt, blocked.
112.Mozilla/5.0 (compatible; CMS-Checker/1.0; +https://example.com)CMS-Erkennungs-Skript (verwendet Dummy-Domain example.com), scannt nach eingesetzten Content-Management-Systemen - was das Ding überhaupt nichts angeht, Sperre.
113.Mozilla/5.0 (compatible; CodeSecBot/1.0)Vielleicht Sicherheits- und Schwachstellen-Scanner für Webseiten. Wer weiß, wozu das dienen soll - also blocked.
114.Mozilla/5.0 (compatible; ContentStudio/1.0; +https://contentstudio.io)Social-Media- und Content-Management-Plattform (ContentStudio), ruft Link-Vorschauen ab. Unnötiger Traffic, weg damit.
115.Mozilla/5.0 (compatible; CopyvioDetector/0.4.2.dev0; +wikipedia.earwig[at]gmail.com)Plagiats-Scanner, der ganze Webseiten spiegelt, um sie mit studentischen Arbeiten oder Wikipedia-Texten abzugleichen. So wird der Seitenbetreiber im Zweifelsfall gleich zweimal beklaut. Blocked.
116.Mozilla/5.0 (compatible; DataAIHub/1.0; +https://www.dataaihub.co)KI- und Daten-Aggregator (dataaihub.co), crawlt Webinhalte für maschinelles Lernen oder Analysedatenbanken. ScrapTrap Payment Enforcement-Kandidat.
117.Mozilla/5.0 (compatible; DataForSeoBot/1.0; +https://dataforseo.com/dataforseo-bot)Kommerzieller SEO-Daten-Crawler (DataForSEO), sammelt Kennzahlen und Suchergebnis-Daten für API-Kunden. Parasitär, gesperrt.
118.Mozilla/5.0 (compatible; Dataprovider.com)Unternehmens- und Technologiedaten-Crawler (Dataprovider.com), scannt Websites für Marktforschungs- und B2B-Datenbanken. Parasitär, gesperrt.
119.Mozilla/5.0 (compatible; Defuddle/1.0; +https://defuddle.md)Konvertiert Seiten für LLMs in Markdown - ScrapTrap Payment Enforcement.
120.Mozilla/5.0 (compatible; DomainAnalyzer/1.0)Generischer Domain-Analyse- und Bewertungs-Bot. Unnütz, raus.
121.Mozilla/5.0 (compatible; DomainScores/2.1; +https://www.domainscores.net/headers)SEO- und Domain-Rating-Dienst (domainscores.net), ermittelt Kennzahlen und Bewertungen von Webseiten. Null Mehrwert, raus.
122.Mozilla/5.0 (compatible; Embedly/0.2; +http://support.embed.ly/Embed- und Vorschau-Dienst (Embedly), generiert Webseiten-Vorschauen, wenn Links auf Plattformen eingebettet werden. Ansichtssache.
123.Mozilla/5.0 (compatible; EpistemicFilter/0.1; personal aggregator)Persönlicher Nachrichten- oder Content-Aggregator für den Eigenbedarf. Wer lesen will, soll auf die Seite kommen. Blocked.
124.Mozilla/5.0 (compatible; ev-crawler/1.0; +https://headline.com/legal/crawler)Startup- und Investitions-Scout (Venture Capital / Headline.com), sucht nach neuen Firmen und Web-Projekten - um Geld damit zu machen, nicht weil es ein Sozialverein ist. Raus.
125.Mozilla/5.0 (compatible; ExaSearchBot/1.0; +https://crawler.exa.ai/)Web-Crawler der KI-Suchmaschine Exa (exa.ai). Sammelt und indexiert Web-Inhalte für semantische Suchen und Large Language Models. Ansichtssache.
126.Mozilla/5.0 (compatible; fastfollow-radar/0.1; +https://fastfollow.lol/how-it-works)Social-Media- oder Follower-Radar-Bot (fastfollow.lol), durchsucht das Netz nach Profilen oder Webseiten-Metriken. Null Mehrwert, weg damit.
127.Mozilla/5.0 (compatible; Feedspot/1.0 (+https://www.feedspot.com/fs/fetcher; like FeedFetcher-Google)Kommerzieller RSS-Reader und Content-Aggregator (Feedspot), ruft Artikel für Nutzer-Feeds ab - natürlich ohne den Betreiber zu beteiligen, stattdessen werden ihm unnötige Ressourcenkosten aufgezwungen. Blocked!
128.Mozilla/5.0 (compatible; ForestEngine/1.0; +https://forestengine.net/)Angeblich eine Art Portscanner, aus welchem Grund auch immer. Unerwünschter Traffic-Müll. Blocked.
129.Mozilla/5.0 (compatible; GCombinator/1.0; +https://news.gcombinator.com)Hacker-News-Aggregator oder alternativer Reader-Client. Im Prinzip nutzlos, blocked.
130.Mozilla/5.0 (compatible; getdomaindata/1.0; +https://getdomaindata.com/bot)Domain-Daten-Sammelbot (getdomaindata.com), crawlt technische Metadaten von Websites. Null Mehrwert, raus.
131.Mozilla/5.0 (compatible; global-new-sites-live-check/1.0; +https://example.invalid)Wohl Test- oder Überwachungs-Skript für neue Webseiten (nutzt ungültige Test-Domain im UA). Suspekt, Sperre.
132.Mozilla/5.0 (compatible; Google-Apps-Script; beanserver; +https://script.google.com; id: UAEmdDd_b9Ocb4YPBbVaLDwvUS_5DqGlFqiw)Nichts Offizielles. Google Apps Script (Google-Tabellen-Automatisierung). Wird von individuellem Code genutzt, um Webinhalte abzufragen. Suspekt, blocked.
133.Mozilla/5.0 (compatible; HaloBot/1.0)Kleiner Web-Crawler (HaloBot), wohl für Monitoring oder Datenerfassung im Einsatz. Endzweck unklar, suspekt, Sperre.
134.Mozilla/5.0 (compatible; HN-archiver/1.0)Hacker-News-Archivierungs-Bot, sichert verlinkte Artikel für externe Sammlungen. Für Nicht-HN-Nutzer uninteressant, ansonsten Ansichtssache.
135.Mozilla/5.0 (compatible; INETDEX-BOT/2.1; +https://inetdex.com/bot.php)SEO‑/Monitoring‑Crawler
136.Mozilla/5.0 (compatible; intel-collector/0.1.0; +https://github.com/enterprise-playbook)Open-Source Intelligence-Collector von GitHub, sammelt gezielt Daten für Enterprise-Analysen. Parasitär, blocked.
137.Mozilla/5.0 (compatible; Miniflux/2.3.1; +https://miniflux.app)Minimalistischer Web-RSS-Reader (Miniflux). Ruft abonnierte Feeds ab, weil ein Nutzer die Seite in seiner App liest. Hier blocked, ansonsten Ansichtssache.
138.Mozilla/5.0 (compatible; NetcraftSurveyAgent/1.0; +info@netcraft.com)Offizielle beziehungsweise massenhafte Infrastruktur-Scanner, die Ports, Zertifikate und offene Dienste kartografieren. Unbedingt sperren, gefährlich! Firma beantragt immer wieder fälschlich Seitensperrungen - Rückgängigmachung ist sehr schwierig und zeitaufwendig, für kleine Shops oft das Aus!
139.Mozilla/5.0 (compatible; newsomo/1.0; +https://newsomo.com)Nachrichten-Aggregator (newsomo.com), zieht Artikel für News-Feeds ab. Ansichtssache.
140.Mozilla/5.0 (compatible; NewsParser/0.1)Nachrichten-Parser-Skript, extrahiert Artikelinhalte - also im Prinzip Scraping, Sperre.
141.Mozilla/5.0 (compatible; NoctraRecon/1.0)Wahrscheinlich Sicherheits- oder Aufklärungs-Scanner (Recon-Bot), scannt Webseitenstrukturen. Kann das Ding woanders machen, blocked.
142.Mozilla/5.0 (compatible; outreach-enrich/1.0; +local)Lokales Skript zur Anreicherung von Kontaktdaten ("outreach-enrich"), typisch für Lead-Generierung. Auf jeden Fall blocked!
143.Mozilla/5.0 (compatible; PBN.BOT Monitoring/1.0)Privates Blog-Netzwerk-Checking – wird von SEO-Guerillas genutzt, um den Status von Spam-Netzwerken zu überwachen. Kann er woanders machen, raus.
144.Mozilla/5.0 (compatible; PitchframeBot/1.0; +https://pitchfra.me)Startup- und Pitch-Plattform-Bot (pitchfra.me), scannt das Netz nach neuen Projekten und Webseiten. Für die meisten wohl uninteressant, ansonsten Ansichtssache.
145.Mozilla/5.0 (compatible; PlagAwareBot/3.2; +https://www.plagaware.com/bot)Plagiatssucher und Text-Checker (PlagAware). Durchsucht das Web nach kopierten Texten und Inhalten. Kommerziell, blocked.
146.Mozilla/5.0 (compatible; PostedIn/1.0)Social-Media- und Content-Publishing-Bot (PostedIn), prüft Links und zieht Vorschauen. Ansichtssache.
147.Mozilla/5.0 (compatible; PostureBot/1.0; +passive-security-check)Wohl passiver Sicherheits- und Konfigurations-Scanner, prüft Webseiten auf Standard-Schwachstellen. Geht den einen feuchten Dreck an. Gesperrt!
148.Mozilla/5.0 (compatible; Reflectionbot/1.0; +https://reflection.ai/bot)KI- und Daten-Crawler (reflection.ai), sammelt wohl Webinhalte für maschinelles Lernen. ScrapTrap Payment Enforcement-Sperre.
149.Mozilla/5.0 (compatible; ResearchBot/1.0)Kann alles und nichts sein. Suspekt, blocked.
150.Mozilla/5.0 (compatible; SectorBot/0.1; +https://example.org/bot) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/124 Safari/537.36Cookieübergabeversuch care_did=0be7cc0f-399e-406d-8c1c-86c87a9f423d, klassischer Angriffs- oder Tracking-Versuch. Blocked!
151.Mozilla/5.0 (compatible; SeekportBot; +https://bot.seekport.com)Früher Suchmaschine, heute Müll. Gesperrt.
152.Mozilla/5.0 (compatible; SemrushBot/7~bl; +http://www.semrush.com/bot.html)Backlink- und SEO-Crawler von Semrush (Backlink-Index-Variante). Scannt das Web nach Verlinkungen, Rankings und SEO-Metriken. Oft penetrant, parasitär, blocked.
153.Mozilla/5.0 (compatible; SeznamBot/4.0; +https://o-seznam.cz/napoveda/vyhledavani/en/seznambot-crawler/)Offizieller Crawler der tschechischen Suchmaschine Seznam.cz. Indexiert Inhalte für den osteuropäischen Raum. Muss nicht gesperrt werden, wenn Host-Validierung möglich ist.
154.Mozilla/5.0 (compatible; SirenHunt/1.0; +https://mysiren.ai)Sicherheits-, Threat-Intelligence- oder Überwachungs-Bot von SirenHunt (mysiren.ai), durchsucht das Netz nach spezifischen Daten oder Infrastrukturen. ScrapTrap Payment Enforcement-Block.
155.Mozilla/5.0 (compatible; SiteAuditBot/0.97; +http://www.semrush.com/bot.html)SEO- und Website-Audit-Bot von Semrush. Scannt Seiten auf Optimierungspotenziale und Fehler, verbraucht dabei oft exorbitant Ressourcen. Völlig wertlos, blocked.
156.Mozilla/5.0 (compatible; StackScopeBot/1.0; +https://stackscope.dev/bot)Technologie-Analyse-Bot (stackscope.dev), scannt Websites nach eingesetzten Software-Stacks und Bibliotheken. Da ihn das nicht zu interessieren hat, blocked.
157.Mozilla/5.0 (compatible; StockNewsDashboard/2.0)Finanz- und Börsen-News-Aggregator, zieht aktuelle Artikel für Investoren-Dashboards ab. Pack, blocked.
158.Mozilla/5.0 (compatible; SurdotlyBot/1.0; +http://sur.ly/bot.html)Link- und Sicherheitsprüfungs-Bot (sur.ly), analysiert Webseiten-Verlinkungen für Widgets und Sicherheits-Badges. Ansichtssache.
159.Mozilla/5.0 (compatible; TaskBountyContactBot/1.0)Wahrschinlich Kontaktdaten-Sucher für Auftrags- oder Micro-Tasking-Plattformen. Unnötiger Müll, raus.
160.Mozilla/5.0 (compatible; TavilyBot/1.0)Such- und Retrieval-Agenten für KI-Systeme, die Webseiten für Live-Antworten durchwühlen. ScrapTrap Payment Enforcement-Sperre.
161.Mozilla/5.0 (compatible; TechBloggerBot/1.0; +personal content-research tool)Wahrscheinlich persönliches Recherche-Skript für einen Tech-Blog. Hey, wenn ihr was wissen wollt, kommt selbst vorbei. Euer Bot ist blocked.
162.Mozilla/5.0 (compatible; The Lounge IRC Client; +https://github.com/lordbex/thelounge) facebookexternalhit/1.1 Twitterbot/1.0Da hier ein Täuschungsversuch gegen einfache UA-Blocker vorliegt, kann das Ding als bösartig bewertet werden. Blocked!
163.Mozilla/5.0 (compatible; ViucomWebsiteCheck/1.0)Firma Viucom - deutscher IT-Dienstleister / Digitalagentur aus Chemnitz. Unnütz, raus.
164.Mozilla/5.0 (compatible; WP-Safe-Scanner/1.0)WordPress-Sicherheits- und Schwachstellen-Scanner, prüft Websites auf installierte Plugins und bekannte Lücken - wahrscheinlich, um dann per Mail "die Lösung" zu verkaufen. Gesperrt!
165.Mozilla/5.0 (lead-qualifier; passive fingerprint)Lead-Qualifizierungs- und Fingerprinting-Bot, scannt Websites zumindest bei Erstaufruf passiv zur Auswertung von Unternehmensdaten. Braucht keiner, raus.
166.Mozilla/5.0 (Linux; Android 13; Pixel 4a (5G) Build/TQ2A.230505.002; wv) AppleWebKit/537.36 (KHTML, like Gecko) Version/4.0 Chrome/112.0.5615.136 Mobile Safari/537.36 GoogleApp/14.16.27.29.arm64 AppEngine-Google; (+http://code.google.com/appengine; appid: s~virustotalcloud)Google App Engine / VirusTotal Cloud (Mobil-Variante). Wird verwendet, wenn eine URL von Nutzern oder automatisierten Systemen bei VirusTotal zur Sicherheitsprüfung eingereicht wird und der Scanner die Seite live abruft. Kann bei vorliegender Hostvalidierung sinnvoll sein.
167.Mozilla/5.0 (Macintosh; Intel Mac OS X 10_10_1) AppleWebKit/600.2.5 (KHTML, like Gecko) Version/8.0.2 Safari/600.2.5 (Gort)Skript oder Automatisierungstool mit getarntem Safari-Mac-User-Agent ("Gort"). Kein Mensch und unklare Absichten, daher gesperrt!
168.Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) AppleWebKit/605.1.15 (KHTML, like Gecko) News Explorer/2.2macOS/iOS-Feedreader-App ("News Explorer"), ruft abonnierte Inhalte für den lokalen Nutzer über andere Seiten ohne Einwilligung ab. Blocked.
169.Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) AppleWebKit/605.1.15 (KHTML, like Gecko) Version/15.5 Safari/605.1.15 AppEngine-Google; (+http://code.google.com/appengine; appid: s~virustotalcloud)Google App Engine / VirusTotal Cloud (Desktop-Variante). Der zweite Standard-Scanner von VirusTotal, der Webseiten auf Malware oder verdächtige Inhalte untersucht, sobald ein Link dort geprüft wird. Kann bei vorliegender Hostvalidierung sinnvoll sein.
170.Mozilla/5.0 (newsdash; +local)Lokales Nachrichten-Dashboard-Skript ("+local") zum Abrufen von RSS- oder Web-Inhalten. Keinerlei Wert, raus.
171.Mozilla/5.0 (Pentestas-Discovery/1.0; +https://pentestas.com/discovery)Automatisierter Pentesting- und Asset-Discovery-Scanner (pentestas.com), sucht nach offenen Diensten und Webseiten-Strukturen. Wertlos, raus.
172.Mozilla/5.0 (ThreatIntelAgent/1.0)Threat-Intelligence-Agent, scannt wohl Webseiten im Rahmen von Sicherheits- und Bedrohungsanalysen - oder für sonst was. Keinerlei Wert, weg damit.
173.Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/128.0 Safari/537.36 TransixProspector/1.0TransixProspector – Ein automatisierter Sales-Prospecting- und Lead-Generierungs-Bot, der sich hinter einem Standard-Chrome-UA versteckt. Traffic-Müll, blocked.
174.Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/135.0.0.0 Safari/537.36 StockerNewsBot/1.0Finanz- und Börsen-News-Bot (StockerNewsBot), zieht Markt- und Aktienartikel mit Browser-Tarnung ab. Auf jeden Fall Sperre.
175.Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/136.0.0.0 Safari/537.36 KR-InfoRadar/1.0Monitoring- und Informations-Radar-Bot, scannt Webseiten wahrscheinlich auf Aktualisierungen. Keine Kunst, kann weg.
176.Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/140.0.0.0 Safari/537.36 Edg/140.0.0.0; 360SpiderBekannte chinesische Suchmaschine/Scraper, die für extrem aggressives Crawling ohne nennenswerten europäischen Such-Traffic berüchtigt ist. Blocked!
177.Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 Chrome/131 Safari/537.36 CodexProductMonitor/1.0E-Commerce-Produkt- und Preisüberwachungs-Bot (CodexProductMonitor). Weder für Seiten-, noch für Shopbetreiber sinnvoll, da niemand weiß, ob die Preise nicht einfach an die Konkurrenz zur Unterbietung verscherbelt werden. Wenn nicht explizit bestellt, blocked.
178.Mozilla/5.0 (Windows NT 10.0; Win64; x64; trendictionbot0.5.0; trendiction search; http://www.trendiction.de/bot; please let us know of any problems; web at trendiction.com) Gecko/20100101 Firefox/125.0Media-Monitoring- und Social-Listening-Crawler (Trendiction/Digimarc), durchsucht das Netz nach Marken- und Nachrichten-Erwähnungen. Wertlos bis risikoreich, raus.
179.Mozilla/5.0 (X11; Linux x86_64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/151.0.7922.34 Safari/537.36 FixBeforeLaunchBot/0.1 (+https://fixbeforelaunch.com/bot; readiness scanner)Launch-Readiness-Scanner (fixbeforelaunch.com), prüft Webseiten-Konfigurationen vor Veröffentlichungen. Unnötiger Traffic, blocked.
180.Mozilla/5.0 (X11; Linux x86_64) AppleWebKit/537.36 (KHTML, like Gecko; GeedoShopProductFinder) Chrome/142.0.0.0 Safari/537.36E-Commerce-Produktfindungs-Bot (GeedoShopProductFinder), scannt Online-Shops nach Produkten und Preisdaten. Sehr penetrant, hört erst auf wenn es einen 301 gibt. Raus mit dem Müll.
181.Mozilla/5.0 (X11; Linux x86_64) AppleWebKit/537.36 (KHTML, like Gecko) HeadlessChrome/134.0.6998.35 Safari/537.36Unbekannter Headless-Chrome-Browser ohne Zweckangabe. Wird oft von generischen Scrapern oder Automatisierungsskripten genutzt. Illegitimer Traffic, suspekt, sperren!
182.Mozilla/5.0 (X11; Linux x86_64) AppleWebKit/537.36 (KHTML, like Gecko) HeadlessChrome/151.0.7922.71 Safari/537.36 WP.com mShotsAutomatischer Screenshot-Generator von WordPress. Im Prinzip unnötig, vor allem wenn man gar kein QP betreibt.
183.Mozilla/5.0 (X11; Linux x86_64) OpenClaw-NewsPPT/1.0News-Aggregator- und Präsentations-Bot (OpenClaw-NewsPPT), extrahiert wohl Nachrichten für Content-Zusammenfassungen. Verhindert also eher einen Seitenaufruf als Besucher zu bringen. Pest, weg damit.
184.MuutedFeedFetcher/1.0 (+https://muuted.com/bot; support@muuted.com)Social-Media- und Content-Monitoring-Bot (muuted.com), ruft Feeds und Webseiten-Inhalte für Analysen ab. Unnötiger Traffic, blocked.
185.MyNews/0.1 (personal news aggregator; +https://github.com/mynews)Persönlicher Open-Source-Nachrichten-Aggregator (GitHub / MyNews), ruft wohl Feeds für den Eigenbedarf ab. Typ, wenn du ernsthaft Interesse an den Inhalten hast komm selbst vorbei, Faulheit wird nicht unterstützt. Blocked!
186.n8nWorkflow-Automatisierung. Unnötiger und sinnloser Traffic. Block.
187.newspaper/0.2.8Python-Scraping- und Artikel-Parser-Bibliothek (newspaper3k). Wird von benutzerdefinierten Skripten genutzt, um Nachrichtentexte auszulesen - wer weiß, wofür. Blocked!
188.newspaper/0.3.0Python-Scraping- und Artikel-Parser-Bibliothek (newspaper3k). Wird von benutzerdefinierten Skripten genutzt, um Nachrichtentexte auszulesen - wer weiß, wofür. Blocked!
189.nodeStandard-User-Agent einer nackten Node.js-Anwendung (ohne spezifische Kennung). Wird oft von Entwicklerskripten oder einfachen Abfragen verwendet. Da kein Zweck ersichtlich, weg damit und blocked.
190.Novan-Research/0.1 (+novan)Wohl Datenanalyse-Bot (Novan-Research), sammelt spezifische Webinhalte. Kein Mehrwert, raus.
191.okf-engine-capture/1.0Automatisiertes Engine-Capture- und Screenshot-Tool, erfasst Webinhalte oder visuelle Daten. Endzweck unklar, darum weg damit.
192.okhttp/5.4.0Standard-HTTP-Client für Java und Android (OkHttp). Wird von mobilen Apps oder Backend-Diensten genutzt, die direkt Anfragen stellen. Endzweck unklar, darum weg damit.
193.omni-mvp/0.1 (personal research aggregator; +https://github.com/)Persönliches Open-Source-Recherche- und Aggregations-Skript (GitHub / MVP). Komm selbst vorbei. Sperre.
194.openmagpie/1.0 (+https://github.com/obris-dev/openmagpie)Open-Source-Inhalts-Extraktor (openmagpie auf GitHub), liest Webseiten- und News-Daten aus. Scraping für Arme, blocked.
195.OpportunityRadar/0.1 (private local research)Lokaler Recherche- und Analyse-Bot für Markt- oder Geschäftschancen ("OpportunityRadar"). Müll, weg.
196.Pandalytics/2.0 (https://domainsbot.com/pandalytics/)Schnüffelt in Deception Folder, in denen weder User noch Bots etwas verloren hätten. Blocked!
197.Pandalytics/2.0 (+https://domainsbot.com/network-crawler-pandalytics-kdc68dhsbd/)Schnüffelt in Deception Folder, in denen weder User noch Bots etwas verloren hätten. Blocked!
198.PipericBot/1.0 (+https://piperic.com/bot)Kommerzieller oder analytischer Web-Crawler (piperic.com) oder beides. Unnützer Schrott, raus.
199.primal-kernel/0.1Benutzerdefiniertes Python-Nachrichten-Export-Skript (Primal Kernel / pyprimalnews), sammelt wohl Artikeldaten. Kein Mehrwert, Sperre.
200.primal-kernel/0.1, pyprimalnews-export/1.0Benutzerdefiniertes Python-Nachrichten-Export-Skript (Primal Kernel / pyprimalnews), sammelt wohl Artikeldaten. Kein Mehrwert, Sperre.
201.Protopage/3.0 (http://www.protopage.com)Personalisierter Web-Desktop und RSS-Reader (Protopage), ruft abonnierte Feeds und Widget-Daten für Nutzer ab - auch ungefragt über andere Seiten wie HN. Raus.
202.PTRagent/1Technischer DNS- und PTR-Prüf-Agent, führt Netzwerk- oder IP-Zuordnungs-Tests durch. Wertlos, blocked.
203.pulsed/0.4.0 readability-probeLesbarkeits- und Inhalts-Analyse-Bot (pulsed), prüft Webseiten auf lesbare Textstrukturen. Müll-Traffic, raus.
204.PulseGate-Indexer/1.0 (+https://www.pulsegate.ai/bot)KI- und Daten-Indexer (pulsegate.ai), crawlt Webseiten zur Einspeisung in Analyse-Plattformen. ScrapTrap Payment Enforcement-Block.
205.PulseWatchBot/0.1 (+public reputation monitoring; contact configured by operator)Öffentlicher Reputations- und Monitoring-Bot (PulseWatch), scannt Websites auf Markenwähnungen. Wertlos, blocked.
206.PUMPKN Research hello@pumpkn.aiDaten-Crawler (PUMPKN Research), sammelt Web-Inhalte für Analysen, offensichtlich für KI-Zwecke - darum ScrapTrap Payment Enforcement-Sperre.
207.PWAsAppBot/1.0 (+https://pwas.app/)PWA-Erkennungs- und Analyse-Bot (pwas.app), scannt Webseiten auf Progressive-Web-App-Funktionen. Sinnloser Müll-Traffic, sperren.
208.python-httpx/0.28.1Standard-User-Agent der modernen Python-HTTP-Bibliothek (HTTPX). Wird von benutzerdefinierten Skripten oder API-Clients verwendet. Suspekt, Sperre.
209.python-requests/2.28.2Standard-User-Agent der Python-Requests-Bibliothek in verschiedenen Versionen. Stammt von nackten Programmierskripten oder Automatisierungen. Suspekt, Sperre.
210.python-requests/2.32.4Standard-User-Agent der Python-Requests-Bibliothek in verschiedenen Versionen. Stammt von nackten Programmierskripten oder Automatisierungen. Suspekt, Sperre.
211.python-requests/2.32.5Standard-User-Agent der Python-Requests-Bibliothek in verschiedenen Versionen. Stammt von nackten Programmierskripten oder Automatisierungen. Suspekt, Sperre.
212.Python/3.12 aiohttp/3.13.5Asynchroner Python-HTTP-Client (aiohttp auf Python 3.12). Wird für performante, programmgesteuerte Web-Abfragen genutzt. Trotzdem verdächtig, raus.
213.Readybot.io (https://readybot.io/webmasters)Discord-Nachrichtenfeed-Bot. Kommerziell, gehört zu Superhuman. Block.
214.rss-portal/0.1RSS-Portal- und Aggregations-Skript, ruft Feeds für Nachrichtenseiten oder Portale ab. Unnütz.
215.RSS-Sweep/2.0 (Content Extractor)Automatisierter Content-Extractor und RSS-Crawler (RSS-Sweep), liest Artikelinhalte aus. Im Prinzip unerwünschtes Scraping, weg mit dem Müll.
216.rss/4.5.6Generischer RSS-Client oder Feed-Abruf-Skript mit einfacher Versionskennung. Unnütz. Raus.
217.RSSPoller/1.0Automatisierter RSS-Poller, prüft Webseiten periodisch auf neue Feed-Einträge. Unnötiger Traffic, raus.
218.RubyStandard-User-Agent der Ruby-Programmiersprache (Net::HTTP). Stammt von nackten Entwicklerskripten oder API-Aufrufen. Wird sehr häufig für SQLi-Angriffe verwendet. Raus mit dem Schrott.
219.SallyProspecting/1.0 (public feedback qualification)Tarnt sich als "Public Feedback Qualification", will aber im Grunde nur für Sales-Outreach qualifizieren. Taucht oft zusammen mit Hermes-SallyPageFetch/1.0 auf.
220.ScourRSSBot/1.0 (+https://scour.ing/bot)Automatisierter RSS- und Content-Sammelbot (scour.ing). Genauer Zweck unklar, suspekt, raus.
221.Scrapy/2.16.0 (+https://scrapy.org)Standard-User-Agent des Python-Web-Scraping-Frameworks Scrapy. Wird von Extraktions-Skripten verwendet, oft in Verbindung mit SQLi-Tests. Müll, weg.
222.ScryBot/1.0 (+https://scry.io; ethical public-content crawler)Kommerzieller Content-Crawler (Scry.io), sammelt öffentliche Web-Inhalte (tarnt sich als "ethisch"). Letztendlich Content-Klau, blocked.
223.SearchEngine/1.0 (+https://search.tuna-lizard.ts.net/about)Eventuell private oder experimentelle Suchmaschinen-Instanz (über Tailscale-Netzwerk angebunden). Zweck unklar, suspekt, raus.
224.siteglass-intel/1.0 (+https://siteglass.io)Webseiten-Intelligence- und Analyse-Bot (siteglass.io), sammelt technische Daten und Kennzahlen. Bestimmt nicht für soziale Zwecke, weg damit.
225.siteradar/0.1 contact: ops@yyai.studioWebseiten-Radar- und Analyse-Bot (yyai.studio), scannt URLs für Datenerfassungen. Wahrscheinlich für Content-Klau-Vorbereitung. Weg mit Schaden und ScrapTrap Payment Enforcement-Sperre.
226.Sitetals-Compliance-Scanner/1.0 (+https://sitetals.com/scanner)Compliance- und Richtlinien-Scanner (sitetals.com), prüft Webseiten auf rechtliche oder technische Vorgaben - was ihn einen Dreck angeht, blocked.
227.SituationAnalysis/1.0 (article fetch; situation-analysis)Artikel-Abruf-Skript für Lage- und Nachrichtenanalysen (SituationAnalysis). Soll sich selbst analysieren, unnützer Traffic und Serverbelastung, weg.
228.Slackbot-LinkExpanding 1.0 (+https://api.slack.com/robots)Offizieller Link-Vorschau-Bot von Slack. Kommt hier allerdings nicht durch Slack-Shares, sondern wird automatisiert getriggert, sobald Links in Communities wie Hacker News (HN) auftauchen. Ansichtssache.
229.SoftNews/0.1 (+https://github.com/softnews)Open-Source-Nachrichten-Aggregator (GitHub / SoftNews), ruft Artikeldaten ab. Unnütz, blocked.
230.SpaceCowboys Android RSS Reader / 2.22.0(4050)Android-RSS-Reader-App ("SpaceCowboys"), ruft abonnierte Feeds für mobile Nutzer ab. Ansichtssache.
231.stealth-lab-trends/1.0 (by /u/manougv)Wohl persönlicher Trend-Analyse-Bot eines Reddit-Nutzers (stealth-lab-trends). Braucht keiner, Sperre.
232.SuperfluidityBot/1.0 (+https://superfluidity.ai/bot)KI- und Datenanalyse-Bot (superfluidity.ai), crawlt Webseiten für maschinelle Auswertungen. Also auch nur KI-Scraping, ScrapTrap Payment Enforcement-Block.
233.TALOS/1.0 (+intelligence platform; contact via source owner)Sicherheits- und Threat-Intelligence-Plattform (TALOS), scannt Webseiten und IP-Infrastrukturen auf Bedrohungen. Soll sich selbst scannen, kein Mehrwert, blocked.
234.TechFeed/1.0Technologie-Nachrichten-Aggregator (TechFeed), zieht Artikel für News-Feeds ab. Ansichtssache.
235.TechFeedBot/1.0 (Lambda; content-aggregator)Cloud-basierter Content-Aggregator (über AWS Lambda laufender TechFeedBot), sammelt technologische Inhalte. Genauer Zweck unklar, blocked.
236.timing-research/1 (contact: gn@gabornyeki.com)Marktforschungs-Bot (timing-research.com), analysiert Webinhalte für datengetriebene Auswertungen. Verdient also Geld mit den Daten anderer ohne Beteiligung oder Nachfrage. Parasitär, blocked.
237.Tiny Tiny RSS/25.02-169ff6de (https://tt-rss.org/)Selfhosted Reader. Ansichtssache.
238.touchstone/0.1 (+personal feed reader)Persönlicher Feed-Reader zum Abrufen von RSS-Inhalten für den Eigenbedarf. Komm selbst vorbei. Blocked.
239.trafilatura/1.12.2 (+https://github.com/adbar/trafilatura)Python-Bibliothek für Web-Extraktion und Text-Mining (Trafilatura). Wird von Skripten genutzt, um Hauptinhalte von Webseiten zu trennen. Letzendlich ungefragte Content-Aneignung. Blocked.
240.trend-pulse/hn-enrichTrend-Analyse-Skript zur Anreicherung und Auswertung von Hacker-News-bezogenen Inhalten. Braucht keiner, weg.
241.Turnitin (https://bit.ly/2UvnfoQ)Plagiats-Scanner, der ganze Webseiten spiegelt, um sie mit studentischen Arbeiten oder Wikipedia-Texten abzugleichen. So wird der Seitenbetreiber im Zweifelsfall gleich zweimal beklaut. Blocked.
242.twitter-reader-paper-resolverEchter Zweck unklar. Suspekt, Sperre.
243.ucp-crawler/0.1 (+https://github.com/huckleberry-inc/ucp-crawler)Huckleberry, Inc. - Shopify-Apps und E-Commerce-Tools. Verursacht unnötigen Traffic auf Nicht-Shopify-Seiten, weg damit.
244.uk-nhs-data/0.0 (internal fraud-research)Ein extrem dreist gefälschter UA, der versucht, sich als interne Betrugsbekämpfung des britischen Gesundheitssystems (NHS) zu tarnen. Suspekt bis schädlich, Sperre!
245.undiciStandard-HTTP/Fetch-Client von Node.js (Undici). Stammt von modernen, ungebrandeten Backend-Skripten oder API-Abfragen. Zweck unklar, suspekt, raus.
246.vegapunk-collector/1.0 (+HN trend research)Trend-Bot zur Auswertung von Hacker-News-bezogenen Projekten und Webseiten. Absolut null Mehrwert, raus.
247.vibelaunched/1.0 (+https://vibelaunched.com; market-scan bot)Ein weiterer Markt-SuchBot, der frisch gelaunchte Seiten abklappert, um sie in Launch-Verzeichnisse oder Lead-Datenbanken zu zerren. Weg mit Schrott.
248.visionheight.com/scan Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) Chrome/126.0.0.0 Safari/537.36Technischer Website-Scanner von visionheight.com mit getarnter Browser-Kennung (Mac/Chrome). Null Sinn, null Mehrwert, null legitim. Schrott, der weg muss.
249.vroni-job-signals/1.0 (+manual review)Datenabgriff für Vertriebs- oder Investment-Datenbanken. Völlig überflüssiger Müll, Sperre.
250.w3m/0.5.6Terminal-Textbrowser. Ansichtssache.
251.wp2shellEin automatisierter Scanner/Exploit-Striker, der nach Schwachstellen in WordPress sucht, um Web-Shells abzulegen.
252.wedgemap-crawler/1.0 (launch trend research)Launch- und Trend-Crawler (wedgemap.com), durchsucht das Netz nach neu veröffentlichten Projekten und Websites. Ansichtssache.