By submitting, you consent to our use of your data. Privacy Policy.
Kategorie
Technologie
Erstellt von
Beam.ai
Erfassen Sie HTML-Code von Seiten, die herkömmliche Anfragen blockieren, und schreiben Sie geparste Felder direkt in Ihre Datensätze – so automatisieren Sie Datenerfassungsprozesse wie das Auslesen von Produktseiten im großen Stil.
Blockadefreies Laden von HTML
ScrapingBot gibt den HTML-Code von Websites zurück, die einfache Anfragen blockieren. Ein Beam-Agent ruft ihn bei einem Trigger auf, liest das Markup und wendet Ihre Regel an, um festzulegen, welche Elemente beibehalten werden sollen. Bereinigte Werte werden in den von Ihnen angegebenen Datensatz geschrieben, wobei die Quell-URL angehängt wird. Wenn ein Abruf leer bleibt oder der erwartete Inhaltsblock fehlt, überspringt der Agent den Schreibvorgang und leitet die Seite an eine Person weiter. Diese prüft dann, ob sich das Layout geändert hat oder ob die Website automatisierten Besuchern eine andere Antwort liefert als zuvor.
Zielgerichtetes Content-Parsing
ScrapingBot kann sich auf bestimmte Seitentypen wie Produkt- oder Übersichtsseiten konzentrieren. Ein Beam-Agent liest die zurückgegebenen Felder, wendet Ihr freigegebenes Mapping an und schreibt Preise, Titel oder Lagerbestände in Ihren Katalogdatensatz. Jeder Schreibvorgang wird zur Rückverfolgbarkeit mit einem Erfassungszeitstempel versehen. Wenn ein Pflichtfeld fehlt oder ein Preis außerhalb des in Ihrer Regel festgelegten Bereichs liegt, hält der Agent die Zeile an und markiert sie für eine manuelle Überprüfung. So wird verhindert, dass fehlerhafte oder falsch formatierte Werte direkt in die Preisgestaltung, den Lagerbestand oder die darauf basierenden Berichte einfließen.
Wiederholungslogik bei Blockaden
ScrapingBot startet einen neuen Versuch, wenn eine Website eine Anfrage blockiert. Ein Beam-Agent wendet Ihre Wiederholungsregel an, liest den Status jedes Versuchs aus und rotiert die vom Connector unterstützten Methoden. Seiten, die schließlich geladen werden können, gehen in das Parsing und die Speicherung über, wobei die Anzahl der Versuche erfasst wird. Wenn eine Domain auch nach den zulässigen Wiederholungsversuchen blockiert, stoppt der Agent, protokolliert den Fehler und übergibt die Quelle an eine Person. Diese entscheidet dann, ob der Job pausiert, der Zeitplan angepasst oder akzeptiert wird, dass die Website unter der aktuellen Konfiguration und den vorliegenden Berechtigungen nicht zuverlässig erfasst werden kann.







