By submitting, you consent to our use of your data. Privacy Policy.
Kategorie
Technologie
Erstellt von
Beam.ai
Erfassen Sie strukturierte Seiten über Piloterr, schreiben Sie Ergebnisse in Scrape-Jobs und automatisieren Sie Erfassungsprozesse, wie beispielsweise die regelmäßige Aktualisierung von Datensätzen.
On-Demand-Scrape-Anfragen
Ein Beam AI Agent sendet eine Scrape-Anfrage an Piloterr, wenn sich eine Quell-URL oder ein Eintrag auf der Watchlist ändert, und liest dann das zurückgegebene Seiten-Payload aus. Er wendet Ihre genehmigte Parsing-Regel an, um die für Sie relevanten Felder herauszufiltern, und schreibt diese in den Zieldatensatz oder das Dataset. Bereinigte, exakt übereinstimmende Ergebnisse werden automatisch abgelegt, ohne dass jemand eingreifen muss. Wenn eine Seite unvollständiges Markup, blockierten Inhalt oder ein Layout zurückgibt, das die Regel nicht erkennt, hängt der Agent die Rohantwort an und leitet den Fall an eine Person weiter, die das Mapping bestätigt, bevor nachgelagerte Systeme auf Basis von Vermutungen aktualisiert werden.
Strukturiertes Feld-Mapping
Jeder Scrape liefert rohes HTML oder JSON, das selten mit Ihrem Schema übereinstimmt. Nach Abschluss eines Jobs liest der Agent die Antwort, wendet Ihr Feld-Mapping an, um Quellelemente in benannte Spalten zu übersetzen, und schreibt die Zielzeile mit typisierten Werten. Konsistente Zeilen mit hoher Validität werden ohne Prüfung gespeichert. Uneindeutige Felder, fehlende Schlüssel oder Werte, die eine Validierungsregel verletzen, werden zurückgehalten: Der Agent benachrichtigt einen Prüfer und zeigt das Original sowie das vorgeschlagene Mapping nebeneinander an, sodass ein Mensch entscheidet, wie der fehlerhafte Datensatz gespeichert werden soll, anstatt die Zuordnung dem Zufall zu überlassen.
Handhabung von Ratenbegrenzungen und Retries
Umfangreiche Crawls stoßen an Ratenbegrenzungen und temporäre Fehler. Wenn Piloterr eine Drosselung oder eine Fehlermeldung zurückgibt, liest der Agent den Status, wendet Ihre Retry-Regel an und plant die Anfrage innerhalb des zulässigen Zeitfensters neu, anstatt die Quelle ununterbrochen zu belasten. Erfolgreiche Wiederholungsversuche werden geräuschlos fortgesetzt und der Datensatz wird befüllt. Wiederholte Fehler, Probleme mit den Anmeldedaten oder eine Quelle, die Anfragen blockiert, unterbrechen das Muster. In diesem Fall pausiert der Agent den Job und eskaliert ihn inklusive Fehlerhistorie an einen Operator. So wird verhindert, dass ein blockierter Crawl unbemerkt Daten verliert, auf die Ihr Team pünktlich angewiesen ist.







