By submitting, you consent to our use of your data. Privacy Policy.
Kategorie
Technologie
Erstellt von
Beam.ai
Rufen Sie strukturierte Daten von jeder beliebigen Webseite via FireCrawl ab und automatisieren Sie Recherchearbeiten wie das Erstellen von Briefing-Dokumenten.
Scraping einzelner Seiten
FireCrawl nimmt eine URL entgegen und gibt den Inhalt der Seite als sauberes Markdown oder strukturierte Daten zurück. Dabei übernimmt es das Rendering, sodass ein Beam-Agent keinen eigenen Browser benötigt. Ein Beam-Agent greift ein, wenn ein Link aus einer freigegebenen Quelle eintrifft, z. B. aus einer Rechercheanfrage oder einer Liste überwachter Seiten. Er liest die URL aus und ruft FireCrawl auf, um den Inhalt gemäß den freigegebenen Crawling-Einstellungen des Kontos abzurufen. Der Agent schreibt den zurückgegebenen Inhalt in den anfragenden Datensatz oder das Dokument. Seiten, die einen Fehler zurückgeben, ein Login erfordern oder hinter einer Paywall liegen, werden an einen Menschen weitergeleitet, um sie manuell abzurufen.
Crawling kompletter Websites
FireCrawl kann eine gesamte Website crawlen, indem es internen Links von einer Startseite aus folgt und den Inhalt für jede erreichte Seite innerhalb festgelegter Grenzen zurückgibt. Ein Beam-Agent startet einen vollständigen Crawl, wenn eine freigegebene Rechercheaufgabe eine komplette Website statt nur einer einzelnen Seite erfordert. Er liest die Start-URL sowie das Tiefenlimit aus und startet den Crawl unter den freigegebenen Einstellungen des Kontos. Nach Abschluss stellt der Agent die zurückgegebenen Seiten im angeforderten Dokument oder Datensatz zusammen. Websites, die das Crawling blockieren, das vereinbarte Seitenlimit überschreiten oder hauptsächlich irrelevante Seiten zurückgeben, werden an einen Menschen weitergeleitet, um den Umfang anzupassen.
Strukturierte Datenextraktion
FireCrawl kann bestimmte Felder, wie einen Preis oder einen Titel, aus dem Inhalt einer Seite extrahieren. Dabei wird ein vom Konto definiertes Schema verwendet, anstatt unstrukturierter Rohtext zurückgegeben. Ein Beam-Agent wird aktiv, wenn eine Seite einen bestimmten Wert für einen nachgelagerten Datensatz benötigt. Er liest die URL sowie das freigegebene Schema aus und ruft FireCrawl auf, um nur diese Felder zurückzugeben. Der Agent schreibt die extrahierten Werte in den Zieldatensatz. Seiten, die nicht in das Schema passen, leere Felder zurückgeben oder ein neues Schema erfordern, werden an einen Menschen weitergeleitet, damit dieser das Schema definiert, bevor der Agent fortfährt.







