By submitting, you consent to our use of your data. Privacy Policy.
Kategorie
Geschäftsführung
Erstellt von
Beam.ai
Rufen Sie eine Seite über das r.jina.ai-Präfix von Jina Reader auf und erhalten Sie LLM-bereiten Text anstelle von rohem HTML, sodass ein Agent das manuelle Parsen von Markup überspringen kann.
URL-zu-Text-Konvertierung via r.jina.ai
Jina Reader konvertiert eine normale Webadresse mithilfe des Präfixes „r.jina.ai“ in eine LLM-freundliche Antwort und gibt den Inhalt der Seite als Text anstelle von rohem HTML-Markup zurück. Ein Beam AI Agent nutzt dies, wenn ein Workflow den Inhalt einer Seite benötigt – wie einen Artikel, eine Produktseite oder eine Dokumentationsseite –, ohne selbst Tags oder Skripte parsen zu müssen. Der Agent ruft den konvertierten Text ab und schreibt ihn in den Datensatz oder das Feld, in dem der Workflow ihn benötigt, beispielsweise in eine Recherchenotiz. Seiten, die einen Fehler, einen Paywall-Hinweis oder eine unerwartet kurze Ausgabe zurückgeben, werden markiert und zur manuellen Überprüfung an eine Person weitergeleitet.
Ausgabe im Markdown-Stil für LLM-Input
Anstatt rohes HTML an ein Sprachmodell zu übergeben, formatiert Jina Reader den Inhalt einer Seite in ein einfacheres Layout im Markdown-Stil um, wodurch Überschriften und Absätze lesbar bleiben. Ein Beam AI Agent fordert diese Version an, wenn ein nachgelagerter Schritt, wie eine Zusammenfassung oder eine Klassifizierung, einfachen Input anstelle von Tags und Skripten benötigt. Der formatierte Text wird in das vom Workflow erwartete Feld oder Dokument geschrieben – bereit für den nächsten Schritt, ganz ohne manuelle Bereinigung. Seiten, die größtenteils leer zurückgegeben werden, hauptsächlich Navigationsdaten enthalten oder den erwarteten Inhalt vermissen lassen, werden aussortiert und an eine Person weitergeleitet, die die Originalseite öffnet und prüft, was schiefgelaufen ist.
Scraping-freier Inhaltszugriff
Da Jina Reader den Abruf und die Bereinigung einer Seite übernimmt, benötigt ein Beam AI Agent keine eigene Scraping-Logik oder einen Headless-Browser, um den Inhalt einer Seite abzurufen. Der Agent fordert eine URL über das Präfix „r.jina.ai“ nach Zeitplan oder beim Erscheinen eines neuen Links in einer Warteschlange an und wendet die freigegebene Regel für die nächsten Schritte an, wie das Speichern des Textes in einem Dokument oder den Vergleich mit einer vorherigen Version. Wenn der Inhalt den Erwartungen entspricht, wird der Datensatz ohne menschliches Zutun aktualisiert. Falls sich die Struktur einer Seite geändert hat oder sie nichts Verwertbares zurückgibt, wird sie zuerst an eine Person weitergeleitet.







