By submitting, you consent to our use of your data. Privacy Policy.
Kategorie
Geschäftsführung
Erstellt von
Beam.ai
Verarbeiten Sie Cerebras-Inferenzanfragen und Modellantworten, um Ihre KI-Abläufe zu automatisieren – inklusive der Überwachung des Anfragestatus und der automatischen Wiederholung fehlgeschlagener Aufrufe.
Modell-Inferenz mit geringer Latenz ausführen
Cerebras führt die Inferenz großer Sprachmodelle über eine auf Geschwindigkeit ausgelegte API aus und liefert Vervollständigungen auf einen Prompt mit sehr geringer Latenz. Ein Agent kann eine Anfrage senden, wenn ein Workflow ein Modell zur Generierung oder Bewertung von Text benötigt (z. B. beim Entwerfen einer Antwort oder beim Klassifizieren eines eingehenden Elements), und die Antwort lesen, sobald sie eingeht. Dies eignet sich für Workflows, bei denen eine Person oder ein nachgelagertes System in Echtzeit auf das Ergebnis wartet. Ergebnisse, die unsicher, unvollständig oder außerhalb der erwarteten Regeln liegen, werden an eine Person zur Überprüfung weitergeleitet, bevor darauf reagiert wird.
Anfragestatus und -nutzung überwachen
Jeder Aufruf von Cerebras liefert ein Ergebnis, das der Agent protokollieren kann, einschließlich der Information, ob die Anfrage erfolgreich war, wie lange sie gedauert hat und was sie im Vergleich zur Nutzung des Kontos verbraucht hat. Ein Agent verfolgt dies, sodass ein Team sehen kann, wie sich ein von Cerebras abhängiger Workflow im Laufe der Zeit verhält, ohne dass jemand ein Dashboard manuell überprüfen muss. Er zeichnet fehlgeschlagene Aufrufe mit dem zurückgegebenen Grund auf, sodass das Muster sichtbar wird und nicht unbemerkt bleibt. Wenn sich Fehler wiederholen, die Latenz über das vom Workflow erwartete Maß ansteigt oder die Nutzung an ein Limit des Kontos herankommt, meldet der Agent dies einer Person, anstatt die Versuche unbeaufsichtigt fortzusetzen.
Anfragen über verfügbare Modelle routen
Wenn ein Konto Zugriff auf mehr als ein Modell auf Cerebras hat, kann ein Agent basierend auf einer vom Team genehmigten Regel für die jeweilige Aufgabe auswählen, welches Modell aufgerufen werden soll – beispielsweise ein schnelleres Modell für Routineklassifizierungen und ein größeres für Aufgaben, die mehr logisches Denken erfordern. Wenn das bevorzugte Modell nicht verfügbar ist oder der Zugriff des Kontos es nicht abdeckt, weicht der Agent auf die genehmigte Alternative aus. Sollte kein geeignetes Modell verfügbar sein, leitet er die Anfrage an eine Person weiter.







