By submitting, you consent to our use of your data. Privacy Policy.
Kategorie
Geschäftsführung
Erstellt von
Beam.ai
Bewerten Sie LLM-Antworten anhand freigegebener Testfälle und übertragen Sie die Ergebnisse direkt nach Langfuse – so automatisieren Sie Evaluierungsschritte, die Entwickler sonst manuell prüfen müssten.
LLM-Aufruf-Tracing
Langfuse zeichnet jeden Aufruf auf, den eine Anwendung an ein Sprachmodell richtet, einschließlich des gesendeten Prompts, der erhaltenen Antwort und der dafür benötigten Zeit. Ein Beam AI Agent liest diese Traces nach einem festen Zeitplan aus, gleicht sie mit dem genehmigten Latenz- oder Fehlerratengrenzwert für diese Anwendung ab und aktualisiert ein gemeinsames Dashboard, sodass Ingenieure Langfuse nicht direkt abfragen müssen. Wenn eine Reihe von Aufrufen eine weitaus höhere Fehlerrate als üblich aufweist, markiert der Agent das Muster, anstatt irgendetwas neu zu starten. Ein Mensch untersucht anschließend, ob sich das Modell, der Prompt oder die zugrunde liegenden Daten geändert haben.
Prompt-Versionsverwaltung
Langfuse führt einen Versionsverlauf der von einer Anwendung verwendeten Prompts, damit Teams die Leistung einer Änderung mit der vorherigen Version vergleichen können. Ein Beam AI Agent liest eine neu genehmigte Prompt-Änderung aus einem verbundenen Repository und veröffentlicht sie als nächste Version in Langfuse, versehen mit dem Grund für die Änderung. Er vermerkt im Anwendungsdatensatz, welche Version nun aktiv ist. Eine Prompt-Änderung, die den Überprüfungsschritt des Teams noch nicht durchlaufen hat, wird zurückgehalten und an einen Menschen weitergeleitet, anstatt automatisch veröffentlicht zu werden.
Automatisierte Evaluierungsbewertung
Langfuse kann die Antworten eines Modells anhand einer Rubrik oder einer Referenzantwort bewerten und bietet so ein konsistentes Qualitätsmaß über viele Durchläufe hinweg. Ein Beam AI Agent liest neue Antworten bei deren Eingang aus, wendet die genehmigte Bewertungsregel für diese Anwendung an und erfasst die Bewertung für den jeweiligen Durchlauf in Langfuse. Er aktualisiert einen gemeinsamen Bericht, damit das Team die Qualität im Zeitverlauf verfolgen kann, ohne jeden Durchlauf manuell prüfen zu müssen. Antworten, die weit unter dem genehmigten Grenzwert liegen, werden an einen Menschen weitergeleitet, um zu prüfen, ob das Problem beim Modell, beim Prompt oder bei den Eingabedaten liegt.







