Schichten
Tracing, Evaluation und Product Analytics
Drei Fragen auf demselben agentischen Lauf — keine austauschbaren Tools.
Tools sind keine Schichten
Teams behandeln Trace-Tools, Eval-Suites und Produkt-Dashboards oft als Ersatz füreinander. Tun sie nicht. Jede beantwortet eine andere Frage auf demselben Lauf. Rankings um einen Slot verdecken die Lücke. Du brauchst weiter Detail zur Ausführung, Signale zur Qualität und ein genanntes Job-Ergebnis. Zusammen.
Tracing — was ist gelaufen?
Tracing zeichnet den Runtime-Pfad auf. Du bekommst Spans für Schritte und Tools. Dazu Model-Calls, Retries, Timing und Fehler. Es beantwortet, ob Graph oder Pipeline wie geplant gelaufen ist. Ein grüner Trace ist nötiger Beleg der Ausführung. Er sagt allein nicht, ob der Produkt-Job erfolgreich war.
Hier beginnt das Beobachten von Agenten meist. Dedizierte Trace-Tools sind hier am stärksten. Behalte diese Schicht. Verlange von ihr nicht, Outcomes zu ersetzen.
Evaluation — Qualität vs. Kriterien?
Evaluation bewertet Outputs gegen Kriterien. Das können Rubriken, feste Datasets, Offline-Suiten und Online-Judges oder Scores sein. Sie sagt, wie gut das Ergebnis vs. einem Standard aussieht. Ein hoher Eval-Score kann neben einem verfehlten Produktziel stehen. Das passiert, wenn Rubrik und Job-Regel nicht passen.
Eval-Tools gehören neben Tracing. Keine der beiden Schichten sagt klar fürs Produkt, ob der Lauf den Job erreicht hat, für den du ausgeliefert hast.
Product Analytics — war der deklarierte Job erledigt?
Produkt-Outcomes stellen eine dritte Frage. Hat dieser Lauf das Ziel erreicht, das du genannt hast — mit Evidenz, die du prüfen kannst? Das heißt: ein Ziel neben dem Code. Pass oder Fail an Feldern auf dem Lauf. Wenn sinnvoll, Spend an derselben Lauf-ID.
HTTP 200 kann stimmen. Fertige Spans können stimmen. Ein guter Rubrik-Score kann stimmen. Die Antwort kann trotzdem leer sein. Oder ohne Beleg. Oder außerhalb des Contracts. Analytics zu Outcomes schließt diese Lücke. Sie ersetzt keine Traces und keine Evals.
Wie sie zusammenpassen — eine Karte, kein Ranking
Denk in Schichten auf einer Lauf-ID. Kosten sitzen zwischen Ausführung und Outcomes. Spend bedeutet erst etwas, wenn er mit dem verknüpft ist, was der Lauf erreicht hat. Das Diagramm ist eine Karte der Fragen. Keine Rangliste von Tools.
Wo Witdem sitzt
Witdem fokussiert die Outcomes-Schicht. Das heißt: genannte Produktziele, Belege auf dem Lauf und Spend an diesem Job. Peers wie Langfuse, LangSmith und Arize Phoenix decken oft Tracing und große Teile der Evaluation ab. Nutze sie für das, was sie gut können. Ergänze Outcomes auf demselben Lauf. Behandle kein einzelnes Produkt als den ganzen Stack.
Witdem ersetzt keine Tracing- oder Eval-Plattform. Die sinnvolle Einordnung ist komplementär. Traces und Scores zeigen, wie der Lauf sich verhalten hat. Outcomes beantworten, ob der ausgelieferte Job gehalten hat.
Was das in der Praxis heißt
Stell dir einen Agent-Lauf von Start bis Ende vor. Du stellst drei kurze Fragen auf demselben Lauf. Was ist gelaufen? Wie gut war es vs. Kriterien? War der genannte Job erledigt?
Zuerst kommt Tracing. Du siehst Schritte, Tools, Models und Fehler. Ein grüner Pfad sagt hier nur: Der Code ist fertig.
Dann kommt Evaluation. Du bewertest den Output gegen Kriterien, die du gewählt hast. Ein hoher Score braucht trotzdem einen Job, den du vorher genannt hast.
Zuletzt kommt das Produktziel. Du fragst, ob das Ziel gehalten hat, das du aufgeschrieben hast. Du behältst Felder, die das zeigen. Hänge Spend an dieselbe Lauf-ID, wenn Kosten-Reviews zählen.
FAQ
Sind Tracing und Product Analytics dasselbe? Nein. Tracing zeigt, was gelaufen ist. Product Analytics fragt, ob der Job, den du genannt hast, erledigt wurde. Du brauchst beides auf demselben Lauf.
Ersetzen Eval-Scores ein Produktziel? Nein. Eval-Scores prüfen Qualität vs. Kriterien. Sie sagen allein nicht, ob das ausgelieferte Ziel gehalten hat.
Wo sitzt Witdem? Auf der Outcomes-Schicht: genannte Ziele, Evidenz und Spend×Job. Neben Tracing und Evaluation.
Soll ich ein Tool für alle Schichten wählen? Nein. Behalte starke Tracing- und Eval-Tools. Ergänze Outcomes auf derselben Lauf-ID.
Weiterführend
Witdem und Langfuse · Witdem und LangSmith · Witdem und Arize Phoenix · Observability für agentische Workflows
Framework-Leitfäden: Haystack · LangGraph · LangChain · OpenAI Agents