Um die Kosten eines KI-Agenten-Piloten zu messen, teilen Sie die für einen festgelegten Arbeitsstapel eingesetzten Ressourcen durch die Zahl der Ergebnisse, die bis zum Stichtag unabhängig abgenommen wurden. Berücksichtigen Sie Software, wiederholte Versuche, menschliche Prüfung und Fehlerbehebung. Zeigen Sie daneben Fertigstellung, Qualität und tatsächliche Ausgaben, damit eine billige, aber unfertige Aufgabe nicht als nutzbares Ergebnis erscheint.

Diese Kennzahl hilft Ihnen zu entscheiden, ob Sie den Piloten verlängern. Die Rechnung des Modellanbieters allein zeigt nicht, ob der Arbeitsablauf bezahlbar ist. Sie müssen auch wissen, welche Ergebnisse die Anforderungen erfüllen, was noch wartet und wer bei der Fertigstellung geholfen hat.

## Was sagt Pion über die Wirtschaftlichkeit von Agenten aus?

Pion erleichtert Experimente mit Agenten unter realen Bedingungen. Aus dem Produktstart lässt sich aber nicht ableiten, ob sich der Einsatz in Ihrem Unternehmen rechnet. Nehmen Sie ihn zum Anlass, einen klar begrenzten Arbeitsablauf sorgfältig zu messen.

Am 14. September stellte Andon Labs Pion als Forschungsvorschau für Experimente mit autonomen Unternehmen vor. Der Start führte zu einer regen [Diskussion auf Hacker News](https://news.ycombinator.com/item?id=49700477). Andon berichtete über Fortschritte bei seinen Automatenexperimenten; das Café und das Einzelhandelsgeschäft seien dagegen weiterhin unrentabel. Diese Ergebnisse stammen vom Entwickler und aus bestimmten Einsatzsituationen. Sie sind weder unabhängig geprüft noch eine Prognose für andere Unternehmen. [Andon Labs über den Start von Pion](https://andonlabs.com/blog/why-we-built-pion).

Diese Unterscheidung zählt, weil sich hinter *funktioniert* mehrere wirtschaftliche Fragen verbergen können. Erledigt das System eine Aufgabe? Deckt ein Verkauf die Kosten der verkauften Ware? Deckt der Betrieb seine laufenden Ausgaben? Spielt die Investition ihre Einrichtungskosten wieder ein? Wählen Sie die Frage, bevor Sie Zahlen sammeln.

Andons früherer Café-Bericht zeigt eine weitere Unterscheidung: Zutaten und Verpackung, Miete und Löhne, Lagerwert sowie Zahlungen an Lieferanten beschreiben unterschiedliche Teile des Geschäfts. Unverkaufte Ware kann ihren Wert behalten, während das Geld knapp wird. Keine dieser Perspektiven erklärt für sich den gesamten Betrieb. [Andons Café-Bericht](https://andonlabs.com/blog/why-gemini-lost-money-andon-cafe).

Schreiben Sie für Ihren Piloten die Entscheidungsfrage oben in die Tabelle: „Sollen wir diesen Arbeitsablauf unter diesen Bedingungen noch einmal durchführen?“ Forschung kann sich lohnen, obwohl ein Experiment Geld verliert. Eine kommerzielle Ausweitung braucht eigene Nachweise. Weisen Sie das Lernbudget sichtbar aus und bewerten Sie die laufenden Leistungskosten getrennt davon.

## Was gilt als abgenommenes Ergebnis?

Ein abgenommenes Ergebnis erfüllt schriftlich festgelegte Anforderungen und wurde unabhängig von der Fertigmeldung des Agenten geprüft. Legen Sie diese Anforderungen vor dem Start fest.

Anthropics Leitfaden zur Bewertung von Agenten unterscheidet zwischen dem Protokoll der Agentenaktionen und dem daraus entstandenen Systemzustand. Wiederholte Versuche gelten dort zudem als eigenständige Durchläufe. Das ist eine nützliche Messregel: Die Aussage des Agenten, eine Aufgabe sei erledigt, beweist noch nicht, dass das benötigte Ergebnis vorliegt. [Anthropics Leitfaden zur Agentenbewertung](https://www.anthropic.com/engineering/demystifying-evals-for-ai-agents).

Ein eigens für diesen Artikel entwickeltes Beispiel: Ihr Pilot bereitet Lieferantendatensätze aus bereits vorhandenen Dokumenten vor. Ein abgenommener Datensatz muss den richtigen Lieferanten nennen, die Pflichtfelder ausfüllen, das Belegdokument zuordnen und widersprüchliche Angaben kennzeichnen. Eine prüfende Person bestätigt diese Bedingungen, bevor sie den Datensatz für den nächsten Schritt freigibt. Dieser Vorbereitungspilot erteilt keine Zahlungsfreigaben und ändert keine Bankverbindungen.

Die Einheit ist ein nutzbarer Lieferantendatensatz. Dokumentseiten, Werkzeugaufrufe und Entwürfe sind Aktivitäten. Sie können sie erfassen, um Kosten zu untersuchen; die Zahl der abgenommenen Ergebnisse erhöhen sie nicht.

### Legen Sie Arbeitsstapel und Stichtag fest

Geben Sie jedem zugewiesenen Fall eine Kennung und erfassen Sie, wann er in den Piloten aufgenommen wurde. Behalten Sie den ursprünglichen Stapel bei, einschließlich schwieriger Fälle, die scheitern. Wenn Sie vor dem Start Fälle ausschließen, dokumentieren Sie die Auswahlregel. So beschreibt das spätere Ergebnis die tatsächlich getestete Arbeit.

Wählen Sie einen Stichtag, der dem tatsächlichen Bedarf entspricht. Ein später abgenommener Datensatz kann nachträglich nützlich werden, war aber zur ursprünglichen Frist nicht fertig. Bewahren Sie den ursprünglichen Stand auf und ergänzen Sie das spätere Ergebnis. Sonst verbessert jeder zusätzliche Tag die Kennzahl, ohne die Kosten des Wartens zu zeigen.

Verwenden Sie zum Stichtag drei Ergebniszustände: abgenommen, abgelehnt und offen. Ein abgelehntes Ergebnis erfüllt die Anforderungen nicht; für einen offenen Fall liegt noch kein endgültig abgenommenes Ergebnis vor. Halten Sie jeweils den Grund fest. So können Sie schlechte Ergebnisse von fehlenden Eingaben oder einem Rückstau bei der Prüfung unterscheiden.

## Was gehört in die Kostenaufstellung des Piloten?

Erfassen Sie die Ressourcen für den gesamten zugewiesenen Stapel, einschließlich der Arbeit, die nie abgenommen wird. Trennen Sie gezahlte Beträge vom Wert der dem Piloten zugerechneten Arbeitszeit.

Eine Tabelle mit Links zu bestehenden Unterlagen genügt für den Anfang.

| Eintrag | Was Sie erfassen | Was Sie damit prüfen |
|---|---|---|
| Zugewiesene Arbeit | Fallkennung, Eingangszeit, Aufgabentyp | Ob sich der Stapel verändert hat |
| Abnahme | Entscheidung, Zeitstempel, prüfende Person, Nachweise | Ob ein nutzbares Ergebnis vorliegt |
| Software | Anbieternutzung, Werkzeuggebühren, zugerechnete Abonnementkosten | Ressourcenverbrauch über alle Versuche hinweg |
| Menschlicher Aufwand | Zeit für Einrichtung, Prüfung und Fehlerbehebung | Arbeit außerhalb der Agentenaktivität |
| Offene Arbeit | Aktueller Stand, Grund, nächste zuständige Person | Welche Verpflichtungen noch offen sind |
| Zahlungsfluss | Rechnung, Zahlung, Gutschrift oder Zuschuss | Was tatsächlich ausgegeben wurde |
| Konfiguration | Modell, Anweisungen und relevante Werkzeugänderungen | Welche Konfiguration das Ergebnis erzeugt hat |

Trennen Sie die reguläre Prüfung von der Fehlerbehebung. Einen vorbereiteten Datensatz und seine Belege zu lesen, ist Prüfung. Nach einer falschen Zuordnung das richtige Dokument zu suchen, Felder zu berichtigen und die Aufgabe neu zu starten, ist Fehlerbehebung. Beides zählt; die Unterscheidung zeigt, wo sich Verbesserungen lohnen.

Menschliche Hilfe entwertet das Experiment nicht. Die zweite Phase von Project Vend berichtete über bessere Ergebnisse bei weiterhin bestehenden menschlichen Kaufprüfungen und anderer Unterstützung. Der öffentliche Bericht enthält keinen vollständigen Kostenabgleich. Daraus lassen sich weder umfassende Stückkosten ableiten noch lässt sich behaupten, eine bestimmte Kostenart sei ausgeschlossen worden. [Project Vend, Phase zwei](https://www.anthropic.com/research/project-vend-2).

### Erfassen Sie Unterbrechungen, ohne Beschäftigte zu überwachen

Bitten Sie die Beteiligten, ihre Zeit nach Tätigkeit und Stapel zu erfassen – mit ausreichend Angaben, um wiederkehrende Probleme zu erklären. Eine kurze Notiz wie „widersprüchliche Lieferantenidentität geklärt“ hilft mehr als eine Sammlung von Bildschirmfotos. Sammeln Sie keine privaten Nachrichten oder sachfremden Mitarbeiteraktivitäten, nur damit die Tabelle vollständig aussieht.

Kennzeichnen Sie Unsicherheit offen. Hat die Fehlerbehebung etwa eine Stunde gedauert, tragen Sie eine Schätzung ein. Wurde Arbeit auf mehrere Piloten verteilt, halten Sie die Verteilungsregel fest. Scheinbar genaue Summen aus unerklärten Schätzungen erschweren die nächste Entscheidung.

## Wie berechnen Sie die Kosten pro abgenommenem Ergebnis?

Addieren Sie die für den Stapel eingesetzten laufenden Ressourcen und teilen Sie die Summe durch die Zahl der bis zum Stichtag abgenommenen Ergebnisse. Weisen Sie die Einrichtung getrennt aus. So werden sowohl der laufende Betrieb als auch der gesamte Ressourcenbedarf des ersten Stapels sichtbar.

Das folgende Beispiel ist vollständig hypothetisch. Geldbeträge, Zeitaufwand, Arbeitsmenge und Abnahmezahlen sind erfunden, um die Rechnung zu veranschaulichen. Es handelt sich weder um Pion-Ergebnisse noch um Kit-Kundendaten oder einen Branchenvergleich. Alle Beträge sind beispielhaft in US-Dollar angegeben.

Ihr Pilot für Lieferantendatensätze erhält **100 Fälle**. Zum Stichtag sind **80 abgenommen, 12 offen und 8 abgelehnt**. Die laufenden KI- und Softwarekosten betragen insgesamt **200 $**. Beschäftigte verbringen **6 Stunden mit Prüfung** und **2 Stunden mit Fehlerbehebung**, bei einem angenommenen Personalkostensatz einschließlich Nebenkosten von **50 $ pro Stunde**.

Dieser Satz dient hier zur Zurechnung der Arbeitszeitkosten und umfasst die Beschäftigungskosten, die Sie einbeziehen möchten. Geben Sie Ihre eigene Definition an, wenn Sie diese Annahmen durch tatsächliche Aufzeichnungen ersetzen.

| Hypothetischer laufender Aufwand | Berechnung | Zugerechnete Kosten |
|---|---|---|
| KI und Software | Summe für den Stapel | 200 $ |
| Menschliche Prüfung | 6 Stunden × 50 $ | 300 $ |
| Fehlerbehebung | 2 Stunden × 50 $ | 100 $ |
| Laufende Ressourcen insgesamt | 200 $ + 300 $ + 100 $ | 600 $ |

**Laufende Kosten pro abgenommenem Ergebnis: 600 $ ÷ 80 = 7,50 $.**

Wenn kein Ergebnis abgenommen wurde, ist der Quotient nicht definiert. Weisen Sie die verbrauchten Ressourcen und null abgenommene Ergebnisse aus. Zeigen Sie keine Kosten von null an und verbergen Sie den gescheiterten Stapel nicht.

Teilen Sie die Softwarekosten durch die zugewiesenen Fälle, ergibt das **200 $ ÷ 100 = 2 $**. Das sind Softwarekosten pro zugewiesenem Fall. Menschlicher Aufwand fehlt; der Nenner enthält auch offene und abgelehnte Arbeit. Benennen Sie diese Kennzahl korrekt, wenn Sie sie ausweisen. Verwenden Sie sie aber nicht als Kostenangabe für abgenommene Ergebnisse.

### Zeigen Sie Einrichtung und Zahlungsfluss getrennt

Nehmen wir an, die anfängliche Einrichtung erfordert **10 Stunden zu 50 $**, also **500 $**. Damit steigt der gesamte Ressourcenbedarf des ersten Stapels auf **1.100 $**. Das ergibt **1.100 $ ÷ 80 = 13,75 $ pro abgenommenem Ergebnis**. Diese Zahl beschreibt den Verbrauch des ersten Stapels insgesamt; 7,50 $ stehen für seine laufenden Ressourcen ohne Einrichtung.

Für eine spätere Planung könnten Sie die Einrichtungskosten auf ein erwartetes Volumen verteilen. Zeigen Sie die Volumenannahme und die Folgen eines vorzeitigen Abbruchs. Rechnen Sie nicht den gesamten Einrichtungsbetrag und zusätzlich einen anteilig verteilten Teil desselben Betrags in eine Summe ein.

Diese zugerechneten Personalkosten sind nicht zwingend neue Zahlungen. Beschäftigte mit bestehenden Gehältern setzen weiterhin Zeit ein, doch der Pilot muss die Gehaltszahlungen nicht verändern. Führen Sie eine Spalte für tatsächliche Zahlungen und eine Ressourcenspalte für den umfassenderen Vergleich. Keine darf stillschweigend die andere ersetzen.

Pions Produktseite beschreibt Startguthaben in Form von Tokens für ausgewählte Ideen und ein vorgesehenes Modell zur Umsatzbeteiligung, ohne eine allgemein gültige numerische Gebühr zu nennen. Erfassen Sie jede Unterstützung, die Ihr Pilot tatsächlich erhält, einschließlich Ablaufdatum und Grenzen. Setzen Sie ein vorübergehendes Guthaben nicht mit dem Preis des laufenden Betriebs gleich. [Pions Produktseite](https://andonlabs.com/pion).

## Wie vergleichen Sie den Piloten mit dem heutigen Arbeitsablauf?

Vergleichen Sie ähnlich schwierige Arbeit unter denselben Abnahmeanforderungen und mit derselben Frist. Zeigen Sie unfertige Arbeit neben dem Kostenvergleich, damit niedrigere Stückkosten nicht verdecken, dass weniger Arbeit rechtzeitig fertig wird.

Im hypothetischen Vergleich nimmt der bisherige Arbeitsablauf **100 Datensätze in 20 Stunden zu 50 $ pro Stunde** ab. Die zugerechneten Ressourcen betragen **1.000 $**, also **10 $ pro abgenommenem Ergebnis**. Der laufende Wert des Piloten liegt mit 7,50 $ niedriger. Er hat aber nur 80 Datensätze abgenommen; einschließlich Einrichtung lag sein erster Stapel bei 13,75 $.

Damit liegen mehrere Befunde vor, kein Nachweis gleichwertiger Arbeitsabläufe. Der Pilot verbrauchte weniger zugerechnete laufende Ressourcen und lieferte bis zum Stichtag weniger abgenommene Ergebnisse. Für offene und abgelehnte Fälle brauchen Sie weiterhin einen Plan. Aussagen über Personalbedarf oder Einsparungen erfordern mehr Nachweise, als diese Tabelle liefert.

### Vergleichen Sie nach denselben Regeln

Berücksichtigen Sie Prüfung und Korrekturen im bisherigen Arbeitsablauf genauso wie im Piloten. Prüft heute eine Person die Arbeit einer anderen, gehört dieser Aufwand in die Vergleichsbasis. Werden menschliche Fehler später entdeckt, erfassen Sie auch diese. Messen Sie den Agenten nicht an Anforderungen, die für den Vergleich nie galten.

Wählen Sie vergleichbare Fallgruppen, bevor Sie Ergebnisse betrachten. Ein Pilot, der saubere Dokumente verarbeitet, während Beschäftigte fehlende Anhänge beschaffen, testet eine engere Aufgabenmenge. Das kann ein sinnvoller erster Versuch sein, solange die Schlussfolgerung innerhalb dieser Grenze bleibt.

Erfassen Sie außerdem, wer die Stunden geleistet hat. Weniger Bearbeitungszeit durch Junior-Kräfte bei gleichzeitig höherem Bedarf an knapper Fachprüfung kann für Ihr Team ein schlechter Tausch sein. Die durchschnittlichen Kosten können einen Engpass verdecken, der die Fertigstellung des nächsten Stapels verhindert.

### Prüfen Sie, ob die scheinbare Ersparnis übliche Änderungen übersteht

Führen Sie eine eigene Szenariospalte für veränderliche Annahmen: Unterstützung endet, die Prüfung dauert länger, die Fälle werden schwieriger oder die Einrichtung muss wiederholt werden. Ändern Sie jeweils nur eine Annahme, damit erkennbar bleibt, wovon die Entscheidung abhängt. Kennzeichnen Sie jede Prognose; mischen Sie Szenarien nicht in das beobachtete Pilotergebnis.

Frei werdende Stunden sind Kapazität, die Sie anderweitig nutzen könnten. Zu einer zahlungswirksamen Ersparnis werden sie erst, wenn sich eine tatsächliche Ausgabe ändert. Nutzen Sie für weitergehende Personalentscheidungen diese Nachweise zusammen mit der [Personalplanung für Menschen und KI-Agenten](/blog/headcount-planning-humans-ai-agents-new-hr-role), statt eine Zeitschätzung direkt in eine Entscheidung über eine offene Stelle zu übersetzen.

## Wann sollten Sie den Piloten verlängern, ändern oder stoppen?

Legen Sie vorab fest, welche Nachweise einen weiteren Stapel rechtfertigen. Kosten, Abnahme, Termintreue und nicht hinnehmbare Fehler brauchen eigene Bedingungen. Ein Durchschnitt kann nicht alle Fragen beantworten.

Im Lieferantenbeispiel würde eine falsche Bankverbindung, die in einen Zahlungsprozess gelangt, einen Stopp und eine Untersuchung erfordern – selbst bei attraktiven durchschnittlichen Kosten. Für schwere Fehler müssen ausdrückliche Regeln gelten. Ihre Kosten in einen Durchschnitt einzurechnen, macht das zugrunde liegende Risiko nicht akzeptabel.

Halten Sie zum Stichtag eine kurze Entscheidungsnotiz fest:

1. **Was wurde getestet?** Nennen Sie Stapel, Konfiguration, Auswahlregeln und Frist.
2. **Was wurde geliefert?** Führen Sie abgenommene, abgelehnte und offene Fälle mit Nachweisen und Gründen auf.
3. **Was wurde verbraucht?** Zeigen Sie Software, menschlichen Aufwand, Einrichtung und tatsächliche Ausgaben.
4. **Was bleibt offen?** Nennen Sie die Person, die ausstehende Arbeit fertigstellt oder berichtigt, und den Ort, an dem spätere Kosten erfasst werden.
5. **Wie geht es weiter?** Verlängern Sie mit derselben Konfiguration, ändern Sie einen bestimmten Teil oder stoppen Sie – jeweils mit Begründung und Prüftermin.

Wenn Sie Modell, Anweisungen oder Werkzeuge ändern, dokumentieren Sie die neue Konfiguration vor dem nächsten Stapel. Bessere Ergebnisse nach mehreren Änderungen sagen etwas über das überarbeitete System aus. Welche einzelne Änderung zur Verbesserung geführt hat, zeigen sie nicht.

Fehlende Nachweise sind ebenfalls ein Ergebnis. Wenn niemand die Prüfzeit rekonstruieren oder die Abnahme bestätigen kann, verbessern Sie zuerst die Messung, bevor Sie eine größere Ausweitung beschließen. Sie können dennoch berichten, was Sie gelernt haben und welche Ausgaben dafür anfielen.

Mit wachsendem Pilotumfang hängt der Betrieb zunehmend von verfügbaren Prüfern ab. Liegt dort Ihr Engpass, behandelt der separate Leitfaden zum [Aufbau eines Teams für menschliche Prüfung](/blog/mturk-shutdown-human-in-the-loop-team) die personelle Kontinuität. Behalten Sie in der Kostentabelle die einfachere Frage bei: Wie viel qualifizierte menschliche Arbeit erforderte dieser Stapel?

## Was kann Kit zu den Kostennachweisen beitragen?

Nutzungsdaten können einen Teil der Kostenaufstellung liefern. Abgenommene Ergebnisse und menschlicher Aufwand brauchen eigene Nachweise. Klären Sie zuerst, welche Aufrufe ein Produkt genau erfasst.

Kit erfasst geschätzte Kosten und Nutzungsmetadaten für abgedeckte KI-Aufrufe innerhalb der Anwendung, mit Ansichten nach Mitglied und Monat. Mitgliederzeilen enthalten keine nicht zugeordneten Hintergrundaufrufe; die Monatssummen enthalten sie. Die Limits prüfen die Nutzung vor neuen erfassten Aufrufen. Sie sind keine universelle, exakt eingehaltene Obergrenze für Anbieterrechnungen. Diese Daten decken einen Teil der laufenden Kosten ab. [Kits Leitfaden zu KI-Anbietern und Ausgabenlimits](/docs/ai-providers-and-spend-controls).

Behalten Sie bei ihrer Verwendung die Grenzen des Erfassungsumfangs zusammen im Blick: Hiring Live Review und die Hintergrundanreicherung in der Gehaltsrecherche liegen außerhalb der Kostenerfassung und Limits; die Erfassung von Embeddings ist unvollständig. Rechnungen für die Modelle externer MCP-Clients sind getrennt, obwohl eine MCP-Aktion eine erfasste Generierung in Kit auslösen kann. Kit bietet weder eine verifizierte Pion-Integration noch eine Messung von Mitarbeiterminuten oder ein Gewinnmodell für das gesamte Unternehmen. Seine Nutzungsschätzungen allein belegen keine wirtschaftlichen Einsparungen und gleichen nicht jede Anbieterrechnung ab.

Führen Sie die erfassten Nutzungsdaten mit Rechnungen, Abnahmenachweisen und Ihrer eigenen Zeitzurechnung zusammen. Halten Sie den ursprünglichen Stapel und Stichtag sichtbar. So können Sie die Entscheidung erklären: Was wurde nutzbar, was blieb offen und welche Ressourcen hat die Arbeit verbraucht?

> [!CTA]
> **Machen Sie den nächsten Piloten messbar.** Wenn Ihr Arbeitsablauf über Kit läuft, nutzen Sie die abgedeckten KI-Nutzungsdaten als einen Beitrag zu Ihrer Tabelle. [Starten Sie einen kostenlosen Test](/users/sign_up).