Coût d’un pilote d’agents IA : mesurez les résultats acceptés

Mesurez le coût d’un pilote d’agents IA par résultat accepté, avec les nouvelles tentatives, la vérification humaine et le travail inachevé. Un guide pratique.

Ernest Bursa

Ernest Bursa

Founder · · 13 min de lecture
A male founder and an older female colleague count cartons beside a notebook outside a small San Francisco shop.

Pour mesurer le coût d’un pilote d’agents IA, divisez les ressources consacrées à un lot de travail défini par le nombre de résultats acceptés après une vérification indépendante, avant l’échéance. Incluez les logiciels, les nouvelles tentatives, la vérification humaine et la correction des erreurs. Présentez aussi le degré d’achèvement, la qualité et les décaissements, pour qu’une tâche peu coûteuse mais inachevée ne passe pas pour un résultat utile.

Vous obtenez ainsi un chiffre sur lequel appuyer la décision de prolonger le pilote. La facture du modèle ne suffit pas à déterminer si le flux de travail est abordable. Il faut aussi savoir quels résultats satisfont aux exigences, ce qui reste en attente et qui a contribué à les terminer.

Que révèle Pion sur la rentabilité des agents ?

Pion facilite les expériences avec des agents en conditions réelles. Son lancement ne démontre toutefois pas la rentabilité de votre activité. Prenez-le comme une invitation à mesurer soigneusement un flux de travail bien délimité.

Le 14 septembre, Andon Labs a annoncé Pion, une version de recherche destinée aux expériences de gestion autonome d’entreprises. Le lancement a suscité une discussion active sur Hacker News. Andon a fait état de progrès dans ses expériences avec des distributeurs automatiques, tout en indiquant que son café et sa boutique restaient déficitaires. Ces résultats sont rapportés par le développeur dans des contextes précis. Ce ne sont ni des résultats audités de façon indépendante, ni des prévisions pour d’autres entreprises. Le compte rendu du lancement par Andon Labs.

Cette distinction compte, car plusieurs questions économiques peuvent se cacher derrière le mot fonctionne. Le système termine-t-il une tâche ? Une vente couvre-t-elle le coût des marchandises vendues ? L’activité couvre-t-elle ses dépenses courantes ? L’investissement permet-il de récupérer le coût de mise en place ? Choisissez la question avant de recueillir les chiffres.

Le précédent compte rendu du café d’Andon illustre une autre distinction : les ingrédients et les emballages, le loyer et les salaires, la valeur du stock et les paiements aux fournisseurs décrivent différentes facettes de l’activité. Des invendus peuvent conserver une valeur alors que la trésorerie se raréfie. Aucune de ces deux perspectives n’explique à elle seule l’ensemble de l’activité. Le compte rendu d’Andon Cafe.

Pour votre pilote, inscrivez la décision en haut du tableau : « Devons-nous exécuter à nouveau ce flux de travail dans ces conditions ? » La recherche peut être utile même lorsqu’une expérience perd de l’argent. Le développement commercial exige ses propres preuves. Affichez le budget d’apprentissage, puis évaluez séparément le coût du fonctionnement courant.

Qu’est-ce qu’un résultat accepté ?

Un résultat accepté satisfait à des exigences écrites et a été vérifié indépendamment de la déclaration d’achèvement de l’agent. Définissez ces exigences avant le début du pilote.

Le guide d’Anthropic sur l’évaluation des agents distingue l’historique des actions de l’agent de l’état du système qui en résulte. Il traite également les tentatives répétées comme des essais distincts. C’est une règle de mesure utile : le fait que l’agent annonce une tâche terminée ne prouve pas que le résultat requis existe. Le guide d’évaluation d’Anthropic.

Prenons un exemple opérationnel conçu pour cet article. Votre pilote prépare des fiches fournisseurs à partir de documents déjà en votre possession. Pour être acceptée, une fiche doit identifier le bon fournisseur, renseigner les champs obligatoires, joindre le justificatif et signaler les informations contradictoires. Un évaluateur vérifie ces conditions avant de la déclarer prête pour l’étape suivante. Ce pilote de préparation n’autorise aucun paiement et ne modifie aucune coordonnée bancaire.

L’unité de mesure est une fiche fournisseur utilisable. Les pages de documents, les appels d’outils et les brouillons sont des activités. Vous pouvez les suivre pour comprendre les coûts, mais ils n’augmentent pas le nombre de résultats acceptés.

Fixez le lot et l’échéance

Attribuez un identifiant à chaque dossier confié au pilote et consignez sa date d’entrée. Conservez le lot initial, y compris les cas difficiles qui échouent. Si vous excluez des dossiers avant le démarrage, documentez la règle d’éligibilité pour que le résultat final décrive le travail réellement testé.

Choisissez une échéance correspondant au moment où le travail est nécessaire. Une fiche acceptée après cette date pourra être utile plus tard, mais elle n’était pas prête pour le délai initial de prestation. Conservez la situation à cette date et ajoutez le résultat ultérieur. Sinon, chaque jour supplémentaire améliore discrètement le chiffre présenté, sans montrer le coût de l’attente.

À l’échéance, utilisez trois états : accepté, rejeté et inachevé. Un résultat rejeté ne satisfait pas aux exigences ; un dossier inachevé n’a pas encore de résultat final accepté. Notez le motif de chaque état pour distinguer un résultat médiocre d’une information manquante ou d’un retard de vérification.

Que faut-il inscrire dans le relevé des coûts du pilote ?

Consignez les ressources pour l’ensemble du lot attribué, y compris le travail qui ne sera jamais accepté. Séparez les sommes payées de la valeur du temps de travail affecté au pilote.

Un tableau et des liens vers les pièces existantes suffisent pour commencer.

Élément Données à recueillir Ce qu’elles permettent de vérifier
Travail attribué Identifiant du dossier, heure d’arrivée, type de tâche Si le lot a changé
Acceptation Décision, horodatage, évaluateur, preuves Si un résultat utile existe
Logiciels Utilisation des services du fournisseur, frais des outils, quote-part d’abonnement Ressources consommées par toutes les tentatives
Travail humain Temps de mise en place, de vérification et de correction des erreurs Travail effectué en dehors des actions de l’agent
Travail inachevé État actuel, motif, prochain responsable Obligations encore en attente
Trésorerie Facture, paiement, crédit ou subvention Sommes réellement sorties de l’entreprise
Configuration Modèle, instructions et changements d’outils pertinents Configuration à l’origine du résultat

Séparez la vérification courante de la correction des erreurs. Lire une fiche préparée et examiner ses justificatifs relève de la vérification. Retrouver le bon document après une mauvaise correspondance, corriger les champs et relancer la tâche relève de la correction des erreurs. Les deux comptent ; la distinction aide à choisir ce qu’il faut améliorer.

L’aide humaine n’invalide pas l’expérience. La deuxième phase de Project Vend a fait état de meilleurs résultats, avec le maintien de vérifications humaines des achats et d’autres formes d’assistance. Le compte rendu public ne fournit pas de rapprochement complet des coûts. Vous ne pouvez donc ni en déduire un coût unitaire exhaustif ni supposer qu’un coût précis a été exclu. Project Vend, deuxième phase.

Consignez les interruptions sans surveiller les salariés

Demandez aux participants de noter leur temps par activité et par lot, avec assez de détails pour expliquer les problèmes récurrents. Une brève note comme « conflit d’identité du fournisseur résolu » est plus utile qu’une pile de captures d’écran. Évitez de recueillir des échanges privés ou des activités sans rapport avec le pilote dans le seul but de remplir le tableau.

Indiquez les incertitudes. Si une correction a pris environ une heure, précisez qu’il s’agit d’une estimation. Si le travail a été partagé entre plusieurs pilotes, notez la règle de répartition. Des totaux apparemment précis, fondés sur des suppositions inexpliquées, compliquent la décision suivante.

Comment calculer le coût par résultat accepté ?

Additionnez les ressources de fonctionnement consommées par le lot, puis divisez cette somme par le nombre de résultats acceptés à l’échéance. Présentez la mise en place séparément pour rendre visibles le fonctionnement récurrent et les ressources totales nécessaires au premier lot.

L’exemple suivant est entièrement hypothétique. Les montants, les durées, le volume de travail et le nombre de résultats acceptés sont inventés pour illustrer le calcul. Ce ne sont ni des résultats de Pion, ni des données de clients Kit, ni une référence sectorielle. Tous les montants sont exprimés en dollars américains à titre d’illustration.

Le pilote de préparation des fiches fournisseurs reçoit 100 dossiers. À l’échéance, 80 sont acceptés, 12 sont inachevés et 8 sont rejetés. Les coûts de fonctionnement de l’IA et des logiciels totalisent 200 $. L’équipe consacre 6 heures à la vérification et 2 heures à la correction des erreurs, avec un coût horaire chargé supposé de 50 $ par heure.

Le coût chargé sert ici à affecter au pilote le coût du temps de travail, avec les coûts liés à l’emploi que vous choisissez d’inclure. Précisez votre définition lorsque vous remplacerez ces hypothèses par des données réelles.

Ressource de fonctionnement hypothétique Calcul Coût affecté
IA et logiciels Total du lot 200 $
Vérification humaine 6 heures × 50 $ 300 $
Correction des erreurs 2 heures × 50 $ 100 $
Total des ressources de fonctionnement 200 $ + 300 $ + 100 $ 600 $

Coût de fonctionnement par résultat accepté : 600 $ ÷ 80 = 7,50 $.

Si aucun résultat n’est accepté, le ratio n’est pas défini. Indiquez les ressources consommées et zéro résultat accepté ; n’affichez pas un coût nul et ne masquez pas le lot qui a échoué.

Diviser la facture des logiciels par les dossiers attribués donne 200 $ ÷ 100 = 2 $. C’est le coût logiciel par dossier attribué. Il exclut le travail humain et utilise un dénominateur qui comprend aussi le travail inachevé et rejeté. Nommez-le correctement si vous le présentez, mais ne l’utilisez pas pour décrire le coût des résultats acceptés.

Présentez séparément la mise en place et la trésorerie

Supposons que la mise en place initiale prenne 10 heures à 50 $, soit 500 $. En l’incluant, les ressources totales du premier lot atteignent 1 100 $, soit 1 100 $ ÷ 80 = 13,75 $ par résultat accepté. Ce chiffre indique ce que le premier lot a consommé au total ; les 7,50 $ décrivent ses ressources de fonctionnement hors mise en place.

Pour une estimation ultérieure, vous pourriez répartir la mise en place sur un volume prévu. Indiquez ce volume et les conséquences d’un arrêt anticipé du pilote. Ne comptez pas dans le même total l’intégralité de la mise en place et une quote-part amortie de cette même somme.

Ces coûts de personnel affectés ne correspondent pas nécessairement à de nouveaux décaissements. Les salariés déjà rémunérés consacrent bien du temps au pilote, mais celui-ci ne change pas forcément la masse salariale versée. Conservez une colonne de trésorerie pour les paiements réels et une colonne de ressources pour la comparaison plus complète. L’une ne doit pas remplacer l’autre sans le dire.

La page produit de Pion décrit des jetons de démarrage pour certaines idées retenues et un modèle prévu de partage des revenus, sans tarif chiffré universel. Consignez toute aide effectivement reçue par votre pilote, avec sa date d’expiration ou ses limites. Ne supposez pas qu’un crédit temporaire représente le prix du fonctionnement courant. La page produit de Pion.

Comment comparer le pilote au flux de travail actuel ?

Comparez des tâches de difficulté semblable, avec les mêmes exigences d’acceptation et le même délai. Présentez le travail inachevé à côté des coûts, pour qu’un meilleur coût unitaire ne masque pas une dégradation de la prestation.

Dans la comparaison hypothétique, le flux de travail actuel accepte 100 fiches en 20 heures à 50 $ par heure. Les ressources affectées sont de 1 000 $, soit 10 $ par résultat accepté. Le coût de fonctionnement du pilote est inférieur, à 7,50 $, mais il n’a accepté que 80 fiches et son premier lot coûtait 13,75 $ par résultat avec la mise en place.

Vous disposez donc de plusieurs constats, sans pouvoir conclure à l’équivalence des deux flux de travail. Le pilote a consommé moins de ressources de fonctionnement affectées et produit moins de résultats acceptés à l’échéance. Il reste à prévoir le traitement des dossiers inachevés et rejetés. Toute affirmation sur les recrutements ou les économies exigerait davantage de preuves que ce tableau n’en fournit.

Appliquez les mêmes règles aux deux méthodes

Incluez la vérification et les corrections dans le flux de travail actuel comme dans le pilote. Si une personne vérifie aujourd’hui le travail d’une autre, gardez cet effort dans la base de comparaison. Si des erreurs humaines sont découvertes plus tard, consignez-les, au lieu de soumettre l’agent à des exigences jamais appliquées à l’autre méthode.

Choisissez des groupes de dossiers comparables avant d’examiner les résultats. Un pilote qui traite des documents sans difficulté particulière pendant que l’équipe cherche les pièces jointes manquantes a testé une charge de travail plus restreinte. Ce peut être une première expérience judicieuse, à condition de limiter la conclusion à ce périmètre.

Notez aussi qui a fourni les heures. Réduire le temps de traitement des profils juniors tout en sollicitant davantage des spécialistes peu disponibles pour la vérification peut être un mauvais compromis. Le coût moyen peut masquer un goulot d’étranglement qui empêche de terminer le lot suivant.

Vérifiez si l’économie apparente résiste aux changements courants

Gardez une colonne distincte pour les scénarios dont les hypothèses pourraient changer : l’aide prend fin, la vérification dure plus longtemps, les dossiers deviennent plus difficiles ou la mise en place doit être répétée. Modifiez une seule hypothèse à la fois pour voir ce qui détermine la décision. Signalez chaque projection ; ne mélangez pas les scénarios aux résultats observés du pilote.

Les heures libérées constituent une capacité que vous pourriez utiliser ailleurs. Elles ne deviennent une économie de trésorerie que lorsqu’une dépense réelle change. Pour des choix d’effectifs plus vastes, utilisez ces preuves avec la planification des effectifs humains et des agents IA, au lieu de convertir directement une estimation de temps en décision sur un poste vacant.

Quand prolonger, modifier ou arrêter le pilote ?

Décidez à l’avance quelles preuves justifieront un autre lot. Le coût, l’acceptation, le respect des délais et les erreurs inacceptables exigent des conditions distinctes : une moyenne ne peut pas répondre à tout.

Dans l’exemple des fiches fournisseurs, une coordonnée bancaire erronée qui parviendrait au processus de paiement imposerait un arrêt et une enquête, même si le coût moyen semblait attractif. Des règles explicites doivent encadrer le traitement des erreurs graves. Les intégrer à une moyenne ne rend pas l’exposition au risque acceptable.

À l’échéance, rédigez une courte note de décision :

  1. Qu’a-t-on testé ? Indiquez le lot, la configuration, les règles d’éligibilité et le délai.
  2. Qu’a-t-on produit ? Listez les dossiers acceptés, rejetés et inachevés, avec leurs preuves et leurs motifs.
  3. Qu’a-t-on consommé ? Présentez les logiciels, le travail humain, la mise en place et les décaissements réels.
  4. Que reste-t-il à faire ? Nommez la personne qui terminera ou corrigera le travail restant et précisez où ses coûts ultérieurs seront consignés.
  5. Quelle suite donner ? Prolongez avec la même configuration, modifiez un élément précis ou arrêtez, avec une raison et une date de réexamen.

Si vous changez le modèle, les instructions ou les outils, consignez la nouvelle configuration avant le lot suivant. De meilleurs résultats après plusieurs changements renseignent sur le système révisé. Ils ne permettent pas d’isoler le changement à l’origine de l’amélioration.

L’absence de preuves est aussi un résultat. Si personne ne peut reconstituer le temps de vérification ou confirmer l’acceptation, améliorez la mesure avant de décider d’une extension importante. Vous pouvez toujours rendre compte des enseignements tirés et des dépenses engagées pour les obtenir.

À mesure que le pilote grandit, son fonctionnement dépend de la disponibilité des évaluateurs. Si c’est votre contrainte, le guide consacré à la constitution d’une équipe de vérification humaine traite de la continuité des effectifs. Dans le tableau des coûts, gardez la question simple : quelle quantité de travail humain qualifié ce lot a-t-il exigée ?

Quelles données sur les coûts Kit peut-il fournir ?

Les données d’utilisation peuvent alimenter une partie du relevé des coûts, mais les résultats acceptés et le travail humain exigent leurs propres preuves. Commencez par identifier précisément les appels que le produit comptabilise.

Kit consigne une estimation des coûts et des métadonnées d’utilisation pour les appels IA couverts dans l’application, avec des vues par membre et par mois. Les lignes par membre excluent les appels en arrière-plan non attribués que les agrégats mensuels incluent. Les limites vérifient l’utilisation avant les nouveaux appels comptabilisés ; elles ne constituent pas un plafond universel exact sur les factures des fournisseurs. Ces données couvrent une partie des coûts de fonctionnement. Le guide Kit des fournisseurs IA et de la maîtrise des dépenses.

Gardez toutes les limites de couverture visibles lorsque vous utilisez ces données : l’évaluation en direct de Hiring et l’enrichissement en arrière-plan de la recherche de rémunération ne sont couverts ni par le relevé des coûts ni par les plafonds, et la comptabilisation des embeddings reste incomplète. Les factures de modèles des clients MCP externes sont distinctes, même si une action MCP peut déclencher une génération comptabilisée dans Kit. Kit ne propose ni intégration Pion vérifiée, ni mesure des minutes de travail des salariés, ni modèle de calcul du bénéfice de l’ensemble de l’entreprise. Ses estimations d’utilisation ne suffisent pas à établir des économies ou à rapprocher toutes les factures des fournisseurs.

Réunissez les données d’utilisation couvertes, les factures, les preuves d’acceptation et vos propres affectations de temps. Conservez bien en vue le lot initial et l’échéance. Vous pourrez alors expliquer la décision : ce qui est devenu utilisable, ce qui reste inachevé et les ressources consommées par le travail.

Donnez au prochain pilote une base mesurable. Si votre flux de travail passe par Kit, utilisez ses données d’utilisation IA couvertes comme l’une des sources du tableau. Démarrez votre essai gratuit.

Articles similaires

Pret a recruter plus intelligemment ?

Commencez gratuitement pendant 30 jours. Résiliez avant la fin et vous ne payez rien. Configurez votre premier pipeline de recrutement en quelques minutes.

Commencer gratuitement