Amazon Mechanical Turk wird am 30. September 2026 endgültig eingestellt. Damit fällt auch der öffentliche MTurk-Pool in SageMaker Ground Truth und Amazon Augmented AI weg. Exportieren Sie vor der Abschaltung von Mechanical Turk Ihren Verlauf, schließen Sie offene Aufgaben ab und ordnen Sie jede Prüfwarteschlange nach Risiko und benötigtem Fachwissen ein. Entscheiden Sie außerdem, welche Aufgaben Sie automatisieren und welche Sie einem Dienstleister, Auftragnehmern oder einem geschulten Team für menschliche Prüfungen übertragen.

Das ist mehr als ein Anbieterwechsel. MTurk ließ menschliches Urteilsvermögen wie eine API wirken: Sie sandten eine Human Intelligence Task, erhielten eine Antwort und bezahlten pro Aufgabe. Mit der Abschaltung werden all die betrieblichen Entscheidungen sichtbar, die diese Schnittstelle bislang verborgen hat. Sie müssen weiterhin wissen, wer die Daten sehen darf, welche Qualifikation für die Beurteilung nötig ist, wie Sie Meinungsverschiedenheiten klären und wer die endgültige Antwort verantwortet.

## Wie sieht der Zeitplan für die Abschaltung von Mechanical Turk aus?

**MTurk wird am 30. September 2026 eingestellt, doch mehrere Abwicklungsfristen laufen über das Ende der Auftragsannahme hinaus.** Nehmen Sie diese Termine jetzt in einen Migrationsplan mit klarer Verantwortung auf. Lassen Sie sie nicht bloß in einem Browser-Tab stehen und hoffen Sie, dass sich jemand daran erinnert.

Laut [Amazons FAQ zur Abschaltung](https://www.mturk.com/help) gilt:

- Arbeitskräfte können HITs bis zum 30. September 2026 einreichen. Nicht eingereichte HITs verfallen mit der Einstellung des Dienstes.
- Auftraggeber haben das übliche Zeitfenster von 30 Tagen, um vor der Abschaltung eingereichte Arbeiten anzunehmen oder abzulehnen. Nicht geprüfte Einreichungen werden danach automatisch angenommen.
- Auftraggeber können bis zum 30. Oktober 2026 Boni vergeben.
- Im Voraus bezahlte Guthaben von Auftraggebern sollen innerhalb von 30 Tagen erstattet werden.
- Der Transaktionsverlauf bleibt bis zum 28. Januar 2027 zugänglich.
- Der öffentliche MTurk-Pool steht ab dem 30. September auch für neue oder bestehende Abläufe zur menschlichen Prüfung in SageMaker Ground Truth und Amazon Augmented AI nicht mehr zur Verfügung.

Amazon nennt in den FAQ keinen Grund für die Abschaltung. Stützen Sie Ihre Migrationsentscheidung daher nicht auf Spekulationen über die Ursachen. Richten Sie sie am bestätigten Termin und an der Arbeit aus, die Ihr Produkt weiterhin erfordert.

Benennen Sie zunächst eine verantwortliche Person. Sie sollte jede direkte MTurk-Integration, jeden AWS-Ablauf zur Kennzeichnung oder Prüfung mit öffentlicher Belegschaft, jede planmäßig laufende Aufgabe zur Erstellung von HITs und jeden nachgelagerten Prozess erfassen, der deren Ergebnisse erwartet. Beziehen Sie einmalige Forschungs- und Betriebskonten ein, nicht nur den Produktionscode.

Sichern Sie anschließend alles, was Sie nach dem 28. Januar noch benötigen. Exportieren Sie Transaktionsdaten, Aufgabendefinitionen, Qualifikationsregeln, Referenzbeispiele, Anweisungen für Prüferinnen und Prüfer, Ablehnungsgründe und Qualitätsberichte. Aus einer Zahlungsübersicht allein lässt sich später nicht rekonstruieren, warum eine Kennzeichnung akzeptiert wurde.

## Was bot MTurk KI-Start-ups tatsächlich?

**MTurk bot flexibel verfügbare menschliche Kapazität, die Verteilung von Aufgaben, Bezahlung und einen programmierbaren Arbeitsablauf. Die notwendige Gestaltung der Beurteilung nahm Ihnen der Dienst nicht ab.** Dieser Unterschied zählt bei der Wahl eines Ersatzes.

Die [MTurk-Produktübersicht](https://www.mturk.com/) von Amazon nennt die Erfassung und Annotation von Daten für maschinelles Lernen, fortlaufende Korrekturen und Human-in-the-Loop-Validierung als zentrale Einsatzgebiete. Auch der wirtschaftliche Reiz wird deutlich: Unternehmen konnten eine verteilte Belegschaft je nach Bedarf vergrößern oder verkleinern, ohne einen vollständigen internen Betrieb aufzubauen.

Für ein Start-up erfüllte dieses Paket mehrere Aufgaben zugleich:

1. **Reichweite:** Sie konnten kleine Aufgaben an einen großen öffentlichen Pool vergeben.
2. **Flexibilität:** Sie bezahlten nur dann für Arbeit, wenn sie tatsächlich anfiel, statt dauerhaft feste Kapazität vorzuhalten.
3. **Verteilung:** Die Plattform wies Arbeitseinheiten zu und sammelte die Antworten ein.
4. **Verwaltung:** Sie verwaltete Konten, Guthaben und Zahlungen der Arbeitskräfte.
5. **Integration:** Eine API verband menschliche Entscheidungen mit einer Software-Pipeline.

Diese bequeme Abstraktion verbarg zugleich Entscheidungen, für die Ihr Team weiterhin verantwortlich war. Wer war qualifiziert? Waren die Anweisungen für Außenstehende eindeutig genug? Durften die Arbeitskräfte personenbezogene oder vertrauliche Daten sehen? Hatte eine Mehrheitsentscheidung überhaupt Aussagekraft? Was geschah, wenn die Kennzeichnung das Ergebnis für einen Kunden beeinflusste?

Wenn niemand diese Fragen beantworten kann, hatte Ihr Unternehmen kein Human-in-the-Loop-System. Es hatte eine Warteschlange, in der irgendwo Menschen mitwirkten.

So störend die Abschaltung ist, sie hat auch einen Nutzen. Sie erhalten einen festen Termin, um aus einer unbeabsichtigten Abhängigkeit eine ausdrücklich definierte betriebliche Funktion zu machen.

## Sollten Sie MTurk durch eine andere Crowd-Plattform ersetzen?

**Eine vergleichbare Crowd-Plattform kann eine Alternative sein, aber nur für unbedenkliche, klar abgegrenzte und messbare Arbeit.** Ordnen Sie die Aufgabe ein, bevor Sie Anbieter vergleichen. Andernfalls verbergen sich dieselben Risiken lediglich hinter einer neuen API.

Stellen Sie für jede Warteschlange vier Fragen:

- **Sensibilität:** Was können Prüferinnen und Prüfer sehen? Enthält das Material Kundendaten, Kandidatendaten, interne Dokumente, personenbezogene Informationen oder regulierte Datensätze?
- **Fachwissen:** Können allgemein geschulte Prüferinnen und Prüfer die Entscheidung treffen oder ist Fachwissen nötig?
- **Mehrdeutigkeit:** Gibt es eine objektiv richtige Antwort, ein stabiles Bewertungsschema oder mehrere berechtigte Auslegungen?
- **Folgen:** Was passiert bei einer falschen Antwort? Lässt sie sich kostengünstig rückgängig machen oder betrifft sie Sicherheit, Zugriff, Beschäftigung, Geld oder eine Kundenbeziehung?

Die [Dokumentation von AWS zur öffentlichen Belegschaft](https://docs.aws.amazon.com/sagemaker/latest/dg/sms-workforce-management-public.html) zieht eine klare Datenschutzgrenze. Demnach dürfen keine vertraulichen oder personenbezogenen Informationen und keine geschützten Gesundheitsdaten an die öffentliche MTurk-Belegschaft gesendet werden. Daten für diese Belegschaft müssen als frei von personenbezogenen Informationen gekennzeichnet sein.

Diese Einschränkung sollte auch nach MTurk gelten. Dieselbe sensible Warteschlange an eine andere öffentliche Crowd zu verschieben, macht die Daten nicht sicher.

| Ersatzmodell | Geeignet für | Hauptrisiko |
|---|---|---|
| Automatisierung oder ein Modell als Prüfinstanz | Deterministische, umkehrbare Vorsortierung mit belastbaren Tests | Ein systematischer Fehler kann sich über die gesamte Warteschlange ausbreiten |
| Betreuter Annotationsdienstleister | Vorübergehender hoher Kapazitätsbedarf mit ausgelagertem Betrieb | Qualität der Prüfungen und Unterauftragsvergabe können undurchsichtig sein |
| Fester Pool aus Auftragnehmern | Wiederkehrende, klar abgegrenzte Arbeit mit bekannten Prüfern | Planung, Führung und rechtliche Einordnung liegen nun bei Ihnen |
| Internes Prüfteam | Sensible, fachlich anspruchsvolle oder folgenreiche Entscheidungen | Fixkosten bei schwankendem Arbeitsvolumen |
| Mehrstufige hybride Prüfung | Unterschiedliche Arbeit mit klaren Eskalationsgrenzen | Erfordert mehr Prozessgestaltung und Messung |

Für die meisten KI-Start-ups ist **eine hybride Prüfung die am besten vertretbare Standardlösung**. Automatisieren Sie Regeln, die sich testen lassen. Übertragen Sie klar abgegrenzte, wiederkehrende Entscheidungen an geschulte Prüfer. Eskalieren Sie mehrdeutige und folgenreiche Fälle an Fachleute. Benennen Sie eine Person, die das Bewertungsschema ändern und Streitfälle entscheiden darf.

Verwechseln Sie Automatisierung nicht mit Migration. Ein Modell kann die Warteschlange verkleinern, Fälle vorsortieren oder eine Empfehlung entwerfen. Es sollte nicht unbemerkt zur endgültigen Entscheidungsinstanz werden, nur weil der menschliche Anbieter verschwindet.

## Welche Human-in-the-Loop-Aufgaben brauchen Fachleute?

**Eine Prüfung durch Fachleute ist angebracht, wenn eine Aufgabe Mehrdeutigkeit, Spezialwissen, sensible Daten oder kostspielige Fehler vereint.** Einfache Kennzeichnungen können weiterhin allgemein geschulte Prüferinnen und Prüfer übernehmen. Entscheidend ist, die Arbeit nach Risiko zuzuweisen, statt ein Personalmodell pauschal für überlegen zu erklären.

Eine praxistaugliche Prüfkette hat vier Stufen:

1. **Deterministische Automatisierung** übernimmt Regeln, deren Ergebnis Sie im Code überprüfen können.
2. **Allgemein geschulte Prüferinnen und Prüfer** bearbeiten wiederholbare Entscheidungen mit einem eindeutigen Bewertungsschema und unbedenklichen Daten.
3. **Fachleute** bearbeiten Grenzfälle, sensibles Material und Entscheidungen, für die berufsspezifischer Kontext nötig ist.
4. **Eine namentlich benannte Entscheidungsinstanz** klärt Meinungsverschiedenheiten, bearbeitet Einsprüche und verantwortet Änderungen am Bewertungsschema.

Die Tagungsbeiträge des Workshops [Data Science with Human-in-the-Loop](https://aclanthology.org/2024.dash-1.pdf) zeigen dieselbe Arbeitsteilung in Forschungsabläufen: Personen ohne Spezialwissen können einfache Annotationen übernehmen. Komplexe Fehleranalysen und Verbesserungsentscheidungen erfordern dagegen Fachleute aus Technik oder dem jeweiligen Fachgebiet.

Mehr anonyme Stimmen ergeben nicht automatisch die Wahrheit. AWS weist darauf hin, dass zusätzliche Arbeitskräfte bei komplexen Kennzeichnungsaufgaben die Qualität verbessern können, bei einfachen Aufgaben aber wenig bewirken. Eine begutachtete [Studie zur Überwachung der öffentlichen Gesundheit](https://www.jmir.org/2022/1/e28749/) setzte pro Element drei Arbeitskräfte aus einem öffentlichen Pool ein und verglich deren Ergebnisse mit einem Referenzdatensatz. Die Forschenden maßen die Zuverlässigkeit, statt Übereinstimmung als Beweis zu behandeln.

Anspruchsvolle Arbeit birgt noch ein subtileres Risiko. Die 2026 in der Harvard Data Science Review veröffentlichte Studie [Bias in the Loop](https://hdsr.mitpress.mit.edu/pub/nrcn4h7d/release/2) kommt zu dem Ergebnis, dass Personen ohne Fachwissen mit schwierigen Annotationsaufgaben kämpfen können und KI-Vorschläge menschliche Urteile beeinflussen. Wer nach dem Lesen einer Modellantwort auf „Zustimmen“ klickt, liefert keine unabhängige Kontrolle.

Sorgen Sie dort für unabhängige Urteile, wo es darauf ankommt. Lassen Sie Prüfer eine Bewertung abgeben, bevor sie die vorgeschlagene Modellantwort oder die Entscheidung einer anderen Person sehen. Zeigen Sie Vorschläge erst später, wenn überhaupt. Bewahren Sie die Begründung auf, damit die Entscheidungsinstanz zwischen einem schwachen Bewertungsschema und einer nachlässigen Prüfung unterscheiden kann.

## Wie bauen Sie ein Team für menschliche Prüfungen auf?

**Stellen Sie Prüferinnen und Prüfer anhand repräsentativer Arbeitsproben ein, die echtes Urteilsvermögen verlangen – nicht aufgrund allgemeiner Behauptungen über ihre Sorgfalt.** Definieren Sie die Arbeit, bezahlen Sie Kandidatinnen und Kandidaten für eine realistische Probe, bewerten Sie diese unabhängig und machen Sie den richtigen Umgang mit Eskalationen zu einem Auswahlkriterium.

### Formulieren Sie das Ergebnis vor der Stellenbeschreibung

Beginnen Sie mit der Entscheidung, die eine Prüfkraft treffen soll, und den dafür verfügbaren Nachweisen. Beschreiben Sie Normalfälle, Grenzfälle, die zugänglichen Daten, den erwarteten Durchsatz und den Punkt, an dem die Person aufhören und den Fall weitergeben muss.

„KI-Ausgaben prüfen“ ist keine Rolle. „Beurteilen, ob Antworten des Kundendienstes die Richtlinie einhalten, sich auf die bereitgestellten Kontodaten stützen, unzulässige Zusagen vermeiden und unklare Erstattungsfälle weitergeben“ beschreibt dagegen eine Rolle, die sich verstehen und testen lässt.

Wählen Sie das Beschäftigungsmodell erst, nachdem Sie die Warteschlange definiert haben. Ein betreuter Dienstleister kann einen saisonalen Rückstau auffangen. Ein fester Pool aus Auftragnehmern eignet sich möglicherweise für wiederkehrende Arbeit mit denselben Prüfern. Eine angestellte Person kann die richtige Wahl für eine sensible Warteschlange sein, die tiefes Produktwissen und tägliche Zusammenarbeit erfordert. Prüfen Sie die für Ihren Standort und die gewählte Vertragsform geltenden rechtlichen und steuerlichen Pflichten.

Wenn dies eine Ihrer ersten Fachrollen ist, hilft Ihnen [Die ersten fünf Einstellungen](/blog/first-five-hires-seed-stage-sequencing) bei der Entscheidung, ob der Bedarf dauerhaft genug für eine Festanstellung ist. Liegt der Prozess noch bei einer Gründerin oder einem Gründer, zeigt [Einstellen ohne Recruiter](/blog/founder-led-hiring-without-recruiter), wie Sie eine disziplinierte Suche führen, ohne eine Personalabteilung zu erfinden.

### Nutzen Sie eine bezahlte, repräsentative Arbeitsprobe

Stellen Sie eine kurze Arbeitsprobe aus echten Aufgabentypen zusammen und entfernen Sie sensible Einzelheiten. Nehmen Sie eindeutige und mehrdeutige Elemente sowie mindestens einen Fall auf, der weitergegeben und nicht zwangsweise einer Kategorie zugeordnet werden sollte.

Bewerten Sie Kandidaten nicht nur danach, wie häufig sie mit Ihrer Musterlösung übereinstimmen:

- richtige Entscheidungen bei Referenzfällen;
- Kosten falsch positiver und falsch negativer Ergebnisse;
- einheitliche Entscheidungen bei ähnlichen Beispielen;
- Qualität der schriftlichen Begründung;
- Erkennen fehlender Informationen;
- korrekte Anwendung der Eskalationsgrenze;
- sorgfältiger Umgang mit privaten und vertraulichen Informationen.

Bezahlen Sie die Arbeitsprobe. Sie verlangen von den Kandidaten eine Tätigkeit, die der späteren Arbeit ähnelt und erhebliche Konzentration erfordern kann. Halten Sie die Aufgabe kurz genug, damit auch qualifizierte Personen teilnehmen können, die bereits berufstätig sind oder Betreuungspflichten haben.

Lassen Sie die Mitglieder des Interviewteams ihre Bewertungen vor der gemeinsamen Besprechung unabhängig abgeben. [Strukturierte Interview-Scorecards](/blog/structured-interview-scorecards-predictive-validity) verhindern, dass die lauteste Meinung die Fakten verdrängt. Halten Sie den Grund für die endgültige Entscheidung fest, insbesondere wenn das Gremium vom Ergebnis der Arbeitsprobe abweicht.

## Wie messen Sie die Qualität von Prüfern?

**Bewerten Sie Ihr Prüfsystem anhand kalibrierter Beispiele, Übereinstimmung, Fehlerkosten, Eskalationsverhalten und Qualitätsverschiebungen im Zeitverlauf.** Reiner Durchsatz und Mehrheitsentscheidungen genügen nicht.

Erstellen Sie einen Referenzdatensatz mit Beispielen, deren erwartete Entscheidungen vom zuständigen Verantwortlichen für das Bewertungsschema oder von Fachleuten geprüft wurden. Behandeln Sie ihn nicht wie ein unveränderliches Archiv. Ergänzen Sie Fälle, sobald im Produktivbetrieb eine neue Mehrdeutigkeit auftritt, und entfernen Sie Beispiele, wenn sich die Richtlinie ändert.

Nutzen Sie eine kompakte Scorecard:

| Kennzahl | Aussage | Warnsignal |
|---|---|---|
| Genauigkeit im Referenzdatensatz | Ob Prüfer das aktuelle Bewertungsschema anwenden | Die Genauigkeit sinkt nach einer Änderung an Richtlinie oder Produkt |
| Paarweise Übereinstimmung | Ob die Aufgabe zu einheitlichen Urteilen führt | Prüfer sind sich bei vermeintlich einfachen Fällen uneinig |
| Kosten falsch positiver Ergebnisse | Schaden durch die irrtümliche Annahme oder Markierung eines Elements | Die Automatisierung wird auf Durchsatz optimiert, während kostspielige Fehler zunehmen |
| Kosten falsch negativer Ergebnisse | Schaden durch das Übersehen eines echten Problems | Prüfer vermeiden schwierige Eskalationen zugunsten der Geschwindigkeit |
| Eskalationsquote | Ob Prüfer Unsicherheit erkennen | Fast keine Eskalationen in einer mehrdeutigen Warteschlange |
| Korrekturquote | Wie häufig Fachleute Entscheidungen der ersten Prüfstufe ändern | Ein Prüfer, ein Aufgabentyp oder ein Abschnitt des Bewertungsschemas dominiert die Korrekturen |
| Prüfdauer | Ob die Kapazität zum Bedarf passt | Offene Fälle bleiben immer länger liegen, obwohl das tägliche Volumen stabil wirkt |

Schlüsseln Sie die Kennzahlen auf. Eine Gesamtgenauigkeit kann Schwächen in einer Sprache, Kundengruppe, Inhaltsart oder Kategorie von Grenzfällen verdecken. Analysieren Sie Meinungsverschiedenheiten nach Aufgabentyp und Abschnitt des Bewertungsschemas.

Bezahlen Sie auch Kalibrierung, die Prüfung von Meinungsverschiedenheiten und Dokumentation, nicht nur akzeptierte Kennzeichnungen. Belohnt die Vergütung allein Geschwindigkeit, reagieren Menschen vernünftig: Sie vermeiden Unsicherheit, begründen knapper und überstürzen ausgerechnet die Fälle, die besonders sorgfältig geprüft werden müssen.

Der [Kern des NIST-Rahmenwerks für KI-Risikomanagement](https://airc.nist.gov/airmf-resources/airmf/5-sec-core/) fordert definierte Rollen von Mensch und KI, klare Aufgaben, festgelegte Aufsichtsverantwortung und eine Validierung im jeweiligen Kontext. Dafür benötigen Sie keine Governance-Abteilung eines Großunternehmens. Sie brauchen namentlich benannte Verantwortliche, schriftliche Grenzen und Nachweise dafür, dass der Prozess an Ihren tatsächlichen Fällen funktioniert.

## Was sollten Sie vor dem 30. September erledigen?

**Nutzen Sie die verbleibende Zeit, um finanzielle Verpflichtungen zu erfüllen und die nötigen Daten zu sichern. Erproben Sie danach den Ersatzprozess an realitätsnahen Aufgaben, bevor MTurk verschwindet.** Eine Migration ist erst abgeschlossen, wenn die Ergebnisse das nachgelagerte System erreichen und jemand deren Qualität erklären kann.

Arbeiten Sie diese Liste der Reihe nach ab:

1. **Verantwortung festlegen.** Geben Sie einer Person die Entscheidungsbefugnis für Termin, Bestandsaufnahme und Umstellung.
2. **Neue Abhängigkeiten stoppen.** Binden Sie MTurk nicht in weitere Abläufe ein, sofern die Arbeit nicht vor der Abschaltung abgeschlossen wird.
3. **Alle Warteschlangen erfassen.** Berücksichtigen Sie direkte API-Aufrufe, Ground Truth, Augmented AI, Forschungskonten, planmäßig laufende Aufgaben und manuelle Exporte.
4. **Offene Arbeit abschließen.** Planen Sie Einreichungen, Annahmen, Ablehnungen, Boni, Guthaben und die Kommunikation mit den Arbeitskräften anhand der von Amazon veröffentlichten Termine.
5. **Nachweise exportieren.** Sichern Sie Transaktionen, Aufgabenvorlagen, Qualifikationen, Anweisungen, Referenzbeispiele, Entscheidungen und den Qualitätsverlauf vor dem 28. Januar 2027.
6. **Aufgaben einordnen.** Erfassen Sie Sensibilität, benötigtes Fachwissen, Mehrdeutigkeit, Folgen, Menge, Bearbeitungszeit und saisonale Schwankungen.
7. **Jede Warteschlange zuweisen.** Automatisieren, auslagern, Auftragnehmer einsetzen, einstellen oder Ansätze kombinieren. Erzwingen Sie keine Einheitslösung für unterschiedliche Arbeiten.
8. **Datenschutzgrenzen prüfen.** Entfernen Sie vertrauliche und personenbezogene Daten aus Abläufen mit öffentlicher Belegschaft. Prüfen Sie bei jedem Ersatzanbieter Zugriffs- und Aufbewahrungsbedingungen.
9. **Beide Systeme kurz parallel betreiben.** Vergleichen Sie die Ergebnisse an denselben sicheren, repräsentativen Fällen. Untersuchen Sie Abweichungen, statt sie durch Mittelwerte zu verwischen.
10. **Rückkehr zum bisherigen System und Eskalation testen.** Legen Sie fest, was geschieht, wenn das neue System ausfällt, die Warteschlange stark wächst oder die Prüfer keine Einigung erzielen.

Legen Sie den internen Umstieg vor dem 30. September fest. Sie brauchen Zeit, um festzustellen, dass ein alter Cronjob weiterhin HITs erstellt, ein Parser für die Ergebnisse ein MTurk-spezifisches Feld erwartet oder ein Finanzkonto den einzigen vollständigen Transaktionsexport enthält.

## Wie hilft Kit beim Aufbau des Teams?

**Kit unterstützt Sie dabei, Prüferinnen und Prüfer mit einem strukturierten Einstellungsprozess zu gewinnen und auszuwählen, in dem Menschen die Entscheidungen treffen. Kit ersetzt weder MTurk noch betreibt es Annotationswarteschlangen im Produktivbetrieb.** Halten Sie diese Grenze bei der Planung des Übergangs klar fest.

Mit Kit definieren Sie die Rolle der Prüfer, erstellen Einstellungsphasen, planen Interviews, geben Kandidaten eine repräsentative Aufgabe und sammeln unabhängige Teambewertungen vor der endgültigen Entscheidung. [Rollenvorlagen](/templates) bieten eine Ausgangsstruktur, die Sie an das Fachwissen und das Risiko der jeweiligen Warteschlange anpassen können.

Kit stellt weder Arbeitskräfte aus öffentlichen Pools noch Aufgabenverteilung, Dashboards zur Übereinstimmung zwischen Prüfern oder ein Qualitätsmanagement für den Produktivbetrieb bereit. Nach der Einstellung gehören die tägliche Prüfwarteschlange und das Kalibrierungssystem in die Fachsysteme Ihres Teams. Kits Aufgabe endet dort, wo aus der Personalauswahl der laufende Betrieb wird.

Auch dieser klar begrenzte Beitrag ist wichtig. Die Abschaltung von MTurk setzt Ihnen eine Frist, sollte Sie aber nicht dazu verleiten, eine anonyme Crowd durch eine improvisierte Einstellungsentscheidung zu ersetzen. Definieren Sie die Arbeit, prüfen Sie tatsächliches Urteilsvermögen, vergleichen Sie Prüfer anhand von Referenzfällen und machen Sie eine Person für die endgültige Entscheidung verantwortlich.

Wenn Sie ein dauerhaftes Prüfteam aufbauen, können Sie [Kit kostenlos testen](/users/sign_up) und den Einstellungsprozess an einem Ort steuern. Die umfassendere Migration bleibt Ihre Aufgabe: Schützen Sie die Daten, messen Sie die Entscheidungen und gestalten Sie einen Human-in-the-Loop-Prozess, der auch den nächsten Anbieterwechsel übersteht.