MTurk cierra: crea tu equipo de revisión humana

El cierre de Mechanical Turk fija el plazo para proteger datos sensibles, clasificar las tareas de revisión y crear un equipo de intervención humana bien calibrado.

Ernest Bursa

Ernest Bursa

Founder · · 13 min de lectura
An older East Asian startup founder waiting at an outdoor tram stop with a notebook and a modest startupkit wordmark on his jacket

Amazon Mechanical Turk cerrará definitivamente el 30 de septiembre de 2026, incluida su plantilla pública en SageMaker Ground Truth y Amazon Augmented AI. Antes del cierre de Mechanical Turk, exporta el historial, termina las tareas abiertas y clasifica cada cola de revisión por riesgo y conocimientos necesarios. Decide también qué trabajo conviene automatizar, cuál encargar a un proveedor o a contratistas y cuál asignar a un equipo de revisión humana con formación.

No se trata solo de cambiar de proveedor. MTurk hacía que el criterio humano pareciese una API: enviabas una tarea de inteligencia humana (HIT), recibías una respuesta y pagabas por tarea. Su cierre deja al descubierto todas las decisiones operativas que ocultaba esa interfaz. Aún necesitas saber quién puede ver los datos, qué cualificación necesita una persona para evaluarlos, cómo resuelves los desacuerdos y quién se responsabiliza de la respuesta final.

¿Cuál es el calendario del cierre de Mechanical Turk?

MTurk cierra el 30 de septiembre de 2026, pero varios plazos del proceso de cierre siguen vigentes después de que el servicio deje de aceptar trabajo. Incluye ya esas fechas en un plan de migración con una persona responsable. No las dejes olvidadas en una pestaña del navegador confiando en que alguien se acordará.

Según las preguntas frecuentes de Amazon sobre el cierre:

  • Los trabajadores pueden enviar HIT hasta el 30 de septiembre de 2026. Las HIT sin enviar caducarán cuando cierre el servicio.
  • Los solicitantes disponen del plazo habitual de 30 días para aprobar o rechazar el trabajo enviado antes del cierre. Los envíos que no se revisen se aprobarán automáticamente al terminar ese plazo.
  • Los solicitantes pueden conceder bonificaciones hasta el 30 de octubre de 2026.
  • Los saldos prepagados de los solicitantes deberían reembolsarse en un plazo de 30 días.
  • El historial de transacciones seguirá accesible hasta el 28 de enero de 2027.
  • El 30 de septiembre, la plantilla pública de MTurk también dejará de estar disponible para flujos de revisión humana nuevos o existentes en SageMaker Ground Truth y Amazon Augmented AI.

Amazon no explica el motivo del cierre en sus preguntas frecuentes. No bases la migración en especulaciones sobre lo ocurrido. Básala en la fecha confirmada y en el trabajo que tu producto todavía necesita.

Empieza por nombrar a una persona responsable. Debe inventariar todas las integraciones directas con MTurk, todos los flujos de etiquetado o revisión de AWS que usan la plantilla pública, todas las tareas programadas que crean HIT y todos los procesos posteriores que dependen de sus resultados. Incluye las cuentas puntuales de investigación y operaciones, no solo el código de producción.

Conserva después lo que necesitarás a partir del 28 de enero. Exporta los registros de transacciones, las definiciones de tareas, las reglas de cualificación, los ejemplos de referencia validados, las instrucciones para los revisores, los motivos de rechazo y los informes de calidad. Un registro de pagos por sí solo no te permitirá reconstruir por qué se aceptó una etiqueta.

¿Qué aportaba realmente MTurk a las startups de IA?

MTurk aportaba capacidad humana flexible, distribución de tareas, pagos y un flujo de trabajo programable. No eliminaba la necesidad de diseñar el criterio de evaluación. Esa diferencia importa al decidir con qué sustituirlo.

La presentación del producto MTurk de Amazon cita como usos principales la recopilación y anotación de datos para aprendizaje automático, la corrección continua y la validación con intervención humana. También deja claro el atractivo económico: las empresas podían ampliar o reducir una plantilla distribuida sin tener que crear toda una operación interna.

Para una startup, ese paquete resolvía varias necesidades a la vez:

  1. Alcance: podías pedir a un grupo público numeroso que completase tareas pequeñas.
  2. Flexibilidad: pagabas por el trabajo cuando había cola, en lugar de mantener una capacidad fija.
  3. Distribución: la plataforma asignaba unidades de trabajo y recopilaba las respuestas.
  4. Administración: gestionaba las cuentas, los saldos y los pagos de los trabajadores.
  5. Integración: una API conectaba las decisiones humanas con un flujo de software.

Esa abstracción tan cómoda también ocultaba decisiones que seguían siendo responsabilidad de tu equipo. ¿Quién estaba cualificado? ¿Las instrucciones eran lo bastante claras para alguien ajeno a la empresa? ¿Podía el trabajador ver datos personales o confidenciales? ¿El acuerdo de la mayoría tenía algún valor real? ¿Qué ocurría cuando una etiqueta cambiaba el resultado para un cliente?

Si nadie puede responder a esas preguntas, tu empresa no tenía un sistema con intervención humana. Tenía una cola con personas en algún punto del proceso.

Por eso el cierre puede ser útil a pesar del trastorno. Te da una fecha límite para convertir una dependencia accidental en una función operativa explícita.

¿Debes sustituir MTurk por otra plataforma de crowdsourcing?

Una plataforma equivalente puede ser una alternativa, pero solo para trabajos seguros, acotados y medibles. Clasifica la tarea antes de comparar proveedores. De lo contrario, conservarás los mismos riesgos ocultos detrás de una API nueva.

Hazte cuatro preguntas para cada cola:

  • Sensibilidad: ¿qué puede ver el revisor? ¿Incluye datos de clientes o candidatos, documentos internos, información personal o registros regulados?
  • Conocimientos: ¿puede emitir el juicio una persona generalista con formación o hacen falta conocimientos especializados?
  • Ambigüedad: ¿hay una respuesta objetivamente correcta, una rúbrica estable o un abanico legítimo de interpretaciones?
  • Impacto: ¿qué ocurre si la respuesta es incorrecta? ¿Puedes revertirla con poco coste o afecta a la seguridad, el acceso, el empleo, el dinero o la relación con un cliente?

La documentación de AWS sobre su plantilla pública establece un límite claro de privacidad. Indica que no deben enviarse a los trabajadores públicos de MTurk datos confidenciales, información personal ni información sanitaria protegida. Los datos enviados a esa plantilla deben marcarse como libres de datos de identificación personal.

Esa restricción debe mantenerse después de MTurk. Trasladar la misma cola sensible a otro grupo público no vuelve seguros los datos.

Alternativa Cuándo encaja mejor Riesgo principal
Automatización o modelo que emite el veredicto Triaje determinista y reversible con pruebas sólidas Un error sistemático puede propagarse por toda la cola
Servicio gestionado de anotación Picos de capacidad con operaciones externalizadas La calidad de los revisores y la subcontratación pueden ser opacas
Grupo privado de contratistas Trabajo acotado y recurrente con revisores conocidos Tú asumes la programación, la gestión y las obligaciones sobre su clasificación laboral
Equipo interno de revisión Decisiones sensibles, especializadas o de gran impacto Coste fijo y volumen irregular en la cola
Revisión híbrida por niveles Trabajo mixto con límites de escalado claros Exige diseñar y medir mejor el flujo de trabajo

Para la mayoría de las startups de IA, la revisión híbrida es la opción predeterminada más fácil de justificar. Automatiza las reglas que puedas probar. Asigna los juicios recurrentes y acotados a revisores con formación. Escala los casos ambiguos y de gran impacto a expertos. Nombra a una persona que pueda cambiar la rúbrica y resolver disputas.

No confundas automatización con migración. Un modelo puede reducir la cola, preclasificar casos o redactar una recomendación. No debe convertirse en juez final sin que nadie lo decida expresamente solo porque ha desaparecido el proveedor de trabajo humano.

¿Qué tareas con intervención humana necesitan expertos?

La revisión experta está justificada cuando la tarea combina ambigüedad, conocimientos especializados, datos sensibles o errores costosos. El etiquetado sencillo puede seguir encajando con generalistas formados. La clave es encaminar el trabajo según el riesgo, no declarar que una modalidad de personal es siempre superior a las demás.

Un sistema práctico de revisión tiene cuatro niveles:

  1. La automatización determinista se ocupa de reglas cuya respuesta puede verificarse mediante código.
  2. Los generalistas con formación se ocupan de juicios repetibles, con una rúbrica clara y datos seguros.
  3. Los expertos en la materia se ocupan de casos límite, material sensible y decisiones que dependen del contexto profesional.
  4. Una persona designada para arbitrar resuelve desacuerdos, atiende recursos y se hace cargo de los cambios en la rúbrica.

Las actas del taller Data Science with Human-in-the-Loop muestran la misma división del trabajo en procesos de investigación: las personas no expertas pueden hacer anotaciones sencillas, mientras que el análisis de errores complejos y las decisiones de mejora necesitan ingenieros o especialistas en la materia.

Sumar más votos anónimos no produce la verdad de forma automática. AWS señala que asignar más trabajadores puede mejorar las tareas de etiquetado complejas, pero ofrece pocas ventajas en las sencillas. Un estudio revisado por pares sobre vigilancia de la salud pública recurrió a tres trabajadores por elemento y comparó sus respuestas con un conjunto de referencia. Los investigadores midieron la fiabilidad en lugar de tratar el acuerdo como una prueba concluyente.

El trabajo complejo también entraña un riesgo más sutil. Un estudio de 2026 de Harvard Data Science Review, Bias in the Loop, concluyó que las personas sin conocimientos especializados pueden tener dificultades con tareas exigentes y que las sugerencias de la IA pueden sesgar el juicio humano. Un revisor que pulsa «de acuerdo» después de leer la respuesta de un modelo no supone una comprobación independiente.

Diseña el proceso para que haya independencia donde importa. Pide a los revisores que puntúen antes de ver la respuesta propuesta por el modelo o la decisión de otra persona. Muestra las sugerencias más tarde, si es que las muestras. Conserva la justificación para que quien arbitra pueda distinguir entre una rúbrica deficiente y una revisión descuidada.

¿Cómo se contrata a un equipo de revisión humana?

Contrata a los revisores por el criterio que demuestran ante casos representativos, no por afirmaciones genéricas sobre su atención al detalle. Define el trabajo, paga a los candidatos por una prueba realista, puntúala de forma independiente e incluye entre los requisitos saber cuándo escalar un caso.

Define el resultado antes de redactar la oferta

Empieza por la decisión que debe tomar el revisor y las pruebas de las que dispondrá. Describe los casos normales, los casos límite, los límites de acceso a los datos, el ritmo esperado y el punto en el que debe detenerse y escalar el caso.

«Revisar resultados de IA» no es un puesto. «Evaluar si las respuestas de soporte cumplen la política, citan los datos facilitados sobre la cuenta, evitan promesas prohibidas y escalan los casos dudosos de reembolso» sí describe un puesto que alguien puede entender y poner a prueba.

Elige la relación laboral después de definir la cola. Un proveedor gestionado puede encajar con un pico estacional. Un grupo privado de contratistas puede servir para trabajo recurrente con revisores estables. Un empleado puede ser la opción adecuada para una cola sensible que exige mucho contexto del producto y colaboración diaria. Comprueba las obligaciones legales y fiscales aplicables a tu ubicación y al tipo de relación.

Si se trata de uno de tus primeros puestos especializados, Las cinco primeras contrataciones te da un marco para decidir si la necesidad es lo bastante duradera como para justificar un puesto permanente. Si el fundador sigue al frente del proceso, Contratar sin reclutador explica cómo llevar una búsqueda disciplinada sin inventarse un departamento de RR. HH.

Usa una prueba de trabajo representativa y remunerada

Prepara una muestra breve con tipos de tareas reales y elimina los detalles sensibles. Incluye elementos sencillos, otros ambiguos y al menos un caso que deba escalarse en lugar de forzarse dentro de una etiqueta.

Evalúa a los candidatos por algo más que su coincidencia con la solución de referencia:

  • decisiones correctas en casos de referencia;
  • coste de los falsos positivos y los falsos negativos;
  • coherencia entre ejemplos parecidos;
  • calidad de la justificación escrita;
  • reconocimiento de la información que falta;
  • uso correcto del límite de escalado;
  • cuidado con la privacidad y el material confidencial.

Paga la prueba. Estás pidiendo a los candidatos que hagan un trabajo parecido al del puesto y el ejercicio puede exigir mucha concentración. Hazlo lo bastante breve para que puedan participar personas cualificadas que ya tengan empleo o responsabilidades de cuidado.

Haz que los entrevistadores puntúen de forma independiente antes de debatir. Los cuadros de evaluación para entrevistas estructuradas evitan que la opinión más contundente sustituya a las pruebas. Registra el motivo de la decisión final, sobre todo cuando el comité se aparta del resultado de la prueba de trabajo.

¿Cómo se mide la calidad de los revisores?

Mide el sistema de revisión con ejemplos calibrados, grado de acuerdo, costes de error, comportamiento ante el escalado y cambios a lo largo del tiempo. El volumen bruto y el voto mayoritario no bastan.

Crea un conjunto de referencia cuyos resultados esperados hayan sido validados por la persona responsable de la rúbrica o por un experto en la materia. No lo conviertas en una pieza de museo. Añade casos cuando el uso en producción revele una ambigüedad nueva y retira ejemplos cuando cambie la política.

Usa un cuadro de evaluación conciso:

Métrica Qué te indica Señal de alerta
Precisión en el conjunto de referencia Si los revisores aplican la rúbrica vigente La precisión cae después de un cambio de política o producto
Acuerdo por pares Si la tarea produce juicios coherentes Los revisores discrepan en casos supuestamente sencillos
Coste de falsos positivos Daño de aceptar o marcar un elemento por error La automatización prioriza el volumen mientras aumentan los errores costosos
Coste de falsos negativos Daño de pasar por alto un problema real Los revisores evitan escalados difíciles para no perder velocidad
Tasa de escalado Si los revisores reconocen la incertidumbre El escalado es casi nulo en una cola ambigua
Tasa de corrección Con qué frecuencia los expertos revierten decisiones iniciales Un revisor, un tipo de tarea o una sección de la rúbrica concentra las correcciones
Latencia de revisión Si la capacidad responde a la demanda Los casos pendientes llevan cada vez más tiempo en cola aunque el volumen diario parezca estable

Segmenta las métricas. Una cifra de precisión general puede ocultar fallos en un idioma, un grupo de clientes, un tipo de contenido o una categoría de casos límite. Revisa los desacuerdos por tipo de tarea y sección de la rúbrica.

Paga la calibración, la revisión de desacuerdos y la documentación, no solo las etiquetas aceptadas. Si la remuneración premia únicamente la velocidad, las personas actuarán de forma racional: evitarán la incertidumbre, escribirán justificaciones más pobres y se apresurarán con los casos que más necesitas que examinen.

El núcleo del marco de gestión de riesgos de IA de NIST pide definir las funciones de las personas y la IA, las tareas explícitas, las responsabilidades de supervisión y la validación en contexto. No necesitas una oficina de gobernanza propia de una gran empresa para aplicar ese principio. Necesitas responsables concretos, límites por escrito y pruebas de que el proceso funciona con tus casos reales.

¿Qué debes hacer antes del 30 de septiembre?

Aprovecha el tiempo restante para cumplir las obligaciones financieras y proteger los datos necesarios. Después, demuestra que el flujo de trabajo alternativo funciona con tareas similares a las reales antes de que desaparezca MTurk. Una migración solo está completa cuando los resultados llegan al sistema de destino y alguien puede explicar su calidad.

Sigue esta lista en orden:

  1. Nombra a una persona responsable. Dale autoridad sobre la fecha límite, el inventario y la migración definitiva.
  2. Congela las dependencias nuevas. Deja de añadir MTurk a otros flujos salvo que el trabajo vaya a terminar antes del cierre.
  3. Haz inventario de todas las colas. Incluye llamadas directas a la API, Ground Truth, Augmented AI, cuentas de investigación, tareas programadas y exportaciones manuales.
  4. Cierra el trabajo abierto. Planifica envíos, aprobaciones, rechazos, bonificaciones, saldos y comunicaciones con los trabajadores según las fechas publicadas por Amazon.
  5. Exporta las pruebas. Conserva transacciones, plantillas de tareas, cualificaciones, instrucciones, ejemplos de referencia, decisiones e historial de calidad antes del 28 de enero de 2027.
  6. Clasifica las tareas. Registra sensibilidad, conocimientos, ambigüedad, impacto, volumen, latencia y estacionalidad.
  7. Elige una vía para cada cola. Automatiza, externaliza, contrata o combina alternativas. No impongas la misma respuesta a trabajos que no tienen relación entre sí.
  8. Comprueba los límites de privacidad. Elimina los datos confidenciales y personales de los flujos destinados a plantillas públicas. Verifica las condiciones de acceso y conservación del proveedor sustituto.
  9. Ejecuta ambos sistemas durante un periodo breve. Compara los resultados sobre los mismos casos seguros y representativos. Investiga los desacuerdos en lugar de diluirlos en una media.
  10. Prueba la vuelta atrás y el escalado. Define qué ocurre si falla el sistema nuevo, se dispara el volumen de la cola o los revisores no logran ponerse de acuerdo.

Fija una fecha interna de cambio anterior al 30 de septiembre. Necesitas tiempo para descubrir que una tarea programada antigua aún crea HIT, que un analizador de resultados espera un campo específico de MTurk o que una cuenta de finanzas contiene la única exportación completa de transacciones.

¿Cómo puede ayudarte Kit a crear el equipo?

Kit puede ayudarte a contratar y seleccionar a los revisores mediante un proceso de selección estructurado y dirigido por personas. No sustituye a MTurk ni gestiona colas de anotación en producción. Mantén claro ese límite al planificar la transición.

Usa Kit para definir el puesto de revisor, crear etapas de contratación, programar entrevistas, asignar a los candidatos un ejercicio representativo y recopilar revisiones independientes del equipo antes de tomar la decisión final. Las plantillas de puestos ofrecen una estructura inicial que puedes adaptar a los conocimientos y al nivel de riesgo de la cola.

Kit no proporciona trabajadores de plataformas de crowdsourcing, distribución de tareas, paneles de concordancia entre revisores ni gestión de calidad en producción. Cuando una persona se incorpora, su cola diaria de revisión y su sistema de calibración pertenecen a las herramientas especializadas que elija tu equipo. El trabajo de Kit termina donde la selección de personal da paso al trabajo operativo.

Ese papel limitado sigue siendo importante. El cierre de MTurk te impone una fecha, pero no debería empujarte a sustituir una multitud anónima de trabajadores por una decisión de contratación improvisada. Define el trabajo, pon a prueba el criterio real, compara a los revisores con pruebas de referencia y mantén a una persona como responsable de la decisión final.

¿Vas a crear un equipo permanente de revisores? Empieza tu prueba gratuita y gestiona el proceso de selección en un solo lugar. El resto de la migración sigue en tus manos: protege los datos, mide las decisiones y diseña una función de intervención humana capaz de sobrevivir al próximo cambio de proveedor.

Artículos relacionados

¿Listo para contratar de forma más inteligente?

Empieza gratis durante 30 días. Cancela antes de que termine y no pagas nada. Configura tu primer pipeline de contratación en minutos.

Empieza gratis