Los datos públicos no dan carta blanca al emparejamiento con IA
Los datos públicos pueden servir para emparejar con IA, pero un uso responsable exige contexto, correcciones, límites de conservación y control humano.
Ernest Bursa
Los datos públicos de candidatos pueden servir para realizar emparejamientos con IA cuando el uso respeta el contexto en el que se compartieron. Pero el acceso público no equivale a un permiso ilimitado. Un sistema responsable informa de la creación de cualquier perfil derivado, conserva la fuente y la finalidad, copia solo lo necesario, permite corregir o eliminar datos, explica qué no puede demostrar una puntuación y mantiene las decisiones importantes bajo una supervisión humana real.
Esta distinción se volvió especialmente tangible esta semana. Un proyecto de Show HN llamado HN Match Maker convirtió los hilos mensuales de empleo de Hacker News en un mercado con buscador y resultados ordenados. Es una idea ingeniosa. También condensa las decisiones de producto que ya debe afrontar cualquier equipo que aplique IA a la contratación.
Las dos reacciones fáciles, «era público, así que todo vale» y «no hubo consentimiento previo, así que tiene que ser ilegal», pasan por alto lo más interesante. Las publicaciones originales invitan expresamente a ofrecer oportunidades laborales. El emparejamiento encaja con esa finalidad. Sin embargo, la extracción, el enriquecimiento, la republicación duradera y la clasificación crean un nuevo producto de datos sobre personas que solo escribieron un comentario en el foro de un tercero.
La pregunta acertada no es si los datos públicos pueden utilizarse alguna vez. Es cómo preservar la intención original de la persona al automatizar el proceso.
Qué hace realmente HN Match Maker
Cada mes, Hacker News publica dos hilos complementarios: «Who is hiring?» («¿Quién contrata?») y «Who wants to be hired?» («¿Quién busca trabajo?»). El hilo de candidatos pide indicar ubicación, preferencia por el trabajo remoto, tecnologías, currículum y correo. También da a quien lo lee una instrucción muy concreta: contactar con esas direcciones únicamente para hablar de oportunidades laborales.
HN Match Maker utiliza la API pública de HN para recopilar comentarios de primer nivel de ambos hilos. Según su página sobre el método, un modelo de lenguaje de gran tamaño (LLM) extrae competencias, ámbito, nivel profesional, horquilla salarial, ubicación y preferencia por el teletrabajo, además de las necesidades de visado. Después, el sistema descarta las combinaciones con incompatibilidades insalvables, como teletrabajo frente a trabajo presencial, horquillas salariales sin solapamiento o visados incompatibles, y ordena el resto.
La fórmula publicada es admirablemente concreta:
| Factor | Peso |
|---|---|
| Competencias | 40 % |
| Ámbito | 20 % |
| Nivel profesional | 20 % |
| Solapamiento salarial | 10 % |
| Puntuación base | 10 % |
En nuestra consulta del 2 de septiembre, el sitio mostraba 105 puestos y 130 candidatos. Eso supone hasta 13 650 combinaciones posibles antes de aplicar los filtros estrictos. Cada página de perfil incluye detalles sintetizados, una lista ordenada de puestos, un desglose de factores y un enlace al comentario original de HN.
Estas decisiones ya colocan el proyecto por delante de una etiqueta opaca del tipo «la IA dice que hay un 87 % de compatibilidad». Se puede consultar la fuente y examinar los factores. El creador aclara que la puntuación mide un encaje plausible, no constituye una decisión de contratación, y advierte de que la extracción automatizada puede interpretar mal las publicaciones más escuetas.
Pero la transparencia aritmética no equivale a validar el emparejamiento. En un ejemplo público, la fórmula daba unos 44 puntos sobre 100. Eso demuestra que el cálculo se puede comprobar. No indica si 44 es una cifra útil, si otro candidato mejor obtuvo una puntuación inferior, si la ausencia de datos beneficia o perjudica de forma sistemática, ni si alguien ha medido los resultados de contratación.
El argumento más sólido para utilizar estas publicaciones
El mejor argumento a favor de este tipo de emparejamiento no es que «internet sea público». Es que el contexto original era la contratación.
Quienes participaron en «Who wants to be hired?» («¿Quién busca trabajo?») ofrecieron voluntariamente información profesional para que las empresas pudieran encontrarles. El hilo invita a escribirles sobre trabajo. Por tanto, una herramienta que facilite el descubrimiento de oportunidades pertinentes se acerca mucho más a la finalidad declarada que, por ejemplo, un intermediario de datos que use esos mismos comentarios para crear perfiles crediticios o audiencias publicitarias.
El contexto importa tanto desde la ética de producto como desde la protección de datos. Según el Reglamento General de Protección de Datos (RGPD), el consentimiento no es la única base jurídica posible. En ciertos casos, un responsable del tratamiento puede ampararse en un interés legítimo tras documentar dicho interés, por qué el tratamiento es necesario y por qué no prevalecen los derechos de la persona. El carácter público de la información y las expectativas razonables forman parte de ese análisis.
Por eso, un artículo que afirmase que «el emparejamiento con IA siempre exige consentimiento» resultaría tranquilizador, sencillo y erróneo.
La regla más acertada es respetar el límite que eligió la persona. Una publicación pública para buscar trabajo respalda la búsqueda de perfiles con fines de contratación. No autoriza automáticamente un enriquecimiento ajeno a ese fin, una conservación permanente, inferencias sobre datos sensibles, la reventa de datos ni un descarte automatizado. Incluso dentro de la contratación, convertir un comentario en un perfil duradero con un nivel profesional inferido y recomendaciones ordenadas cambia la accesibilidad y el significado de los datos.
En ese punto, un producto necesita algo más que un enlace a la fuente.
Cuándo el descubrimiento público se convierte en perfilado silencioso
La expresión «emparejamiento con IA» esconde cinco operaciones distintas:
- Recopilación: importar un comentario público o un currículum.
- Enriquecimiento: convertir texto libre en atributos estructurados o inferidos.
- Búsqueda: ayudar a un responsable de contratación a encontrar registros pertinentes.
- Recomendación: ordenar a las personas según un encaje previsto.
- Acción: ponerse en contacto, preseleccionar o descartar a alguien.
Cada paso aumenta el efecto sobre la persona y merece sus propios controles.
Un sistema atento a la procedencia registra de dónde salió el perfil, cuándo se recopiló y qué finalidad regía la fuente. Un sistema de enriquecimiento distingue los hechos copiados de las inferencias del modelo. Un sistema de búsqueda muestra las pruebas que hicieron aparecer un resultado. Un sistema de recomendación documenta las ponderaciones, el tratamiento de los datos ausentes, los límites y la validación. Un sistema de acción atribuye a una persona concreta la responsabilidad sobre lo que ocurra después.
Reunir los cinco pasos bajo un único permiso de «datos públicos» es la forma en que una función útil de captación acaba convirtiéndose, sin hacer ruido, en una base de datos paralela de candidatos.
La Oficina del Comisionado de Información del Reino Unido (ICO, por sus siglas en inglés) encontró exactamente este patrón al auditar a proveedores de IA para contratación. Su resumen de noviembre de 2024 señala que algunas herramientas recopilaban mucha más información de la necesaria y la conservaban indefinidamente para crear grandes bases de datos de candidatos sin que estos lo supieran. El regulador formuló casi 300 recomendaciones, todas aceptadas total o parcialmente.
Las preguntas prácticas de la ICO son útiles incluso fuera del Reino Unido: ¿cuál es la finalidad?, ¿cuál es la base jurídica?, ¿quién es el responsable y quién el encargado del tratamiento?, ¿qué información es realmente necesaria?, ¿cómo sabrán los candidatos qué hace la herramienta, cómo corregirán errores y cómo podrán impugnar un resultado automatizado?, ¿durante cuánto tiempo se conservará el registro?
Nada de lo anterior demuestra que HN Match Maker haya infringido la ley. No hay información pública completa sobre quién lo opera, dónde lo hace, cuáles son sus procesos internos ni cómo es toda su arquitectura técnica. Sí demuestra por qué el aviso de privacidad, la política de conservación y una vía para corregir o eliminar datos deben formar parte del producto, en lugar de quedar entre las tareas pendientes del equipo jurídico.
Desglosar una puntuación no equivale a validarla
La explicabilidad tiene al menos tres capas, y los productos de contratación suelen ofrecer solo la primera.
Cálculo: ¿puede una persona reproducir la puntuación a partir de los factores mostrados? HN Match Maker lo resuelve bastante bien.
Interpretación: ¿sabe qué significa la puntuación? Un 44 puede ser malo, habitual o excelente según la distribución y el umbral. Sin calibración, no es más que un número con una falsa precisión decimal.
Validez: ¿mejora la puntuación el resultado que pretende respaldar? Para saberlo hay que contrastarla con valoraciones o resultados pertinentes, vigilar los patrones de error y comprobar si el rendimiento varía entre grupos y tipos de puesto.
Una ponderación fija también encierra decisiones de producto. ¿Por qué debería pesar el solapamiento de competencias el doble que el nivel profesional? ¿Cómo se normalizan «Ruby», «Rails» y «Hotwire»? Cuando no se indica la horquilla salarial, ¿se asigna un valor neutro, una penalización o incertidumbre? ¿El «encaje con el ámbito» parte de una experiencia explícita o de una conjetura del LLM? Una fórmula transparente permite ver estas preguntas, pero no las responde.
El Marco de Gestión de Riesgos de IA del Instituto Nacional de Estándares y Tecnología de Estados Unidos (NIST) propone un modelo operativo útil: gobernar, contextualizar, medir y gestionar. Es una guía voluntaria, no una norma de contratación. Su valor está en abarcar todo el ciclo de vida. Los equipos documentan el uso previsto, miden el rendimiento y los efectos, recogen comentarios de las personas afectadas, supervisan el comportamiento en producción y definen cómo puede una persona contradecir al sistema o detenerlo.
Para una herramienta de emparejamiento de candidatos, estas métricas resultan útiles:
- Tasas de error de extracción por campo y formato de origen
- Porcentaje de emparejamientos que los responsables de contratación descartan de inmediato
- Tasas de corrección, eliminación y reclamación por parte de candidatos
- Frecuencia y motivos de las decisiones humanas que contradicen al sistema
- Conversión de una sugerencia de compatibilidad en una conversación aceptada por ambas partes
- Diferencias de resultados entre puestos, ubicaciones, niveles profesionales y grupos pertinentes
- Tasas de perfiles obsoletos e intentos de contacto fallidos
Si no puedes explicar qué te llevaría a reducir la influencia de un modelo o a desactivarlo, no tienes supervisión. Tienes fe acompañada de un panel de control.
Siete controles para emparejar candidatos sin perder el contexto
Los siguientes controles separan un producto de emparejamiento útil de un índice de personas que no rinde cuentas ante nadie.
1. Guarda la finalidad junto con la procedencia
Conserva junto al registro la URL de origen, la fecha de recopilación, el tipo de fuente y la finalidad declarada. «Web pública» no es una categoría de origen suficientemente precisa para regular usos posteriores. Una publicación que invita a contactar por motivos laborales y una lista de asistentes a un congreso pueden ser públicas, pero generan expectativas muy distintas.
2. Informa antes de que el perfil tenga consecuencias
Explica a los candidatos que se han recopilado sus datos, qué se ha copiado, qué se ha inferido, por qué se tratan, quién puede verlos y cuánto tiempo se conservarán. Cuando la normativa obligue a informar en casos de recogida indirecta, puede tratarse de un deber. En otros lugares sigue siendo una decisión de producto que genera confianza.
En un directorio pequeño con perfiles accesibles, «es imposible avisar» no debería ser la premisa de partida del diseño.
3. Reduce al mínimo la republicación
Una herramienta de emparejamiento no suele necesitar volver a publicar un currículum completo, un correo personal o la publicación íntegra para demostrar la pertinencia. Muestra al equipo de contratación solo las pruebas imprescindibles y, cuando corresponda, remítelo a la fuente original. No infieras características protegidas o sensibles solo porque un modelo pueda hacerlo.
4. Separa hechos, inferencias y valores ausentes
Distingue entre «declarado por el candidato», «extraído de la fuente» e «inferido por el modelo». Indica cuándo faltan el salario, el nivel profesional o la ubicación, en vez de inventar certeza sin decirlo. Permite que tanto el candidato como el responsable de contratación corrijan el registro.
5. Inicia el plazo de conservación al recopilar los datos
Los datos de candidatos deben caducar. En una publicación mensual de empleo resulta especialmente sencillo fijar esa caducidad, porque la propia fuente está acotada en el tiempo. Renueva los datos solo cuando haya una señal nueva o una renovación expresa, no cada vez que un rastreador vuelva a visitar la página.
6. Facilita la exclusión y la eliminación
Incluye en el propio perfil una vía clara para corregir los datos, oponerse al tratamiento, impedir usos posteriores o solicitar su eliminación. El derecho de supresión no es absoluto en todas las jurisdicciones, pero obligar a alguien a investigar quién opera el servicio es un mal diseño de producto, al margen del mínimo legal.
7. Separa el emparejamiento de las decisiones y los mensajes
Una puntuación de compatibilidad debe mostrar pruebas, no convertirse en un filtro de descarte automático. El responsable de contratación debe elegir a quién revisar y por qué. Para contactar debe exigirse una aprobación independiente vinculada al destinatario y al contenido exacto del mensaje. Ese límite reduce las consecuencias de una extracción errónea o una puntuación mal calibrada.
Cómo funciona en Kit y qué le queda por resolver
Kit separa deliberadamente el consentimiento para la bolsa de talento, la búsqueda, la conservación y la aprobación del contacto.
Los candidatos que se unen a una bolsa de talento pública de Kit aceptan la declaración de consentimiento que se les muestra, verifican su correo y quedan sujetos a un plazo de conservación configurable. El valor predeterminado es de 24 meses. Antes de que venza, el sistema puede avisar y solicitar la renovación; si el candidato la rechaza o el consentimiento caduca, el registro se anonimiza. Los responsables de contratación pueden utilizar la extracción y búsqueda en currículums entre los perfiles verificados, pero la búsqueda devuelve pruebas, no una puntuación de idoneidad para un puesto. No afirma que la similitud coseno prediga a quién se debería contratar.
Cuando un responsable de contratación pasa del descubrimiento a la toma de contacto, Kit lo trata como otra decisión. La aprobación del envío queda vinculada al destinatario, remitente, asunto, cuerpo, versión, persona que aprobó y momento exactos. Si cambia el mensaje, la aprobación queda invalidada. Es el mismo principio descrito antes: la búsqueda puede sugerir, pero una persona se responsabiliza de la acción. Consulta Privacidad y consentimiento de candidatos y Revisar y enviar mensajes para conocer el proceso actual.
También existe una carencia real. La importación masiva de currículums de Kit registra la procedencia y exige que la empresa importadora declare que cuenta con una base jurídica y que informará a los candidatos. Sin embargo, los registros importados a la bolsa de talento todavía no están verificados ni llevan asociado un consentimiento, no aparecen en la búsqueda verificada habitual y no parecen incorporarse automáticamente al mismo proceso de caducidad del consentimiento. Kit tampoco ofrece una cuenta de autoservicio general para que un candidato elimine su registro de la bolsa de talento.
Conviene exponer estos límites con claridad. Una declaración no es consentimiento, y registrar la procedencia no equivale a completar el ciclo de vida. El siguiente paso del producto consiste en incorporar los registros importados a un proceso que tenga en cuenta su origen y abarque aviso, verificación, renovación y eliminación, sin fingir que todas las jurisdicciones y fuentes se rigen por la misma norma.
Es una postura más honesta que colocar una etiqueta de «IA responsable» sobre una puntuación oculta.
El emparejamiento sirve para descubrir, no para decidir
HN Match Maker resulta útil porque se sitúa justo en ese límite. Los datos de origen eran realmente públicos. Los candidatos sí invitaron a recibir oportunidades laborales. El proyecto expone su fórmula y enlaza las pruebas originales. Son puntos importantes a su favor.
Las preguntas pendientes empiezan donde aparece la nueva capa de producto: ¿se informó a la persona sobre el perfil sintetizado?, ¿puede corregirlo o eliminarlo?, ¿qué caduca?, ¿qué campos son inferencias?, ¿qué predice la puntuación?, ¿cómo se prueba?, ¿quién responde cuando un responsable de contratación confunde una clasificación con un juicio?
La respuesta no consiste en prohibir el emparejamiento ni en exigir una ventana de consentimiento para cada enlace. Consiste en diseñar el sistema para que el contexto sobreviva a la automatización.
Mantén la procedencia vinculada. Copia lo mínimo. Muestra la incertidumbre. Permite que las personas corrijan el registro. Haz caducar los datos obsoletos. Mide los resultados y las decisiones humanas que contradicen al sistema. Exige que una persona se responsabilice de la preselección, el descarte y el mensaje.
La intención manifestada en público puede justificar el descubrimiento. No da carta blanca para crear un perfil permanente ni tomar una decisión invisible.
¿Buscas una bolsa de talento donde el consentimiento, la búsqueda verificada, la conservación y la aprobación del contacto sean controles independientes? Empieza tu prueba gratuita con Kit. El producto todavía no resuelve todos los casos límite, y precisamente por eso sus controles y carencias deben permanecer visibles.
Artículos relacionados
¿Listo para contratar de forma más inteligente?
Empieza gratis durante 30 días. Cancela antes de que termine y no pagas nada. Configura tu primer pipeline de contratación en minutos.
Empieza gratis