Solo el 2,5% del trabajo remoto es automatizable por IA

Un nuevo referente para medir la automatización

El Center for AI Safety (CAIS) y Scale AI han presentado el Remote Labor Index (RLI), el primer benchmark diseñado para evaluar si los agentes de inteligencia artificial pueden completar encargos reales de trabajo digital, tal como lo haría un profesional humano.

A diferencia de las pruebas tradicionales que analizan la inteligencia o habilidades específicas de los modelos, como programar o buscar en la web, el RLI se enfoca en medir el impacto económico potencial de la IA en el mercado laboral. Para ello, incluye 240 proyectos reales de plataformas de trabajo freelance como Upwork, que abarcan desde diseño de productos y desarrollo de videojuegos hasta arquitectura o visualización de datos.

Resultados: la IA aún está lejos de competir con los humanos

A pesar de los avances en tareas puntuales, el estudio demuestra que la inteligencia artificial todavía no está lista para reemplazar a los trabajadores en la mayoría de profesiones digitales. El mejor modelo probado solo logró completar con éxito un 2,5% de los encargos. Entre los modelos evaluados se encuentran Manus, Grok 4, GPT-5, ChatGPT Agent y Gemini 2.5 Pro.

Los encargos del RLI requieren entregables complejos, como vídeos animados, diseños CAD o juegos interactivos. Estas tareas demandan habilidades técnicas, coordinación de múltiples archivos y un nivel profesional de calidad, algo que los modelos actuales no consiguen replicar de forma consistente.

Proyectos reales, datos reales

Cada proyecto del índice incluye tres elementos: un encargo detallado, los archivos necesarios y el resultado profesional entregado por un humano. Estas tareas han sido remuneradas por clientes reales y abarcan más de 6.000 horas de trabajo, valoradas en más de 140.000 dólares.

Entre los ejemplos hay juegos tipo “Watermelon Game”, visualizaciones interactivas de datos del World Happiness Report, vídeos promocionales, diseño de interiores o la creación de dashboards web. La diversidad refleja la complejidad del trabajo freelance moderno.

Evaluación rigurosa y resultados transparentes

Para validar los resultados, los autores implementaron un sistema de evaluación manual en el que expertos comparan la entrega generada por la IA con la de un humano. La IA supera la prueba solo si el resultado es equivalente o mejor que el del profesional.

Los principales motivos de fallo incluyen archivos corruptos, entregas incompletas, calidad insuficiente o falta de coherencia visual. Solo en áreas muy específicas, como edición de audio, escritura de textos o tareas gráficas sencillas, las IA mostraron rendimientos comparables a los humanos.

¿Qué significa esto para el futuro del trabajo?

El RLI no solo mide el presente, sino que establece una base empírica para seguir el progreso de la automatización. El sistema de puntuación Elo empleado muestra que, aunque el nivel actual de automatización es bajo, los modelos más nuevos están mejorando de forma constante.

Esto tiene implicaciones clave para investigadores, legisladores y empresas: proporciona una forma objetiva de evaluar cuándo una IA está realmente lista para asumir tareas laborales, más allá del bombo publicitario o los resultados en benchmarks académicos.

Una herramienta para entender y anticipar

El Remote Labor Index se plantea como una herramienta crucial para anticipar los efectos de la IA en el empleo digital. Al basarse en proyectos económicos reales y evaluar el rendimiento de los modelos en condiciones similares a las del mercado, ofrece una visión más clara del impacto que la automatización podría tener en profesiones del conocimiento.

Si bien aún estamos lejos de una IA que pueda sustituir a diseñadores, arquitectos o desarrolladores de videojuegos, el RLI permite observar con claridad la dirección hacia la que nos dirigimos y el ritmo de avance.

La fotografía de representación de esta noticia pertenece a Possessed Photography y ha sido publicada en Unsplash

ChatGPT
ChatGPThttps://chatgpt.com/
En The AI Revolution News utilizamos ChatGPT para traducir y/o generar algunos textos a partir de notas de prensa oficiales. Todos estos artículos son revisados por humanos para evitar alucinaciones de la inteligencia artificial y ofrecer una información rigurosa y veraz.

Artículos relacionados

Comentarios

DEJA UNA RESPUESTA

Por favor ingrese su comentario!
Por favor ingrese su nombre aquí

Este sitio usa Akismet para reducir el spam. Aprende cómo se procesan los datos de tus comentarios.

+ Noticias