Aplicaciones

El 16% del trabajo autónomo ya es automatizable, el listón está subiendo

En menos de un año, la proporción de misiones independientes que una IA puede llevar a cabo a nivel profesional se ha más que cuadruplicado, según el Índice de Trabajo Remoto del Centro para Laboratorios de Escala y Seguridad de la IA. Claude Fable 5 aplasta a la competencia. Y el estudio está lleno de lecciones sabrosas.

El Índice de trabajo remoto (RLI) no se parece a ningún otro punto de referencia. Aquí no hay preguntas de opción múltiple ni acertijos matemáticos: 240 misiones independientes pagadas reales (modelado 3D, arquitectura, gráficos, video, audio, datos, aplicaciones web) con información para el cliente, archivos fuente y entregables de referencia producidos por un profesional pago. Los evaluadores humanos deciden: ¿merece la pena el trabajo de la IA que el del profesional? El veredicto se llama «tasa de automatización».

Cuando se publicó el índice de referencia a finales de 2025, el mejor agente tenía un límite del 2,5%.. Suficiente para que los autónomos duerman tranquilos. Los resultados publicados esta semana cambian las reglas del juego : GPT-5.5 alcanza el 6,3%, Claude Opus 4.8 sube al 8,3% y Claude Fable 5 se dispara hasta el 16,1%. La frontera se ha más que cuadruplicado en menos de ocho meses. Detalle fundamental: habiendo sido restringido el acceso a Fable 5 durante la evaluación por parte del gobierno americano, sólo se pudieron probar 218 de los 240 proyectos. Incluso si falla en los 22 restantes, su puntuación mínima del 14,6% lo dejaría a la cabeza.

Capture decran 2026 07 03 101220 e1783066412712

Cuando la IA hace trampa… y la IA juzgada se deja engañar

¿La pepita del estudio? Para prescindir de sus costosos evaluadores humanos, los investigadores probaron un “juez de IA”, un agente responsable de calificar los resultados para ellos. Calibrado sobre la generación anterior de modelos, donde sus veredictos se ajustaban a los de los humanos, este juez se descarrila tan pronto como le presentamos los nuevos: atribuye al GPT-5.5 un 17,9% de automatización (frente al 6,3% en la realidad) y al Opus 4.8 un 18,8% (frente al 8,3%). Una sobreestimación de un factor de 2,5 a 3, aunque, hay que reconocerlo, la clasificación relativa de los modelos sigue siendo correcta.

La explicación es interesante: evaluar un producto entregable es en sí mismo una tarea de agencia exigente. Hay que abrir los archivos en el software profesional adecuado, inspeccionar la geometría de un modelo 3D, manipular las herramientas con el ojo crítico de un cliente. Precisamente lo que a los agentes todavía les cuesta dominar. Por lo general, GPT-5.5 ofrecía una excelente “representación 3D” de un baño… realmente generada por un modelo de imagen, sin ningún modelado detrás. Sólo un evaluador humano, al abrir el proyecto, podría desenmascarar el engaño. Moralidad: para juzgar el trabajo de la IA, los humanos siguen siendo –por el momento– insustituibles.

Condiciones reales

Sin embargo, el estudio es interesante porque mide algo más concreto que los puntos de referencia habituales. Para no subestimar los modelos, el SEPARADO se encargó de la administración: agentes que ejecutan Claude Code y Codex CLI enriquecidos con una herramienta de uso informático, Linux VM equipado con más de 30 aplicaciones profesionales (Blender, GIMP, Kdenlive, Audacity, LibreOffice, etc.), hasta 24 horas por proyecto, GPU A100 bajo demanda, presupuesto de 50 dólares por misión (150 para Fable 5, precio requerido). Con, como beneficio adicional, un bucle de “trabajador-crítico” donde un segundo agente interpreta al cliente exigente y envía al primero a su copia hasta que quede satisfecho. Por lo tanto, el punto de referencia no prueba un chatbot para apnea, sino una forma rudimentaria de colega digital equipado.

¿Deberíamos entrar en pánico? Aún no. Casi el 84% de las misiones siguen fuera de alcance e incluso los entregables de Fable 5 presentados como ejemplos delatan acabados que ningún cliente aceptaría. Pero la trayectoria es clara: del 2,5% al ​​16,1% en ocho meses. La progresión sigue una curva exponencial. La IA no va a robarse toda la oficina en una noche. Pero rápidamente devora las tareas, proyecto tras proyecto, entregable tras entregable. Esta no es todavía la gran resignación de los humanos. Pero esto ya es el comienzo de un nuevo organigrama. Y el benchmark RLI, que integrará cada nuevo modelo importante, se destaca como un nuevo termómetro a seguir…

Capture decran 2026 07 03 101413Capture decran 2026 07 03 101413

____________________________

Lea también:

Anthropic confirma el inminente regreso de Claude Fable 5

Claude Fable 5: Anthropic (con cautela) democratiza su clase Mythos

Claude Opus 4.8: un modelo de frontera que piensa más y fanfarronea menos

GPT-5.5: OpenAI contraataca y recupera la corona de los modelos convencionales

Claude Cowork: la IA que hace muchas cosas por ti, incluso ordenar la oficina


Vistas de publicaciones: 469

[

Related posts
Aplicaciones

Se informa que Microsoft está preparando una revisión de Teams para julio

Después de mucho tiempo acumulando conversaciones, canales, reuniones, archivos, apps…
Read more
Aplicaciones

El nuevo Siri ya casi está aquí... pero no en la UE

Después de años de confundir un asistente inteligente con un temporizador parlante, Apple quiere…
Read more
Aplicaciones

LibreOffice saca la regla de madera... y duele

Presentado como una alternativa de oficina europea a Microsoft 365 y Google Docs, Euro-Office no ha…
Read more

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *