IA y modelos
El modelo Opus 4.6 de Anthropic muestra avances en tareas profesionales
El nuevo modelo Opus 4.6 de Anthropic muestra un mejor desempeño en tareas profesionales, con una puntuación apenas inferior al 30% en pruebas de un solo intento, aunque los abogados siguen a salvo de un reemplazo inmediato.
El mes pasado, Mercor (proveedor de evaluaciones comparativas) midió las capacidades de los agentes de IA en tareas profesionales como derecho y análisis corporativo. En ese momento, las puntuaciones eran bajas, y todos los laboratorios principales obtuvieron menos del 25% en la evaluación. Esto llevó a la conclusión inicial de que los abogados estaban a salvo del desplazamiento por IA, al menos por el momento.
Esta semana, Anthropic lanzó su modelo Opus 4.6, que demuestra un salto significativo en el desempeño en esas mismas tareas profesionales. En las pruebas, el modelo obtuvo una puntuación apenas inferior al 30% en pruebas de un solo intento (one-shot trials). Una prueba de un solo intento es un método de evaluación de IA donde el modelo recibe un único intento para resolver un problema. Esta puntuación representa una mejora notable respecto a las evaluaciones anteriores, donde los principales laboratorios obtuvieron menos del 25%.
Sin embargo, el lanzamiento de Opus 4.6 ha alterado esas suposiciones. Al darle algunos intentos más para resolver el problema, el modelo logró un promedio del 45%. El lanzamiento del modelo incluyó varias funciones de agente nuevas, como los “enjambres de agentes” (agent swarms), que son funciones de IA diseñadas para la resolución de problemas de varios pasos. Estas funciones podrían haber ayudado con este tipo de resolución de problemas de varios pasos.
El rápido progreso en estas evaluaciones ha atraído la atención de los observadores de la industria. El CEO de Mercor, Brendan Foody, destacó la importancia del desarrollo, afirmando que “saltar del 18.4% al 29.8% en unos pocos meses es una locura”. Este salto desde la puntuación anterior de vanguardia del 18.4% a la nueva puntuación de evaluación del 29.8% indica que el progreso en los modelos fundacionales continúa sin desacelerarse.
A pesar de estos avances, el treinta por ciento todavía está muy lejos del 100%. Debido a esta brecha, no es como si los abogados tuvieran que preocuparse por ser reemplazados por máquinas la próxima semana. Si bien los resultados de la evaluación muestran que las capacidades de los agentes de IA en tareas profesionales como derecho y análisis corporativo están mejorando, los profesionales humanos en estos campos no enfrentan un desplazamiento inmediato, aunque podrían tener menos motivos para estar confiados que el mes pasado.
Por qué importa
El lanzamiento del modelo Opus 4.6 de Anthropic muestra un salto significativo en el desempeño en tareas profesionales como derecho y análisis corporativo, desafiando las suposiciones previas sobre el desplazamiento por IA.