Al combinar rendimiento agente, gestión optimizada del contexto y eficiencia económica, Claude Opus 4.5 confirma la madurez tecnológica de Anthropic y relanza la carrera por los modelos agente. Como Gemini 3 y GPT-5.1 ilustra el gran progreso logrado por la IA a finales de año y el cambio de los LLM hacia capacidades operativas concretas, donde convergen el razonamiento, la automatización y la integración profunda.
Después de Google y OpenAI, es el turno de Anthropic de llevar el control deslizante un paso más. En pocos días vimos surgir el mal llamado GPT-5.1 que podría haberse llamado GPT-6 ya que la diferencia en la calidad de respuesta es muy obvia en comparación con GPT-5 y la IA revela una cara diferente. Lanzamiento acompañado de GPT-5.1-Codex Máximo un modelo de codificación “agente” capaz de funcionar durante más de 24 horas seguidas, dando paso a mecanismos avanzados de compactación de contexto.
La semana pasada, Google sacó su Géminis 3 Proel nuevo favorito de los rankings de referencia acompañado de un Nano Plátano Pro increíble en la edición de fotografías. Una vez más, el salto cualitativo entre “3 Pro” y “2.5 Pro” es importante.
Obviamente, en este juego de superioridad, Anthropic no podía quedarse sin una respuesta. Y su Claude Opus 4.5 presentado anoche demuestra una vez más que si realmente existe un techo de cristal para los LLM, aún no se ha alcanzado o ha sido superado mucho por esta nueva generación de modelos de frontera.
Un Opus diseñado para código, agentes y uso informático real
Con un 80,9% en SWE-bench Verified, por delante de GPT-5.1-Codex-Max (77,9%) y Gemini 3 Pro (76,2%), el nuevo modelo de Anthropic recupera la “corona del código” y la ingeniería de software automatizada para IA. Porque sí, una vez más, es en el campo de la codificación donde el marketing de Anthropic enfatiza como si fuera el uso principal de sus modelos de IA.
Anthropic presenta Claude Opus 4.5 como su modelo “ el más inteligente, más eficiente y mejor del mundo para códigos, agentes y uso de computadoras ».
Más allá de la fórmula, varios elementos objetivos respaldan esta promesa. Primero, los puntos de referencia. Opus 4.5 logró un 80,9 % en SWE-bench Verified, un corpus de tickets realistas de GitHub en los que hay que comprender un error, navegar por el código existente, aplicar una solución y ejecutar las pruebas. El modelo también domina SWE-bench Multilingual en 7 de 8 idiomas, lo que demuestra un salto de más de 10 puntos en Help Polyglot (problemas de código complejo). Por último, está avanzando con fuerza en pruebas de referencia agentes como BrowseComp-Plus, Vending-Bench o τ2-bench, que prueban la capacidad de ejecutar escenarios prolongados en sistemas reales.
Opus 4.5 destaca sobre todo en términos de uso directo del ordenador (la capacidad agente “Uso del Ordenador”). En OSWorld, un benchmark que mide la capacidad de un modelo para controlar una interfaz gráfica (abrir ventanas, manipular archivos, configurar herramientas), alcanzó el 66,3%, donde las generaciones anteriores se mantuvieron significativamente por debajo.
Es esta base la que impulsa los nuevos casos de uso que Anthropic destaca: agentes capaces de automatizar tareas de oficina complejas, realizar flujos de trabajo financieros o procesar escenarios de investigación cibernética mediante la combinación de registros, inteligencia de amenazas y repositorios de vulnerabilidades.
Anthropic también insiste en la capacidad del Opus 4.5 de “durar en el tiempo”. En una prueba interna tipo “examen para llevar a casa” para ingenieros de desempeño, el modelo obtuvo, en dos horas, una mejor puntuación que cualquier candidato humano que haya pasado esta evaluación. Los comentarios de socios como Warp, Cursor o Notion también convergen: menos callejones sin salida en tareas largas, más tareas completadas y un consumo significativamente reducido de tokens para igual calidad.
Debajo del capó: compactación, “esfuerzo” e integración profunda en las herramientas
Técnicamente, Opus 4.5 no sólo gana en “IQ”, sino también en higiene laboral. Al igual que GPT-5.1-Codex-Max, el modelo está diseñado para gestionar mejor su contexto a lo largo del tiempo, gracias a mecanismos de compactación y memoria que permiten resumir inteligentemente lo sucedido en lugar de simplemente desplegar un contexto gigantesco de 1 millón de tokens.

Otra novedad interesante para los departamentos de TI y sus equipos: el famoso parámetro “Esfuerzo”. En la API de Claude, es posible controlar el nivel de esfuerzo de razonamiento del modelo y, por tanto, el compromiso coste/latencia/capacidad. Con un «esfuerzo» promedio, Opus 4.5 iguala la mejor puntuación de Sonnet 4.5 en SWE-bench Verified mientras utiliza un 76% menos de tokens de salida; al máximo esfuerzo, gana otros 4,3 puntos y sigue siendo un 48% más económico que Sonnet.
En otras palabras, el modelo no se contenta con ser más fuerte: “funciona mejor”, dando menos rodeos para lograr el mismo resultado.
Y con un dinamismo que recuerda al de Google, que impuso instantáneamente su Gemini 3 en todas partes, Anthropic apoya el lanzamiento con una explosión de integraciones concretas. Claude Code evoluciona con un modo Plan más estructurado (preguntas aclaratorias, archivo plan.md editable, ejecución orquestada) y llega a la aplicación de escritorio de Claude para iniciar varias sesiones locales o remotas en paralelo.
Sobre todo, aparecen dos integraciones muy significativas para el día a día de los equipos: Claude para Chrome y Claude para Excel, hasta ahora en forma piloto, están cada vez más disponibles para las ofertas Max, Team y Enterprise. Suficiente para sugerir agentes capaces de manipular automáticamente hojas, presentaciones o documentos complejos de Excel, con ganancias del 15 al 20% en tareas de automatización financiera según las evaluaciones internas de Anthropic.
Finalmente, Opus 4.5 se lanza con una importante caída de precio: 5 dólares por millón de tokens de entrada y 25 dólares de salida, aproximadamente un tercio del coste de los modelos Opus anteriores y hasta un 67% de reducción según algunos análisis. E inevitablemente, este es un activo clave para los departamentos de TI que a menudo se ven frenados por los precios cobrados por Anthropic en comparación con Google y OpenAI: la “gama alta” de Anthropic se vuelve posible no solo para unas pocas pruebas de concepto o casos de uso limitados, sino también para cargas de trabajo de producción a gran escala.
Anthropic toma el rango de actor empresarial… y los hiperescaladores vienen corriendo
En el segmento de uso empresarial, Anthropic ahora rivaliza, o incluso supera, a sus principales competidores en participación de mercado declarada. Particularmente en el mercado americano. Y sólo podemos notar la prisa de los principales socios de la nube por reclamar la disponibilidad inmediata de Cloud Opus 4.5 en sus plataformas.
Microsoft, que durante mucho tiempo no tuvo acceso a los modelos Anthropic debido a su asociación con OpenAI, se apresuró a anunciar la integración del modelo en Microsoft Foundry, la nueva fábrica de agentes de IA en Azure, así como en las ofertas pagas de GitHub Copilot y en Copilot Studio. Con un discurso alineado con el de Microsoft Ignite 2025 transmitido la semana pasada: estamos en un “punto de inflexión” donde los modelos ya no son solo asistentes sino verdaderos colaboradores capaces de pilotear flujos de trabajo multiherramienta de un extremo a otro, y Claude Opus 4.5 es un modelo agente insignia.
Google, uno de los primeros socios de la startup, también lanzó el megáfono de marketing para anunciar la llegada de Opus 4.5 a Vertex AI, en un contexto en el que Gemini 3 sigue siendo la locomotora interna. En Vertex, Claude se beneficia de Agent Builder y Agent Development Kit, un contexto de hasta 1 millón de tokens, almacenamiento en caché rápido, predicciones por lotes y protecciones de seguridad avanzadas como Model Armor para contrarrestar la inyección rápida y el envenenamiento de herramientas.
Finalmente, uno de los principales financiadores de Anthropic, Amazon, anunció casi simultáneamente la disponibilidad de Claude Opus 4.5 en Amazon Bedrock, presentado como el nuevo estándar para código de producción, agentes sofisticados y tareas de oficina complejas, todo “a un tercio del coste” de la generación anterior.
En resumen, los fanáticos de la IA y los CIO tienen mucho trabajo por delante. Tienen una gran cantidad de modelos nuevos con los que experimentar en sus propios escenarios empresariales para descubrir cuál de estos modelos logra mejor sus objetivos porque los Benchmarks sólo dan una visión fragmentaria de la “verdad”. Pero parece obvio que con Gemini 3, GPT 5.1 y Claude Opus 4.5, la IA generativa agente ha dado un salto considerable a finales de año.
Lea también:
Nano Banana Pro: la IA de Google que dibuja imágenes con estilo
Gemini 3 ya está aquí: la respuesta relámpago de Google para hacerse con el trono de la IA
OpenAI lanza su GPT 5.1, un modelo más eficiente pero sobre todo más “humano”
Con GPT-5.1-Codex-Max, OpenAI lleva la IA de desarrollo a otra dimensión
Anthropic presenta Claude Haiku 4.5, un modelo “ligero” de altas prestaciones
Anthropic presenta Claude Sonnet 4.5, su “colega digital” más inteligente
Los modelos de Anthropic se utilizarían más que los de OpenAI en las empresas
[


