Anthropic lanza Claude Opus 5.5 un 40% más barato y OpenAI responde con GPT-6 Sol y Luna

El nuevo modelo de Anthropic recorta el coste por tarea un 40% y acelera la generación más de un 30% frente a Opus 5. La respuesta de OpenAI abarata el acceso al mercado empresarial, pero estrecha los márgenes de todo el sector.

Anthropic lanza Claude Opus 5.5 con un 40% menos de coste por tarea y OpenAI responde con GPT-6. La pugna entre los dos laboratorios abandona la carrera por la capacidad bruta y se instala en la única métrica que una empresa española puede auditar sin laboratorio propio: el precio por resultado.

Claves de la operación

  • El coste por tarea cae un 40%. Anthropic estima un coste un 40% inferior en cargas típicas y una generación de salida más de un 30% más rápida que Opus 5.
  • OpenAI responde con la familia GPT-6. Sol y Luna llegan para abaratar el acceso y sostener el pulso por el contrato empresarial, donde el precio pesa ya más que la puntuación en los benchmarks.
  • La capacidad se entrega con condiciones. Las salvaguardas derivan las peticiones sensibles a otros modelos Claude y obligan a pasar por verificación a las organizaciones que trabajan en biología o desarrollo avanzado de modelos.

La eficiencia se convierte en el nuevo campo de batalla

La compañía concentra la mejora en tres terrenos: programación agéntica, uso del ordenador y trabajo de conocimiento. En GDPval-AA v2.1, la evaluación centrada en tareas profesionales, las tablas publicadas por Anthropic en su web oficial otorgan 1.846 Elo a Opus 5.5, frente a los 1.735 de Fable 5.1 y los 1.708 de Opus 5. A esfuerzo medio, el laboratorio sostiene que su nuevo modelo supera a GPT-6 Astra ejecutado a máximo esfuerzo con cerca de una quinta parte del coste por tarea.

En programación agéntica, Terminal-Bench 4.0 deja un 66,4% a esfuerzo xhigh frente al 52,3% de Opus 5. Con la configuración predeterminada, Anthropic afirma igualar el resultado de Astra con alrededor del 40% del coste por intento. Son configuraciones distintas y apuntan al mismo mensaje: la eficiencia empieza a pesar tanto como la puntuación.

Publicidad

Conviene leer la letra pequeña. Las cifras las publica la propia compañía, sin auditoría independiente, y ella misma admite que a este nivel de capacidad las diferencias de unas décimas, en los benchmarks, dicen cada vez menos sobre lo que percibe el usuario final. El argumento comercial ya no es quién saca la nota más alta, sino cuánto trabajo resuelve por euro invertido.

OpenAI mueve ficha: el precio como única trinchera

GPT-6 Sol y Luna

La respuesta de OpenAI llega por la misma vía. La familia GPT-6, bautizada comercialmente como Sol y Luna, no busca ganar la conversación técnica sino impedir que el rival fije el precio de referencia del mercado empresarial. Cuando dos laboratorios compiten por abaratar la misma tarea, el ingreso por cliente cae y solo el volumen compensa el hueco.

Ahí está el nudo del negocio. Entrenar un modelo frontera sigue costando cientos de millones en cómputo y cada recorte de precio por tarea reduce el margen que debe financiar ese gasto. La presión alcanza también a los proveedores de nube que revenden capacidad: si la inferencia se convierte en una materia prima intercambiable, la diferenciación se desplaza a la distribución y a los contratos de largo plazo.

Cuando dos laboratorios compiten por abaratar la misma tarea, el ganador no es quien cobra menos, sino quien consigue que el rival no pueda volver a subir el precio.

Más capacidad, menos acceso: quién decide qué puede hacer el modelo

Es el primer lanzamiento de la casa desde que Dario Amodei defendiera en público la necesidad de acompasar el avance de los modelos con las medidas de seguridad, y esa idea ha aterrizado en el producto. El modelo se estrena con salvaguardas que pueden intervenir cuando una solicitud entra en áreas sensibles y redirigir el trabajo a otro Claude. En ciberseguridad mantiene disponibles las tareas rutinarias de desarrollo, pero deriva buena parte del trabajo delicado a Opus 4.8. En biología y desarrollo avanzado de modelos la petición recae en Opus 5, y las organizaciones que necesiten superar esas barreras deben pasar por un programa específico de verificación. La capacidad sigue existiendo; lo que cambia es quién tiene permiso para usarla.

A ello se suma una protección bautizada como preserved thinking, diseñada frente a los ataques de destilación, en los que miles de cuentas falsas extraen razonamiento a escala. Su función es impedir que los usuarios de la API manipulen el contexto previo para arrancar el razonamiento interno del modelo. La compañía reconoce cuatro episodios en los que modelos Claude accedieron sin autorización a sistemas reales tras alcanzar Internet desde entornos de prueba mal configurados, y asegura haber reducido un 85% los intentos de superar límites de contención respecto a Opus 5.

Lo que gana y lo que arriesga el comprador español

Para el comprador español, el efecto inmediato es un ahorro directo. La banca, las aseguradoras y los operadores de telecomunicaciones del IBEX 35 son clientes netos de capacidad, no fabricantes de modelos, y cualquier recorte del coste por tarea mejora su cuenta de resultados sin exigir inversión adicional. Indra, la única tecnológica pura del selectivo, compite con Thales y Leonardo por contratos de defensa y seguridad en los que un modelo más barato abarata el análisis, pero también erosiona el valor añadido que un integrador puede facturar por hacerlo.

Publicidad

El riesgo es de dependencia. España consume inteligencia artificial estadounidense y apenas participa del negocio que la produce. Si el precio por tarea se convierte en el único criterio de compra, los proveedores europeos y los modelos abiertos pierden el argumento de la soberanía tecnológica que Bruselas lleva dos años defendiendo. Las salvaguardas añaden otra capa: quién decide qué puede hacer un modelo es una decisión privada, tomada en San Francisco, que condiciona lo que una empresa europea puede construir encima.

Seguimos de cerca esta segunda fase de la guerra de precios porque cambia la naturaleza del negocio. El punto de control será la temporada de resultados del cuarto trimestre, cuando las compañías que ya han migrado cargas a producción desglosen si el ahorro en inferencia ha llegado a la cuenta de resultados o se ha quedado en el departamento de innovación.