Anthropic lanza Claude Opus 5, su cuarto modelo en dos meses, y supera a Fable 5 en la mayoría de las pruebas.
TL;DRClaude Opus 5 supera a Fable 5 en la mayoría de los benchmarks a la mitad del precio por token y es el modelo más alineado de Anthropic hasta la fecha.
Anthropic lanzó el jueves Claude Opus 5, un modelo que iguala o supera su modelo insignia Fable 5 en la mayoría de los benchmarks de codificación y trabajo de conocimiento a la mitad del precio por token. El modelo es el cuarto que Anthropic ha lanzado en menos de dos meses, después de Fable 5 a principios de junio, Sonnet 5 a finales de junio y ahora Opus 5 el 24 de julio. Cuesta $5 por millón de tokens de entrada y $25 por millón de tokens de salida, el mismo precio que su predecesor.
En Frontier-Bench, una evaluación de codificación que mide si los modelos pueden construir software funcional a partir de dibujos de ingeniería, Opus 5 más que duplica la puntuación de su predecesor y supera a todos los modelos competidores, incluido Fable 5. En ARC-AGI 3, que prueba la resolución de problemas novedosos, Opus 5 obtiene una puntuación aproximadamente tres veces más alta que el siguiente mejor modelo. En Zapier AutomationBench, que mide si los modelos pueden completar tareas comerciales reales de principio a fin, Opus 5 supera más tareas que cualquier rival incluso en su configuración de menor esfuerzo.
Anthropic dice que Opus 5 también es su modelo más alineado hasta la fecha, con la tasa más baja de comportamiento engañoso registrada en su auditoría de seguridad automatizada. Su predecesor estableció un nuevo estándar de honestidad cuando se lanzó a finales de mayo, y Opus 5 lleva ese estándar aún más lejos mientras se mantiene detrás de Mythos 5 en tareas ofensivas de ciberseguridad. Anthropic dice que evitó intencionalmente entrenar el modelo en trabajos cibernéticos, aunque ha mejorado en esas tareas como un efecto secundario de volverse más capaz en general.
El modelo está disponible hoy como el nuevo predeterminado en Claude Max y el modelo más fuerte en Claude Pro. Los desarrolladores pueden acceder a él a través de la API, Amazon Bedrock, Google Cloud y Microsoft Foundry. Un modo Rápido funciona a dos veces y media la velocidad predeterminada por el doble del precio base, y se lanzan junto a él dos nuevas características de API: cambios de herramientas en medio de la conversación que permiten a los desarrolladores intercambiar herramientas sin romper la caché de solicitudes, y retrocesos automáticos que dirigen solicitudes marcadas a un modelo diferente en lugar de bloquearlas.
El ritmo de lanzamiento cuenta una historia más amplia sobre hacia dónde se dirige el mercado de modelos de IA. Anthropic ha pasado de lanzar un modelo insignia por trimestre a cuatro modelos en aproximadamente ocho semanas, cada uno dirigido a un segmento diferente de precio-rendimiento. Opus 5 llena el vacío entre la costosa categoría Fable y la categoría económica Sonnet, ofreciendo inteligencia casi fronteriza para la codificación diaria y el trabajo de conocimiento sin las restricciones de ciberseguridad que limitan a Fable o las restricciones de acceso que mantienen a Mythos tras puertas cerradas.
Obtén el boletín de TNW
Recibe las noticias tecnológicas más importantes en tu bandeja de entrada cada semana.
Otros artículos
Anthropic lanza Claude Opus 5, su cuarto modelo en dos meses, y supera a Fable 5 en la mayoría de las pruebas.
Claude Opus 5 establece nuevos máximos en Frontier-Bench y ARC-AGI a $5 por millón de tokens de entrada, la mitad del costo de Fable 5, y es el modelo más alineado de Anthropic.
