El nuevo modo Ultrafast de OpenAI ejecuta GPT-5.6 Sol 14 veces más rápido, en chips de Cerebras.

El nuevo modo Ultrafast de OpenAI ejecuta GPT-5.6 Sol 14 veces más rápido, en chips de Cerebras.

      OpenAI quiere que su modelo más inteligente también sea el más rápido. La empresa ha presentado Ultrafast, un nuevo nivel de su API que ejecuta el modelo insignia GPT-5.6 Sol a hasta 14 veces la velocidad habitual, alcanzando alrededor de 750 tokens de salida por segundo, en hardware construido por el fabricante de chips a gran escala Cerebras.

      Ultrafast no es tanto un nuevo modelo como una nueva forma de servir a uno existente. Se apoya en los chips desproporcionados de Cerebras para eliminar la latencia que ha perseguido durante mucho tiempo a la IA de frontera, y OpenAI abrió una vista previa limitada el 13 de agosto a un pequeño grupo de clientes, con planes de ampliar el acceso a medida que la capacidad lo permita.

      La propuesta se basa en un compromiso que OpenAI dice que finalmente puede disolver. Hasta ahora, cualquiera que quisiera respuestas verdaderamente en tiempo real tenía que recurrir a un modelo más pequeño y menos capaz, aceptando menos inteligencia a cambio de velocidad.

      Ultrafast está diseñado para ofrecer razonamiento de grado fronterizo y respuestas casi instantáneas al mismo tiempo, en lugar de forzar una elección entre ellos.

      Esa combinación es lo que más importa para el software agente que toda la industria está persiguiendo. Un agente de IA que tiene que pensar durante treinta segundos antes de cada paso es una demostración, mientras que uno que responde en el tiempo que lleva mantener una conversación comienza a sentirse como un producto.

      La velocidad, en otras palabras, se está convirtiendo silenciosamente en una característica tan importante como la inteligencia pura.

      OpenAI está dirigiendo este nivel específicamente hacia trabajos sensibles al tiempo, incluyendo respuesta a incidentes y depuración, investigación financiera y detección de fraudes, soporte al cliente en tiempo real y voz, y comercio electrónico.

      Los primeros evaluadores como Jane Street, Podium, Basis y Rogo describen el cambio como cualitativo en lugar de incremental, con uno de ellos diciendo que la velocidad “cambia completamente la experiencia de llamada para trabajos complejos” y desbloquea “experiencias sincrónicas para usuarios que antes estaban limitados por la inteligencia.”

      Para Cerebras, el acuerdo es un respaldo destacado en un momento útil. La empresa salió a bolsa en una de las mayores ofertas del año, pero desde entonces ha luchado por convencer al mercado de que la ambición a gran escala se traduce en ganancias duraderas, por lo que impulsar el nivel más rápido de OpenAI es precisamente el tipo de validación que necesitaba.

      También es un recordatorio de que las arquitecturas de chips exóticas que alguna vez fueron desestimadas como proyectos científicos ahora están realizando un trabajo real para los nombres más grandes en IA.

      La velocidad en sí proviene de una pieza inusual de ingeniería. Cerebras construye procesadores del tamaño de un plato de cena, cortados de un solo wafer de silicio, lo que permite que un modelo entero se aloje en un solo chip en lugar de estar dividido entre estantes de GPUs de Nvidia que deben estar constantemente transfiriendo datos entre ellas.

      Eliminar ese tráfico interno es lo que colapsa la demora entre un aviso y una respuesta, y es la base del argumento de larga data de la empresa de que su diseño se adapta mucho mejor a la inferencia que los chips de propósito general construidos para el entrenamiento.

      El movimiento también se ajusta a un cambio más amplio. A medida que la capacidad bruta del modelo comienza a estabilizarse, la competencia se está moviendo hacia quién puede ejecutar esos modelos más rápido y de manera más económica, una carrera que ha elevado a especialistas en inferencia como Groq y ha convertido la latencia en un punto de venta.

      Rivales como SambaNova y un grupo de nubes especializadas están persiguiendo el mismo premio, y el mercado recompensa cada vez más a quien pueda hacer que un modelo dado responda más pronto, no simplemente a quien entrenó el más grande.

      Para OpenAI, apoyarse en Cerebras también es un paso silencioso hacia una menor dependencia total de Nvidia, en línea con su trabajo en su propio silicio personalizado.

      OpenAI no ha publicado precios, y ejecutar su modelo superior a 14 veces la velocidad en hardware especializado probablemente no será barato, por lo que Ultrafast puede seguir siendo una opción premium para casos obsesionados con la latencia en lugar de una configuración predeterminada.

      También es solo una vista previa, restringida a un puñado de clientes mientras OpenAI busca capacidad. Aun así, el mensaje es lo suficientemente claro. En la próxima fase de la carrera de IA, ser inteligente no contará mucho si también eres lento.

Другие статьи

El nuevo modo Ultrafast de OpenAI ejecuta GPT-5.6 Sol 14 veces más rápido, en chips de Cerebras. El nuevo modo Ultrafast de OpenAI ejecuta GPT-5.6 Sol 14 veces más rápido, en chips de Cerebras. OpenAI ha presentado Ultrafast, un nivel de API que ejecuta GPT-5.6 Sol a velocidades de hasta 14 veces en el hardware de Cerebras, apostando a que la latencia, no solo la inteligencia, es lo que hace que los agentes de IA sean utilizables. Esta startup de Bengaluru está entrenando a perros y a IA para detectar el cáncer temprano. Esta startup de Bengaluru está entrenando a perros y a IA para detectar el cáncer temprano. Dognosis, una startup de Bengaluru, empareja perros detectores entrenados con IA para detectar cáncer temprano a partir de una muestra de aliento. Es una herramienta de preselección en ensayos, no un diagnóstico comprobado. Esta startup de Bengaluru está entrenando a perros y a IA para detectar el cáncer temprano. Esta startup de Bengaluru está entrenando a perros y a IA para detectar el cáncer temprano. Dognosis, una startup de Bengaluru, empareja perros rastreadores entrenados con IA para detectar cáncer temprano a partir de una muestra de aliento. Es una herramienta de preselección en ensayos, no un diagnóstico probado. Microsoft está uniendo sus aplicaciones Copilot antes de su debut planificado de 'super aplicación'. Microsoft está uniendo sus aplicaciones Copilot antes de su debut planificado de 'super aplicación'. Las aplicaciones Copilot de Microsoft se están combinando en una sola experiencia, con Podcasts, Investigación Profunda y Chat en Grupo siendo retirados en el camino. Goldman Sachs está cortejando a los inversores en el acuerdo de financiación de computación de IA de Nvidia por 500 mil millones de dólares. Goldman Sachs está cortejando a los inversores en el acuerdo de financiación de computación de IA de Nvidia por 500 mil millones de dólares. Goldman Sachs está cortejando a los inversores en el acuerdo de financiación de computación de IA de Nvidia por $500 mil millones después de haber conseguido un papel principal, y quiere convertir los chips en una clase de activos negociables, similar a los bonos. Silver Lake supuestamente está en conversaciones para privatizar Workday por 43 mil millones de dólares. Silver Lake supuestamente está en conversaciones para privatizar Workday por 43 mil millones de dólares. Silver Lake está supuestamente en conversaciones para privatizar Workday por aproximadamente 43 mil millones de dólares, en lo que sería una de las adquisiciones de software más grandes de la historia y la primera mega privatización de un nombre destacado en SaaS.

El nuevo modo Ultrafast de OpenAI ejecuta GPT-5.6 Sol 14 veces más rápido, en chips de Cerebras.

OpenAI ha presentado Ultrafast, un nivel de API que ejecuta GPT-5.6 Sol a velocidades de hasta 14 veces en hardware de Cerebras, apostando a que la latencia, no solo la inteligencia, es lo que hace que los agentes de IA sean utilizables.