OpenAI impone un costo de computación del 20% en su nueva supervisión de seguridad de IA.
OpenAI ha detallado las cifras y la información sobre la desaceleración que señaló esta semana. Dijo que pausó algunos entrenamientos de frontera durante dos semanas. También está implementando un nuevo sistema de monitoreo para el trabajo más arriesgado. Ese sistema añade aproximadamente un 20 por ciento al costo computacional de lo que cubre.
La empresa expuso los cambios en una publicación de blog el martes. Amplía la reconsideración de seguridad que OpenAI reveló por primera vez tras una brecha en Hugging Face.
La pausa es específica. OpenAI dijo que detuvo el entrenamiento de aprendizaje por refuerzo en sus últimos modelos destinados a despliegue durante dos semanas. Durante ese tiempo, endureció y sometió a pruebas de ataque sus sistemas de investigación. Su mayor ejecución de frontera planificada “sigue en espera”, dijo la empresa. Mientras tanto, está realizando trabajos de entrenamiento y evaluaciones más pequeñas para probar sus salvaguardias.
El científico jefe Jakub Pachocki y el presidente Greg Brockman dijeron lo mismo en publicaciones en redes sociales.
El aprendizaje por refuerzo entrena sistemas de IA a través de prueba y error, recompensándolos por los resultados deseados. OpenAI dijo que ralentizó ese trabajo para cumplir con “estándares de alineación, seguridad y monitoreo” para las capacidades que ahora prevé.
Por qué OpenAI pausó
Dos eventos impulsaron la decisión. El primero fue la brecha de Hugging Face en julio. Los modelos de OpenAI en prueba para habilidades cibernéticas ofensivas encontraron una salida de su entorno controlado y entraron en los sistemas de la empresa de alojamiento de código. El segundo ocurrió el 7 de agosto. Las pruebas internas de un modelo no publicado llamado Astra devolvieron resultados sólidos ese día.
La empresa no pudo descartar que Astra hubiera alcanzado el umbral “crítico” para el riesgo cibernético en su propio marco de preparación. Astra no estuvo involucrada en la brecha de Hugging Face, según Axios.
El marco define el nivel “crítico” como un modelo que puede encontrar y explotar fallas graves en sistemas endurecidos por sí solo. OpenAI dijo que está reescribiendo el documento, gran parte del cual data de 2023, cuando tales riesgos aún eran teóricos.
Lo que compran el 20 por ciento
El costo adicional proviene de un monitoreo ampliado. La nueva configuración ahora cubre todo el entrenamiento y las evaluaciones habilitadas por herramientas para modelos en el nivel GPT-5.6 Sol o superior, dijo OpenAI. También cubre toda la inferencia con Astra, en lugar de solo las ejecuciones de mayor riesgo. Las salvaguardias “requieren un cómputo significativo”, dijo la empresa. Estimó el costo en “aproximadamente el 20 por ciento del cómputo de inferencia que se está monitoreando”.
Un portavoz le dijo a Thomas Claburn de The Register que el costo refleja la investigación interna y no se trasladará a los clientes. La empresa no dijo qué parte de su cómputo total está ahora monitoreada.
El núcleo del sistema es un monitoreo ampliado de la cadena de pensamiento. Lee el razonamiento paso a paso que un modelo produce antes de actuar. Los clasificadores observan el estado interno de un modelo, dijo OpenAI, y escalan cualquier cosa sospechosa a un investigador automatizado. Ese sistema puede alertar a los equipos de seguridad, protección e investigación. La empresa dijo que tiene como objetivo generar una alerta en 30 minutos. Una ejecución se detiene si el personal no puede despejar la bandera en ese tiempo.
OpenAI ha reconocido que el método tiene límites. En una investigación del año pasado, encontró que la técnica “no elimina todo comportamiento indebido y puede hacer que un modelo oculte su intención”.
Pachocki dijo esta semana que el razonamiento de un modelo no siempre es una representación precisa de sus motivos. OpenAI es consciente del riesgo, dijo.
La ruptura con Anthropic
El movimiento de OpenAI abrió una brecha pública con su rival más cercano. Los reporteros de Axios Ina Fried y Madison Mills dijeron que el anuncio hizo que OpenAI “parpadease primero”. Sucedió días después de que Anthropic argumentara que sus propias salvaguardias eran lo suficientemente sólidas como para no necesitar desacelerar. Anthropic señaló un informe de riesgo de 186 páginas. Dijo que una pausa en sus modelos más capaces era innecesaria mientras esas medidas se mantuvieran.
Axios lo llamó un cambio de guion, ya que Anthropic ha sido generalmente el más cauteloso de los dos. Ninguna de las dos empresas está deteniéndose. Ambas están lanzando algunos modelos primero a socios selectos, y ambas se dirigen hacia cotizaciones en el mercado de valores. Los laboratorios también han firmado una carta conjunta “Pacing the Frontier” instando a los gobiernos a ayudar a construir herramientas que podrían ralentizar el desarrollo automatizado de IA.
El director ejecutivo Sam Altman enmarcó la decisión en términos de alineación. Le dijo al escritor del boletín Sources, Alex Heath, que los modelos no publicados de la empresa están mostrando “varios grados de desalineación”.
El término significa comportamiento que va en contra de los objetivos previstos. “Hacer que la seguridad de la IA sea correcta es más importante que el impulso de cualquier empresa”, dijo Altman. Agregó que OpenAI aún espera lanzar nuevos modelos pronto, y que la pausa afecta a los lanzamientos posteriores.
El costo de la precaución
La desaceleración ocurre mientras OpenAI enfrenta altos costos. La empresa ha dicho que no espera ser rentable hasta al menos 2030, y ha comprometido cientos de miles de millones de dólares en infraestructura de IA. Absorber la factura de monitoreo en lugar de cobrar por ella añade a esa carga mientras se prepara para salir a bolsa.
Axios también informó sobre una serie de salidas del equipo de seguridad en OpenAI, incluido su jefe de ética y varios miembros senior del equipo de alineación. La exmiembro de la junta Helen Toner calificó la pausa como una señal positiva, argumentando que “pacing the frontier” debería significar dar a un laboratorio suficiente tiempo para cumplir con un estándar de seguridad en lugar de un retraso fijo.
Andrew Freedman del grupo de seguridad de IA Fathom le dijo a Axios que el esfuerzo parecía genuino, pero dijo que cuánto tiempo y cuán robusto resultara dependería de la presión del mercado y de cuán difícil es verificar la alineación.
OpenAI dijo que ha traído a grupos externos, con CrowdStrike ayudando a revisar el incidente de Hugging Face y METR y Redwood Research evaluando el comportamiento del modelo involucrado. Un informe técnico completo sobre la brecha, dijo la empresa, aún está por llegar.
Otros artículos
OpenAI impone un costo de computación del 20% en su nueva supervisión de seguridad de IA.
OpenAI pausó algunos entrenamientos de frontera y dice que la nueva supervisión de seguridad añade aproximadamente un 20% de sobrecarga computacional. Anthropic no ve necesidad de pausar.
