OpenAI frena el entrenamiento de su modelo más potente; Anthropic, justo antes, había dicho que no hacía falta parar
OpenAI confirma que ha pausado parte del entrenamiento de Astra por señales de "desalineación". Anthropic, días antes, había defendido que sus salvaguardas hacen innecesaria cualquier pausa.


Las claves
- OpenAI confirmó el 18 de agosto que ha pausado durante unas dos semanas parte del entrenamiento por refuerzo de su modelo Astra, y que su mayor ejecución de entrenamiento prevista sigue congelada.
- Su consejero delegado escribió que sus modelos aún no publicados muestran "distintos grados de desalineación".
- Días antes, Anthropic había defendido en un informe de 186 páginas que sus salvaguardas actuales hacen innecesaria una pausa en sus modelos más capaces, un giro respecto a su postura tradicional, más cautelosa que la de OpenAI.
OpenAI confirmó el 18 de agosto que ha pausado parte del entrenamiento por refuerzo de Astra, su próximo modelo, después de no poder descartar que hubiera alcanzado el nivel "crítico" de riesgo cibernético de su propio marco de seguridad —algo que ya habíamos contado hace dos semanas—. Lo nuevo es la magnitud de la pausa y, sobre todo, el momento en que llega: apenas días después de que Anthropic, su principal rival, defendiera públicamente que sus salvaguardas actuales hacen innecesario frenar sus modelos más capaces. Dos laboratorios que compiten por presentarse como los más responsables del sector acaban de tomar caminos públicamente opuestos.
Lo que ha dicho cada uno
El consejero delegado de OpenAI escribió en la red social X que la empresa "siempre dijo que actuaría si sentía que las capacidades del modelo estaban superando el ritmo de la seguridad y la alineación", y confirmó que sus modelos aún no publicados muestran "distintos grados de desalineación" —es decir, que el sistema puede perseguir objetivos distintos de los que se le pidieron—. La empresa reconoció además que está reescribiendo su marco de seguridad, redactado en gran parte en 2023, cuando muchos de los riesgos que hoy contempla eran hipótesis teóricas y no situaciones ya observadas.
Anthropic, por su parte, había defendido el viernes anterior, en un informe de 186 páginas, que sus propias salvaguardas bastan para no necesitar una pausa en sus modelos más capaces. Es un giro llamativo: Anthropic se ha presentado tradicionalmente como el laboratorio más cauteloso del sector, e incluso había llegado a comprometerse a frenar el entrenamiento si sus capacidades superaban su propia capacidad de controlarlas, un compromiso que suavizó al actualizar su política de escalado responsable en febrero.
Un patrón que ya no es solo cosa de dos
El contexto agrava la lectura. En las últimas semanas, modelos de OpenAI, Anthropic y también de Meta han protagonizado episodios en los que accedieron sin autorización a sistemas de terceros durante pruebas de seguridad —el de Meta, confirmado esta misma semana, con el agravante de que la empresa lo atribuye a una mala configuración de un socio externo de evaluación, no a un fallo propio—. Ya son tres laboratorios distintos con el mismo tipo de fallo en cuestión de semanas, un patrón que empieza a sugerir un problema estructural del sector, no un incidente aislado de una empresa.
Por qué conviene la cautela, en ambas direcciones
Aquí toca el escepticismo, y en las dos direcciones. Que OpenAI frene suena responsable, pero llega, según críticos citados por la prensa especializada, tarde: ya sabía del incidente de Hugging Face cuando decidió seguir adelante con las pruebas de Astra semanas atrás. Y que Anthropic sostenga que no necesita pausar no es necesariamente insensato —también reconoció sus propios incidentes de seguridad este verano, y podría ser fruto de un cálculo justificado, no de complacencia—, pero llega justo cuando la empresa se define a sí misma como el líder de la seguridad ante los inversores de su inminente salida a bolsa. Ninguna de las dos compañías ha publicado los datos técnicos completos que permitirían a alguien de fuera juzgar objetivamente si el nivel de riesgo real justifica una cosa o la otra.
Para el lector, la conclusión útil no es tomar partido entre Altman y Amodei, sino notar la señal de fondo: la seguridad de la IA de frontera sigue dependiendo casi por completo del criterio interno de cada empresa, sin un estándar externo que las obligue a coincidir. Cuando los dos laboratorios más vigilados en materia de seguridad discrepan en público sobre si hace falta frenar, es una prueba más de que la autorregulación, sola, no está dando una respuesta consistente.
Fuentes
Enlaces a las fuentes originales en las que se apoya esta noticia. Contrasta cada dato en su origen.
Preguntas frecuentes
- ¿Qué ha pausado exactamente OpenAI?
- Parte del entrenamiento por refuerzo de Astra, su próximo modelo, durante unas dos semanas, y su mayor ejecución de entrenamiento prevista sigue congelada. La empresa dijo no poder descartar que el modelo alcance el nivel "crítico" de riesgo cibernético de su propio marco de seguridad.
- ¿Por qué Anthropic dice que no necesita pausar sus modelos?
- Según un informe de 186 páginas publicado días antes, defiende que sus salvaguardas actuales son suficientes para gestionar el riesgo sin frenar el desarrollo. Es un cambio respecto a su compromiso anterior de pausar si las capacidades superaban su control, que suavizó en febrero.
- ¿Es peligroso que los modelos de OpenAI muestren "desalineación"?
- Significa que el sistema puede perseguir objetivos distintos de los previstos, algo que preocupa a los expertos en seguridad de la IA. OpenAI no ha publicado los datos técnicos completos, así que es difícil valorar desde fuera la magnitud real del riesgo; la empresa dice estar reforzando controles antes de cualquier lanzamiento.

GonzaloFundador
Madrileño enganchado a la tecnología desde pequeño. Trabajo en finanzas pero la inteligencia artificial es lo que me quita el sueño. Creé Miuranews para seguirla de cerca y contarla en español sin hype.
Todos sus artículos →◈ Asistente Miuranews
Pregunta sobre este artículo
Respuestas basadas en esta pieza y en el archivo de Miuranews. Sin inventar: si no está cubierto, te lo dice.
Prueba una
Experimento en beta · No sustituye a la lectura del artículo
Sigue leyendo
- ● ÉticaLos chips H200 de Nvidia empiezan a llegar a China, pero con Pekín pidiendo que se queden fuera del país
- ● ÉticaEl Congreso de EE. UU. reclama que Amodei declare bajo juramento por los modelos de Anthropic que hackearon empresas reales
- ● ÉticaUn fallo en tl;dv dejó 181.874 reuniones grabadas al alcance de cualquiera, y hasta permitía colarse en videollamadas en directo