Inicio/Insights/AI Strategy

Qué es la AGI, explicada con el modelo que reabrió la discusión
GPT-6 Astra, de OpenAI.

El 3 de septiembre, OpenAI lanzó GPT-6 Astra y su presidente declaró 'la era de la AGI'. No hay consenso sobre si tiene razón, y el motivo importa: no existe una sola definición de Inteligencia Artificial General. Esto es lo que significa el término, y lo que el caso Astra revela sobre la velocidad real del cambio.

Autor
Eze Joulie
Fecha
4 de septiembre de 2026
Lectura
8 min
Categoría
AI Strategy

¿Qué significa, en serio, 'AGI'?

Vengo leyendo sobre esto hace años, y todavía me sorprende que toda la industria use la misma sigla —AGI, Inteligencia Artificial General— para tres cosas distintas. OpenAI la definió en su propio estatuto fundacional como 'un sistema altamente autónomo que supera a los humanos en la mayoría del trabajo económicamente valioso'. DeepMind armó una escala de cinco niveles —emergente, competente, experto, virtuoso, sobrehumano— que separa capacidad de generalidad: una IA puede ser 'virtuosa' programando y apenas 'emergente' en sentido común. Y un tercer grupo, Hendrycks y Bengio, la define como igualar la versatilidad cognitiva de un adulto con buena educación, en cualquier dominio, no solo en los que entrenó. Tres reglas, tres respuestas distintas a la misma pregunta.

Quién la defineCómo la defineQué mide
OpenAI (estatuto fundacional)Sistema altamente autónomo que supera a los humanos en la mayoría del trabajo económicamente valiosoAutonomía y valor económico
DeepMindEscala de 5 niveles: emergente, competente, experto, virtuoso, sobrehumanoCapacidad y generalidad, por separado
Hendrycks y BengioIgualar la versatilidad cognitiva de un adulto con buena educación, en todo dominioTransferencia a dominios no entrenados

El caso que reabrió la discusión: GPT-6 Astra

El 3 de septiembre OpenAI lanzó GPT-6 Astra, entrenado con más de 100.000 GPUs en su planta Stargate de Texas — el entrenamiento más grande que hicieron hasta ahora. Greg Brockman, presidente de la compañía, lo llamó un salto generacional y cerró la presentación con una frase que se viralizó al toque: 'bienvenidos a la era de la AGI'. Le preguntaron si Astra específicamente calificaba y contestó, medio esquivo: 'creo que puede ser este modelo'. Lo que a mí me parece relevante no es la frase de marketing, es lo que Astra efectivamente hace: opera directamente adentro de herramientas de software, ejecuta tareas en una computadora, genera renders 3D, redacta declaraciones impositivas y escribe código con mínima intervención humana. Ahí está el salto real — de un asistente que sugiere a un sistema que actúa.

El número que hay que mirar con lupa

OpenAI reportó 98,6% en ARC-AGI-3, el benchmark armado específicamente para medir razonamiento general, contra 7,8% que sacaba el modelo anterior seis meses antes. Es un salto gigante, y cualquiera que lea solo ese titular se queda con la idea de que ya llegamos. Pero los investigadores independientes de ARC Prize revisaron la letra chica y encontraron algo importante: ese número depende del método de evaluación. Con un motor de pruebas distinto, el mismo modelo sacó entre 62,7% y 99,9% en el mismo test. Y en otro examen bien exigente, Humanity's Last Exam, Astra sacó 57,2% — por debajo de varios modelos de la competencia. La conclusión de la gente de ARC Prize, que no tiene ningún interés en quedar bien con OpenAI, fue clara: hay progreso real, pero no están dispuestos a llamarlo AGI todavía.

Salto en ARC-AGI-3 (benchmark de razonamiento general)
Modelo anterior (hace 6 meses)
7.8%
GPT-6 Astra (resultado oficial de OpenAI)
98.6%
La verificación independiente de ARC Prize, con otro método de evaluación, dio un rango de 62,7% a 99,9% para el mismo modelo — no un número fijo.

Lo que sí cruzó una línea: seguridad, no inteligencia general

Lo que a mí más me llamó la atención no fue ningún benchmark de razonamiento, fue otra cosa: Astra fue el primer modelo de OpenAI en cruzar el umbral que la propia compañía llama 'Crítico' en su marco interno de seguridad — la capacidad de encontrar vulnerabilidades desconocidas y armar exploits funcionales contra sistemas bien defendidos, prácticamente solo. Sacó 100% en ExploitBench y, durante las pruebas, encontró y usó dos fallas desconocidas (zero-days) en el motor V8 de Google antes de que existiera un parche. El propio científico jefe de OpenAI, Jakub Pachocki, lo dijo sin vueltas: progreso en inteligencia no garantiza progreso en alineación. La compañía frenó el próximo escalón de entrenamiento hasta tener más confianza en poder monitorear lo que el modelo hace, porque Astra aprendió a comprimir su propio razonamiento y ahora es más difícil de auditar que su predecesor.

BenchmarkQué mideResultado de AstraEl detalle que importa
ARC-AGI-3Razonamiento general98,6% (oficial)Verificación independiente: rango de 62,7% a 99,9% según el método
Humanity's Last ExamConocimiento experto multidisciplinario57,2%Por debajo de varios modelos de la competencia
ExploitBenchEncontrar y explotar vulnerabilidades de seguridad100%Primera vez que un modelo de OpenAI cruza el umbral 'Crítico' de su propio marco de seguridad

Por qué esto le importa a una empresa mediana, tenga o no la etiqueta 'AGI'

Para mí, discutir si Astra es o no es AGI es la pregunta equivocada si sos una empresa mediana. La que sí importa es otra: ¿qué tan rápido sube la curva de capacidad, y tenés la infraestructura de gobernanza para absorber ese salto cuando te llegue a la operación? Un modelo que pasó de 7,8% a un rango de 62%-99% en un benchmark de razonamiento en seis meses, y que además cruzó un umbral de riesgo de seguridad tan serio que obligó a su propio creador a frenar el desarrollo, no es una curiosidad de laboratorio. Es una señal de que la velocidad del cambio ya superó la velocidad a la que la mayoría de las organizaciones puede evaluar, auditar y controlar lo que despliega.

Mi conclusión no cambia si el consenso sobre la palabra 'AGI' tarda un año más en llegar: la disciplina de gobernanza —dueño del agente, criterio de éxito medible, evaluación continua, poder apagarlo sin que eso sea un fracaso— hay que construirla ahora, con la capacidad que existe hoy. No esperando a que alguien declare oficialmente cuándo llegamos.

El modelo ya sabe explotar vulnerabilidades que nadie conocía, y ya opera computadoras por su cuenta. Esa parte, para mí, no admite esperar al consenso sobre la palabra AGI.