El 3 de septiembre de 2026 OpenAI lanzó el GPT-6 Astra, que ella misma presenta como “el modelo más inteligente y más alineado del mundo”. Empezó por un grupo limitado de organizaciones y, según el anuncio, llega en los próximos días a todos los planes ChatGPT Plus, Pro, Business y Enterprise, además de la API de OpenAI, de Microsoft Azure y de AWS Bedrock.
El presidente de la empresa, Greg Brockman, dijo a periodistas que “no es irrazonable sentir que ahora estamos en la era de la AGI”. Es la frase que se convirtió en titular. Debajo de ella hay tres cosas que cambian la decisión de quien usa IA para trabajar: qué pasó a hacer la máquina, qué significan realmente los números y cuánto cuesta esto.
Qué hace que el anterior no hacía
El salto que OpenAI destaca es uso de computadora: rellenar un formulario en pantalla, actualizar la ficha de un cliente en el CRM, organizar la agenda, investigar y redactar un resumen dentro del editor de texto, armar un sitio web y después comprobar si los botones funcionan. Es el modelo operando la interfaz, no devolviendo texto para que tú lo ejecutes.
Los números que publicó, todos comparando con el GPT-5.6 Sol, la generación anterior:
- OSWorld 2.0 (tareas reales de computadora): 72,6% frente a 65,7%, en cerca de un 47% menos de tiempo por tarea — aproximadamente 40 minutos frente a 75.
- ScreenSpot-Pro (encontrar y hacer clic en el elemento correcto en una interfaz cargada): 92,7% frente a 76,9%.
- Agents’ Last Exam (trabajo profesional en software real): 59,3%, frente al 55,5% de Claude Opus 5 y al 53,6% de Sol.
Ficha técnica: ventana de contexto de 1.050.000 tokens, salida de hasta 128.000 tokens y corte de conocimiento el 30 de abril de 2026.
La misma prueba, dos números: 62,7% y 99,9%
En el anuncio, OpenAI escribe que Astra “satura el ARC-AGI-3 con 99,9%”. El ARC-AGI-3 es una prueba de razonamiento en entornos inéditos, mantenida por la ARC Prize Foundation — una organización ajena a OpenAI. Y la ARC Prize publicó, el mismo día, dos resultados para el mismo modelo:
- 62,7% con el arnés estándar, la interfaz mínima e igual para todos los modelos, a un costo de US$ 26.098 en llamadas.
- 99,9% con un “provider adapter”, un arnés específico del proveedor que preserva el estado de razonamiento entre las llamadas y comprime la conversación, permitiendo al modelo reaprovechar el trabajo ya hecho. Costó US$ 18.817.
No es fraude ni es un detalle. En las 167 partidas que los dos arneses resolvieron, la versión con adaptador fue cerca de 3,66 veces más rápida y gastó 49% menos tokens. Y el 62,7% del arnés estándar ya es, por sí solo, el mejor resultado que la ARC Prize midió: Claude Opus 5 hizo 30,2% y GPT-5.6 Sol, 7,8%. La propia ARC Prize escribe que saturar esa prueba no sería prueba de AGI, porque su alcance es estrecho frente al mundo real. Para completar la confusión, parte de la prensa publicó 98,6%, que es todavía otra configuración de la misma medición.
La lección práctica vale para cualquier proveedor. El número de una prueba de IA no es una propiedad del modelo: es el resultado del modelo sumado al andamiaje en el que corre. Cuando alguien te muestre un porcentaje, las dos preguntas que separan información de propaganda son “¿medido con qué arnés?” y “¿con qué nivel de esfuerzo?”. Escribimos sobre este tipo de trampa en cómo evaluar una IA.
El precio subió de nivel, y la cuenta no es por token
En la API, Astra cuesta US$ 10 por millón de tokens de entrada y US$ 50 por millón de salida, con entrada en caché a US$ 1. El modo Fast sale por el doble, Batch y Flex por la mitad, y por encima de 272 mil tokens de entrada la cuenta cambia de nuevo. Eso es cerca de 2,5 veces el precio del GPT-5.6 Sol.
Brockman respondió a la subida diciendo que “lo que realmente quieres es el precio por tarea”. El argumento es legítimo: si la tarea termina con menos tokens y en menos tiempo, el costo total cae aunque el token sea más caro. OpenAI muestra un caso así en el Terminal-Bench Science, donde Astra marca 64,6% frente al 52,6% de Claude Fable 5.1 con un costo estimado de API cerca de 31% menor.
Solo que Artificial Analysis, que mide desde afuera, llegó al resultado opuesto en el índice general: Astra usa menos tokens que Sol para un desempeño parecido, y aun así sale más caro, porque el aumento de precio supera el ahorro. En el índice de inteligencia de esa casa, Astra marca 61 frente a 66 de Claude Fable 5.1.
En otras palabras: “precio por tarea” es el criterio correcto, y es exactamente por eso que no puede responderlo el proveedor. El precio por tarea se mide en tu tarea. Si ya pagas por token en producción, este lanzamiento es motivo para rehacer la planilla, no para cambiar de modelo por defecto. El razonamiento de costo está detallado en el precio de la IA cayó 80%.
Primera vez en el nivel “Crítico” de seguridad
Astra es el primer modelo de OpenAI en alcanzar el nivel Crítico en capacidad cibernética dentro del propio Preparedness Framework de la empresa. Probado sin las trabas de producción, marcó 100% en ExploitBench (frente al 78,5% de Sol) y 42,4% en ExploitGym (frente al 30,3%). En el SRE-Bench, que mide ingeniería inversa de binarios, resolvió el 88,0% de las tareas en el primer intento y el 99,2% en hasta cuatro — frente al 55,9% y al 68,7% de Sol.
El dato más concreto: en una evaluación armada con fallas de los tres meses anteriores, el modelo descubrió y usó dos vulnerabilidades zero-day hasta entonces desconocidas. OpenAI dice estar comunicando ambas a los mantenedores de los softwares afectados.
La versión que se está liberando rechaza tareas ofensivas — crear un exploit de prueba de concepto, por ejemplo — y acepta trabajo defensivo, como revisión de código y aplicación de correcciones. A través del programa Daybreak, la empresa pretende aflojar esas trabas para equipos de defensa en las próximas semanas.
Para una empresa común, el efecto no es abstracto: encontrar una falla se volvió mucho más barato y corregirla sigue dependiendo de personas y de una cola de mantenimiento. Es el desfase que ya habíamos medido en la IA encuentra fallas más rápido de lo que se corrigen.
Lo que OpenAI no puso en el titular
- El modelo se volvió más difícil de vigilar. La propia empresa escribe que el razonamiento escrito de Astra es más difícil de monitorear que el de Sol, porque controla mejor lo que escribe y resuelve problemas con menos pasos visibles. Clasifica esto como un empeoramiento que se toma en serio.
- No toda tabla es favorable. En el Humanity’s Last Exam con herramientas, Astra hace 57,2% frente al 65,0% de Claude Fable 5.1. En codificación agéntica en DeepSWE, Muse Spark 1.3, de Meta, aparece por delante con 75,4% frente a 74,1%.
- Una de las pruebas destacadas tiene historial de conflicto. El FrontierMath, donde Astra marca 98%, fue creado por Epoch AI con financiamiento de OpenAI — un arreglo revelado solo a fines de 2024 y que generó críticas públicas de matemáticos que colaboraron sin saberlo.
- Casi todos los números salieron con esfuerzo máximo, una configuración que eleva la puntuación y que no es la que usas en el día a día.
Nada de esto desmonta el lanzamiento. Sirve para recordar que quien publica la mayor parte de los números es la parte interesada — y que la comprobación independiente, cuando existe, suele llegar después.
Qué hacer esta semana
- No cambies de modelo por defecto. Separa las diez tareas que tu equipo más repite y corre las mismas diez en el modelo actual y en el nuevo, midiendo el costo por tarea concluida y cuántas volvieron para retrabajo.
- Revisa el presupuesto si pagas por token. Una subida de 2,5 veces en el precio de lista cambia la proyección, aunque el consumo baje.
- Empieza por el trabajo de pantalla. Es donde la ganancia medida es mayor: rellenar formularios, actualizar registros, revisar planillas, comprobar si un sitio sigue funcionando después de un cambio. Elige una tarea aburrida, repetitiva y que ya sepas cronometrar.
- Trata la seguridad como una cola, no como una noticia. Si el descubrimiento de fallas se aceleró, el cuello de botella pasa a ser tu rutina de actualización y corrección.
- Exige registro. Un agente que opera un sistema necesita dejar rastro de lo que hizo, con aprobación humana en las acciones que gastan dinero o borran datos.
Es ese tipo de enfoque — tarea medida, costo por tarea, aprobación humana en el lugar correcto — el que hacemos en implementación de IA para empresas. La pregunta útil no es qué modelo es el mejor del mundo, sino qué tarea de tu empresa vale la pena entregarle a una máquina esta semana.
Fuentes
Anuncio oficial y página de seguridad de GPT-6 Astra (OpenAI, 3 de septiembre de 2026); documentación de modelos y precios de la API de OpenAI; análisis del ARC-AGI-3 publicado por la ARC Prize Foundation; mediciones independientes de Artificial Analysis; cobertura de Fortune, de Engadget y de The New Stack; comentario de Gary Marcus; y el historial de financiamiento del FrontierMath publicado por Epoch AI.
Preguntas frecuentes
¿Qué es GPT-6 Astra y cuándo se lanzó?
Es el nuevo modelo de frontera de OpenAI, anunciado el 3 de septiembre de 2026 como “el modelo más inteligente y más alineado del mundo”. Empezó por un grupo limitado de organizaciones y, según el anuncio, llega en los días siguientes a los planes ChatGPT Plus, Pro, Business y Enterprise, además de la API de OpenAI, Microsoft Azure y AWS Bedrock.
¿GPT-6 es AGI?
No existe esa declaración formal. El presidente de OpenAI, Greg Brockman, dijo que “no es irrazonable sentir que ahora estamos en la era de la AGI”, lo que es una impresión, no una medida. La ARC Prize Foundation, que mantiene la prueba de razonamiento en la que el modelo destacó, escribe de forma explícita que saturar esa prueba no sería demostración de AGI, porque su alcance es estrecho comparado con el mundo real.
¿Por qué la misma prueba aparece con 62,7% y con 99,9%?
Porque son arneses distintos. En el arnés estándar de ARC Prize, igual para todos los modelos, Astra logró 62,7%. Con un adaptador específico del proveedor, que conserva el estado de razonamiento entre llamadas y deja que el modelo reutilice trabajo anterior, logró 99,9%. Ambos números son reales y miden cosas distintas: el segundo incluye el andamiaje, no solo el modelo.
¿Cuánto cuesta usar GPT-6 Astra?
En la API, 10 dólares por millón de tokens de entrada y 50 dólares por millón de salida, con entrada en caché a 1 dólar. El modo Fast cuesta el doble y los modos Batch y Flex, la mitad. Es cerca de 2,5 veces el precio de la generación anterior, GPT-5.6 Sol.
¿Conviene cambiar de modelo ahora?
Solo después de medir. Ejecute las tareas que su equipo más repite en ambos modelos y compare costo por tarea terminada y tasa de retrabajo, no precio por token. Un modelo más caro por token puede salir más barato por tarea si termina en menos pasos, y también ocurre lo contrario.
¿Qué cambia en la seguridad de mi empresa?
Es el primer modelo de OpenAI clasificado en el nivel Crítico de capacidad cibernética por el criterio de la propia empresa, y llegó a descubrir dos vulnerabilidades inéditas durante una evaluación. La versión pública rechaza tareas ofensivas y acepta las defensivas. En la práctica, encontrar fallas se abarató para los dos lados, y el cuello de botella pasa a ser su rutina de corrección y actualización.


