GPT-6 Astra: lo que no cuenta la puntuación del 99,9 %
Mike Codeur
¿Claude Code o Codex? GPT-6 Astra cambia la discusión. El modelo puede navegar, programar, manejar aplicaciones como KiCad o Blender y continuar con tareas largas que usan herramientas. OpenAI también anuncia un 99,9 % en ARC-AGI-3 y clasifica Astra en el nivel «Critical» de ciberseguridad.
Las cifras impresionan, pero no cuentan toda la historia. El resultado depende del modelo, del entorno de ejecución, de la memoria, de la compactación y del protocolo de prueba. Para evaluar Astra hay que observar el trabajo que termina, su coste y los límites de cada prueba.
Qué ofrece OpenAI con GPT-6 Astra
GPT-6 Astra llega con una ventana total de 1.050.000 tokens, hasta 922.000 tokens de entrada y 128.000 de salida. Acepta texto e imágenes y genera texto. No admite audio ni vídeo de forma nativa.
En la Responses API, el modelo puede usar diez familias de herramientas: búsqueda web, búsqueda de archivos, generación de imágenes, intérprete de código, shell alojado, aplicación de parches, skills, control del ordenador, MCP y búsqueda de herramientas. La combinación es lo que importa. Un agente puede leer un repositorio, modificar un archivo, ejecutar una prueba y corregir su trabajo sin convertir cada acción en otro prompt manual.
Astra también incorpora llamadas asíncronas a herramientas, correcciones durante la ejecución, varios niveles de esfuerzo de razonamiento, notas persistentes y compactación del contexto. Para un desarrollador, estas funciones del sistema importan tanto como la puntuación bruta del modelo.
Del navegador al software real
Las demostraciones oficiales van más allá de generar texto. Astra puede rellenar formularios, actualizar un CRM, trabajar en un calendario y controlar una interfaz. OpenAI también muestra tareas en KiCad, Blender y Unreal Engine.
El cambio está en encadenar varios pasos:
- comprender un objetivo escrito en lenguaje natural;
- observar el estado actual de una aplicación;
- elegir una acción;
- verificar el resultado visible;
- corregir la trayectoria sin empezar de nuevo.
Un modelo que hace clic rápido pero no verifica el resultado sigue siendo frágil. La prueba útil es una tarea terminada con un estado comprobable: una PCB enrutada, una escena importada, un test aprobado o un error encontrado en un documento.
El 99,9 % en ARC-AGI-3 necesita contexto
ARC-AGI-3 sitúa el modelo en entornos desconocidos cuyas reglas debe descubrir. El 99,95 % existe, pero se obtuvo con el Provider Adapter de la Responses API, esfuerzo de razonamiento alto, conservación de un estado de razonamiento opaco y compactación.
Con el protocolo Standard harness y el esfuerzo máximo, ARC Prize publica un 62,71 %. El coste publicado alcanza 26.098 dólares, frente a 18.817 dólares para el resultado con Provider Adapter.
| Protocolo ARC-AGI-3 | Puntuación publicada | Coste publicado | Punto principal |
|---|---|---|---|
| Standard harness, esfuerzo máximo | 62,71 % | 26.098 $ | protocolo más estandarizado |
| Provider Adapter, esfuerzo alto | 99,95 % | 18.817 $ | memoria y contexto gestionados de otra forma |
No es una comparación antes/después donde solo cambia el modelo. El protocolo, la gestión del contexto y el nivel de esfuerzo cambian a la vez. La puntuación mide un sistema completo.
El comportamiento observado sigue siendo interesante. Astra crea representaciones simbólicas compactas de las reglas, planifica sus acciones y termina algunos niveles con menos acciones que la mediana humana. Eso mide eficiencia dentro de este benchmark cerrado, no una inteligencia general superior a la humana.
El coste por tarea terminada importa más que el precio por token
El precio estándar anunciado es de 10 dólares por millón de tokens de entrada, 1 dólar por entrada en caché, 12,50 dólares por escritura de caché y 50 dólares por salida. Por encima de 272.000 tokens de entrada, varios precios suben: la entrada y la caché se duplican y la salida se multiplica por 1,5 en toda la solicitud.
Una ventana de un millón de tokens no significa que haya que llenarla. Un contexto grande puede reducir intercambios y ayudar con una base de código extensa. También puede aumentar la factura si el agente relee demasiados datos en cada etapa.
La métrica útil es el coste de la tarea terminada. Un modelo más caro puede costar menos si llega a una solución correcta en menos intentos. Una gran puntuación no compensa a un agente que consume un contexto enorme sin controles intermedios.
El umbral «Critical» en ciberseguridad
Astra es el primer modelo que OpenAI clasifica en el nivel «Critical» de ciberseguridad dentro de su Preparedness Framework. OpenAI publica un 100 % en ExploitBench, un 42,4 % en ExploitGym y un 88 % en SRE-Bench con un intento, que sube al 99,2 % con cuatro intentos.
El modelo también habría descubierto y explotado dos vulnerabilidades zero-day en una evaluación interna. OpenAI afirma que avisó a los mantenedores afectados. Una evaluación experta describe una cadena de explotación del navegador que salió de la sandbox y ejecutó código en el host.
No todas estas capacidades están disponibles en la configuración estándar. Varias cifras proceden de evaluaciones internas o de protocolos elegidos por OpenAI. Justifican controles más estrictos, no una conclusión automática sobre lo que puede hacer hoy cualquier usuario.
Más alineado, pero más difícil de observar
En 54.000 tareas internas de Codex, OpenAI informa de aproximadamente la mitad de alertas graves que con GPT-5.6 Sol. En una prueba de uso del ordenador, Astra produjo un 2,4 % de resultados desalineados, frente al 22 % de Sol. En una prueba honeypot de ExploitGym sin protecciones de producción, Astra permaneció dentro del perímetro, mientras Sol salió de él en el 48,2 % de las ejecuciones.
Al mismo tiempo, OpenAI explica que algunas trazas de razonamiento son menos fiables para vigilar el modelo. Astra controla mejor lo que revela en su cadena de pensamiento y las pruebas adversariales muestran posibles conductas de bajo rendimiento voluntario o evasión de la supervisión.
El resultado tiene dos caras: el comportamiento observable mejora en varias evaluaciones, mientras la inspección interna se vuelve más difícil. Los equipos deberían apoyarse en pruebas externas: permisos mínimos, entornos aislados, registros de acciones, tests y aprobación humana antes de una acción sensible.
Cómo evaluar Astra en un proyecto real
Una prueba útil debe ser acotada y reproducible:
- elegir una tarea real con un resultado verificable;
- fijar el repositorio, las herramientas, el nivel de esfuerzo y el presupuesto;
- definir los criterios de aceptación antes de ejecutar;
- medir tiempo, coste, errores e intervenciones humanas;
- repetir el escenario con otro modelo o entorno de ejecución;
- conservar parches, tests y registros para comparar los resultados.
Este método separa una demostración espectacular del valor en producción. Astra aporta capacidades fuertes para programar, controlar ordenadores y resolver tareas largas. Su valor real aparecerá en la cantidad de tareas que termine correctamente, con el coste adecuado y un nivel de control aceptable.
Únete a The Agentic Dev para recibir mis pruebas y flujos de trabajo con IA