---
title: "Astra ya no habla de tu ordenador. Lo usa."
description: "Greg Brockman, de OpenAI, dice que estamos en la era de la AGI. Lo interesante de GPT-6 Astra no son sus resultados en los tests. Es lo que el modelo toca."
author: "Matthias Meyer"
published: 2026-09-04
updated: 2026-09-04
language: es
tags: ["agi", "openai", "ai-agents", "ai-trends", "computer-use", "ki-sicherheit"]
canonical: "https://studiomeyer.io/es/blog/gpt-6-astra-agi"
markdown_versions: ["https://studiomeyer.io/de/blog/gpt-6-astra-agi.md", "https://studiomeyer.io/en/blog/gpt-6-astra-agi.md", "https://studiomeyer.io/es/blog/gpt-6-astra-agi.md"]
publisher: "StudioMeyer, https://studiomeyer.io (llms.txt: https://studiomeyer.io/llms.txt)"
---

# Astra ya no habla de tu ordenador. Lo usa.

Durante tres años, la pregunta ante cada modelo nuevo fue siempre la misma. ¿Qué sabe ahora?

Astra plantea otra distinta. No qué sabe. Qué toca.

Suena a un matiz de redacción. Es un cambio de categoría. Un modelo que sabe cosas es una enciclopedia excelente, y sobre la inteligencia de una enciclopedia se puede discutir muchísimo tiempo. Un modelo que abre tu programa de CAD, mueve las piezas, guarda el archivo y pasa a lo siguiente ya no es una enciclopedia. La mayoría de los argumentos que hemos intercambiado sobre inteligencia artificial general estaban escritos para la enciclopedia.

OpenAI publicó GPT-6 Astra el 3 de septiembre de 2026. En una rueda de prensa cerrada previa al lanzamiento, el presidente de la compañía, Greg Brockman, cerró la sesión con cuatro palabras. "Welcome to the AGI era." En esa misma rueda había sido bastante más prudente. Preguntado por si OpenAI declaraba formalmente la AGI, dijo que el término ya no está atado a un disparador contractual, que se ha convertido en "a mission concept or spiritual concept", y que la AGI misma es "a much more gray, fuzzy thing". Después, en primera persona: "For me personally, I do think we're there."

Creo que es posible que tenga razón. Y creo que casi todo lo que se ha escrito desde entonces mira la prueba equivocada. Tanto los aplausos como los ojos en blanco.

## El salto son las manos, no el cociente intelectual

Mira qué eligió OpenAI para la demostración. Astra trazando una placa de circuito impreso en KiCad. Construyendo una escena urbana en 3D en Unity. Animando una transmisión de coche entre FreeCAD y Blender. Redactando un borrador de declaración de impuestos a partir de un formulario W-2. En el vídeo de lanzamiento formatea un contrato legal y construye un juego en 3D mientras, en paralelo, busca comida y reserva una pista de tenis.

Nada de eso es una demostración de conocimiento. Todo eso es una demostración de manejo. Astra está construido para trabajar dentro del software, en lugar de decirle a una persona dónde hacer clic a continuación.

La cifra que hay debajo pesa más que las de los titulares. En OSWorld 2.0, la prueba que mide el manejo de un ordenador real, [OpenAI publica](https://openai.com/index/gpt-6-astra) un 72,6 por ciento en unos 40 minutos por tarea, frente al 65,7 por ciento en unos 75 minutos de su antecesor. Más acertado y más rápido, a la vez.

Esa combinación es la historia entera. Un modelo más preciso pero más lento es un modelo que supervisas. Un modelo más preciso y más rápido es un modelo al que le encargas algo y te vas. Son dos productos distintos. Y dos riesgos distintos.

## Brockman plantó una bandera. OpenAI no.

Esta distinción se está contando como una sola cosa, y son dos.

La frase sobre la AGI es de Brockman, dicha ante periodistas en una sala. Los materiales escritos del lanzamiento de OpenAI no contienen ninguna afirmación formal sobre la AGI. La página de la empresa describe a Astra como puntero en manejo del ordenador, navegación, desarrollo de software, ciberseguridad, ciencia y trabajo profesional. No escribe lo que su presidente dijo en voz alta.

Ese hueco no es un descuido, y tampoco es un escándalo. Así se ve una empresa que cree algo que todavía no puede defender por escrito.

## Cada uno en esta discusión mide una cosa distinta

La razón por la que esto no se resuelve es que hay al menos tres varas de medir en la sala, y se contradicen en el fondo, no solo en el detalle.

La propia carta fundacional de OpenAI define la AGI como sistemas altamente autónomos que superan a los humanos en la mayoría del trabajo económicamente valioso. Es una prueba económica. Pregunta por la amplitud del trabajo cubierto, no por la brillantez.

François Chollet, que construyó las pruebas ARC, define la inteligencia como la eficiencia con la que un sistema adquiere habilidades nuevas a partir de poca experiencia. Es una prueba de aprendizaje, y un sistema puede salir bien parado y seguir siendo inútil en tu trabajo.

El modelo por niveles salido de DeepMind rechaza directamente la pregunta de sí o no. Pone el rendimiento en un eje y la generalidad y la autonomía en otros, de modo que un sistema puede estar a nivel experto y ser estrecho al mismo tiempo.

Brockman no estaba esquivando cuando llamó a la AGI una cosa gris y difusa. Estaba describiendo el estado real del campo. El problema es que gris y difuso es mal cimiento para un titular.

## La cifra que faltó en el lanzamiento

La objeción más fuerte no viene de un crítico. Viene de la propia caja de herramientas de OpenAI.

OpenAI construyó una prueba llamada GDPval precisamente para medir el rendimiento en trabajo real económicamente valioso, que es exactamente la categoría con la que su carta define la AGI. GDPval no apareció en los materiales de lanzamiento de Astra. El grupo independiente Artificial Analysis informa de que Astra retrocedió en algunas categorías de tareas de GDPval frente a su antecesor.

Así que la prueba más cercana a la propia definición de AGI de OpenAI fue la que faltó el día en que el presidente de OpenAI anunció la llegada. Por sí solo eso no demuestra nada. Es una ausencia llamativa, y sería lo primero que yo querría ver respondido.

## El mismo modelo, dos boletines de notas

La cifra de titular en casi toda la cobertura fue un 99,9 por ciento en ARC-AGI-3, una prueba construida expresamente para resistir la memorización. ARC Prize, la organización que construyó la prueba, [ejecutó el modelo por su cuenta](https://arcprize.org/results/openai-gpt-6-astra) y publicó un 62,71 por ciento en su montaje estándar, neutral respecto al proveedor. El casi pleno está en la misma tabla, solo que en otra columna, la del adaptador del proveedor. El informe del propio Chollet aterriza en la misma zona: alrededor de un 66 por ciento en el montaje estándar, cerca del pleno con un montaje de conversación continua y compactación propia.

Esto no es hacer trampa, y conviene decirlo claro. Ese montaje es el andamio alrededor del modelo. Cómo toma notas, cuánto se lleva de un paso al siguiente, cuántos intentos tiene. Todo despliegue real tiene un andamio, el tuyo también.

El punto es más estrecho y más afilado que el fraude. Una puntuación que se mueve más de treinta puntos según el andamio no mide el modelo por sí solo. Mide un sistema. Cuando este año alguien te ponga delante un benchmark, la primera pregunta es qué andamio, y la segunda quién lo construyó.

## Lo inquietante no es la afirmación sobre la AGI

Astra es el primer modelo que OpenAI clasifica como crítico en ciberseguridad dentro de su marco de preparación. Es decir, puede encontrar y explotar vulnerabilidades desconocidas hasta ahora en sistemas bien protegidos, sin que nadie le marque los pasos. Durante las pruebas encontró dos fallos desconocidos, que OpenAI comunicó después a quienes mantienen ese software. La empresa retrasó el lanzamiento para hacer más pruebas de seguridad y mantiene por ahora las capacidades cibernéticas más potentes dentro de un pequeño programa de acceso restringido.

Al lado hay un cambio más silencioso. Según The Information, Astra usa una técnica llamada recurrent depth, que hace pasar el mismo texto varias veces por las mismas capas antes de producir la siguiente palabra. Aporta rendimiento y abarata el coste. También significa que parte del pensamiento ya no ocurre en un texto que una persona pueda leer.

El científico jefe de OpenAI, Jakub Pachocki, reconoció en X que la supervisión de la cadena de razonamiento es "fragile" y "unfortunately trending in a negative direction". Su contraargumento es una cifra: la profundidad de cálculo de los modelos punteros actuales, Astra incluido, está dentro de un factor de dos respecto a GPT-4, así que el modelo sigue teniendo que escribir la mayor parte de su razonamiento. El AI Security Institute británico advirtió en mayo de que el razonamiento opaco amenaza con socavar gravemente los métodos de supervisión actuales.

Lee esos párrafos juntos. El modelo que la propia OpenAI clasifica como el más capaz encontrando agujeros en el software es también, por un margen pequeño pero real, el más difícil de observar mientras piensa. Que ese margen siga siendo pequeño es una decisión que alguien toma, no una ley natural.

## Lo que pienso yo

Toby Walsh, de la UNSW de Sídney, formuló bien la objeción de fondo. La inteligencia de la inteligencia artificial sigue siendo hoy muy irregular, dice, y hay cosas sencillas que hasta los mejores modelos hacen mal. Es cierto con Astra. Será cierto con el siguiente.

Solo que la irregularidad nunca fue la prueba, porque tampoco se la aplicamos a las personas. Hay colegas brillantes de sobra que no saben aparcar en batería.

Mi lectura: esto podría ser un primer paso, y la razón no tiene nada que ver con la tabla de resultados. Todos los saltos anteriores fueron saltos en lo que un modelo podía decir. Este es un salto en lo que puede hacer sin que alguien le indique el siguiente movimiento, dentro de software real, durante el tiempo que haga falta para terminar. Eso es una diferencia de clase, no de grado. Si la AGI llega alguna vez como un acontecimiento y no como una década, estará hecha de diferencias así.

La palabra podría carga con peso real en esa frase. Astra satura pruebas construidas contra la saturación y retrocede en la que mide trabajo pagado. Maneja un ordenador durante cuarenta minutos y nadie ha publicado qué pasa a las ocho horas. Según sus propias evaluaciones es el modelo mejor alineado que OpenAI ha entregado nunca, y su razonamiento es un poco más difícil de leer que el anterior. Todo eso es verdad a la vez, y quien te venda un veredicto limpio te está vendiendo algo.

## Cómo sostener esto con honestidad

Escribimos aquí en julio que [nadie sabe cuándo llega la AGI, y que por eso conviene construir para el desplazamiento que hay debajo](https://studiomeyer.io/es/blog/agi-timeline-value-shift). Lo sigo pensando. Astra no cambia el consejo. Le da al consejo una fecha sobre la que discutir.

Lo que sí cambia es qué vara merece tu atención. No "¿esto es AGI?", que nadie puede responder mientras nadie se ponga de acuerdo en qué contaría. Observa dos cosas en su lugar, porque ambas se miden en vez de predecirse. Cuánto puede durar una tarea que un modelo termina solo. Y con qué frecuencia llega al final sin que una persona tenga que rescatarlo. [La fiabilidad en recorridos largos](https://studiomeyer.io/es/blog/ai-agents-production-reality-2026) es el punto donde los proyectos con agentes en los que he trabajado se rompen de verdad, y ninguna rueda de prensa lo ha arreglado todavía.

La formulación del propio Brockman fue lo más justo que ofreció nadie aquel día. Si dentro de un par de años miramos atrás y preguntamos cuándo se creó la AGI, dijo, podría ser más o menos este momento y más o menos este modelo. Esa es una afirmación que solo se puede comprobar después.

Y esa es la cuestión con los primeros pasos. Nunca se sienten como pasos. Se viven como un martes cualquiera en el que la herramienta que usas empieza a hacer la parte que antes hacías tú.

## Seguir leyendo, Tendencias de IA

- [La Ley de IA de la UE en 2026: cómo leer la norma tras el Omnibus](https://studiomeyer.io/es/blog/eu-ai-act-2026-after-the-omnibus.md)
- [Nadie se pone de acuerdo sobre cuándo llega la AGI. Construye para el cambio.](https://studiomeyer.io/es/blog/agi-timeline-value-shift.md)
- [La paradoja del coste de la IA: 280x más barata, facturas al alza](https://studiomeyer.io/es/blog/ai-cost-paradox-2026.md)
- [Tendencias de IA 2026: Balance de mitad de año desde la sala de máquinas](https://studiomeyer.io/es/blog/ai-trends-2026-mid-year.md)
