Español
← Volver a la cronología

Un modelo, dos puntuaciones ARC-AGI-3 separadas por 36 puntos

Era: La Era de los LLM · años 2020–Presente

El 2 de septiembre de 2026 ARC Prize publicó resultados ARC-AGI-3 verificados para GPT-6 Astra en doce configuraciones de harness. Sobre el mismo conjunto de evaluación semiprivado el modelo obtiene 62,71% con el harness estándar, que le permite llevarse las notas que decide conservar, y 98,55% con un harness Provider Adapter, que preserva el estado de razonamiento entre peticiones y comprime las conversaciones largas. Astra usó menos acciones que la mediana de los humanos evaluados en el 96% de los niveles. La cifra mide un modelo junto con su andamiaje, y por eso aquí constan ambas.

ARC Prize Foundation

Fuentes y respaldo

  1. GPT-6 Astra — ARC-AGI Results

    ARC Prize Foundation · Tipo de fuente: institutional-archive

    ARC Prize records 62.71% with the Standard harness and 98.55% with the Provider Adapter harness for the same model on the same Semi-Private set, across twelve harness configurations.

    Publicado: ·Consultado:

  2. OpenAI’s GPT-6 Astra on ARC-AGI-3

    ARC Prize Foundation · Tipo de fuente: primary-announcement

    ARC Prize’s own analysis quotes 62.7% for $26K with the Standard harness and a best observed 99.9% for $19K with a Provider Adapter, and states that Astra used fewer actions than the median tested human on 96% of levels.

    Publicado: ·Consultado: