Français
← Retour à la chronologie

Un seul modèle, deux scores ARC-AGI-3 distants de 36 points

Ère : L’Ère des LLM · années 2020–Présent

Le 2 septembre 2026, ARC Prize a publié des résultats ARC-AGI-3 vérifiés pour GPT-6 Astra sur douze configurations de harness. Sur le même jeu d’évaluation semi-privé, le modèle obtient 62,71% avec le harness standard, qui lui permet de conserver les notes qu’il choisit de garder, et 98,55% avec un harness Provider Adapter, qui préserve l’état de raisonnement entre les requêtes et compacte les longues conversations. Astra a utilisé moins d’actions que la médiane des humains testés sur 96% des niveaux. Le chiffre mesure un modèle avec son échafaudage : c’est pourquoi les deux figurent ici.

ARC Prize Foundation

Sources et éléments étayés

  1. GPT-6 Astra — ARC-AGI Results

    ARC Prize Foundation · Type de source : institutional-archive

    ARC Prize records 62.71% with the Standard harness and 98.55% with the Provider Adapter harness for the same model on the same Semi-Private set, across twelve harness configurations.

    Publié : ·Consulté :

  2. OpenAI’s GPT-6 Astra on ARC-AGI-3

    ARC Prize Foundation · Type de source : primary-announcement

    ARC Prize’s own analysis quotes 62.7% for $26K with the Standard harness and a best observed 99.9% for $19K with a Provider Adapter, and states that Astra used fewer actions than the median tested human on 96% of levels.

    Publié : ·Consulté :