Português
← Voltar à linha do tempo

Um modelo, dois resultados ARC-AGI-3 a 36 pontos de distância

Era: A Era dos LLMs · anos 2020–Presente

A 2 de setembro de 2026 a ARC Prize publicou resultados ARC-AGI-3 verificados para o GPT-6 Astra em doze configurações de harness. No mesmo conjunto de avaliação semiprivado o modelo obtém 62,71% com o harness padrão, que lhe permite levar consigo as notas que escolhe guardar, e 98,55% com um harness Provider Adapter, que preserva o estado de raciocínio entre pedidos e comprime conversas longas. O Astra usou menos ações do que a mediana dos humanos testados em 96% dos níveis. O número mede um modelo juntamente com o seu andaime, e por isso ambos ficam aqui registados.

ARC Prize Foundation

Fontes e evidências

  1. GPT-6 Astra — ARC-AGI Results

    ARC Prize Foundation · Tipo de fonte: institutional-archive

    ARC Prize records 62.71% with the Standard harness and 98.55% with the Provider Adapter harness for the same model on the same Semi-Private set, across twelve harness configurations.

    Publicado: ·Acessado:

  2. OpenAI’s GPT-6 Astra on ARC-AGI-3

    ARC Prize Foundation · Tipo de fonte: primary-announcement

    ARC Prize’s own analysis quotes 62.7% for $26K with the Standard harness and a best observed 99.9% for $19K with a Provider Adapter, and states that Astra used fewer actions than the median tested human on 96% of levels.

    Publicado: ·Acessado: