Одна модель, два результата ARC-AGI-3 с разрывом в 36 пунктов
Эпоха: Эра больших языковых моделей · 2020-е–настоящее время
2 сентября 2026 года ARC Prize опубликовала проверенные результаты ARC-AGI-3 для GPT-6 Astra по двенадцати конфигурациям harness. На одном и том же полузакрытом наборе модель набирает 62,71% со стандартным harness, который позволяет ей переносить заметки по собственному выбору, и 98,55% с harness Provider Adapter, сохраняющим состояние рассуждения между запросами и сжимающим длинные диалоги. На 96% уровней Astra потратила меньше действий, чем медиана протестированных людей. Величина измеряет модель вместе с её лесами, поэтому здесь записаны обе.
ARC Prize Foundation
Источники и подтверждения
GPT-6 Astra — ARC-AGI Results
ARC Prize Foundation · Тип источника: institutional-archive
ARC Prize records 62.71% with the Standard harness and 98.55% with the Provider Adapter harness for the same model on the same Semi-Private set, across twelve harness configurations.
Опубликовано: ·Проверено:
OpenAI’s GPT-6 Astra on ARC-AGI-3
ARC Prize Foundation · Тип источника: primary-announcement
ARC Prize’s own analysis quotes 62.7% for $26K with the Standard harness and a best observed 99.9% for $19K with a Provider Adapter, and states that Astra used fewer actions than the median tested human on 96% of levels.
Опубликовано: ·Проверено: