Satu Model, Dua Skor ARC-AGI-3 yang Terpaut Tiga Puluh Enam Poin
Era: Era LLM · 2020-an–Kini
Pada 2 September 2026 ARC Prize menerbitkan hasil ARC-AGI-3 terverifikasi untuk GPT-6 Astra pada dua belas konfigurasi harness. Pada set evaluasi Semi-Private yang sama, model itu meraih 62,71% dengan harness Standard, yang membiarkannya membawa serta catatan yang dipilihnya untuk disimpan, dan 98,55% dengan harness Provider Adapter, yang melestarikan keadaan penalaran antarpermintaan dan memadatkan percakapan panjang. Astra memakai tindakan lebih sedikit daripada median manusia yang diuji pada 96% level. Angka itu mengukur model bersama perancahnya, dan itulah sebabnya keduanya dicatat di sini.
ARC Prize Foundation
Sumber dan bukti
GPT-6 Astra — ARC-AGI Results
ARC Prize Foundation · Jenis sumber: institutional-archive
ARC Prize records 62.71% with the Standard harness and 98.55% with the Provider Adapter harness for the same model on the same Semi-Private set, across twelve harness configurations.
Terbit: ·Diakses:
OpenAI’s GPT-6 Astra on ARC-AGI-3
ARC Prize Foundation · Jenis sumber: primary-announcement
ARC Prize’s own analysis quotes 62.7% for $26K with the Standard harness and a best observed 99.9% for $19K with a Provider Adapter, and states that Astra used fewer actions than the median tested human on 96% of levels.
Terbit: ·Diakses: