Một mô hình, hai điểm ARC-AGI-3 cách nhau 36 điểm
Thời kỳ: Kỷ nguyên LLM · những năm 2020–Hiện tại
Ngày 2 tháng 9 năm 2026, ARC Prize công bố kết quả ARC-AGI-3 đã kiểm chứng cho GPT-6 Astra trên mười hai cấu hình harness. Trên cùng một tập đánh giá bán riêng tư, mô hình đạt 62,71% với harness tiêu chuẩn, vốn cho phép nó mang theo những ghi chú mà nó chọn giữ lại, và đạt 98,55% với harness Provider Adapter, vốn giữ trạng thái suy luận giữa các yêu cầu và nén các hội thoại dài. Astra dùng ít hành động hơn trung vị của những người được thử nghiệm ở 96% số màn. Con số này đo mô hình cùng với giàn giáo của nó, nên cả hai đều được ghi lại ở đây.
ARC Prize Foundation
Nguồn và bằng chứng
GPT-6 Astra — ARC-AGI Results
ARC Prize Foundation · Loại nguồn: institutional-archive
ARC Prize records 62.71% with the Standard harness and 98.55% with the Provider Adapter harness for the same model on the same Semi-Private set, across twelve harness configurations.
Xuất bản: ·Truy cập:
OpenAI’s GPT-6 Astra on ARC-AGI-3
ARC Prize Foundation · Loại nguồn: primary-announcement
ARC Prize’s own analysis quotes 62.7% for $26K with the Standard harness and a best observed 99.9% for $19K with a Provider Adapter, and states that Astra used fewer actions than the median tested human on 96% of levels.
Xuất bản: ·Truy cập: