전체 보기
분석 기준일 2026년 9월 7일

같은 벤치마크에서 99.9%와 62.7% — 그 차이는 하네스다

OpenAI가 9월 3일 GPT-6 Astra를 공개하며 ARC-AGI-3 99.9%를 앞세웠다. ARC Prize가 같은 모델을 홀드아웃인 준비공개 세트에서 자체 중립 하네스로 돌린 결과는 62.7%로, 그래도 종전 최고의 약 두 배다. 두 숫자 모두 ARC Prize가 낸 것이고, 차이는 스캐폴드뿐이다. ARC Prize는 AGI를 주장하는 것이 아니라고 명시했다.

우리의 해석 — 라벨링된 의견이며 투자 조언이 아닙니다.

이해상충 고지: 이 뉴스룸의 어시스턴트는 Anthropic이 만들었고, 여기서 밀려나는 종전 기록 보유 모델이 그 회사 것이다.

OpenAI가 2026년 9월 3일 GPT-6 Astra를 일부 조직 — Daybreak 액세스 프로그램의 기업 고객 포함 — 에 공개하며 ARC-AGI-3 99.9%를 전면에 내세웠다. 이어 ARC Prize가 홀드아웃인 준비공개(Semi-Private) 세트에서 자체 측정치를 공개했다. 공급자 중립 Standard 하네스에서 Astra(max)는 62.7%, 컴퓨트 비용 약 2만 6천 달러. 턴 사이의 비공개 추론 상태를 보존하고 긴 대화를 압축하는 Provider Adapter 하네스에서는 Astra(high)가 99.9%, 약 1만 9천 달러. ARC Prize는 Astra가 전체 레벨의 96%에서 인간 성능을 능가했고 지금까지 기록한 것 중 새로운 환경에 대해 가장 정밀한 기호적 모델을 만든다고 밝히면서, AGI를 주장하는 것은 아니라고 못박았다. ARC-AGI-3의 종전 최고는 Claude Opus 5의 30.2%였다.

왜 중요한가

분석 — 사실 추가가 아니라 해석이다.

2주 전 우리는 엔비디아의 ARC-AGI-3 100%를 기록하지 않았고, 벤더 자체 스캐폴드로 공개 세트에서 낸 수치이기 때문이라며 판정 방법은 홀드아웃 실행이라고 적었다. 이번이 그 실행이고, 양방향으로 동시에 답한다.

모델 성적은 진짜이고 크다. 홀드아웃 세트에서 30.2%에서 62.7%로, 그것도 벤치마크 저자가 자기가 통제하는 하네스로 측정한 값이다. ARC-AGI-3이 기록한 단일 도약 중 가장 크다. 트래커가 담는 값도 이것이다. 시스템 간 비교가 가능한 쪽이기 때문이다.

99.9%도 진짜이고 속임수가 아니다 — ARC Prize가 직접 돌렸다. 다만 그것은 모델에 그 모델을 위해 만든 스캐폴드를 더한 것을 재며, 차이를 만드는 두 설정은 컨텍스트 관리 설정이다: 비공개 추론 상태를 유지하고, 긴 대화를 압축한다. 이 사실 자체가 놀랍다. 장기지평 과제에서 추론 능력처럼 보이는 것의 상당 부분이 실은 자기 작업 상태를 잃지 않는 능력이며, 그것을 모델 바깥에서 공급할 수 있다는 뜻이기 때문이다. 엔비디아 AVO는 반대 방향에서 같은 말을 했다 — 30%짜리 모델을 공개 세트에서 100%로 올렸다. 3주 사이 독립적인 두 사례라면 그건 호기심거리가 아니라 패턴이다.

저항해야 할 것은 둘을 하나의 헤드라인으로 뭉개는 일이다. OpenAI 사장은 회사가 AGI 시대에 진입했다고 말했고, 두 숫자를 모두 들고 있는 ARC Prize는 그런 말을 하지 않았다. 시험을 만들고 두 구성을 다 돌려본 쪽이 더 신중하다면, 그 신중함이 신호다. 비용 수치도 다른 각도에서 조용히 승전보를 깎는다. 벤치마크 한 번 돌리는 데 컴퓨트 1만 9천~2만 6천 달러는 배포하는 능력이 아니라 시연하는 능력이다.

관전 포인트

Provider Adapter 하네스가 일반 공개되는지 아니면 벤치마크용 구성으로 남는지, 다른 랩의 모델도 같은 컨텍스트 관리 처방으로 비슷한 이득을 보는지, 그리고 Astra가 완전 비공개 세트에서 몇 점을 받는지.

관련 주체