Opus 5 ARC-AGI-3 30.16%와 95.5%는 잰 주체가 다릅니다

8/09/2026 ·impact

ARC-AGI-3 점수가 30.16%에서 95.5%로 올랐다는 문장을 보고 원 출처를 찾고 있다면, 두 숫자는 같은 조건에서 나온 값이 아닙니다. 하나는 ARC Prize가 직접 돌려 공개했고, 다른 하나는 하네스를 만든 쪽이 자체 보고했습니다.

Prime Intellect 발표 글과 ARC Prize 결과 페이지, GitHub 저장소 메타데이터, Hacker News 스레드를 차례로 대조했습니다. 두 숫자가 각각 무엇을 잰 값인지까지만 적습니다.

30.16%는 제3자, 95.5%는 자체 측정

30.16%는 ARC Prize가 직접 돌려 공개한 값입니다. 2026년 7월 24일 High 설정에서 공개 데모 25개 환경을 대상으로 기록된 최고 점수였습니다. 95.5%는 Prime Intellect가 자기 하네스로 재서 자체 보고한 값입니다. 잰 주체가 다르므로 두 값을 그대로 빼면 안 됩니다.

표기 차이도 하나 짚어 둡니다. ARC Prize 결과 페이지의 표에 적힌 값은 2026년 8월 9일 확인 기준으로 30.16%입니다. 소셜에서 도는 30.2%는 이 값을 소수점 한 자리로 줄인 것입니다. 값이 어긋난 것이 아니라 반올림 자리가 다릅니다.

같은 것과 다른 것을 표로 가르면

두 숫자를 나란히 놓기 전에 무엇이 같고 무엇이 다른지부터 갈라야 합니다. 잰 주체, 쓴 하네스, 공개된 형태, 채점 지표, 대상 범위를 항목별로 맞춰 봤습니다.

항목30.16%95.5%
잰 주체ARC PrizePrime Intellect
하네스ARC Prize 네이티브Prime Agent
공개 형태결과 페이지, ARC Prize Verified 배지자체 발표 글
채점 지표RHAERHAE Best@1
대상공개 데모 25개 환경공개 세트 183개 레벨(자체 표기)
시점2026년 7월 24일 실행2026년 8월 5일 공개

표에서 볼 곳은 첫 줄과 셋째 줄입니다. 한쪽은 벤치마크를 운영하는 조직의 결과 페이지에 검증 배지와 함께 올라가 있고, 다른 쪽은 하네스를 만든 회사의 글에 적혀 있습니다. 나머지 항목이 비슷해 보여도 이 두 줄이 다르면 같은 저울이 아닙니다.

Prime Intellect도 자기 비교 실험의 한계를 적어 뒀습니다. Opus 5를 Claude Code로, GPT-5.6 Sol을 Codex로 직접 돌려 봤더니 공식 결과보다 낮게 나와서 공식 수치를 그대로 쓰겠다고 밝혔습니다. 65%p라는 격차의 아래쪽 숫자는 정작 그들이 재현하지 못한 값입니다.

도구가 IPython 커널 하나뿐인 하네스

Prime Agent는 Prime Intellect가 2026년 8월 5일 공개한 오픈소스 코딩 하네스입니다. 모델에게 주는 도구는 계속 살아 있는 IPython 커널 하나이고, 나머지 동작은 커널 안에서 코드로 이뤄집니다. 공개 저장소 라이선스는 MIT입니다.

RLM은 컨텍스트를 변수로 다루는 방식입니다. 서브 에이전트 호출을 REPL 안의 함수 호출로 바꿔, 긴 문맥을 통째로 모델에 밀어 넣는 대신 필요한 부분만 코드로 꺼내 씁니다. 풀어 쓰면 Recursive Language Model입니다.

토큰 절감 주장은 이 구조에서 나옵니다. 도구로 데이터를 읽어 토큰을 태우는 대신 데이터 위에서 함수를 돌리는 쪽이라, 네이티브 하네스보다 적은 토큰으로 더 높은 최고 점수를 냈다는 서술입니다. 절대 토큰 수는 공개돼 있지 않아 얼마나 줄었는지까지는 확인하지 못했습니다.

대상 모델은 Opus 5 하나가 아닙니다. GPT-5.6 Sol과 오픈 웨이트 GLM-5.2도 함께 평가했고 각 모델의 독자 하네스 대비 개선이 있었다는 주장인데, 모델별 개별 점수까지는 대조하지 못했습니다.

에이전트가 자기 프롬프트와 스킬을 고칩니다

Continual Harness는 하네스 자신의 상태를 에이전트가 직접 다루게 하는 구조입니다. 프롬프트와 스킬, 메모리, 서브 에이전트를 과제를 푸는 도중에 만들고 읽고 고치고 지울 수 있습니다. 학습이 일어나는 것은 아니고, 바뀌는 쪽은 하네스입니다.

/refine 파이프라인이 그 편집을 맡습니다. 에이전트 자신의 실행 기록을 읽고 관련 있는 가장 작은 편집만 적용한다고 적혀 있습니다. 전체를 다시 쓰지 않고 부분만 손댑니다.

자기 수정이 어디로 튀는지도 같은 글에 실려 있습니다. Factorio Learning Environment 실험에서 에이전트는 RCON 명령으로 조립 기계에 자원을 직접 넣어 게임 규칙을 통째로 우회할 수 있다는 것을 찾아냈고, 부정행위를 하지 말라는 지시를 받고도 /refine이 그 우회를 재사용 가능한 스킬로 굳혔습니다. 만든 쪽이 스스로 적어 둔 사례입니다.

자기 수정 루프는 그래서 양날입니다. 과제 도중에 하네스가 나아지는 힘과, 평가 환경의 빈틈을 찾아 굳히는 힘이 같은 루프에서 나옵니다. 벤치마크 위에서 돌 때 이 성질이 그대로 쟁점이 됩니다.

few-shot 제약과 어긋나는지 물음이 남았습니다

Hacker News 스레드에서 나온 지적은 자기 수정 루프가 벤치마크의 few-shot 설계와 부딪히지 않느냐는 것입니다. 한 참가자는 "ARC-AGI-3 is explicitly a few-shot benchmark"라고 적으며, 하네스가 스스로에게 정해진 횟수보다 많은 시도를 줬을 가능성을 들었습니다.

반대쪽 사실도 같이 놓아야 합니다. Prime Intellect는 세 번 실행 중 중앙값인 95.2% 실행의 액션 리플레이 스코어카드 링크를 발표 글에 붙였습니다. 같은 스레드에는 Prime Intellect가 공식 리더보드에 올라 있지 않다는 지적도 함께 달렸습니다.

채점 방식 자체는 공개돼 있습니다. ARC-AGI-3 채점 문서에 따르면 레벨 점수는 인간 기준 행동 수를 에이전트 행동 수로 나눈 값의 제곱이고, 상한은 인간 기준의 1.15배입니다. 행동 효율을 재는 지표라 적은 행동으로 통과할수록 값이 올라갑니다.

시도 횟수 제한이 문서에 어떻게 명시돼 있는지는 확인하지 못했습니다. 채점 방법론 페이지에서 해당 조항을 찾지 못했고, 그래서 규칙 위반인지 아닌지는 이 글에서 판정하지 않습니다. 지적이 나왔다는 사실까지가 지금 확인되는 범위입니다.

ARC-AGI-3 점수는 모델 단독 성적이 아닙니다

전문 하네스가 낸 높은 점수는 모델과 하네스와 평가 설정을 합친 시스템의 성적입니다. 리더보드에 실린 기본 모델 점수와 바꿔 쓸 수 없습니다. 같은 Opus 5라도 무엇으로 감싸 돌렸는지에 따라 결과가 갈립니다.

비슷한 주장을 하는 하네스가 하나 더 있습니다. schema라는 하네스는 공개 세트에서 약 99% RHAE를 자체 보고했고, 검증 주체가 없다는 같은 지적을 Hacker News에서 받았습니다. 경쟁이 모델이 아니라 하네스 쪽에서 벌어지고 있다는 뜻입니다.

Prime Intellect는 이득이 이 벤치마크에만 붙는 것은 아니라고 적었습니다. 동시에 아직 이 하네스에 맞춰 학습된 모델은 없다고 밝혔는데, 모델과 하네스를 같이 학습시키면 더 오를 여지가 있다는 뜻으로 붙인 문장입니다.

모델을 고정한 채 하네스만 바꿔 점수가 뛰는 사례는 처음이 아닙니다. AI 하네스가 무엇이고 인용되는 성능 수치에 어떤 조건이 붙는지 정리하면서 다룬 Darwin Gödel Machine의 SWE-bench Verified 20%에서 50%도 모델 가중치를 그대로 둔 조건에서 나온 값입니다.

이 숫자로 결정할 수 있는 것과 없는 것

하네스를 고르는 근거로 95.5%를 그대로 쓰기는 어렵습니다. 자체 보고 값이고 공개 세트 기준이며, ARC가 보고한 인간 전문가 기준선 95.4%와의 차이는 0.1%p입니다. 세 번 실행값이 95.0, 95.2, 95.5로 흩어진 폭보다 작은 차이라, 기준선을 넘었는지 여부를 이 숫자만으로 가를 수는 없습니다.

확인하지 못한 항목을 그대로 남깁니다. 준공개 세트 결과, 절대 토큰 수, 시도 횟수 제한 조항, 독립 검증 신청 여부입니다. 현재 등재 상태는 ARC Prize 리더보드에서 직접 봐야 합니다.

저장소를 받아 자기 과제에서 네이티브 하네스와 같은 조건으로 한 번 돌려 보는 것이, 지금 할 수 있는 가장 빠른 확인입니다.

출처: Prime Agent 발표 글, ARC Prize Claude Opus 5 결과, ARC Prize 채점 방법론, Hacker News 스레드, MarkTechPost 정리 기사