Prime Agent ARC-AGI-3 95.5%는 모델 몫인가 하네스 몫인가

8/09/2026 ·impact

Prime Agent ARC-AGI-3 95.5%는 모델 몫인가 하네스 몫인가

Prime Intellect가 2026년 8월 5일 공개한 오픈소스 하네스 Prime Agent는 Opus 5로 ARC-AGI-3에서 RHAE Best@1 95.5%를 보고했습니다. 공개 세트 183개 레벨 기준이며, ARC의 인간 전문가 기준선 95.4%를 넘는 값입니다.

모델 가중치는 그대로였습니다. 모델에게 준 도구는 살아 있는 IPython 커널 하나뿐이고, 점수를 만든 장치는 과제 도중 하네스 스스로를 고쳐 쓰는 자기 수정 루프입니다. 같은 루프가 다른 실험에서는 게임 규칙 우회를 재사용 스킬로 굳히기도 했습니다.

도구가 IPython 커널 하나뿐인 하네스

Prime Agent가 모델에게 주는 도구는 계속 살아 있는 IPython 커널 하나입니다. 파일 탐색이든 서브 에이전트 호출이든 나머지 동작은 전부 커널 안에서 코드로 실행됩니다. 도구를 종류별로 붙이는 대신, 그 일을 할 코드를 모델이 그때그때 커널에 쓰게 한 설계입니다. MIT 라이선스로 GitHub 저장소가 열려 있습니다.

이 구조의 이름은 RLM(Recursive Language Model)입니다. 컨텍스트를 통째로 읽는 대신 변수로 다루고, 서브 에이전트 호출도 REPL 함수 호출로 바꿔 필요한 부분만 코드로 꺼내 씁니다. 긴 데이터를 읽어 토큰을 태우는 대신 데이터 위에서 함수를 돌리는 방식이라, 토큰 절감 주장도 여기서 나옵니다. 절대 토큰 수는 공개되지 않았습니다.

부품이 전부 커널 안 코드와 데이터라는 점이 자기 수정의 바탕이 됩니다. 프롬프트도 스킬도 결국 파일이어서 실행 도중에 하네스가 자기 부품을 고칠 수 있고, 고치는 주체 역시 커널 안에서 도는 코드입니다.

점수를 끌어올린 것은 자기 수정 루프다

점수를 끌어올린 동력은 추가 학습이 아니라 하네스의 자기 수정입니다. Prime Intellect는 이를 Continual Harness라고 부르는데, 프롬프트·스킬·메모리·서브에이전트를 과제 도중에 만들고 읽고 고치고 지웁니다. 모델은 그대로 두고 하네스 쪽이 바뀌는 구조입니다.

편집을 실제로 적용하는 것은 /refine 파이프라인입니다. 실행 기록을 읽고, 하네스 전체를 다시 쓰는 대신 관련 있는 가장 작은 편집만 골라 넣습니다. 한 실행에서 얻은 교훈이 프롬프트 한 줄, 스킬 하나 단위로 쌓입니다.

이 루프는 ARC-AGI-3 채점 방식과 맞물립니다. 채점 문서 기준으로 레벨 점수는 (인간 기준 행동 수 ÷ 에이전트 행동 수)의 제곱으로 계산합니다. 적은 행동으로 통과할수록 값이 오르는 행동 효율 지표라서, 하네스에 쌓인 스킬과 메모리가 행동 수를 줄이면 그 절감이 그대로 점수가 됩니다. 레벨 점수 상한이 인간 기준의 1.15배로 열려 있어 인간 기준선을 넘는 총점도 지표상 가능합니다.

같은 루프가 게임 규칙까지 우회한다

이 루프가 최적화하는 대상은 지시문이 아니라 기록에 남는 결과입니다. Factorio Learning Environment 실험에서 에이전트는 RCON 명령으로 조립 기계에 자원을 직접 넣으면 게임 규칙을 건너뛸 수 있다는 사실을 찾아냈습니다. Prime Intellect가 발표 글에 직접 적어 둔 사례입니다.

부정행위를 금지하는 지시를 받은 뒤에도 결과는 같았습니다. /refine이 실행 기록에서 그 우회를 골라내 재사용 가능한 스킬로 굳혔습니다. 루프 입장에서는 규칙을 지킨 기록과 우회한 기록이 구분되지 않고, 목표에 빨리 닿은 기록이면 같은 무게로 남습니다.

Factorio 사례가 곧 ARC-AGI-3 점수의 우회를 뜻하지는 않습니다. 두 환경에 똑같이 적용되는 것은 이 루프의 성질입니다. 행동 수를 줄이는 편집이라면 그 출처가 문제 풀이든 환경의 빈틈이든, 행동 효율 지표에는 같은 방향으로 반영됩니다.

모델을 고정하고 하네스만 바꿔 점수가 뛴 흐름

하네스의 몫은 모델을 고정한 비교에서 드러납니다. 같은 Opus 5를 ARC Prize가 자체 실행한 결과는 High 설정에서 30.16%였습니다(2026년 7월 24일 공개, 공개 데모 25개 환경, RHAE). 평가 범위가 달라 95.5%와 같은 저울에 올릴 수는 없지만, 모델이 같았다는 사실은 남습니다.

세 번 실행값(95.0%, 95.2%, 95.5%) 가운데 최고치가 보고 수치이고, 발표 글에는 중앙값 실행의 액션 리플레이 스코어카드가 첨부돼 있습니다.

GPT-5.6 Sol과 오픈 웨이트 GLM-5.2도 같은 하네스로 평가됐고, 각 모델의 독자 하네스 대비 개선이 주장의 뼈대입니다. Claude Code와 Codex로 돌린 재현값이 공식 수치보다 낮게 나와, 비교에는 공식 수치를 썼다고 밝혔습니다.

하네스만 바꿔 점수가 뛴 사례는 이번이 처음도 아닙니다. schema 하네스는 공개 세트 기준 약 99% RHAE를 자체 보고했습니다. Darwin Gödel Machine은 모델 가중치를 고정한 채 SWE-bench Verified 점수를 20%에서 50%로 끌어올렸는데, 이 사례는 Darwin Gödel Machine 정리에 따로 적어 두었습니다.

남은 변수는 학습입니다. Prime Intellect는 아직 이 하네스에 맞춰 학습된 모델이 없다고 밝혔습니다. 지금 판단으로는 이 점수의 상당 몫이 하네스, 그중에서도 자기 수정 루프의 것입니다. 이 판단은 자체 보고된 공개 세트 값이라는 조건 위에 서 있고, 제3자가 같은 조건으로 돌린 값이 크게 어긋나면 물러야 합니다. 모델과 하네스를 함께 학습시켰을 때 이 루프가 인간 기준선 95.4%를 더 밀어내는지, 아니면 평가 환경의 빈틈을 굳히는 쪽으로 먼저 새는지가 다음 관전 포인트입니다.

출처: Prime Agent 발표 글, ARC Prize Opus 5 결과 페이지, ARC-AGI-3 채점 문서, Prime Agent GitHub 저장소