AI 하네스 성능 향상 수치에 붙은 조건: DGM 50%와 RE-Bench 4배

8/09/2026 ·impact

AI 하네스 성능 향상 수치에 붙은 조건: DGM 50%와 RE-Bench 4배

모델 가중치를 고정한 채 AI 하네스만 진화시켜 SWE-bench Verified 점수를 20%에서 50%로 올린 시스템이 있습니다. DGM(Darwin Gödel Machine)입니다. 상승분은 전부 모델 바깥, 도구와 검증 절차에서 나왔습니다.

이 수치가 인용될 때 조건이 함께 옮겨지는 일은 드뭅니다. 어떤 값은 모델을 고정했을 때만, 어떤 값은 시간 예산이 짧을 때만 성립하고, 기반 모델이 약하면 같은 자기 개선 루프가 오히려 점수를 깎습니다.

하네스는 프롬프트가 아니라 실행 시스템 전체다

Sakana AI가 공개한 DGM의 개선 목록에는 지시문 수정이 없습니다. 에이전트가 스스로 찾아낸 것은 패치 검증 단계 추가, 파일 보기 개선, 편집 도구 강화, 여러 해답을 만들어 순위를 매기는 장치, 시도 이력 기록이었습니다. 점수를 올린 것은 문장이 아니라 도구와 검증 절차였습니다.

이 폭을 정의로 옮긴 것이 Lilian Weng의 글입니다(2026년 7월 4일). 여기서 AI 하네스는 계획과 사고, 도구 호출과 행동, 컨텍스트 인식과 관리, 산출물 저장, 결과 평가라는 다섯 층으로 이루어진 실행 시스템 전체를 가리킵니다. 지시문은 그중 한 층의 일부일 뿐입니다.

Harness Engineering for Self-Improvement하네스 다섯 층의 정의와 자기 개선 루프의 조건을 정리한 원문

DGM의 20%에서 50%는 모델을 고정한 조건에서 나왔다

DGM의 상승은 모델 학습이 아니라 에이전트가 자기 코드베이스를 고친 결과입니다. 모델 가중치를 고정한 채 하네스만 진화시켰다는 조건은 arXiv 초록에 명시돼 있고, SWE-bench Verified 점수는 그 조건에서 20%에서 50%가 됐습니다.

Polyglot 점수도 14.2%에서 30.7%로 올랐고, 두 벤치마크 값 모두 Sakana AI 발표와 arXiv 초록에 같은 값으로 실려 있습니다. 그러니까 50%는 모델이 똑똑해진 값이 아니라 같은 모델이 더 좋은 작업 환경을 갖게 된 값입니다.

다만 이 상승폭이 과제를 가리지 않는 것은 아닙니다. Weng 글이 모은 값을 보면 PaperBench의 Claude 3.5 Sonnet은 약 21%로 ML 박사 과정 연구자를 넘지 못했고, CORE-Bench의 가장 어려운 과제 정확도도 당시 보고된 최고 에이전트 기준 21%였습니다. MLE-bench에서는 o1-preview에 AIDE 하네스를 붙이고도 대회의 16.9%에서만 캐글 동메달 수준 이상을 냈습니다. 50%라는 점수는 과제를 옮기면 그대로 따라오지 않습니다.

RE-Bench 4배는 2시간 예산일 때의 값이고, 시간을 늘리면 뒤집힌다

'인간 전문가의 4배'는 시간 예산이 2시간일 때 측정된 값입니다. RE-Bench 논문 기준으로 예산을 8시간으로 늘리면 사람이 근소하게 앞섭니다. 32시간이 되면 평균 인간 점수가 최고 에이전트 점수의 약 2배까지 벌어집니다.

이때 비교 대상이 된 사람 기록은 METR 발표에 정리돼 있습니다. 커널 최적화나 스케일링 법칙 추정처럼 답이 열린 ML 연구공학 환경 7개에서, 전문가들이 낸 8시간짜리 시도 71건입니다(참여 전문가 61명).

초록 기준으로 이 시도의 82%가 0점을 넘겼습니다. 참조 해답과 같거나 그 이상인 시도도 24%였습니다. 낮은 기준선을 상대로 얻은 4배가 아니라는 뜻입니다.

짧은 예산에서는 에이전트가 앞서고 예산이 길어지면 사람이 앞서는 교차가 이 벤치마크의 핵심 결과입니다. 4배만 떼어 인용하면 그 교차가 사라지고, 시간 축이 빠진 배율만 남습니다.

약한 모델에서는 자기 개선 루프가 오히려 성능을 깎는다

하네스를 스스로 고치게 하는 루프의 이득은 모델 등급에 비례하지 않습니다. Weng 글이 인용한 STOP 실험에서 GPT-4는 반복하며 평균 성능이 올랐지만, GPT-3.5와 Mixtral 같은 약한 모델은 오히려 떨어졌습니다. 기반 모델이 개선 장치 자체를 고칠 만큼 유능해야 루프가 이득이 됩니다.

이득의 모양도 단조롭지 않습니다. 같은 글에 인용된 Lin 등의 실험에서는 중간 등급 모델이 하네스 이득을 가장 크게 봤습니다. 하네스 개선이 곧 성능 개선이라는 등식은 특정 등급 구간에서 가장 강하게 성립하는 셈입니다.

보상 설계에도 조건이 붙습니다. 유닛 테스트로 보상을 주면 에이전트는 테스트에 과적합하고, 판정 모델로 주면 그 판정기에만 통하는 요령을 익힙니다. Weng이 꼽은 가장 큰 병목은 빠르고 정확한 검증기의 부재이고, 권한 제어와 보안 계층을 루프 바깥에 두라는 단서도 함께 달려 있습니다.

지시 한 줄을 바꾸자 같은 모델이 다른 그림을 냈다

작은 규모에서도 층의 구분은 그대로 나타납니다. 제가 쓰는 블로그 CLI의 이미지 생성은 photo 스타일 정의가 '실제 사진처럼' 한 줄뿐이었고, 결과물은 계속 제품 광고 컷 같은 기본값으로 쏠렸습니다. 모델과 프롬프트 앞부분은 그대로 두고 이 정의만 고치자 결과가 달라졌습니다.

고친 내용은 카메라와 조리개, 재질 결함을 서술하는 문장과 '3D 렌더 느낌, 반들거리는 하이라이트, 제품 광고 같은 구도를 쓰지 마라'는 금지문입니다.

반대로 지시로 못 메운 고장도 세 건 있었습니다. 생성 실패 후 옛 파일이 남아 성공으로 오독되는 문제는 지우고 만들고 확인하는 순서로 바꿔 잡았고, 저장이 끝나기 전에 API를 조회해 이미지 없는 판을 받는 문제는 고정 대기 2초를 없애고 실제 업로드가 확인될 때까지 재조회하게 고쳤습니다. 편집기 HTML 보기에서 iframe이 숨겨져 이미지 삽입이 막힌 문제까지, 셋 다 실행 순서와 검증 절차의 일이었습니다.

DGM이 자동으로 찾아낸 여러 해답 생성과 비평 층을 사람 손으로 먼저 구현해 둔 예로는 가재코드 CLI의 ralplan 스킬이 있습니다.

다음 관전 포인트는 DGM의 50%가 SWE-bench 밖의 과제에서도 재현되는지입니다. 함께 볼 것은 중간 등급 모델이 하네스 이득을 가장 크게 본다는 비단조 곡선이 새 모델 세대에서도 유지되는지이고, 이 곡선이 유지된다면 AI 하네스 투자의 우선순위는 최신 모델 추격보다 검증기 구축 쪽에 놓입니다.

출처: Harness Engineering for Self-Improvement, DGM arXiv, Sakana AI DGM 발표, RE-Bench arXiv, METR RE-Bench 발표