Tencent WorldClaw 공개, 텍스트로 3D 오픈월드 만드는 에이전트

8/11/2026 ·impact

Tencent WorldClaw 공개, 텍스트로 3D 오픈월드 만드는 에이전트

Tencent Hunyuan이 텍스트 프롬프트 한 줄로 3D 오픈월드를 만드는 에이전트 시스템 WorldClaw를 논문과 프로젝트 페이지로 공개했습니다. 결과물이 영상이 아니라 지형 메시와 낱개 객체 메시라서, 만들어진 월드에서 나무 한 그루 단위로 골라 옮기고 지울 수 있습니다.

다만 공개 범위는 논문과 데모 페이지까지입니다. 코드와 가중치는 올라오지 않았고 공개 계획도 적혀 있지 않아, 지금 설치해서 써 볼 수는 없습니다.

논문과 프로젝트 페이지까지만 공개된 WorldClaw

공개는 2026년 8월 초에 이뤄졌습니다. arXiv 논문(2608.05248)과 결과물 데모를 모은 프로젝트 페이지가 올라왔고, GitHub 저장소는 이 둘로 안내하는 내용이 전부입니다. 코드와 가중치는 저장소에 없습니다.

대규모 3D 오픈월드를 에이전트 방식으로 생성하는 시스템입니다. 시스템이 받는 입력은 개방형 텍스트 프롬프트 하나입니다. 출력은 장면 전체에 깔리는 명시적 지형 메시와, 그 위에 배치되는 텍스처 메시 객체들입니다. 객체가 배경에 붙어 굳은 한 덩어리 장면이 아니라 하나하나 독립적으로 관리되는 에셋으로 나온다는 점이 이 시스템의 핵심입니다.

WorldClaw 프로젝트 페이지에서 데모 보기

영상이 아니라 낱개로 편집되는 3D 에셋이 나온다

기존 접근과는 결과물의 형태가 다릅니다. 텍스트로 월드를 만드는 시스템은 흔히 영상이나 Gaussian Splatting 장면을 내놓는데, 영상은 정해진 경로 밖을 볼 수 없고 Splatting은 물체 하나만 집어 고치기 어렵습니다. WorldClaw는 명시적 메시를 내놓기 때문에 시점을 자유롭게 옮겨 탐색할 수 있고, 만든 뒤에도 편집할 수 있습니다.

편집 단위는 객체 하나입니다. 나무 한 그루, 바위 하나를 선택해 옮기고 지우고 다른 것으로 바꿀 수 있습니다. 만들어진 객체를 꺼내 다른 프로젝트에서 재사용할 수도 있어서, 게임 제작 파이프라인에 그대로 가져다 쓸 수 있습니다.

다만 논문에 수치 벤치마크는 없습니다. SynCity, Marble, WorldGen, MajutsuCity, GPT-5.6 Sol 같은 기존 시스템과는 결과 화면을 나란히 놓는 정성 비교만 실려 있습니다. 격차가 어느 정도인지 숫자로 말할 근거는 논문에 없습니다.

에이전트가 Blender를 조작하며 스스로 고친다

한 번의 모델 호출로 장면 전체를 뽑는 구조가 아닙니다. 프롬프트에서 의도를 분석해 장면을 계획하고, 전역 지형을 만들고, 영역을 나눠 객체를 생성·배치하는 세 단계로 진행되며, 단계마다 그 일을 맡는 에이전트가 붙습니다.

논문이 밝힌 실행 환경은 Blender 5.1.1입니다. 에이전트가 BlenderMCP(Model Context Protocol)를 통해 Blender를 직접 조작해서 지형을 만들고, 객체를 놓고, 렌더링합니다.

자기 수정도 파이프라인 안에 있습니다. 정해 둔 카메라 시점에서 장면을 렌더링해 검사하면서 공중에 뜬 물체, 지형을 뚫고 들어간 물체, 불안정하게 걸쳐 있는 물체를 찾아냅니다. 스케일이 어긋난 객체는 변환을 갱신하고, 놓일 자리가 문제면 그 물체의 지지 영역 지형만 국소적으로 다듬어 전역 지형은 그대로 보존합니다. 검사와 수정은 한 라운드로 끝나지 않고 여러 번 돌며, 품질이 떨어지는 메시는 Hunyuan3D로 다시 생성합니다.

기반 모델 조합이 눈에 띕니다. 계획과 판단을 맡는 에이전트 LLM은 Anthropic의 Claude Opus 4.8, 이미지 생성은 GPT-Image-2, 세그먼테이션은 SAM3입니다. 3D 재구성은 자사 Hunyuan3D와 SAM3D가 맡습니다. Tencent가 만든 시스템인데 두뇌와 눈은 경쟁사 모델을 쓰는 구성입니다.

코드·가중치 미공개, 한계도 논문에 적혀 있다

지금 이 시스템을 설치하거나 호출해서 써 볼 방법은 없습니다. 코드와 가중치가 공개되지 않았고, 공개 일정에 대한 언급도 논문과 저장소 어디에서도 찾을 수 없습니다. 결과물을 눈으로 확인할 방법은 프로젝트 페이지에 올라온 데모뿐입니다.

한계도 논문이 직접 밝히고 있습니다.

  • 기반 모델 의존: 오픈소스 LLM으로 바꾸면 절차적 지형·재질 생성이 자주 실패해, Claude Opus 4.8급 모델이 필요
  • 지연과 비용: 객체를 하나씩 생성하고 정제 라운드를 여러 번 도는 구조라, 단순한 장면도 만드는 데 오래 걸림
  • 표현 범위: 파트 계층·관절·상호작용 로직은 아직 생성 불가

지금 WorldClaw라고 부를 수 있는 것은 논문, 데모 페이지, 안내용 저장소가 전부입니다. 텍스트 한 줄이 편집 가능한 지형·객체 메시가 되는 것까지는 보여 줬고, 코드가 공개되기 전까지는 직접 만들어 볼 방법이 없습니다.

출처: 프로젝트 페이지, arXiv 2608.05248, GitHub 저장소