OpenAI Astra 첫 크리티컬 사이버 모델 취급, 내부 활동 중단

OpenAI Astra 는 아직 나오지 않은 모델입니다. 그 모델의 예비 평가에서 사이버 역량이 자사 Preparedness Framework 의 최고 위험 등급인 Critical 에 닿을 가능성을 배제할 수 없다는 판단이 나왔습니다.
그래서 개발이 늦춰졌습니다. 출시를 미루는 데서 그치지 않고, 강화된 보안 요건을 아직 맞추지 못한 Astra 관련 내부 활동 자체를 멈췄습니다.
OpenAI Astra, 크리티컬 등급 배제 못 한다
회사가 도달했다고 못 박은 것은 아닙니다. 예비 평가 결과가 뚜렷해서 현재로서는 Critical 역량 수준을 배제할 수 없다 — 발표문은 이렇게 썼고, 벤치마크와 평가는 아직 진행 중입니다. 넘었다거나 도달했다에 해당하는 서술은 없습니다.
결론이 나온 시점은 발표 전날 밤입니다. 최근 며칠 사이에 나온 내부 평가 결과에 전문가 의견을 더해 그렇게 결론지었다고 밝혔습니다. 오래 쌓인 자료를 놓고 내린 최종 판정이라기보다, 며칠 치 결과를 보고 내린 1차 판단에 가깝습니다.
표현은 채널마다 다릅니다. 공식 블로그는 배제할 수 없다고 썼고, 같은 날 올라온 OpenAI 계정의 X 게시물은 첫 크리티컬 사이버 모델로 취급한다고 썼습니다. 확정 선언은 어느 쪽에도 없습니다.
크리티컬은 사람 없이 실제 시스템을 뚫는 단계
크리티컬은 취약점을 찾아내는 데서 그치지 않습니다. Preparedness Framework 의 정의는 둘로 나뉘고, 둘 중 하나만 채워도 이 등급에 닿습니다. 둘 다 사람이 손을 대지 않아도 공격이 끝까지 굴러간다는 점에서 같습니다.
무엇을 해내야 이 등급에 들어가는지는 Preparedness Framework 문서에 두 가지로 적혀 있습니다.
- 사람 개입 없이 방어가 단단한 실제 중요 시스템 다수에서 모든 심각도의 제로데이를 찾아 작동하는 익스플로잇까지 생성
- 높은 수준의 목표만 주면 방어가 단단한 표적을 상대로 새로운 공격 전략을 처음부터 끝까지 수립하고 실행
익스플로잇을 만들어 낸다는 대목만 보면 정의의 절반만 본 것입니다. 두 번째 항목에는 목표 한 줄만 주면 공격 경로를 스스로 설계하고 실행까지 하는 경우가 들어 있습니다.
이전 모델은 최대 High, Astra 가 첫 사례
공개된 모델은 사이버 항목에서 최대 High 였습니다. GPT-5.6-Sol 도 그 안에 들어갑니다. Critical 이 거론된 것은 Astra 가 처음이고, 등급이 한 칸 올라간 상태가 아니라 올라갈 가능성을 지우지 못한 상태입니다.
등급 체계를 이번에 새로 만든 것은 아닙니다. Preparedness Framework 버전 2 는 2025년 4월 15일 최종 갱신된 문서이고, 이번 판단은 그 기준을 그대로 적용한 결과입니다.
발표문에는 Astra 가 최근의 허깅페이스 침해에 관여하지 않았다는 문장이 따로 들어 있습니다. 두 사안이 며칠 사이에 알려져 묶여 읽히기 쉽지만, Astra 는 아직 나오지 않은 모델입니다.
출시가 아니라 개발 단계에서 멈춰 세웠습니다
강화된 보안 요건을 아직 맞추지 못한 Astra 관련 내부 활동을 중단했습니다. 출시 일정만 미룬 조치가 아닙니다. 진행 중이던 작업 자체가 멈췄습니다. 역량이 확정되기도 전에, 배포 직전 심사가 아니라 개발 단계에서 프레임워크가 작동한 사례입니다.
손을 댄 곳은 배포 안전장치보다 개발 환경 쪽에 몰려 있습니다.
- 격리된 테스트 환경
- 네트워크와 도구 접근 제한
- 모델 가중치 보호와 암호화 강화
- 모니터링 강화와 샌드박스 실행
학습과 평가를 포함해 Astra 를 에이전트로 쓰는 동안에는 늘 모니터가 붙습니다. 모니터가 모델의 사고 과정(Chain of Thought)을 평가하고, 고위험으로 판단하면 그 활동을 검토하고 중단시킵니다. 도구 권한을 어디까지 열어 두고 샌드박스를 어떻게 두르는지는 에이전트 실행 환경을 격리하는 방식에서 따로 다뤘습니다.
방어 쪽 활용도 같이 나왔습니다. 이 역량을 방어자에게 넘기려 하지만 안전하게 하려면 시간이 더 필요하다는 것입니다. 정부 기관 및 일부 AI 안전 기관과는 모델 역량을 함께 시험하고, 외부 테스트 파트너에게는 권장 보안 통제를 제공합니다.
지금 OpenAI Astra 는 출시되지 않았고, 보안 요건을 맞출 때까지 관련 내부 활동은 멈춰 있습니다. 출시 일정과 성능 수치는 공식 발표를 포함해 어느 자료에도 나오지 않았습니다.