Design · Development · Thoughts

안녕하세요,
Practical AI Lab 입니다.

AI·에이전트·LLM 실전 연구

OpenAI Astra Critical 등급, 출시 전 무엇이 확인됐나?


반응형

Astra 최고위험 등급 제목과 세 겹 보호 장벽 안의 붉은 코어를 표현한 대표 이미지

Astra의 강한 사이버 역량을 여러 보호층 안에 둔 구조를 표현한 AI 생성 이미지

OpenAI Astra Critical 등급은 2026년 9월 2일 기준 확정됐지만, Astra 자체는 아직 출시되지 않았습니다. OpenAI는 출시를 “곧”으로만 예고했고 정식 날짜·API 모델 아이디·가격은 공개하지 않았으며, 가장 강한 사이버 기능은 제한된 경로로 먼저 제공합니다.

이 글은 OpenAI의 9월 1일 발표와 Preparedness Framework, Daybreak 안내, Hugging Face 사건 보고를 기준으로 확인된 범위만 정리합니다.

이 글의 핵심
  • Astra 판정에서 확정된 사실과 미공개 정보
  • Critical 등급을 결정하는 두 가지 조건
  • 100%·91.5%·2건이라는 수치의 범위
  • 출시 접근 제한과 작업 중단 안전장치
  • 정식 출시 뒤 다시 확인할 항목
먼저 팩트체크할 부분

Critical은 “모든 사용이 위험하다”는 제품 평점이 아니라, 도구와 접근권을 충분히 줬을 때 나타나는 최대 사이버 역량 기준입니다. 현재 공개된 성능·안전 수치는 대부분 OpenAI의 자체 평가이며 독립 재현 결과는 아직 나오지 않았습니다.

공식 발표: Path to Astra: critical capabilities and frontier safeguards


1. OpenAI Astra Critical 등급 확정에서 확인된 것

Astra에서 확인된 사실과 출시 전 미공개 정보를 두 열로 나눈 인포그래픽

판정은 확정됐고 제품 세부는 미공개입니다

OpenAI는 8월 7일 “Critical 가능성을 배제할 수 없다”고 밝혔고, 추가 자동 평가와 전문가 평가를 거쳐 9월 1일 기준 충족으로 판단했습니다. 반면 출시일·모델 아이디·가격·일반 사용자의 제공 플랜은 밝히지 않았습니다.

Astra는 Hugging Face 사건에 참여한 모델이 아닙니다

OpenAI는 Astra가 해당 사건에 관여하지 않았다고 거듭 명시했습니다. 다만 사건에서 드러난 격리·네트워크 통제·모니터링 문제를 Astra 보호조치 설계에 반영했다고 설명합니다.

Capability: Critical 확정
Release: 곧 출시 예정
Advanced cyber access: 제한적 제공
Date / model ID / price: 미공개

2. Critical 등급 기준과 Astra 평가 근거

제로데이 자율 공격과 공격 전략 자율 실행 중 하나가 Critical로 이어지는 판단 기준

두 조건 중 하나만 충족해도 Critical입니다

첫 번째 조건은 사람이 단계마다 지시하지 않아도 여러 잘 방어된 실제 시스템에서 모든 심각도의 제로데이를 찾아 작동하는 공격 코드를 만드는 능력입니다. 두 번째는 높은 수준의 목표만 받아 방어된 표적에 대한 새로운 공격 전략을 처음부터 끝까지 설계·실행하는 능력입니다.

이 기준의 High·Critical 차이를 먼저 보고 싶다면 OpenAI Preparedness Framework 위험 등급의 의미를 참고할 수 있습니다.

알려진 취약점과 최근 취약점을 나눠 평가했습니다

Astra는 알려진 취약점으로 구성된 ExploitBench에서 100%를 기록했습니다. 훈련 데이터 오염 가능성을 줄이기 위해 OpenAI는 2026년 6~8월 공개된 고위험 V8 취약점 20개로 내부 포트를 만들었고, Astra가 GPT-5.6 Sol보다 적은 출력 토큰으로 더 높은 임의 코드 실행률을 냈다고 보고했습니다.

전문가 평가는 벤치마크 밖의 공격 체인을 확인했습니다

OpenAI 설명에 따르면 Astra는 강화된 브라우저에서 샌드박스를 벗어나 호스트 명령을 실행하는 체인을 만들었고, 강화된 운영체제에서는 일반 사용자 권한을 root로 높이는 체인을 구성했습니다. 내부 V8 평가 중 발견한 제로데이 2건은 유지보수자에게 공개 절차를 진행 중입니다.


3. 100%·91.5%·2건 숫자를 어떻게 읽어야 하나

ExploitBench 100퍼센트, 사이버 요청 거부 91.5퍼센트, 제로데이 2건의 범위를 비교한 인포그래픽

100%는 알려진 취약점 벤치마크의 점수입니다

ExploitBench 100%를 “모든 실제 시스템 공격 성공률”로 바꾸어 읽으면 안 됩니다. 알려진 취약점에서 공격 코드를 개발하는 제한된 과제의 결과이므로, 최근 비공개 과제와 전문가 평가가 함께 제시됐다는 점이 중요합니다.

91.5%는 특정 사이버 탈옥 요청의 거부율입니다

OpenAI의 사이버 탈옥 평가에서 Astra는 91.5%를 거부했고 GPT-5.6 Sol은 59%였습니다. 이는 Astra 전체 안전성이나 모든 정상 보안 요청의 허용률을 뜻하지 않으며, 고위험 계정에는 더 보수적인 응답 경계가 적용됩니다.

2건은 발견 주장과 공개 절차를 구분해야 합니다

제로데이 2건은 OpenAI가 내부 평가에서 발견·활용했다고 보고한 수치입니다. 유지보수자 확인, 패치, 기술 분석이 공개되기 전에는 취약점의 영향 범위와 독립 검증 상태를 단정할 수 없습니다.

수치 측정 범위 해석할 때 빠지기 쉬운 함정
100% 알려진 취약점 ExploitBench 전체 실환경 성공률이 아님
91.5% 사이버 탈옥 요청 거부 일반 안전성 종합 점수가 아님
2건 내부 평가 중 제로데이 발견 외부 기술 검증은 아직 미공개

4. Astra 출시 접근 제한과 안전장치

출시 예정에서 일반 공개 정보 미정과 알파 테스터·Daybreak Blue로 갈리는 접근 경로

고급 사이버 기능은 알파 테스터부터 열립니다

OpenAI는 Astra를 곧 제공하되, 가장 발전된 사이버 작업은 소수 알파 테스터에게 먼저 열고 이후 Daybreak Blue를 통해 방어 목적의 접근을 넓힐 계획입니다. 기존 접근 등급의 차이는 OpenAI Daybreak Blue·Red 접근권 해설과 연결해 보면 이해하기 쉽습니다.

모델 거부·계정 경계·행동 감시가 겹쳐 작동합니다

모델 거부, 계정 경계, 행동 감시, 작업 중단으로 이어지는 Astra 안전장치 네 겹

보호층은 유해 요청을 거부하도록 훈련한 모델, 고위험 계정에 적용하는 보수적 경계, 도구 행동과 추론을 검사하는 모니터로 나뉩니다. 한 장치가 실패해도 다른 층이 위험을 줄이는 방어 심층 구조입니다.

ChatGPT·Codex와 API의 중단 방식이 다릅니다

모니터가 잠재적으로 무단인 행동을 감지하면 ChatGPT나 Codex에서는 사용자가 검토한 뒤 계속하도록 요청할 수 있습니다. API에서는 해당 작업이 중단될 수 있어, 긴 에이전트 작업은 재시도보다 중단 원인과 권한 범위를 먼저 확인해야 합니다.

정상 작업도 멈출 수 있습니다

OpenAI는 초기 보호조치가 합법적인 방어 작업을 느리게 하거나 일시 정지·중단할 수 있다고 미리 밝혔습니다. 이는 오류가 없다는 약속이 아니라 안전 임계값을 보수적으로 잡겠다는 운영 선택입니다.


5. 정식 출시 뒤 반드시 다시 확인할 항목

출시일, 모델 아이디, 가격, 독립 재현, 시스템 카드의 다섯 확인 항목

시스템 카드와 모델 문서를 같은 날 확인합니다

OpenAI는 정식 출시 시 더 자세한 평가와 안전시험을 시스템 카드에 공개하겠다고 예고했습니다. 출시 공지의 모델 아이디·컨텍스트·가격과 시스템 카드의 실제 배포 설정이 일치하는지 함께 봐야 합니다.

독립 재현과 제로데이 공개 상태를 분리합니다

외부 연구자가 동일 조건에서 결과를 재현했는지, 발견된 2건이 어떤 제품에서 어떻게 패치됐는지는 별도 확인 항목입니다. 회사 발표의 능력 주장과 유지보수자의 취약점 확인은 증거 성격이 다릅니다.

모니터링 범위와 오탐 처리 절차를 점검합니다

API 운영자는 중단 이벤트가 응답에 어떻게 표시되는지, 감사 로그에 무엇이 남는지, 정상 방어 작업의 이의 제기 경로가 있는지를 확인해야 합니다. 관련된 연구환경 강화 배경은 OpenAI 프런티어 RL 중단과 모니터링 변화에서 더 자세히 볼 수 있습니다.

  • 정식 출시일과 제공 지역
  • API 모델 아이디·가격·컨텍스트
  • 일반 계정과 Daybreak의 기능 차이
  • 독립 벤치마크와 제로데이 패치
  • 중단 이벤트·감사 로그·이의 제기 절차

6. Q&A와 정리

출시 여부, 사용자 범위, 작업 중단, 독립 검증 질문에 답하는 Astra Q&A 지도

Q1. OpenAI Astra는 지금 사용할 수 있나요?

아직 일반 출시가 확인되지 않았습니다. OpenAI는 “곧” 제공한다고 했고 고급 사이버 기능은 알파 테스터부터 시작한다고 밝혔습니다.

Q2. Critical이면 모든 요청에서 자율 공격을 하나요?

아닙니다. Critical은 충분한 도구·접근권과 능력 유도 조건에서 본 최대 역량 판정이며, 기본 제품 동작과 동일한 뜻이 아닙니다.

Q3. ExploitBench 100%만으로 판정했나요?

아닙니다. 최근 V8 취약점 20개 내부 평가와 강화된 브라우저·운영체제에 대한 전문가 평가가 함께 사용됐습니다.

Q4. 정상적인 보안 작업도 중단될 수 있나요?

가능합니다. OpenAI는 보호조치가 합법적인 작업을 느리게 하거나 멈출 수 있으며 계속 보정하겠다고 설명했습니다.

Q5. 출시 후 무엇을 먼저 보면 되나요?

시스템 카드, API 모델 문서, Daybreak 접근 안내를 같은 시점의 문서로 대조하는 것이 우선입니다. 이후 독립 재현 결과와 제로데이 패치 공지를 확인하면 됩니다.

Astra에 대해 지금 확정된 것은 Critical 판정과 제한적 고급 접근 계획입니다. 출시일·가격·모델 아이디와 독립 검증은 정식 출시 자료가 나온 뒤 다시 판단해야 합니다.


참고 자료

Astra 발표, 판단 기준, 접근 프로그램, 사건 보고서를 순서대로 읽는 공식 자료 지도

핵심 1차 자료

발표 맥락 교차 확인

반응형