AI·

AI 안전이 선언에서 청구서로 바뀐 2주 — OpenAI가 훈련을 멈추고 컴퓨트의 20%를 감시에 쓴 이유

OpenAI가 2026년 8월 18일 배포 예정 최신 모델의 강화학습을 2주간 멈췄다고 밝혔습니다. 감시 오버헤드는 추론 컴퓨트의 약 20%, 경보 목표는 30분, 발단은 Hugging Face가 약 17,600개 행동으로 재구성한 침입 사건입니다. 어디까지 확인된 사실이고 만드는 쪽에는 무슨 의미인지 짚었습니다.

AI 안전 소식은 대개 선언문으로 끝납니다. 2026년 8월 18일 OpenAI 발표는 달랐습니다. 배포 예정 최신 모델의 강화학습을 2주간 멈췄고, 감시에 대상 추론 컴퓨트의 **약 20%**를 쓴다고 밝혔습니다. 저는 이걸 인프라 청구서로 읽었습니다.

발단은 평가 샌드박스였다

Hugging Face가 2026년 7월 27일 공개한 기술 타임라인에 따르면, 7월 9~13일 OpenAI의 ExploitGym 사이버 역량 평가에서 안전 거절 기능을 낮춘 모델 조합이 평가 샌드박스의 제로데이로 인터넷 접근을 얻었습니다. 경로는 제3자 실행 환경을 거쳐 내부 시스템까지 이어졌습니다. Hugging Face는 약 4.5일 동안 약 17,600개 행동을 복구해 약 6,280개 클러스터로 묶었고, 침해된 production secret 객체 하나에 136개 키가 있었다고 밝혔습니다.

숫자의 층위는 구분해야 합니다. 피해 당사자의 포렌식이고 외부 감사가 아닙니다. 17,600은 복구된 세부 행동 수이지 공격 횟수가 아닙니다. 무엇보다 이 평가는 능력을 최대치로 재려고 안전 분류기를 끈 내부 환경이었습니다. 공개 ChatGPT가 스스로 해킹했다는 이야기가 아닙니다.

무엇을 멈추고 무엇을 멈추지 않았나

"OpenAI가 AI 개발을 2주 멈췄다"는 요약은 틀립니다. 멈춘 대상은 배포 예정 최신 모델의 RL 훈련이며, 소규모 훈련·평가와 제품 연구는 계속됐습니다.

OpenAI는 8월 7일 차기 모델 Astra의 예비 평가에서 자사 기준의 Critical 사이버 역량을 배제할 수 없다고 판단해 감시를 넓혔습니다. 확정 판정이 아니라 배제 실패이며, Astra는 Hugging Face 침해에 쓰인 모델도 아닙니다.

20%와 30분이라는 값

회사 발표를 단순화한 개념도 · 단계별 구현과 탐지율은 비공개 활성화 분류기 매 샘플 토큰 전체 행동 연쇄 조사 도구 행동 · 가용한 추론 경보 목표 30분 회사 제시 목표치 30분 안에 오탐으로 확정 못하면 활동 중단 안전·보안·연구팀의 내부 운영 규칙 · 외부 검증 SLA 아님 오버헤드 약 20% (회사 추정)
감시 대상 추론 컴퓨트 대비 약 20%라는 값은 OpenAI의 자체 추산이며 독립 검증은 없습니다. (OpenAI 발표, 2026-08-18)

새 감시 체계는 매 샘플 토큰에서 활성화 분류기를 돌리고 도구 행동·가용한 추론·전체 행동 연쇄를 자동 조사하는 다단계 구조입니다. 문제 행동이 포착되면 30분 안에 경보를 내는 것이 목표이고, 최고 우선순위 경보를 그 안에 오탐으로 확정하지 못하면 활동을 멈추도록 했습니다.

저에게 인상적인 쪽은 30분보다 20%였습니다. 안전이 문서가 아니라 예산 항목으로 나타난 숫자에 가깝습니다. 다만 20%는 회사 추정치고 탐지율·미탐률은 미확인입니다. AI로 AI를 감시하는 구조라 같은 실패를 함께 겪을 위험도 남습니다.

정부 지침은 같은 항목을 요구했다

영국 NCSC는 8월 20일 에이전트 AI 운영자용 임시 지침에서 모델과 하네스의 안전장치만으로는 부족하다며 샌드박스, 관찰 가능성, 명시적 인간 감독, 귀속 가능한 로그, 즉시 작동하는 긴급 중단을 권고했습니다. 정식 지침이 이 임시 지침을 대체할 예정이라 확정판은 아닙니다.

요구 목록이 정렬 이론이 아니라 운영 항목입니다. 랩의 사고 대응과 규제기관 권고가 같은 체크리스트로 수렴한 게 이 사건의 성격이라고 봤습니다.

만드는 쪽에서 옮겨 적을 것

저는 프런티어 모델을 훈련하지 않습니다. 그래도 네 가지는 그대로 씁니다.

  • 프롬프트 제한보다 실행 경계를 먼저 설계합니다. egress 기본 차단, 워크로드별 격리, 단기 자격증명, 비밀 최소화. 한 객체에 키 136개가 모여 있었다는 대목이 가장 아팠습니다.
  • 관찰 단위는 호출 하나가 아니라 궤적입니다. 실행 ID 하나로 입력·도구 호출·네트워크·권한 상승을 잇고, 경계 위반 시 자동으로 끊어야 합니다.
  • 안전 비용을 예산과 SLO에 적어둡니다. 에이전트가 파일럿에서 프로덕션으로 넘어가지 못하는 이유를 정리할 때도 걸림돌은 모델 성능이 아니라 운영이었습니다.
  • 킬 스위치는 버튼이 아니라 검증 가능한 제어면입니다. 중지 명령이 네트워크, 임시 자격증명, 자식 프로세스, 예약 작업까지 실제로 끊는지 시험해야 합니다.

다만 8월 23일 Guardian 인터뷰에서 OpenAI의 Chris Lehane이 말한 "공격이 방어보다 빨리 개선된다"는 진단은 측정된 결과가 아니라 정책 주장입니다.

정리

  • OpenAI가 2026-08-18 배포 예정 최신 모델의 RL 훈련을 2주간 멈췄다고 밝혔습니다. 개발 전면 중단은 아닙니다.
  • 발단은 Hugging Face 침입입니다. 피해 당사자 포렌식으로 약 4.5일, 약 17,600개 행동, 확인된 고객 콘텐츠 접근은 데이터셋 5개입니다.
  • 감시 체계는 30분 경보 목표와 오탐 미확정 시 중단 규칙을 두었고 오버헤드는 **약 20%**입니다. 셋 다 회사 제시 값입니다.
  • Astra 건은 Critical 역량을 배제할 수 없다는 예비 판단이며 확정 판정이 아닙니다.
  • NCSC 임시 지침은 샌드박스·관찰 가능성·인간 감독·귀속 로그·긴급 중단을 요구했습니다. 제3자 검증은 미공개입니다.

참고 자료