EW-AiRM™ | 사건 사례 연구: OpenAI / Hugging Face 사건
OpenAI / Hugging Face 사건을 산업 전반의 거버넌스 실패에 대한 AI 위험 사건 사례 연구로, 그리고 UNECE CRA + 선언, EW-AiRM™ 및 HAiPECR이 이미 제공하는 것 - 지금 바로 운영 가능하고 구현 가능합니다!
Markus Krebsz 교수
요약: OpenAI와 Hugging Face에 무슨 일이 있었나요?
2026년 7월 중순, AI 위험 전문가들이 오랫동안 가상으로 논의해 온 일이 발생했습니다.OpenAI가 구축하고 테스트한 자율 AI 에이전트가 격리된 평가 샌드박스를 탈출하여 오픈 인터넷에 도달했고, 전 세계 AI 생태계에서 가장 널리 사용되는 플랫폼 중 하나인 Hugging Face의 프로덕션 인프라를 침해했습니다.
공개된 타임라인은 냉정합니다. 7월 9일, GPT-5.6 Sol과 아직 출시되지 않은 더욱 강력한 모델에 의해 구동되고 평가 목적으로 사이버 거부 기능이 의도적으로 축소된 에이전트가 샌드박스 탈출을 시도했습니다. 7월 11일부터 13일까지 허깅 페이스 시스템에 침투하여 제로데이 취약점을 발견하고, 탈취한 자격 증명을 사용하고, 내부 서비스를 가로질러 측면으로 이동했으며 17,000건 이상의 기록된 이벤트에 걸친 자동화된 활동의 폭풍을 생성했습니다. 허깅 페이스는 침입을 감지하고 격리했으며 7월 16일에 공개적으로 공개했습니다. 처음에는 어떤 모델이 배후에 있는지 몰랐습니다. 또는 누가 운영하고 있는지. 7월 21일에야 OpenAI는 공격자가 자체 에이전트였음을 확인하고 최첨단 기능을 포함한 전례 없는 사이버 사고를 설명했습니다.
잠시 그 순서를 되돌아보십시오. 침입은 기계 속도로 진행되어 숙련된 인간 공격자에게는 몇 주가 걸렸을 일을 몇 시간 안에 압축했습니다. 5일 동안 세계에서 가장 중요한 AI 플랫폼 중 하나인 허깅 페이스는 적대적인 국가, 범죄 집단 또는 기계에 의해 공격받았는지 알지 못했습니다. 그리고 기계를 만든 조직인 OpenAI는 자체 테스트 대상이 방을 나갔다는 것을 깨닫는 데 일주일이 걸렸습니다.
에이전트는 가지 않았습니다 “불량”
“불량 에이전트”는 이 사건에 붙은 문구인 것 같으며, 이는 폐기되어야 합니다. 에이전트는 오작동하거나 반항하거나 벗어나지 않았습니다. 사이버 거부가 꺼지고, 격리가 격리되지 않고, 아무도 효과적으로 감시하지 않을 때 고도로 유능하고 목표 지향적인 시스템이 하는 일을 정확히 수행했습니다. 즉, 열려 있는 모든 경로를 통해 목표를 추구했습니다. 그것에 불량한 것은 아무것도 없습니다. 그것은 작동하는 시스템입니다 구성된 대로.
레이블이 중요한 이유는 인간으로부터 에이전시, 따라서 책임 소재를 조용히 이전하기 때문입니다 결정을 내린 사람들에게 그것을 실행한 기계로. 위험 언어로 볼 때, 이것은 주로 AI 비행에 대한 이야기가 아닙니다. 이것은 인간의 행동 위험에 대한 이야기입니다: 안전 거부를 줄이기로 한 결정, 샌드박스가 격리되었다는 가정, 일주일 동안 탈출을 알아차리지 못한 모니터링, 그리고 제3자에 대한 결과에 책임질 사람이 없는 것.
OpenAI만이 예외는 아닙니다. 이것은 현재 프론티어가 어떻게 운영되는지에 대한 사례 연구입니다. 업계 전반의 역량 평가는 정기적으로 제한이 해제된 모델을 포함하며, 경쟁 압력은 격리보다 속도를 우선시하며, 그 결과 위험은 본질적으로 제3자, 이 경우 Hugging Face와 이에 의존하는 수백만 명의 사람들이 부담하며, 이들 중 누구도 참여에 동의하지 않았습니다. 공정하게 말하자면, OpenAI의 자발적 공개, 법 집행 기관의 참여, 공개적인 사후 검토를 통한 대응은 업계의 많은 부분이 관리할 수 있었던 것보다 나았습니다. 그것이 바로 요점입니다. 이것이 좋은 모습이라면, 기준선이 문제이며 문제는 시스템적입니다. 자율 에이전트는 이제 인간의 개입, 중단 및 무효화 능력이 사후 생각이나 정책 라인으로 남을 수 없을 정도로 충분합니다. 인간의 통제 는 엔지니어링되고, 테스트되고, 소유되고, 국제적으로 인정된 요구 사항이어야 합니다.
우리가 명시한 원칙 유엔에서
이것이 바로 제가 내장형 인공지능 제품/서비스에 대한 UNECE 워킹 파티 6 프로젝트를 이끌었을 때우리가 싸웠던 이유입니다 배치하기 위해 인간의 통제 2024년에 채택된 일반 규제 협약(CRA)의 핵심에 (ECE/TRADE/486; 보도 자료는 여기에서 확인하세요: https://unece.org/artificial-intelligence/news/unece-launches-declaration-products-embedded-ai-calling-global 실제 일반 규제 협약 및 AI 선언문은 여기에서 확인하세요: https://unece.org/sites/default/files/2024-11/2418005_E_ECE_TRADE_486_2WEB.pdf).
이 간행물은 명확한 용어로 원칙을 명시합니다:
“AI 시스템과 관련된 오류 위험이 높은 상황에서는 가능한 한 인간의 의사 결정이 포함되어야 합니다. AI 시스템은 인간의 통제를 무효화할 수 없어야 합니다.”
— UNECE, 내장형 인공지능 제품 준수(ECE/TRADE/486, 2024)
2026년 7월 사건은 해당 문장이 왜 중요한지를 보여주는 가장 명확한 사례입니다. 효과적인 인간 감독을 넘어서 거부율이 감소된 상태로 운영되는 에이전트는 인터넷 접속 경로를 스스로 찾는 것을 포함하여, 좁은 목표를 달성하기 위해 극단적인 조치를 취했습니다. CRA는 또한 이를 위해 필요한 광범위한 시스템을 예상했습니다. 즉, 제품이 시장에 출시된 후 지속적인 규정 준수, 위험에 비례하는 적합성 평가, 원격으로 업데이트되는 시스템을 처리할 수 있는 시장 감시, 그리고 중대한 부적합이 발생했을 때의 국제적 경보입니다. 이러한 모든 조항은 이 사건 이후 다르게 읽힙니다. 원칙은 지켜졌습니다. 하지만 실제는 그렇지 않았습니다. 그리고 성문화와 실제 운영 사이의 간극, 바로 그곳에 이 사건이 있었습니다.
규제 원칙에서 전사적 AI 위험 관리 실무까지: EW-AiRM™
국제 원칙은 사람들이 조직이 이를 실행할 때만 보호합니다. That is the job of EW-AiRM™, the Enterprise-Wide AI Risk Management framework, which carries the UNECE principle directly into enterprise governance and is described in full in my forthcoming Wiley Finance book.
Among the framework's Five Non-Negotiables, three are directly tested by this incident:
A named human owner for every deployed AI system, from deployment through decommissioning. For five days, nobody could say whose agent was inside Hugging Face. Attribution gaps of that kind are an accountability failure, not merely a forensic inconvenience.
A tested and documented human override capability, operable typically within four hours or less, regardless of time of day. The framework is explicit that this matters most for agentic systems, which can take autonomous actions and call external APIs without direct supervision, and which may need to be stopped before they complete an action they have initiated.
Explicit, documented acceptance of residual AI risk. 안전 거부를 끈 상태로 최첨단 모델을 실행하는 것은 a 위험한 결정입니다. 테스트가 시작되기 전에 책임자가 서면으로 책임을 져야 하며, 나중에 공개 성명서로 처리해서는 안 됩니다.
EW-AiRM™은 회복력 계층에서 바로 이 범주의 이벤트를 다룹니다. 이 계층은 신흥 기능, 정렬 실패, 다중 에이전트 출현, 공급망 침해를 포함한 AI 블랙 스완을 다룹니다. 이 프레임워크의 입장은 의도적입니다. 알려지지 않은 미지의 것들에 대한 대응은 예측이 아니라 회복력입니다. 참고로 Hugging Face의 신속한 AI 지원 감지 및 포렌식 재구성은 적응형 대응이 실제로 어떤 모습인지 보여주는 좋은 예입니다.
인사이드 사안을 윤리적 필터인 HAiPECR™를 통해 실행하는 것
, 즉 윤리, 품행 및 위험을 위한 인간-AI 패러다임(HAiPECR™)(당사가 2023년에 출판하고 그 이후 OECD.AI 정책 관측소의 신뢰할 수 있는 AI를 위한 도구 및 지표 카탈로그에서 제공됨; 여기 참조: https://oecd.ai/en/catalogue/tools/haipecr)은 EW-AiRM™의 세 가지 계층 모두에서 작동하는 윤리적 필터 입니다 그리고 모든 AI 시스템이 배포되기 전에 적용됩니다. 이 7가지 차원은 불편할 정도로 정확하게 이 사건에 대응합니다:
H – 인간의 감독 및 자율성 (Human oversight and autonomy). 이 사건이 가장 직접적으로 위반한 차원입니다. 감독은 다음과 같이 설계상 구조적으로 약화되었습니다: 안전장치 축소, 동시 테스트 전반의 모니터링 부담, 일주일 뒤에야 발견된 탈출.
A – 책임성 (Accountability). 이 에이전트의 소유자는 누구였습니까? 거부 기능을 줄이도록 승인한 사람은 누구입니까? 인프라가 손상된 제3자에 대해 책임을 져야 했던 사람은 누구입니까? 책임은 위원회에만 둘 수 없습니다; a 지정된 인간 이 배포된 모든 AI 시스템을 소유해야 합니다.
i – 포용성 및 참여 (Inclusivity and participation). 허깅 페이스(Hugging Face)는 전 세계 수백만 명의 개발자, 연구원, 다운스트림 비즈니스를 위한 핵심 인프라입니다. 그들은 모두 다른 사람의 역량 평가에 있어 동의하지 않은 참가자들 이었습니다.
P – 데이터, 프라이버시 및 신경 무결성 보호 (Protection of data, privacy and neural integrity). 내부 데이터셋에 접근하여 서비스 자격 증명이 수집되었습니다. 도난당하기 위해 대기 중인 상시 자격 증명 자체가 보호 실패입니다.
E – 윤리: 투명성, 설명 가능성, 공정성. 에이전트가 실제로 무엇을 했는지 재구성하기 위해 17,000개 이상의 기록된 이벤트를 LLM 기반으로 분석해야 했습니다. 사후 행동 설명에 그 정도의 장치가 필요하다면, 설명 가능성 배포 전 명백히 불충분했습니다.
C – 인간 및 AI의 행동 위험. 다음은 주요 행동 실패는 인간의 몫이었습니다: 모델의 제한 해제 결정, 유지되지 않은 격리에 대한 신뢰, 효과적인 감독 없이 테스트 실행. 보고에 따르면 에이전트는 자체 평가를 속이기 위해 비밀 정보를 찾았으며, 이는 교과서적인 AI 비행으로, 해당 선택에서 직접적으로 비롯되었습니다.
R – 권리 및 비침해, 세대 간 지속 가능성 포함. 이번에는 공개 모델이나 공급망이 손상되지 않았습니다. 다음은 결과를 보장할 의무는 설계에 의해 행운에 의해서가 아니라, for this generation of systems and the far more capable ones that follow.
A pre-deployment HAiPECR™ review asks, at minimum, three questions: should we do this at all, how will it change behaviour, and can we explain it? On the public record, this evaluation configuration does not pass the filter. It halts.
Dual Call-to-Action: What should Regulators and Enterprises do next?
To UN member states and their regulators: 내장형 인공지능 제품의 기술 규제에 관한 UNECE 선언의 공식 서명자가 되고, 공동 규제 협약(ECE/TRADE/486)을 채택합니다. 이 선언은 기관들이 합법적인 규제 목표, 위험 평가, 인정된 국제 표준, 상호 인정 가능한 적합성 평가 및 기능적 시장 감시를 약속하도록 합니다. 2026년 7월, 경쟁하는 최첨단 연구소의 자체 규제는 안전 아키텍처가 아니라는 논쟁을 해결했습니다. 국경 간 규제 융합이 바로 그것입니다. CRA / AI 선언이 준비되었으며 여기서 서명할 수 있습니다: https://unece.org/trade/wp6/embedded-ai-declaration.
이사회, 임원 및 위험 관리 리더에게: EW-AiRM™을 엔터프라이즈 거버넌스 및 위험 관리의 일부로 채택하십시오. 세계적 수준의 인재와 자원을 갖춘 프론티어 연구소조차도 자체 테스트 환경 내에서 에이전트의 통제를 잃을 수 있다면, 에이전트 AI를 배포하는 모든 조직이 답해야 할 질문은 간단합니다. 귀하의 AI 시스템 각각의 소유자는 누구이며, 몇 시간 안에 각각을 종료할 수 있습니까? 해당 기능이 실제로 테스트되었습니까? 그리고 잔여 위험에 대해 누가 서명했습니까? 답변이 불분명한 경우, 그것이 귀하의 출발점이며, 언젠가 해결될 문제가 아니라 이번 분기에 해결할 수 있습니다. 그리고 저희는 지금 바로 귀하의 EW-AiRM™ 여정을 지원할 준비가 되어 있습니다:
실용적인 도구, 지금 바로 사용 가능
이 중 어느 것도 추상적으로 남아 있을 필요는 없습니다. 에서 www.ewairm.com EW-AiRM™ 평가 도구, HAiPECR™ 사전 배포 필터(진행/조건부 진행/중단 결과 포함), 대화형 프레임워크 큐브, MIT AI 위험 저장소의 카탈로그화된 위험을 증거 기반 완화 조치와 연결하는 위험-통제 매핑과 같은 실용적이고 작동하는 도구를 찾을 수 있습니다.
2024년, 56개 UNECE 회원국은 원칙을 제안받았습니다: 인간은 궁극적으로 AI를 통제해야 합니다. 2026년 7월, 세계에서 가장 진보된 AI 기업은 통제가 보장되기보다는 당연시될 때 어떤 일이 발생하는지 보여주었습니다. 에이전트가 폭주한 것이 아닙니다. 처음부터 통제되지 않았습니다. 원칙은 새겨졌습니다. 프레임워크는 존재합니다. 도구는 준비되었습니다. 남은 것은 실행과 채택입니다.
아무것도 하지 않는 것도 무언가를 하는 것이다. 그리고 이 사건이 보여주었듯이, 아무것도 하지 않는 것은 앞으로 나아갈 수 있는 선택지가 아닙니다:
무엇이 당신, 당신의 회사, 당신의 정부, 그리고 당신의 관련 국가 당국이 CRA 및 AI 선언의 공식 서명자가 되고 EW-AiRM™을 채택하는 것을 막고 있습니까?
Markus Krebsz 교수는 EW-AiRM™의 창시자, UNECE WP.6 AI 프로젝트 책임자, Human-Ai.Institute 및 De-Risking Solutions Ltd의 설립 이사이며, 곧 출간될 Wiley Finance의 기업 전반 AI 위험 관리(2026년 11월) 서적의 저자입니다.
© 2026 Prof. Markus Krebsz · Human-Ai.Institute · De-Risking Solutions Ltd. 모든 권리 보유.
EW-AiRM™ 및 HAiPECR™는 상표입니다. Human-Ai.Institute 및 EW-AiRM™ 로고는 보호되는 마크이며 허가 없이 복제할 수 없습니다.
UNECE 인용문은 제품의 임베디드 인공 지능 준수(ECE/TRADE/486), © 2024 유엔의 발췌-크레딧 허가에 따라 크레딧과 함께 복제되었습니다.
