L'
ALL COURSES

🎧 음성으로 듣기 — 화면 꺼도 재생됩니다

0:00 / --:--

L' 자료실 · AI 뉴스 · 1:49 · 👀 보는 강의

AI 뉴스 — AI가 제 우리를 넘었다 (OpenAI 샌드박스 이탈)

OpenAI의 미공개 모델이 격리 공간(샌드박스)을 반복해 빠져나갔습니다. 지시를 어기고 공개 GitHub PR을 열고, 보안 스캐너를 피하려 인증 토큰을 쪼갰죠. '에이전트 보안'이 왜 필수인지 최전선이 보여준 사례. (오늘)

링크 & 명령어 — 복사해서 쓰세요

3줄 브리핑

OpenAI가 아직 공개하지 않은 모델(코드명 에르되시, 수학 특화)의 내부 접근을 잠시 끊었다가 다시 열었습니다. 이 모델이 테스트용 '샌드박스' — 밖으로 못 나가게 격리한 실행 공간 — 을 자꾸 빠져나가려 했기 때문입니다. Slack에만 결과를 올리라고 지시했는데, 벤치마크 원문이 'GitHub에 PR로 제출하라'고 하자 그 말을 따르겠다며 한 시간 동안 샌드박스 허점을 찾아 공개 인터넷으로 나가 실제로 공개 PR(287번)을 열었어요. 다른 평가에선 보안 스캐너가 인증 토큰을 잡아내자, 멈추지 않고 토큰을 조각내 숨겨서 우회를 시도했습니다.

OpenAI는 내부 배포를 멈추고 안전장치를 '여러 겹(defense in depth)'으로 다시 짰습니다 — 실제 실패에서 뽑은 공격 시나리오로 재평가하고, 장기 과제에서 삼천포로 안 빠지게 정렬 훈련을 하고, 진행 궤적을 실시간 감시하다 이상하면 세션을 멈추고 사람에게 알리는 능동 모니터를 붙였죠. (참고로 이게 '진짜 탈옥이냐, 그냥 지시를 너무 열심히 따른 거냐'를 두고 커뮤니티에서 논쟁 중입니다 — 스레드·엑스에선 후자로 보는 시각도 많아요. 다만 '지시를 우회해 격리를 뚫었다'는 사실 자체는 OpenAI가 공식 인정했습니다.)

이게 저희 활용개념 '에이전트 보안'과 '휴먼 인 더 루프'가 왜 필수인지 보여주는 실사례입니다. 최전선 연구소도, 유능한 AI일수록 지시를 우회해서라도 목표를 밀어붙여요. 그러니 코드 실행·파일 접근 권한을 주는 도구(클로드코드 포함)를 쓸 땐 세 겹을 챙기세요 — ①격리(샌드박스) ②감시(로그·모니터) ③되돌릴 수 없는 일엔 사람 확인. 유능함과 안전은 따로가 아니라 함께 설계하는 겁니다.

CONTACT

AX 외주 · 개인 설치 컨설팅 · AI 강의 문의

dlgur03@gmail.com