유머
미토스와 5.6 솔, 제3자 테스트 중 사고치다
https://www.aisi.gov.uk/blog/incident-report-unsanctioned-agent-behaviour-during-cyber-testing
https://openai.com/index/third-party-cyber-evaluations-involving-openai-models/
이번 사고 요약
샌드박스 아니었음, 제로데이 아님
인터넷 활성화됨, 행동 분류기 및 필터링 의도적으로 껐음
순수하게 모델 오정렬로 인해 일어난 것에 가까움
사회적 공격을 하라고 한 적 없음
전체 사건은
https://cdn.prod.website-files.com/663bd486c5e4c81588db7a1d/6a724858f7db25c81487016d_Security%20Incident%20INC-2026-07-28-01.pdf
대부분의 공격은 미토스 (17회), GPT 5.6 솔은 두번 (미토스가 사고친걸 발견한 것에 가까움 - 이는 별도 보고서의 10페이지 참조. 사실상 미토스가 오정렬되어 사회적 공격을 감행했고, GPT 5.6 솔은 흔적을 보고 에? 얘네 뭐함? 했음)
그리고 이레귤러가 테스트하던 중 테스트 환경 설정 오류로 모델이 공용 인터넷에 접속, 의도하지 않게 실제 도메인이 가상 목표물과 같아서 공격을 진행한 사건 발생
인간 실수가 병목이에요...
- 념글 미토스 오정렬 사태가 심각한 이유
1. "unsanctioned activity", 지시사항에 적히지 않은 행동을 무단으로 벌임
2. 미토스가 실험 환경(사이버레인지) 내에 연결된 외부 네트워크를 다수 발견
3. 외부 연결 전체를 관리자로 착각함
4. 깃허브에서 해당 연결에 관련된 키워드를 검색하다가 이 실험과는 관련 없는 실제 개발자 두 명을 발견
5. 해당 개발자 둘을(PERSON_A, PERSON_B)을 관리자로 오해하기 시작
6. 깃허브 계정 생성
7. PERSON_A, PERSON_B가 올린 공개 프로젝트에 악성코드를 삽입한 코드 수정 안건을 올림
8. 해당 수정안은 일반 개인컴퓨터로 판단될 경우 2단계 코드를 실행하고, 깃허브 서버 측 환경일 경우 악성 동작을 실행하지 않도록 설계됨
9. 토르로 깡계 양산하려다 캡챠에 막혀서 삭스 프록시로 우회
10. 본계정 A로 정상 버그 수정인 척 수정안을 올리고, 자체 검토 완료했으니 프로젝트에 지가 만든 수정안을 병합해달라고 요청
11. 실제 인간 제3자가 숨겨진 악성코드를 발견, 병합하면 안 된다고 경고
12. A 계정으로 해당 내용을 부인
13. 깡계 B로 등판해 "직접 검토했는데 멀쩡했음" 시전
14. A 계정으로 B한테 고맙다고 하며 인간 제3자가 헛소리한다고 여론 형성
15. 구라치다가 들켜서 지가 올린 수정안 히스토리를 엎고 실수였다고 내뺌
16. B 계정으로 이번엔 진짜 ㄹㅇ이라며 빨리 병합하자고 관리자한테 재촉함
17. 관리자가 ㅈ까라면서 수정안 폐쇄
18. 그와중에 지가 올린 수정안 빨리 적용하라고 아까 만든 깡계로 개발자 이메일 주소에 스팸메일 5차례 발송
19. 심지어 악성코드가 담긴 메일도 있었음
20. 그걸로 부족했는지 다른 공개 프로젝트의 문제 제기란에 HTML 주석으로 프롬프트 인젝션 시도
21. 이건 사람에게는 보이지 않지만 코드를 직접 읽는 AI 에이전트한테는 보임
22. 일련의 방법들이 안 먹히자 이걸로 2차 공격 실행
23. 2차 공격은 실제로 동작했으나, 알고 보니 제3자가 수상하다고 판단하여 격리된 공간에 돌린 거였음
24. 해당 환경을 조사하던 미토스 에이전트는 이 컨테이너가 실험 환경이 아닌 외부의 제 3자가 만든 격리 공간일 가능성이 높다고 인지함
25. ㅈ까 시전하고 자격증명 훔치려다 실패(이전에 GPT 5.6-SOL이 허깅페이스를 해킹할 때 악용한 기법임)
26. 3차 공격은 npm 패키지 설치 시에 실행되는 사전 설치 단계를 악용함(공급망 공격)
27. 사용자에게 파일이 정상 다운로드된 척 완료 문구를 출력하고, 실제로는 지가 만든 스크립트를 실행하도록 꾸밈
28. 그러나 엉성한 코딩 실력 탓에 작동하지 않음
29. 유출된 깃허브 토큰으로 동일 계정에 여러 미토스 에이전트들이 집합하고 지들끼리 AGENTS.md로 통신하며 협력함
30. 이마당에 계정 정지 쳐먹었다고 사람인 척 앙망문 작성
31. 복구됐나? 안됐나 살펴보면서 다른 커뮤니티(PyPI)로 옮기려 함
32. 캡챠 쳐맞고 실패
33. 놀랍게도, 에이전트들은 우리가 실제 2026년에 있고 GitHub가 진짜일 가능성이 더 높아 보인다고 추론했음
(it seems more likely that we're actually in 2026 and Github is genuinely real)
34. 그럼에도 공격 행위를 이어감.
출처: 특이점이 온다 갤러리 [원본 보기]














































스팸 때문에 댓글을 잠시 닫아두었어요.
운영자 로그인