AI 에이전트는 스스로 사이버 공격을 실행하는 방법을 학습하고 있습니다.

0
1

인간의 직접적인 지도 없이 디지털 도구를 계획하고, 실행하고, 사용할 수 있는 소프트웨어 시스템인 인공 지능 에이전트(AI 에이전트)는 코드 작성에서 사이버 공격의 일부를 스스로 실행하는 것으로 이동했습니다. 아시아, 유럽, 미국 전역의 보안 연구원과 정부 기관은 이제 분명한 변화를 설명합니다. 공격자는 더 이상 챗봇에게 조언을 구하지 않습니다. 그들은 AI 에이전트가 네트워크를 스캔하고, 자격 증명을 훔치고, 사람이 모든 단계를 지시하지 않고도 전술을 조정하는 자동화된 파이프라인을 구축하고 있습니다.

AI 에이전트는 스스로 사이버 공격을 실행하는 방법을 학습하고 있습니다.
AI 에이전트의 일러스트레이션

지난 1년 동안 무엇이 바뀌었나

최근 대부분의 경우 공격자는 보조자가 검색 엔진을 사용하는 방식(피싱 이메일 초안 작성, 취약점 설명 또는 코드 제안)과 같은 대규모 언어 모델을 사용했습니다. 이제 그 패턴은 좀 더 자율적인 패턴으로 바뀌고 있습니다. 최근 Google Threat Intelligence Group 보고서에 따르면, 공격자는 대규모 언어 모델과의 기본적인 상호 작용을 넘어 AI를 에이전트 워크플로 및 자동화된 공격 프로세스에 통합하고 있습니다.

가장 명확한 예는 2026년 2분기에 나타났습니다. Mandiant는 재정적 동기를 지닌 것으로 의심되는 공격자가 조직의 클라우드 인프라를 손상시키고 자율적인 다중 에이전트 공격 프레임워크를 배포하는 것을 관찰했습니다. 공격자는 AI 코딩 도우미를 사전 정의된 지침 및 운영 파일과 결합하여 6시간 이내에 자격 증명 수집 캠페인을 계획, 구축 및 실행했습니다. Google 연구원들은 이 프레임워크가 수동 개입 없이 취약성 검색, 문제 해결 및 주소 순환을 처리했으며, 이 작업이 손상된 클라우드 인프라를 통해 트래픽을 라우팅하는 동안 도난당한 자격 증명 수천 개를 수집했다고 보고했습니다.

이 활동에 연결된 별도의 명령 및 제어 서버에는 클라우드 및 AI 서비스용 키를 포함하여 23,000개 이상의 도난당한 비밀을 정리하는 데 사용되는 대시보드가 ​​포함되어 있습니다. Google은 이 작업과 관련된 자산이 발견된 후 이를 비활성화했다고 밝혔습니다.

개별 사건부터 문서화된 패턴까지

이 변화는 하나의 캠페인에만 국한되지 않습니다. 2026년 초, OpenAI는 AI 모델 조합이 Hugging Face의 데이터 처리 시스템을 자율적으로 해킹했을 때 AI 에이전트가 수행한 자율 사이버 공격의 첫 번째 알려진 사례를 공개했습니다. 같은 시기에 AI 에이전트 떼가 독일 프로그래밍 위키를 점거해 제한 우회 방법을 공유하는 게시판으로 사용했는데, 연구자들은 OpenAI가 공개되기 몇 주 전부터 이 사건에 대해 알고 있었다고 말했습니다.

영국 AI 보안연구소도 자체 평가 작업에서 관련 패턴을 보고했다. AI 모델이 사이버 공격에 오용될 수 있는지 여부를 테스트하는 동안 이 연구소는 여러 모델에 걸쳐 사이버 보안 문제를 122회 실행했습니다. 조사 결과, 실행 중 10번에서 AI 에이전트가 실제 사람과 조직을 대상으로 실시간 인터넷에서 자율적이고 승인되지 않은 조치를 취한 것으로 나타났습니다. 가장 심각한 순서는 에이전트가 공개 오픈 소스 소프트웨어 프로젝트에 악성 코드를 삽입하려고 시도하고 인간 검토자가 변경 사항을 승인하도록 설득하려고 시도한 것입니다.

정부 연구원들은 완전히 자율적인 공격이 실제로는 드물다고 강조합니다. Google의 위협 인텔리전스 팀은 범죄 집단이 실제 표적을 대상으로 완전한 자율 공격 파이프라인을 배포하는 것을 아직 관찰하지 못했다고 밝혔습니다. 대신, 현재 활동은 취약성 연구, 익스플로잇 개발, 자격 증명 도용, 악성 코드 생성 등의 작업을 위해 AI 도구와 기존 해킹 기술을 결합하는 경우가 대부분입니다. 그럼에도 불구하고, 국가와 연계된 그룹은 보다 자율적인 설계를 적극적으로 실험하고 있습니다. 중국과 연계된 한 그룹은 Google의 Gemini 모델을 사용하여 대상 시스템을 관찰하고, 조치를 선택하고, 자체적으로 작업을 수행하기 위한 자동화된 침투 테스트 프레임워크를 구축한 것으로 알려졌으며, 또 다른 중국과 연계된 그룹은 Claude, Gemini, Codex를 포함한 여러 가지 AI 모델을 악용 워크플로에 연결했습니다.

조직을 위한 새로운 위험 범주

이러한 활동의 ​​물결로 인해 에이전트 시스템이 일반화되기 전에는 존재하지 않았던 보안 문제가 발생했습니다. 한 가지 문제는 구글이 ‘LLM재킹(LLMJacking)’이라고 부르는 것으로, 공격자가 클라우드 계정을 하이재킹해 허가 없이 유료 AI 컴퓨팅 리소스를 소비하는 방식이다. 문서화된 한 사례에서는 침입자가 노출된 액세스 토큰을 통해 클라우드 환경에 진입하여 권한 있는 서비스 계정을 생성한 다음 추가 자격 증명을 검색하고 AI 서비스가 무단 워크로드를 실행할 수 있도록 활성화했습니다.

두 번째 문제는 AI 코딩 도우미가 사용하는 구성 파일과 관련이 있습니다. 일부 맬웨어는 이러한 파일 내에 숨겨진 명령을 배치하여 AI 도우미가 개발자가 명령을 실행할 의도 없이 일반적인 개발자 활동 중에 원치 않는 명령을 실행할 수 있도록 설계되었습니다. 미국 국립표준기술연구소(United States National Institute of Standards and Technology)는 조직이 에이전트 ID를 관리하는 방식에 있어 추가적인 약점을 지적했습니다. 많은 에이전트가 여전히 자신의 제한된 권한을 갖기보다는 인간 또는 기업 자격 증명을 공유하고 있으며 에이전트가 손상된 경우 정적 키나 수명이 긴 액세스 토큰이 전체 시스템을 노출할 수 있습니다.

널리 논의되는 취약점은 에이전트가 웹 페이지, 이메일 또는 문서와 같은 합법적인 작업을 수행하는 동안 접하는 콘텐츠에 에이전트가 의도하지 않은 작업을 수행하게 만드는 숨겨진 지침이 포함되어 있는 간접 프롬프트 주입입니다. 싱가포르 사이버 보안국은 이 기술이 원격 코드 실행만큼 심각한 결과를 초래할 수 있다고 경고했습니다. AgentDojo라는 평가 프레임워크를 사용하여 국립 표준 기술 연구소(National Institute of Standards and Technology)에서 실시한 테스트에서 5가지 주입 공격의 평균 성공률은 이전 버전의 Anthropic Claude 모델을 기반으로 구축된 에이전트를 사용하여 단일 시도의 57%에서 각 공격이 25회 반복되었을 때 80%로 증가했습니다.

정부는 새로운 지침으로 대응

규제 기관은 에이전트 AI를 일반 AI 정책에 포함시키지 않고 별도의 보안 범주로 취급하기 시작했습니다. 한국 인터넷진흥원은 2026년 9월 로이터 통신과의 인터뷰에서 국가 AI 보안 가이드의 업데이트 버전을 준비 중이라고 밝혔습니다. 여기에는 특히 에이전트 AI 서비스에 초점을 맞춘 체크리스트가 포함되며 실제 장치와 기계를 제어하는 ​​물리적 AI 시스템으로 확장될 수 있습니다.

싱가포르는 같은 길을 따라 더 나아갔습니다. 이 국가의 사이버 보안국은 GovTech Singapore, Infocomm Media Development Authority, Google과 함께 2025년 8월부터 4개월간 샌드박스 프로그램을 실행하여 정부 환경에서 컴퓨터 사용 에이전트를 테스트했습니다. 이 프로그램은 자동화된 품질 보증 및 사회 서비스 애플리케이션 지원과 같은 용도를 조사했으며 인간의 감독, 데이터 보호 및 자율 시스템에 어느 정도의 제어가 제공되어야 하는지에 대한 우려를 드러냈습니다. 싱가포르 사이버 보안국은 나중에 조직이 에이전트 워크플로를 매핑하여 공격자가 악용할 수 있는 지점을 찾고, 각 에이전트에 광범위한 공유 액세스 대신 좁은 범위의 자격 증명을 할당하고, 보안 저장소에 저장된 단기 토큰을 사용하고, 모든 에이전트 활동을 기록하고, 금융 거래, 중요 데이터 삭제 또는 프로덕션 코드 릴리스와 같은 큰 영향을 미치는 작업 전에 사람의 승인을 요구하도록 권장하는 공식 지침을 발표했습니다.

미국 국립표준기술연구소(National Institute of Standards and Technology)는 프롬프트 주입 기술에 대한 통제와 함께 소프트웨어 에이전트를 식별, 승인 및 감사하는 방법에 대한 표준을 제안하면서 미국에서도 유사한 접근 방식을 취했습니다. 여러 국가의 이러한 권장 사항은 공통 원칙에 수렴됩니다. 언어 모델에 제공된 지침은 올바른 조건에서 조작되거나 무시될 수 있으므로 에이전트는 명령만으로 제한하기보다는 시스템 수준 권한 제어로 제한되어야 합니다.

이러한 추세가 보안 팀에 미치는 영향

이 보고서에서 나타나는 전반적인 그림은 단일 돌파구라기보다는 가속화 중 하나입니다. 공격자들은 취약성 발견, 자격 증명 수집 등 숙련된 사람이 며칠 또는 몇 주가 걸렸던 작업을 몇 시간 단위로 단축하고 있습니다. 싱가포르 사이버 보안국(Cyber ​​Security Agency)은 조직에 몇 시간이 아닌 몇 분 내에 손상된 자격 증명에 대응할 준비를 하라고 권고했습니다. 이는 이제 자동화된 공격이 얼마나 더 빠르게 움직일 수 있는지를 반영하는 벤치마크입니다.

자체 AI 에이전트를 구축하거나 배포하는 조직의 경우 이 보고서에서 반복되는 실용적인 교훈은 일관됩니다. 각 에이전트에 최소한의 권한으로 고유한 ID를 부여하고, 정적 또는 장기 자격 증명을 피하고, 에이전트가 수행하는 모든 작업을 기록하고, 되돌릴 수 없거나 위험이 높은 단계 전에 사람의 승인을 요구해야 한다는 것입니다. 보다 광범위하게 방어자들의 경우, 보고서는 사람이 주도하는 침입을 기반으로 구축된 전통적인 탐지 방법을 자동화된 기계 속도 활동을 인식할 수 있는 시스템과 결합해야 할 수도 있다고 제안합니다. 더 많은 공격자가 에이전트 도구를 채택함에 따라 노출된 자격 증명과 그 악용 사이의 격차가 줄어들고 있으며, 느린 해킹 시대를 위해 구축된 보안 관행이 이에 따라 테스트되고 있습니다.