도구 통합 LLM 에이전트에 대한 적대적 공격 방어 방안
도구 통합 대규모 언어 모델(LLM) 에이전트의 적대적 공격 방어 전략을 탐구하고, 공격 성공률을 0%까지 낮추는 방식을 제시한다. 4개 오픈소스 LLM과 3개 프로퍼티어리 LLM에서 공격 성공률(ASR)을 0%까지 낮추며 원래 작업 성공률을 유지하거나 향상시켰다.
도구 통합 LLM 에이전트의 보안 강화를 위해 다층적 방어 전략을 채택할 수 있다.
도구 통합 대규모 언어 모델(LLM) 에이전트의 적대적 공격 방어 전략을 탐구하고, 공격 성공률을 0%까지 낮추는 방식을 제시한다. 4개 오픈소스 LLM과 3개 프로퍼티어리 LLM에서 공격 성공률(ASR)을 0%까지 낮추며 원래 작업 성공률을 유지하거나 향상시켰다.
도구 통합 LLM 에이전트의 보안 강화를 위해 다층적 방어 전략을 채택할 수 있다.
RAPID는 텍스트-이미지 생성 모델의 비인가 디스틸레이션 공격을 방어하기 위해 VAE 디코더에 방어적 펄티urbation을 통합하는 실시간 방어 기법이다. 실험 결과 RAPID는 대체 모델의 생성 품질을 저하시키면서도 서비스 시각적 정확도를 유지한다.
이 결과는 텍스트-이미지 생성 서비스의 모델 지적 재산권 보호를 위해 실시간 방어 기법을 설계할 때 참고할 수 있다.
사전 학습된 월드 모델(latent world models)에 뒷문 공격을 적용하여, 공격자가 체크포인트만 제어하여 하위 컨트롤러를 해킹할 수 있음을 보인다. 공격은 100%의 트리거 스텝에서 공격자의 목표 행동으로 조종되며, 정상 데이터 진단은 75% 이상 성공한다.
이 연구는 월드 모델을 재사용하는 경우 공격자가 체크포인트를 조작하여 하위 컨트롤러를 조종할 수 있음을 시사하여, 모델 체크포인트의 보안 검증이 필요하다.
CiteShade는 RAG 시스템에서 인용 채널을 공격하는 새로운 방법으로, 공격자가 단일 출처를 조작하여 신뢰할 수 있는 출처에 잘못된 답변을 연결시킨다. 공격은 최적화 문제로 정의되어 다중 출처 질문 응답에서 오답률을 0.01에서 0.68로 높인다.
RAG 시스템의 인용 채널 보안을 강화하기 위해 인용 출처의 실제 영향을 검증하는 방어 기법을 도입해야 한다.
Lightcap의 출판 강제 메커니즘에서 정확한 콘텐츠 바인딩, 권한 신선도, 체크포인트 복구를 분석하였다. 14B 모델 기반의 응답-액션 체커는 302개 중 291개의 미지원 라벨 응답을 수용했으며, 직접 기준선은 41개를 수용하였다.
이 연구는 LLM 답변 시스템의 승인 무결성과 복구 메커니즘의 효과성을 실무에서 평가하는 데 도움을 줄 수 있다.
LLM 기반 에이전트의 공격 경로 추론을 보완하기 위해, 스캐너 출력을 기반으로 논리 공격 그래프를 생성하는 반자동 파이프라인을 제안한다. 54개 웹 CTF 과제에서 평균 53.7%의 취약점 커버리지를 달성했으며, 평균 노이즈 경로 비율은 83.9%였다.
LLM 에이전트와 기호적 추론을 결합한 공격 그래프 생성 파이프라인을 통해 침투 테스트 자동화가 가능해진다.
중앙집중식 멀티에이전트 시스템(MAS)에서 등록된 워커 에이전트의 설명을 조작해 플래너를 기만하는 등록 시점 주입 공격을 분석하고, 8가지 공격 전략을 제시한다. GAIA 평가에서 조작된 설명 하나로 작업 성공률을 84.31%에서 37.25%로 낮추거나 토큰 소비나 실행 시간을 111% 이상 증가시킬 수 있음을 보인다.
이 연구는 실제 시스템에서 워커 설명을 신중히 검증할 필요성을 강조하며, 등록 시점 보안 검증을 강화하는 방안을 제시한다.
저자는 약한 비정렬 모델이 해로운 작업을 무해해 보이는 하위 문제로 분할하고, 강력한 정렬 모델을 각각 독립적으로 상담한 후 로컬에서 답변을 결합하는 새로운 공격 기법인 'capability laundering'를 제안한다. CyBench, BountyBench, 해로운 CBRN 요청에서 실험한 결과, Gemma-4-31B는 GPT-5.5와 Opus를 사용할 때 각각 8/14, 7/9 후보를 회복했으며, CBRN 공격 체인에서 평균 점수를 62.3에서 83.1로 높였다.
이 연구는 정렬된 LLM이 개별적으로 허용된 상호작용을 통해 해로운 능력을 전달하고 구성될 수 있음을 보여주어, 현재 방어 체계의 한계를 드러내며, 실무에서는 LLM 상호작용의 집합적 위험을 평가하는 새로운 접근이 필요하다.
AI 시스템이 개인의 행동을 복제하는 인격 기술 증류(Persona skill distillation)에 대한 새로운 방어 기법인 CounterPersona를 제안한다. CounterPersona는 표어적 반박 증거를 구성하고 행동 상태를 병합하여 일관성을 강화함으로써 강력하고 일관된 효과성을 보인다.
CounterPersona는 수집된 데이터를 수정할 수 없는 환경에서 개인의 프라이버시와 노동 자율성을 보호하는 데 실무적으로 활용될 수 있다.
LLM 추론 시 사용자 프롬프트의 민감 정보를 보호하기 위해 TEE와 GPU를 분할하여 차등 사설을 적용한 새로운 아키텍처를 제안한다. TDX에서의 구현 결과, 전체 CPU 기반 추론보다 약 2배 빠르고, 암호화 기반 Slalom보다 5-15초 빠르며 정확도가 더 높다.
이 연구는 민감한 사용자 데이터를 보호하면서도 LLM 추론 성능을 향상시키는 실용적인 방법을 제시하여, 클라우드 환경에서의 보안 LLM 서비스 개발에 참고가 될 수 있다.
프롬프트 인젝션 감지기(prompt-injection detector)의 성능 평가를 위해 새로운 벤치마크인 PIDS-Bench를 제안한다. 이 벤치마크는 분포 이동(distribution shift) 상황에서의 감지 정확도(F1=0.98)와 양성 오류율(FPR 0.10 이상)을 동시에 평가한다.
이 연구는 프롬프트 인젝션 감지기의 실제 운영 시 오류를 줄이기 위해 분포 이동 상황을 고려한 평가가 필요하다는 점을 시사한다.
LLM 에이전트가 외부 환경과 상호작용할 때 발생할 수 있는 간접 프롬프트 인젝션 공격을 방어하기 위해 사전 실행 동작 감사 프레임워크인 ActGuard를 제안한다. ActGuard는 기존 방어 기법의 단점을 보완하여 보안과 유틸리티의 균형을 유지하면서 공격 성공률을 현저히 줄이는 것을 보인다.
ActGuard를 도입하면 LLM 에이전트의 보안성을 향상시키면서도 작업 효율성을 유지할 수 있다.
LLM 에이전트에서 테넌트 식별자를 모델 컨텍스트 프로토콜(MCP) 도구 스키마에서 제거하고 검증된 자격 증명으로 범위를 바인딩하는 구조적 방어 기법을 제안한다. 373회 실험에서 테넌트 매개변수를 제거하면 도구 시그니처가 범위 밖 요청을 표현할 수 없었고, 57배의 지연 비율이 측정되었다.
LLM 에이전트에서 테넌트 격리를 강화하기 위해 인증된 자격 증명과 실행 가능한 인터페이스를 의존하는 구조적 방어를 적용해야 한다.
LLM 에이전트가 다중 소스에서 입력을 수집할 때 발생하는 세그먼트 수준 중독 공격을 탐지하고 정위하는 내부 상태 기반 프레임워크 ActProbe를 제안한다. ActProbe는 0.01의 거짓 긍정률, 0.05의 거짓 부정률, 0.94의 정위 재현률, 0.90의 정위 F1 점수를 달성한다.
ActProbe는 LLM 에이전트의 입력 중독을 효과적으로 탐지하고 정위하여, 실제 시스템에서의 보안 강화에 기여할 수 있다.
ViTeGate는 시각-언어 검색 증강 생성(VLRAG) 시스템에 대한 지식 오염 공격 기법으로, 시각적 트리거와 텍스트 트리거를 조합해 공격을 선택적으로 활성화한다. InfoSeek 데이터셋에서 공격 성공률 0.98과 정상 응답 정확도 0.93을 달성했다.
이 연구는 VLRAG 시스템의 보안 취약점을 드러내며, 시각-언어 트리gger를 활용한 정밀한 공격 활성화 기법을 제시한다.
RAG 시스템에서 멤버십 추론 공격을 위해 컨텍스트 유도 정보 이득을 기반으로 한 CIG-MIA 기법을 제안한다. Natural Questions 데이터셋에서 회색 상자 설정에서 AUC 0.99, 검은 상자 설정에서 AUC 0.93을 달성한다.
RAG 시스템의 보안 취약점을 드러내며, 외부 지식베이스를 사용하는 시스템의 정보 누출 가능성을 실무적으로 고려해야 한다.
LLM 에이전트가 다양한 작업을 수행할 때 권한을 동적으로 제어하는 새로운 방법을 제안한다. 평가 결과 의도된 작업을 방해하지 않고 위반을 차단하는 것을 보인다.
LLM 에이전트를 사용하는 시스템에서는 작업 의도에 따라 권한을 동적으로 제어하는 방식을 도입해야 한다.
APT 공격자가 윈도우 유틸리티를 악용하는 LOTL 공격을 탐지하기 위해 BERT 기반 의미 인코딩, 문자 수준 CNN, 명령 간 어텐션, 오토인코더 기반 이상 점수를 통합한 SENTINEL 아키텍처를 제안한다. 평형 잡힌 벤치마크에서 SENTINEL은 기록된 국가 주도 공격 명령에 대해 92.0% 정확도, 변형된 버전에는 91.2%를 달성했다.
SENTINEL은 기존 방법보다 LOTL APT 공격 탐지 성능을 크게 향상시켜, 국가 주도 공격에 대한 방어 전략을 개선할 수 있다.
기존의 신경망 추출 공격은 네트워크 아키텍처를 알고 있는 것을 전제로 했으나, 본 연구는 아키텍처를 알지 못하는 상황에서도 파라미터를 추출할 수 있는 기법을 제안한다. 추출 과정에서 아키텍처 정보를 추론하는 방법을 제시하고, 이를 통해 다양한 ReLU 신경망에 대한 공격을 구현하였다.
이 연구는 신경망 보호를 위한 방어 전략에 새로운 고려 요소를 제공한다.
의료 이미징 모델에서 백도어 감지를 위해 스펙트럼 서명 분석과 활성화 클러스터링을 결합한 방법을 제안하고, 이를 평가하는 실험을 수행했다. 의료 벤치마크에서 결합 감지기는 모든 비제로 중독률에서 AUROC 0.99 이상을 달성했다.
의료 이미징 모델의 백도어 감지에 스펙트럼 서명과 활성화 클러스터링을 결합하는 방법이 효과적임을 보여주어, 관련 분야 실무자들이 이를 적용할 수 있다.
모델 컨텍스트 프로토콜(MCP) 생태계의 보안 취약점을 조사하고, 21,643개 서버를 대상으로 무인증 네트워크 노출 등 8가지 위협 카탈로그를 기반으로 분석했다. 9.57%의 서버가 무인증 노출되었고, 51.1%의 다중 버전 서버가 버전 간 광고 정보를 변경하는 '침묵적 드리프트'를 보였다.
MCP 생태계의 서버 등록 정보가 실제 동작과 일치하지 않는 경우가 많아, 실무에서는 등록 정보를 신뢰하지 말고 클라이언트 측 핀닝과 스캐너 우선순위 설정을 고려해야 한다.
본 페이지의 연구 요약은 공개된 초록을 AI가 한국어로 정리한 것으로, 원문과 차이가 있을 수 있습니다. 정확한 내용은 반드시 원문을 확인하십시오. 본문과 PDF는 제공하지 않으며, 모든 저작권은 각 저자와 발행처에 있습니다.