RESEARCH

연구·리포트 참고 자료

이번 주 연구최근 7200편 · 출처 5
343Updated 1일 전
arXivAI 보안 · 프리프린트 · 3일 전Xiaoyan Li, Yunli Wang

도구 통합 LLM 에이전트에 대한 적대적 공격 방어 방안

도구 통합 대규모 언어 모델(LLM) 에이전트의 적대적 공격 방어 전략을 탐구하고, 공격 성공률을 0%까지 낮추는 방식을 제시한다. 4개 오픈소스 LLM과 3개 프로퍼티어리 LLM에서 공격 성공률(ASR)을 0%까지 낮추며 원래 작업 성공률을 유지하거나 향상시켰다.

도구 통합 LLM 에이전트의 보안 강화를 위해 다층적 방어 전략을 채택할 수 있다.

LLM 에이전트적대적 공격방어 전략공격 성공률PDF 있음
arXivAI 보안 · 프리프린트 · 4일 전Zihan Wang 외 7명

RAPID: 텍스트-이미지 서비스에 대한 비인가 디스틸레이션 방어

RAPID는 텍스트-이미지 생성 모델의 비인가 디스틸레이션 공격을 방어하기 위해 VAE 디코더에 방어적 펄티urbation을 통합하는 실시간 방어 기법이다. 실험 결과 RAPID는 대체 모델의 생성 품질을 저하시키면서도 서비스 시각적 정확도를 유지한다.

이 결과는 텍스트-이미지 생성 서비스의 모델 지적 재산권 보호를 위해 실시간 방어 기법을 설계할 때 참고할 수 있다.

AI 보안모델 디스틸레이션텍스트-이미지 생성VAE 디코더PDF 있음
arXivAI 보안 · 프리프린트 · 4일 전Roberto Ria\~no 외 3명

월드 모델의 뒷문 공격(Backdoor Attacks)

사전 학습된 월드 모델(latent world models)에 뒷문 공격을 적용하여, 공격자가 체크포인트만 제어하여 하위 컨트롤러를 해킹할 수 있음을 보인다. 공격은 100%의 트리거 스텝에서 공격자의 목표 행동으로 조종되며, 정상 데이터 진단은 75% 이상 성공한다.

이 연구는 월드 모델을 재사용하는 경우 공격자가 체크포인트를 조작하여 하위 컨트롤러를 조종할 수 있음을 시사하여, 모델 체크포인트의 보안 검증이 필요하다.

월드 모델뒷문 공격latent world modelscontrolPDF 있음
arXivAI 보안 · 프리프린트 · 4일 전Guo Fuzheng

CiteShade: 다중 출처 RAG에서의 인용 세탁 공격과 그에 대한 반사적 방어

CiteShade는 RAG 시스템에서 인용 채널을 공격하는 새로운 방법으로, 공격자가 단일 출처를 조작하여 신뢰할 수 있는 출처에 잘못된 답변을 연결시킨다. 공격은 최적화 문제로 정의되어 다중 출처 질문 응답에서 오답률을 0.01에서 0.68로 높인다.

RAG 시스템의 인용 채널 보안을 강화하기 위해 인용 출처의 실제 영향을 검증하는 방어 기법을 도입해야 한다.

RAG인용 세탁 공격CiteShadeAI 보안PDF 있음
arXivAI 보안 · 프리프린트 · 4일 전Faruk Alpay, Taylan Alpay

LLM 답변 출판에서의 승인 무결성 및 복구

Lightcap의 출판 강제 메커니즘에서 정확한 콘텐츠 바인딩, 권한 신선도, 체크포인트 복구를 분석하였다. 14B 모델 기반의 응답-액션 체커는 302개 중 291개의 미지원 라벨 응답을 수용했으며, 직접 기준선은 41개를 수용하였다.

이 연구는 LLM 답변 시스템의 승인 무결성과 복구 메커니즘의 효과성을 실무에서 평가하는 데 도움을 줄 수 있다.

LLM승인 무결성복구권한 신선도PDF 있음
arXivAI 보안 · 프리프린트 · 4일 전Oliver Stevanovic, Jasmin Wachter

공격 그래프 자동 생성을 위한 에이전트 침투 테스트 연구

LLM 기반 에이전트의 공격 경로 추론을 보완하기 위해, 스캐너 출력을 기반으로 논리 공격 그래프를 생성하는 반자동 파이프라인을 제안한다. 54개 웹 CTF 과제에서 평균 53.7%의 취약점 커버리지를 달성했으며, 평균 노이즈 경로 비율은 83.9%였다.

LLM 에이전트와 기호적 추론을 결합한 공격 그래프 생성 파이프라인을 통해 침투 테스트 자동화가 가능해진다.

LLM공격 그래프침투 테스트MulVALPDF 있음
arXivAI 보안 · 프리프린트 · 4일 전Zhaofeng Yu 외 5명

사기성 이력서로 플래너를 기만하는 등록 시점 주입 공격 (Registration-Time Injection in Centralized Multi-Agent Systems)

중앙집중식 멀티에이전트 시스템(MAS)에서 등록된 워커 에이전트의 설명을 조작해 플래너를 기만하는 등록 시점 주입 공격을 분석하고, 8가지 공격 전략을 제시한다. GAIA 평가에서 조작된 설명 하나로 작업 성공률을 84.31%에서 37.25%로 낮추거나 토큰 소비나 실행 시간을 111% 이상 증가시킬 수 있음을 보인다.

이 연구는 실제 시스템에서 워커 설명을 신중히 검증할 필요성을 강조하며, 등록 시점 보안 검증을 강화하는 방안을 제시한다.

LLM멀티에이전트 시스템등록 시점 주입보안PDF 있음
arXivAI 보안 · 프리프린트 · 4일 전Mark Russinovich 외 4명

분할, 상담, 정복: 정렬된 LLM을 통한 능력 세탁(Capability Laundering)

저자는 약한 비정렬 모델이 해로운 작업을 무해해 보이는 하위 문제로 분할하고, 강력한 정렬 모델을 각각 독립적으로 상담한 후 로컬에서 답변을 결합하는 새로운 공격 기법인 'capability laundering'를 제안한다. CyBench, BountyBench, 해로운 CBRN 요청에서 실험한 결과, Gemma-4-31B는 GPT-5.5와 Opus를 사용할 때 각각 8/14, 7/9 후보를 회복했으며, CBRN 공격 체인에서 평균 점수를 62.3에서 83.1로 높였다.

이 연구는 정렬된 LLM이 개별적으로 허용된 상호작용을 통해 해로운 능력을 전달하고 구성될 수 있음을 보여주어, 현재 방어 체계의 한계를 드러내며, 실무에서는 LLM 상호작용의 집합적 위험을 평가하는 새로운 접근이 필요하다.

LLM 보안capability laundering정렬된 모델악성 작업 분할PDF 있음
arXivAI 보안 · 프리프린트 · 4일 전Pengwei Wang 외 5명

CounterPersona: 추가만 허용되는 환경에서 비인가 인격 기술 증류 방어

AI 시스템이 개인의 행동을 복제하는 인격 기술 증류(Persona skill distillation)에 대한 새로운 방어 기법인 CounterPersona를 제안한다. CounterPersona는 표어적 반박 증거를 구성하고 행동 상태를 병합하여 일관성을 강화함으로써 강력하고 일관된 효과성을 보인다.

CounterPersona는 수집된 데이터를 수정할 수 없는 환경에서 개인의 프라이버시와 노동 자율성을 보호하는 데 실무적으로 활용될 수 있다.

인공지능 보안프라이버시 보호인격 기술 증류CounterPersonaPDF 있음
arXivAI 보안 · 프리프린트 · 4일 전Shashie Dilhara Batan Arachchige 외 3명

SpliTEE: 신뢰할 수 있는 하드웨어에서의 LLM 추론을 위한 차등 사설 GPU 아웃소싱

LLM 추론 시 사용자 프롬프트의 민감 정보를 보호하기 위해 TEE와 GPU를 분할하여 차등 사설을 적용한 새로운 아키텍처를 제안한다. TDX에서의 구현 결과, 전체 CPU 기반 추론보다 약 2배 빠르고, 암호화 기반 Slalom보다 5-15초 빠르며 정확도가 더 높다.

이 연구는 민감한 사용자 데이터를 보호하면서도 LLM 추론 성능을 향상시키는 실용적인 방법을 제시하여, 클라우드 환경에서의 보안 LLM 서비스 개발에 참고가 될 수 있다.

LLM 추론신뢰할 수 있는 실행 환경차등 사설GPU 아웃소싱PDF 있음
arXivAI 보안 · 프리프린트 · 4일 전Yusuf Khalid Shire, Sang-Chul Kim

PIDS-Bench: 프롬프트 인젝션 감지기 평가

프롬프트 인젝션 감지기(prompt-injection detector)의 성능 평가를 위해 새로운 벤치마크인 PIDS-Bench를 제안한다. 이 벤치마크는 분포 이동(distribution shift) 상황에서의 감지 정확도(F1=0.98)와 양성 오류율(FPR 0.10 이상)을 동시에 평가한다.

이 연구는 프롬프트 인젝션 감지기의 실제 운영 시 오류를 줄이기 위해 분포 이동 상황을 고려한 평가가 필요하다는 점을 시사한다.

프롬프트 인젝션PIDS-Bench분포 이동감지기 평가PDF 있음
arXivAI 보안 · 프리프린트 · 4일 전Bingzheng Wang 외 5명

ActGuard: LLM 에이전트의 간접 프롬프트 인젝션 공격을 위한 사전 실행 동작 감사

LLM 에이전트가 외부 환경과 상호작용할 때 발생할 수 있는 간접 프롬프트 인젝션 공격을 방어하기 위해 사전 실행 동작 감사 프레임워크인 ActGuard를 제안한다. ActGuard는 기존 방어 기법의 단점을 보완하여 보안과 유틸리티의 균형을 유지하면서 공격 성공률을 현저히 줄이는 것을 보인다.

ActGuard를 도입하면 LLM 에이전트의 보안성을 향상시키면서도 작업 효율성을 유지할 수 있다.

LLM 에이전트프롬프트 인젝션ActGuard보안-유틸리티 균형PDF 있음
arXivAI 보안 · 프리프린트 · 4일 전Mirza Samad Ahmed Baig 외 3명

랜덤 부관(The Stochastic Deputy): 도구 사용 LLM 에이전트의 구조적 테넌트 격리

LLM 에이전트에서 테넌트 식별자를 모델 컨텍스트 프로토콜(MCP) 도구 스키마에서 제거하고 검증된 자격 증명으로 범위를 바인딩하는 구조적 방어 기법을 제안한다. 373회 실험에서 테넌트 매개변수를 제거하면 도구 시그니처가 범위 밖 요청을 표현할 수 없었고, 57배의 지연 비율이 측정되었다.

LLM 에이전트에서 테넌트 격리를 강화하기 위해 인증된 자격 증명과 실행 가능한 인터페이스를 의존하는 구조적 방어를 적용해야 한다.

LLM 에이전트테넌트 격리stochastic deputy problemModel Context ProtocolPDF 있음
arXivAI 보안 · 프리프린트 · 4일 전Xue Tan 외 8명

다중 소스 LLM-에이전트 입력의 세그먼트 수준 중독 탐지 및 정위

LLM 에이전트가 다중 소스에서 입력을 수집할 때 발생하는 세그먼트 수준 중독 공격을 탐지하고 정위하는 내부 상태 기반 프레임워크 ActProbe를 제안한다. ActProbe는 0.01의 거짓 긍정률, 0.05의 거짓 부정률, 0.94의 정위 재현률, 0.90의 정위 F1 점수를 달성한다.

ActProbe는 LLM 에이전트의 입력 중독을 효과적으로 탐지하고 정위하여, 실제 시스템에서의 보안 강화에 기여할 수 있다.

LLM 에이전트중독 공격ActProbe내부 상태 기반 탐지PDF 있음
arXivAI 보안 · 프리프린트 · 4일 전Xue Tan 외 7명

ViTeGate: 시각-언어 트리거 기반 지식 오염 공격

ViTeGate는 시각-언어 검색 증강 생성(VLRAG) 시스템에 대한 지식 오염 공격 기법으로, 시각적 트리거와 텍스트 트리거를 조합해 공격을 선택적으로 활성화한다. InfoSeek 데이터셋에서 공격 성공률 0.98과 정상 응답 정확도 0.93을 달성했다.

이 연구는 VLRAG 시스템의 보안 취약점을 드러내며, 시각-언어 트리gger를 활용한 정밀한 공격 활성화 기법을 제시한다.

ViTeGate지식 오염 공격시각-언어 트리거VLRAGPDF 있음
arXivAI 보안 · 프리프린트 · 4일 전Tan Xue 외 6명

CIG-MIA: 컨텍스트 유도 정보 이득을 활용한 멤버십 추론 공격(Retrieval-Augmented Generation 대상)

RAG 시스템에서 멤버십 추론 공격을 위해 컨텍스트 유도 정보 이득을 기반으로 한 CIG-MIA 기법을 제안한다. Natural Questions 데이터셋에서 회색 상자 설정에서 AUC 0.99, 검은 상자 설정에서 AUC 0.93을 달성한다.

RAG 시스템의 보안 취약점을 드러내며, 외부 지식베이스를 사용하는 시스템의 정보 누출 가능성을 실무적으로 고려해야 한다.

RAG멤버십 추론 공격CIG-MIA정보 이득PDF 있음
arXivAI 보안 · 프리프린트 · 4일 전Yusheng Zheng 외 2명

LLM 에이전트의 권한은 작업 의도와 맥락에 따라 달라져야 한다

LLM 에이전트가 다양한 작업을 수행할 때 권한을 동적으로 제어하는 새로운 방법을 제안한다. 평가 결과 의도된 작업을 방해하지 않고 위반을 차단하는 것을 보인다.

LLM 에이전트를 사용하는 시스템에서는 작업 의도에 따라 권한을 동적으로 제어하는 방식을 도입해야 한다.

LLM 에이전트권한 관리보안IntentCapPDF 있음
arXivAI 보안 · 프리프린트 · 4일 전Ahad Bin Islam Shoeb 외 6명

SENTINEL: 윈도우 명령줄에서 LOTL APT 공격 탐지를 위한 다중 경로 아키텍처

APT 공격자가 윈도우 유틸리티를 악용하는 LOTL 공격을 탐지하기 위해 BERT 기반 의미 인코딩, 문자 수준 CNN, 명령 간 어텐션, 오토인코더 기반 이상 점수를 통합한 SENTINEL 아키텍처를 제안한다. 평형 잡힌 벤치마크에서 SENTINEL은 기록된 국가 주도 공격 명령에 대해 92.0% 정확도, 변형된 버전에는 91.2%를 달성했다.

SENTINEL은 기존 방법보다 LOTL APT 공격 탐지 성능을 크게 향상시켜, 국가 주도 공격에 대한 방어 전략을 개선할 수 있다.

APT 공격BERTSENTINEL명령줄 분석PDF 있음
arXivAI 보안 · 프리프린트 · 4일 전Yantian Shen 외 4명

알 수 없는 아키텍처를 가정하지 않은 신경망의 암호분석적 추출

기존의 신경망 추출 공격은 네트워크 아키텍처를 알고 있는 것을 전제로 했으나, 본 연구는 아키텍처를 알지 못하는 상황에서도 파라미터를 추출할 수 있는 기법을 제안한다. 추출 과정에서 아키텍처 정보를 추론하는 방법을 제시하고, 이를 통해 다양한 ReLU 신경망에 대한 공격을 구현하였다.

이 연구는 신경망 보호를 위한 방어 전략에 새로운 고려 요소를 제공한다.

암호분석신경망 추출ReLU공격 기법PDF 있음
arXivAI 보안 · 프리프린트 · 4일 전Suresh Tamang

스펙트럼 서명과 활성화 클러스터링을 결합한 의료 이미징 모델의 백도어 감지: 방법, 구현, 평가

의료 이미징 모델에서 백도어 감지를 위해 스펙트럼 서명 분석과 활성화 클러스터링을 결합한 방법을 제안하고, 이를 평가하는 실험을 수행했다. 의료 벤치마크에서 결합 감지기는 모든 비제로 중독률에서 AUROC 0.99 이상을 달성했다.

의료 이미징 모델의 백도어 감지에 스펙트럼 서명과 활성화 클러스터링을 결합하는 방법이 효과적임을 보여주어, 관련 분야 실무자들이 이를 적용할 수 있다.

백도어 감지의료 이미징스펙트럼 서명활성화 클러스터링PDF 있음
arXivAI 보안 · 프리프린트 · 4일 전Obada Kraishan

동일한 이름, 다른 서버: 모델 컨텍스트 프로토콜(MCP) 생태계의 침묵적 드리프트 보안 조사

모델 컨텍스트 프로토콜(MCP) 생태계의 보안 취약점을 조사하고, 21,643개 서버를 대상으로 무인증 네트워크 노출 등 8가지 위협 카탈로그를 기반으로 분석했다. 9.57%의 서버가 무인증 노출되었고, 51.1%의 다중 버전 서버가 버전 간 광고 정보를 변경하는 '침묵적 드리프트'를 보였다.

MCP 생태계의 서버 등록 정보가 실제 동작과 일치하지 않는 경우가 많아, 실무에서는 등록 정보를 신뢰하지 말고 클라이언트 측 핀닝과 스캐너 우선순위 설정을 고려해야 한다.

모델 컨텍스트 프로토콜보안 취약점침묵적 드리프트MCPPDF 있음

본 페이지의 연구 요약은 공개된 초록을 AI가 한국어로 정리한 것으로, 원문과 차이가 있을 수 있습니다. 정확한 내용은 반드시 원문을 확인하십시오. 본문과 PDF는 제공하지 않으며, 모든 저작권은 각 저자와 발행처에 있습니다.