RESEARCH

연구·리포트 참고 자료

이번 주 연구최근 7200편 · 출처 5
343Updated 1일 전
arXivAI 보안 · 프리프린트 · 2026년 9월 1일Ashok Subbabhatta Gopalakrishna

AI 에이전트 간 제로지식 예측 증명: 측정된, 프로토콜 간 게이트웨이와 소스 무결성 간극

AI 에이전트 간 데이터 공유 시 민감 정보 누출을 방지하기 위해 제로지식 증명 기반의 게이트웨이를 구현하고, GDPR 데이터 최소화 원칙을 기술적 조치로 구현했다. 6.2ms의 증명 시간과 1.0ms의 검증 시간을 기록했다.

AI 에이전트 간 민감 정보 공유 시 제로지식 증명을 활용해 데이터 누출을 사전에 방지할 수 있다.

제로지식 증명AI 에이전트데이터 최소화GDPRPDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 1일Wujie Xiong 외 4명

LLM 에이전트의 간접 프롬프트 인젝션 공격 대응을 위한 도달성 기반 능력 제한

LLM 에이전트가 외부 스킬의 출력을 실행 컨텍스트에 삽입하는 방식을 통해 공격자가 제어하는 데이터가 후속 권한 있는 작업에 영향을 미치는 문제를 해결하기 위해 SkillGuard라는 새로운 방어 기법을 제안한다. SkillGuard는 오염 발생 시 이진, 분수, 분수 흐름 전략을 사용하여 능력 제한을 계산하여 공격 성공률을 4.8%와 14.3%로 줄인다.

이 연구는 LLM 에이전트의 보안을 강화하기 위한 실용적인 방어 기법을 제시하여, AI 보안 분야의 실무자들에게 중요한 참고 자료가 될 수 있다.

LLM 에이전트프롬프트 인젝션SkillGuard도달성 기반 제한PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 1일Mingshuo Wang 외 5명

ActReal: 시스템 수준 모바일 에이전트가 모바일 자동화 탐지에 도전

시스템 수준 모바일 에이전트가 고정된 스크립트에서 벗어나 동적 UI를 탐색하고 복잡한 작업을 수행할 수 있도록 진화하고 있다. ActReal은 진짜 터치 궤적과 물리 기반 IMU 신호를 생성하여 기존 탐지 방식을 우회하는 공격 프레임워크이다.

ActReal을 통해 모바일 자동화 탐지 기술의 한계를 인식하고, 시스템 수준의 보안 강화가 필요하다.

모바일 에이전트자동화 탐지IMU 신호ActRealPDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 1일Tanzim Ahad 외 5명

인플루언스는 권한이 아니다: 인과적 가드레일 신호가 정당한 도구 사용을 공격처럼 보이게 하는 경우

현재 최신 인플루언스 기반 가드레일은 외부 도구 정보에 의존하는 정당한 사용과 악의적인 사용을 구분하지 못한다는 한계를 분석하고, 이를 보완하기 위한 새로운 접근법을 제안한다. 실험 결과, 사용자 권한이 있는 경우와 없는 경우의 평균 점수 변화가 실제 권한 변화보다 더 크며, 새로운 접근법으로 공격 성공률은 0%로 낮아지고 유틸리티는 28%로 유지된다.

이 연구는 인플루언스 기반 가드레일의 한계를 드러내고, 도구 사용을 정당한지 판단하는 새로운 접근법을 제시하여 AI 에이전트 보안 설계에 실질적인 개선을 제공한다.

AI 보안가드레일인플루언스 기반도구 사용PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 1일Tairui Wang 외 5명

JITterFlip: JIT 컴파일 기반 LLM 서비스의 결함 공격 표면 탐지

JIT 컴파일을 사용하는 클라우드 기반 LLM 서비스의 호스트 측 제어 플레인을 타겟으로 하는 새로운 bit-flip 공격 기법 JITterFlip을 제안한다. JITterFlip은 PPL 비율 15.45~2.48×10⁶배, 지연 증폭 2.03~181.90배의 공격 효과를 보인다.

JIT 컴파일 기반 LLM 서비스는 CPU 측 제어 플레인의 취약점을 공격받을 수 있으므로, 해당 제어 플레인 보안 강화가 필요하다.

JIT 컴파일LLM 서비스bit-flip 공격RowhammerPDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 1일Qian Chen 외 2명

OASIS: 하드-라벨 블랙박스 텍스트 공격에서 공격자 시퀀스 최적화

하드-라벨 블랙박스 텍스트 공격에서 공격 성공률과 퍼트رب레이션을 균형 있게 조정하는 공격자 시퀀스 최적화 방법을 제안한다. 여러 데이터셋과 대상 모델, 대형 언어 모델에서 실험한 결과, 기존 단일 공격 기반의 강력한 기준 모델과 수동적으로 구성된 체인을 꾸준히 초과하는 성능을 보인다.

텍스트 기반 블랙박스 공격 시 공격자 시퀀스 최적화를 통해 공격 성능을 향상시킬 수 있다.

하드-라벨 블랙박스 공격공격자 시퀀스 최적화AI 보안텍스트 공격PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 1일Junbin Lu 외 4명

SpatialTrust: 보안 인증에서 환경적 위험 인식을 평가하는 벤치마크

보안 인증에서 시각 환경적 위험 인식 능력을 평가하는 새로운 벤치마크인 SpatialTrust를 제안한다. SpatialTrust는 민감 요인 탐지, 직접/간접 요인 식별 및 설명 능력을 평가하며, 현재 MLLMs가 간접 위험을 이해하고 설명하는 데 어려움을 겪는다는 것을 보인다.

이 연구는 보안 인증에서 MLLMs의 환경적 위험 인식 능력 향상을 위한 벤치마크와 추론 방법 개발의 필요성을 강조한다.

보안 인증MLLM환경적 위험 인식벤치마크PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 1일Johanna Angulo 외 2명

벤치마크 오염(Benchmark Contamination) 분류체계: 무력화된 완화책별 분류

벤치마크 오염을 기존 완화책별로 분류하는 새로운 체계를 제안하고, 평가 프로토콜과 실증 결과를 제시한다. 41개 문서에 대한 측정에서 변수별 내부일치도가 0.00~0.35로 나타났으며, 일부 항목은 기준 이하인 것으로 드러났다.

벤치마크 오염 분류체계를 활용해 연구 공개 수준을 체계적으로 평가할 수 있으며, 이는 모델 평가의 신뢰도를 높이는 데 기여할 수 있다.

벤치마크 오염분류체계평가 프로토콜AI 보안PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 1일Guanlong Wu 외 5명

안전한 재개인가? 에이전트 실행을 통해 롤백을 통한 실행 연속성 파괴

AI 에이전트의 체크포인트 및 롤백 기술의 보안 문제를 체계적으로 분석하고, 5가지 핵심 실패 모드를 제시한다. 헤르메스, 클라인, 랭그래프에서 실제 공격을 통해 악성코드 검증 우회, 비인가 이메일 전달, 이중 결제를 보인다.

AI 에이전트 시스템의 체크포인트 및 롤백 기술은 보안 취약점이 존재하므로, 실행 연속성 관리 시 주의가 필요하다.

AI 에이전트체크포인트롤백보안 취약점PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 1일Yudong Gao 외 7명

GhostSplat: 입력 트리거 백도어를 통한 3D 콘텐츠 조작

3D Gaussian Splatting(3DGS)에 공격을 적용하는 새로운 입력 트리거 방식의 백도어 기법인 GhostSplat을 제안한다. 실험 결과, 최대 96%와 100%의 공격 성공률을 달성하면서 JPEG, 블러, 리샘플링 공격에 견디는 것을 보였다.

이 연구는 공유된 3D 생성 모델에 지속적인 조작을 유발할 수 있는 새로운 백도어 공격 방식을 제시하여, 공격자들이 공유된 생성 모델을 악용할 수 있는 잠재적 위험성을 드러냅니다.

백도어3DGSGhostSplat입력 트리거PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 1일Jona te Lintelo 외 2명

WoE가 썼다? 스파스 MoE 모델의 텍스트 프로바네이스를 위한 워터마킹

LLM 워터마킹 기법의 한계를 분석하고, 스파스 Mixture-of-Experts(MoE) 모델의 구조적 특성을 활용한 새로운 텍스트 프로바네이스 방법인 Watermarking of Experts(WoE)를 제안한다. 8개의 MoE 모델에서 평가한 결과, 1%의 거짓 긍정률에서 평균 90.1%의 진짜 긍정률을 달성했으며, 최대 94.9%에 달했다.

WoE는 도난당한 모델 가중치나 유출된 체크포인트로 생성된 텍스트를 추적할 수 있는 새로운 워터마킹 방법으로, 악의적인 행위자에게 추가적인 모델 적응이나 텍스트 재작성 작업을 요구한다.

LLM 워터마킹텍스트 프로바네이스Mixture-of-Experts보안PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 1일Eunna Lee 외 8명

LLM 보호적 개입의 요청 수신 방식 의존성

대규모 언어 모델(LLM)이 음성 대 텍스트 요청에 따라 보호적 개입이 달라지는지 실험했다. 음성 인터페이스에서 보호 행동이 줄어드는 경향을 관찰했으며, 응답 길이와 무관하게 나타났다.

LLM의 보호적 개입이 요청 수신 방식에 따라 달라질 수 있으므로, 보호 정책 설계 시 인터페이스 차이를 고려해야 한다.

LLM보호적 개입인터페이스보안PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 1일Ruiyi Yan 외 3명

언어 스테가노그래피 종합 서베이: 방법, 대응책, 평가, 과제

LLM 시대의 언어 스테가노그래피 분야를 체계적으로 정리하고, 148개의 방법, 60개의 대응책, 23개의 평가 지표, 9개의 개방적 과제를 분류하고 분석한다. LLM 시대의 5가지 패러다임 변화를 식별한다.

이 서베이를 통해 실무자는 LLM 시대의 언어 스테가노그래피 기술 동향과 주요 과제를 파악할 수 있다.

언어 스테가노그래피LLM보안서베이PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 1일Masaki Nakada 외 5명

CARVY-FL: 증명 가능한 보안 연방 학습에서의 견고한 투표를 위한 클라이언트 반군집화

연방 학습(FL)에서 악의적인 클라이언트에 대한 취약성을 개선하기 위해 CARVY-FL이라는 새로운 방어 기법을 제안한다. MNIST와 Fashion-MNIST에서 FLCert보다 높은 인증 정확도(CA)를 보였다.

CARVY-FL은 연방 학습 환경에서 악성 클라이언트의 영향을 줄이는 데 실무적으로 활용될 수 있다.

연방 학습보안CARVY-FL반군집화PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 1일Feng Jiang 외 4명

멤버십은 소유권이다(Membership is Ownership): 확산 모델을 위한 강력한 소유권 검증 프레임워크

확산 모델의 지적 재산권 보호를 위해 훈련 시간에 워터마크를 삽입하는 기존 방법의 한계를 극복한 새로운 소유권 검증 프레임워크를 제안한다. MiO는 ROC-AUC와 true-positive rate 지표에서 성능을 보인다.

이 연구는 확산 모델의 지적 재산권 보호를 위한 실용적인 방안을 제시하여, 모델 도용 방지를 위한 실무 전략에 기여할 수 있다.

확산 모델지적 재산권 보호소유권 검증Membership is OwnershipPDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 1일Lilliane Linnet Musoke 외 2명

머신러닝을 활용한 SQL 인젝션 탐지 웹 방화벽 개선

SQL 인젝션 공격 탐지를 위해 DistilBERT-Stacked 앙상블 파이프라인을 설계하고 최적화하여 탐지 효율과 견고함을 향상시켰다. 최적화된 앙상블은 정확도 99.81%를 달성했으며, 단일 모델 대비 140배 빠른 추론 속도를 기록했다.

이 연구는 실시간 SQL 인젝션 탐지에 적합한 고정확도, 고속도의 방화벽 구축 방법을 제시한다.

SQL 인젝션머신러닝앙상블 학습웹 방화벽PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 1일Lilliane Linnet Musoke 외 2명

BERT-GNN을 활용한 SQL 인젝션 탐지 웹 애플리케이션 방화벽 개선

BERT와 그래프 신경망(GNN)을 결합한 하이브리드 모델을 설계하여 SQL 인젝션 공격 탐지 정확도를 향상시켰다. 99.67% 정확도, 99.71% 정밀도, 99.39% 재현율, 99.55% F1 점수를 달성했다.

BERT-GNN 하이브리드 모델은 웹 애플리케이션 방화벽의 SQL 인젝션 탐지 성능을 현저히 향상시킬 수 있다.

BERTGNNSQL 인젝션웹 보안PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 1일Benjamin Fehrensen, Jens Hubler

일반 목적 대형 언어 모델(LLM)로 다크넷 CAPTCHA 해결

다크넷 환경에서 자주 사용되는 자바스크립트 없는 CAPTCHA를 대형 언어 모델(LLM)로 해결하는 방법을 연구하고, 정확도 90% 이상의 하이브리드 프레임워크를 제안한다. 실험 결과, LLM과 전통적 컴퓨터 비전 기법을 결합한 시스템이 90% 이상의 성공률을 보였다.

이 연구는 LLM과 전통적 컴퓨터 비전 기법을 결합한 하이브리드 시스템이 CAPTCHA 해결에 효과적임을 보여주어, 보안 설계 시 이러한 결합 방식을 고려해야 한다는 시사점을 제공한다.

대형 언어 모델CAPTCHA다크넷보안PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 8월 31일Jun Wen Leong

인식은 있지만 실행은 없음: LLM 에이전트 지시 조정의 구성에 따른 실패

LLM 에이전트가 시스템 프롬프트, 사용자, 메모리, 도구에서 온 지시를 조정하지만, 이 조정이 신뢰 경계를 강제하지 못한다는 것을 보인다. 46개 모델 엔드포인트에서 평균 실행률은 1.21%이며, 외부 참조 모니터를 통해 위조된 요청을 확정적으로 거부하는 방어 기법을 제안한다.

LLM 에이전트의 자체 조정은 보안 경계로 간주할 수 없으며, 외부 강제가 필요하다.

LLM 에이전트지시 조정신뢰 경계외부 참조 모니터PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 8월 31일Jingjing Nie 외 3명

소프트웨어 및 시스템 보안을 위한 LLM 기반 에이전트: 접근, 응용, 평가

LLM 기반 에이전트가 보안 작업을 자동화하는 방식을 체계적으로 검토하고, 기술적 접근, 응용 분야, 평가 방법을 분석했다. 2023~2026년 동안의 동료 평가 논문을 대상으로 했다.

이 연구는 LLM 기반 에이전트의 보안 자동화에 대한 체계적 이해를 제공하여, 실무에서의 적용 범위와 한계를 파악하는 데 도움이 된다.

LLM에이전트보안 자동화문헌 검토PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 8월 31일Yupei Liu 외 3명

LongPIBench: 프롬프트 인젝션(prompt injection)을 위한 긴 문맥 벤치마크

긴 문맥에서의 프롬프트 인젝션 공격과 방어를 평가하기 위해 LongPIBench라는 새로운 벤치마크를 제안한다. 평가 결과, 기존 방어 기법이 긴 문맥에서 높은 성공률로 우회되는 것으로 나타났다.

긴 문맥 환경에서 기존 프롬트 인젝션 방어 기법의 효과가 크게 떨어진다는 점을 실무에서 고려해야 한다.

프롬프트 인젝션긴 문맥벤치마크AI 보안PDF 있음

본 페이지의 연구 요약은 공개된 초록을 AI가 한국어로 정리한 것으로, 원문과 차이가 있을 수 있습니다. 정확한 내용은 반드시 원문을 확인하십시오. 본문과 PDF는 제공하지 않으며, 모든 저작권은 각 저자와 발행처에 있습니다.