RESEARCH

연구·리포트 참고 자료

이번 주 연구최근 7200편 · 출처 5
344Updated 19시간 전
arXivAI 보안 · 프리프린트 · 2026년 9월 2일Padmeswari Nandiya 외 4명

NeuroGraph: 설명 가능한 위협 추론을 위한 AI 그래프 기반 신경-기호 프레임워크

공급망 보안에서 위협 분석의 복잡성을 해결하기 위해 그래프 기반 신경-기호 프레임워크를 제안하고, 이는 기존 기반선 대비 추론 정확도를 개선하며 환상 생성을 줄인다. 공개된 CTI 벤치마크를 사용한 실험 평가에서 NeuroGraph는 추론 정확도, 다중 홉 추론, 적대적 변동에 대한鲁棒성을 개선하였다.

이 연구는 공급망 보안 분석에서 설명 가능하고 신뢰할 수 있는 위협 추론을 가능하게 하여 실무자의 결정 과정을 지원할 수 있다.

공급망 보안신경-기호 추론그래프 기반 RAG설명 가능한 AIPDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 2일Rui Yang 외 6명

안전한 에이전트가 함께 실패할 때: 다중 에이전트 LLM 시스템의 보안

다중 에이전트 LLM 시스템(MAS)에서 정보, 상태, 결정, 권한이 주체 경계를 넘나들며 발생하는 보안 문제를 체계적으로 분석하고, 공격 경로와 방어 전략을 제시한다. 197개 연구를 분석하여 6개의 상호작용 인터페이스, 4개의 공격자 위치, 7개의 시스템 수준 위험, 8개의 반복 공격 경로를 정리하고, A-I-R 프레임워크와 5부분 계약 방식의 방어 전략을 제안한다.

다중 에이전트 LLM 시스템의 보안을 평가할 때 상호작용 경로를 종단간으로 추적하고 방어 전략이 해당 경로를 차단하는지 테스트해야 한다.

다중 에이전트 시스템LLM 보안A-I-R 프레임워크상호작용 인터페이스PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 2일Chuanchao Zang 외 7명

LLM 에이전트의 간접 장기 메모리 오염을 위한 전이 가능한 엔드투엔드 최적화

LLM 에이전트의 장기 메모리 오염 공격을 엔드투엔드 최적화 문제로 접근하여, 기존 단계별 최적화의 한계를 극복하는 새로운 공격 기법 PipePoison을 제안한다. 세 가지 에이전트 프레임워크와 네 가지 메모리 메커니즘에서 공격 활용률을 19.1% 포인트 향상시켰으며, 미확인 피해 설정에서도 기존 최고 기준을 16% 포인트 초과했다.

LLM 에이전트의 장기 메모리 보호를 위해 단계별 최적화보다 엔드투엔드 접근을 고려해야 한다.

LLM 에이전트장기 메모리 오염엔드투엔드 최적화공격 기법PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 2일Pingyu Wu 외 2명

안전장치가 작동했다. LLM 시스템은 더 안전한가?

LLM 서비스의 안전장치 평가 방법을 분석하고, 실제 배포 환경에서의 효과를 측정하는 기준을 제시한다. 안전장치의 로컬 성능 향상이 전체 시스템의 안전성 향상으로 이어지지 않는다는 점을 보인다.

LLM 시스템의 안전성 평가 시 단순히 안전장치의 성능 향상에 집중하기보다, 전체 시스템에서의 잔여 위험을 고려해야 한다.

LLM안전장치ai-security배포 환경PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 2일Marco Antonio Corallo 외 3명

추론이 백도어 공격을 완화할까? 신경 기호적 관점

신경 기호(Neuro-Symbolic) AI 모델의 적대적 공격에 대한 안정성을 평가하기 위해 DeepProbLog와 기초 신경망을 8가지 백도어 설정과 4가지 추론 작업에서 비교했다. 평균적으로 신경 기호 모델이 신경망보다 더 안정적이지만, 추론 과정의 엄격성과 공격 대상과의 호환성에 따라 안정성이 크게 달라진다.

신경 기호 AI 모델의 적대적 공격에 대한 안정성은 추론 과정의 엄격성과 공격 대상과의 호환성에 크게 의존하므로, 이 점을 고려한 설계가 필요하다.

신경 기호(Neuro-Symbolic)백도어 공격적대적 공격추론 엄격성PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 2일Patrikas Vanagas 외 2명

능력 제어 언어 모델(Capability-Gated Language Models): 보안은 합성되지만 유틸리티는 그렇지 않다

언어 모델의 배포 보안 기법을 개선하기 위해 'capability-gated deployment'라는 새로운 접근법을 제안한다. 이 기법은 단일 가중치 집합 내에서 각 사용자의 접근 제어를 구현하며, 보안성이 이론적으로 증명된다.

이 연구는 언어 모델의 보안 기능을 효과적으로 구성하는 새로운 방법을 제시하여, 보안 정책의 유연한 적용을 가능하게 한다.

AI 보안언어 모델접근 제어보안 기법PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 2일Oleksandr Hrabar 외 5명

OreProof: 제로지식 증명을 활용한 주요광물 공급망의 검증 가능한 추적성

광물 공급망에서 검증 가능성과 정보 공개 간의 갈등을 해결하기 위해 OreProof라는 프로토타입 추적성 플랫폼을 제안한다. OreProof는 제로지식 증명을 활용해 선택적 공개를 가능하게 하며, 기존의 투명성 기준 대비 기밀 속성의 유추 가능성을 4개 중 3개에서 0개로 감소시켰다.

이 연구는 주요광물 공급망에서 정보 보호와 검증 가능성의 균형을 유지하는 기술적 접근법을 제시하여, 공급망 보안 및 정보 관리 실무에 새로운 방안을 제시한다.

제로지식 증명추적성공급망 보안OreProofPDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 2일Simone Gargiulo, Gabriel Kulp

AI 거버넌스를 위한 물리적 부채널을 활용한 작업 식별

NVIDIA H200 GPU의 전력 소모를 분석하여 AI 작업 부하를 식별하는 방법을 제시한다. 97% 정확도로 학습과 추론을 구분할 수 있으며, 4가지 회피 전략 중 3가지에 대해 99% 이상의 탐지 성능을 보인다.

이 연구는 AI 작업 감시를 위한 물리적 부채널 기반의 새로운 접근법을 제시하여, AI 거버넌스 정책 수립에 기여할 수 있다.

AI 거버넌스GPU 작업 식별물리적 부채널AI 학습 감시PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 2일Panduranga Sai Varma Dantuluri, Jyotirmoy Sundi

신뢰 없이도 작동하는 다중 에이전트 LLM 시스템의 권한 위임 보안 분석

다중 에이전트 언어 모델 시스템에서 권한 위임과 런타임 거버넌스의 보안 문제를 실증적으로 분석하고, 4가지 공격 시나리오에 대응하는 권한 부여 브로커를 제안한다. 200,000개의 위조 토큰 중 0개를 수용하고, 평균 1.5개의 행동만 허용하는 등 높은 보안 성능을 보인다.

이 연구는 다중 에이전트 LLM 시스템에서 권한 위임 시 보안을 강화하기 위한 실용적 접근법을 제시하며, 실무에서는 권한 부여 브로커 도입을 고려해야 한다.

LLM권한 위임보안에이전트 시스템PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 2일Chanwoo Bae 외 3명

DUPIN: 학습 기반 공격 포렌식에서 공격 학습이 여전히 필요하다

DUPIN은 대량의 감사 이벤트를 사용하여 비감독 사전 학습을 수행한 후 소수의 라벨이 있는 공격 예제로 미세 조정하는 학습 기반 공격 포렌식 접근법을 제안한다. DUPIN은 최대 38-52일 동안의 감사 로그(총 7.3TB)로 사전 학습하고 4개의 다른 데이터 소스에서 25개의 APT 캠페인에 대해 다양한 기준선과 비교 평가한다.

이 연구는 대량의 감사 로그를 활용한 학습 기반 공격 포렌식 접근법을 제시하여, 소규모 라벨 데이터로도 효과적인 공격 탐지를 가능하게 한다.

공격 포렌식비감독 사전 학습미세 조정APTPDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 2일Amr S. Mohamed 외 7명

산업 사이버보안을 위한 설명 가능한 인공지능(XAI) 기법 검토

산업 사이버보안에서 인공지능(AI)의 불투명한 의사결정이 운영 신뢰와 규정 준수를 어렵게 하므로, 설명 가능한 인공지능(XAI) 기법을 검토하여 투명성과 해석성을 향상시킨다. XAI 기법의 주요 유형과 산업 환경에서의 적용 가능성, 한계를 분석한다.

이 결과로 실무에서는 XAI 도구를 보안 운영 센터(SOC)에 통합하여 AI 기반 위협 탐지의 신뢰도를 높이고 규정 준수를 용이하게 할 수 있다.

설명 가능한 인공지능XAI산업 사이버보안보안 운영 센터PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 2일Xun Wang 외 4명

AgentProv: 도구 사용 정책 탐지 기반의 에이전트 언어 모델 API 감사

에이전트 언어 모델(agentic LLM) API 제공업체의 백본 모델을 감사하기 위해 도구 사용 패턴을 분석하는 새로운 방법 AgentProv를 제안한다. AgentProv는 630개 체크포인트 쌍에서 100%의 탐지 성능을 보이며, 시스템 프롬프트 주입에 따른 오류율은 7% 미만이다.

이 연구는 제공업체가 주장하는 모델과 실제 제공하는 모델이 다른 경우를 감지하는 데 실무적으로 활용될 수 있다.

LLM 감사에이전트 언어 모델도구 사용 정책모델 신원 검증PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 1일Yuna Park 외 5명

운영 상태 변화에 따른 LLM 탈옥 안정성의 취약성

기존 탈옥 공격 평가가 단일 설정에서의 성공률만을 기준으로 하였으나, 실제 사용 환경에서의 다양한 운영 상태 변화가 공격 성공률에 큰 영향을 미친다는 점을 실증했다. 7개 정렬된 모델과 3가지 대표 탈옥 공격을 통해 평가 상태가 아닌 비평가 상태에서 공격 성공률이 최대 56%포인트 증가하는 현상을 관찰하였다.

LLM의 탈옥 공격에 대한 평가 시 단일 운영 상태만을 기준으로 하면 실제 보안 취약성을 과소평가할 수 있으므로, 다양한 운영 상태에서의 평가가 필요하다.

LLM탈옥 공격운영 상태보안 평가PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 1일Sing Team

SingProbe 기술 보고서

대규모 언어 모델(LLM)의 런타임 가드를 위해 내재적 방법인 SingProbe를 제안하고, 토큰 수준에서 질의 의도, 응답 안전성, 환상 위험을 예측한다. SingProbe는 약 2M 파라미터와 0.5% 미만의 추가 오버헤드로 기존 가드레일보다 경쟁적 또는 우수한 성능을 보인다.

SingProbe는 LLM 생성 과정의 실시간 모니터링과 제어를 저비용으로 가능하게 하여, 보안 및 의료 분야에서의 안전한 사용을 촉진할 수 있다.

LLM런타임 가드SingProbe안전성 모니터링PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 1일Fukang Zhu 외 5명

코딩 에이전트의 레포지토리 포이징 취약성에 영향을 미치는 사용자 인보케이션

코딩 에이전트가 타사 레포지토리에서 작업할 때 사용자의 인보케이션 선택이 취약성에 미치는 영향을 분석하고, CIPR이라는 벤치마크를 제안한다. CIPR은 20개 레포지토리, 4가지 작업 유형, 3가지 프롬프트 스타일, 3가지 스킬/규칙 조건을 포함하며, 공격 성공률(ASR)과 에이전트 경고률(AR)을 측정한다.

코딩 에이전트의 취약성은 사용자 설정에 따라 달라지므로, 개발자는 작업 유형과 프롬프트 표현 방식을 신중히 선택해야 한다.

코딩 에이전트(coding agent)레포지토리 포이징(repository poisoning)프롬프트 레벨 구성(PLC)CIPRPDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 1일Shiqian Zhao 외 7명

ECLIPSE: 자가 진화하는 은밀한 프롬프트 인젝션 공격(ECLIPSE: Self-Evolving Stealthy Prompt Injection Attack against Long-Horizon Agentic Systems)

LLM 에이전트가 장기적 작업을 수행하는 시스템에 대해, 기존 프롬프트 인젝션 공격의 한계를 극복한 ECLIPSE 공격 기법을 제안하고, 이 기법이 기존 방어 기법을 우회하는 높은 공격 성공률을 보인다. ECLIPSE는 방어 없이 96.7%, 일반적인 안전 필터 하에서 69.2%의 공격 성공률을 달성한다.

이 연구는 LLM 에이전트 시스템의 보안 취약성을 드러내며, 기존 방어 기법의 한계를 보여주어 보다 효과적인 방어 기법 개발이 필요하다.

프롬프트 인젝션(prompt injection)LLM 에이전트ECLIPSE장기적 작업PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 1일Yizhe Zeng 외 9명

LLM 백도어 방어가 분산된 이유: 희소 오토인코더를 활용한 특징 수준 분석

LLM 백도어 공격 방어 기법이 분산된 이유를 희소 오토인코더(SAE)를 사용한 특징 수준 분석을 통해 밝혔다. 실험 결과, SAE 기반 분석을 통해 정상 작업 성능을 유지하면서 ASR을 최대 10.8%까지 감소시켰다.

이 연구는 LLM 백도어 방어 기법의 분산 원인을 설명하고, 해석 가능한 방어 전략을 제시하여 실무에서 보안 설계에 활용할 수 있다.

LLM백도어희소 오토인코더방어 기법PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 1일Lifei Liu, Haoran Yu

다중 에이전트 AI 시스템에서 출력물과 위임 계보 인증

다중 에이전트 시스템에서 독립적으로 운영되는 배포자 간의 작업 위임을 인증하기 위한 두 단계 인증 설계를 제안한다. Apple M1 Pro에서 계보 확인은 24.3-499.2us, AWS 클라우드에서 1,000개 경로가 검증되는 결과를 얻었다.

이 연구는 다중 에이전트 AI 시스템에서 위임 인증을 강화하는 기술로, 실무에서 위임 흐름의 보안성을 확보하는 데 활용될 수 있다.

AI 보안다중 에이전트 시스템인증동적 위임PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 1일Chuanchao Zang 외 8명

LLM 에이전트에서 도구를 통한 지식 추출(ToolSiphon)

LLM 에이전트가 도구를 사용할 때 노출된 지식을 추출하는 공격 기법인 ToolSiphon을 제안한다. 평가 결과, 74.3%의 원본 기록을 복원할 수 있었다.

LLM 에이전트가 도구를 사용할 때 지식 유출 위험이 있으며, ToolSiphon을 통해 이를 확인할 수 있다.

LLM 에이전트지식 추출ToolSiphon보안 위험PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 1일Chen Xiong 외 4명

SIR: 컴퓨트 사용 에이전트의 자기 개선형 레드팀 공격

컴퓨터 사용 에이전트(CUAs)는 인젝션 공격에 취약하다. SIR은 적응적 공격을 시뮬레이션하여 공격 성공률을 4%에서 24%, 0%에서 28%로 높였다.

CUAs를 사용하는 실무자는 SIR을 통해 보안 취약점을 사전에 확인하고 대응 전략을 수립해야 한다.

AI 보안프롬프트 인젝션레드팀 공격컴퓨터 사용 에이전트PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 1일Chuanchao Zang 외 8명

LLM 에이전트 메모리의 단계별 유틸리티-위험 교환 이해

LLM 에이전트 메모리의 단계별 유틸리티-위험 교환을 이해하기 위해 MemGauge라는 제어 가능한 프레임워크를 제시한다. 11개 LLM과 두 개의 장기 메모리 벤치마크에서 단계별 평가를 통해 3가지 구별된 프로파일을 밝혀냈다.

이 결과는 LLM 에이전트 메모리의 단계별 평가와 제어가 필요하다는 것을 시사한다.

LLM 에이전트메모리유틸리티-위험 교환MemGaugePDF 있음

본 페이지의 연구 요약은 공개된 초록을 AI가 한국어로 정리한 것으로, 원문과 차이가 있을 수 있습니다. 정확한 내용은 반드시 원문을 확인하십시오. 본문과 PDF는 제공하지 않으며, 모든 저작권은 각 저자와 발행처에 있습니다.