RESEARCH

연구·리포트 참고 자료

이번 주 연구최근 7200편 · 출처 5
329Updated 2일 전
arXivAI 보안 · 프리프린트 · 2026년 9월 7일Emily J. Winokur 외 5명

네피론 기업 시뮬레이션 피싱 데이터셋(Nebulon Enterprise Simulated Threats for Phishing Research)

피싱 이메일을 연구하기 위한 새로운 합성 기업 이메일 데이터셋을 제안한다. 합성 이메일은 다양한 업무 커뮤니케이션 주제를 포함하며, 피싱 신호를 해석할 수 있도록 주석이 달려 있다.

이 데이터셋은 기업 환경에서 피싱 탐지 및 인간 취약성 연구에 활용할 수 있다.

피싱데이터셋기계학습보안PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 7일Jerson Francia 외 3명

설계된 설득(Engineered Persuasion): LLM 생성 피싱 이메일의 개인화된 전제 평가

연구팀은 180명의 미국 성인 근로자를 대상으로 LLM이 생성한 피싱 이메일의 설득력과 개인화 수준 간의 관계를 실험적으로 평가했다. 설득력 평가(0-100)와 클릭 의도 발생률(28% 증가)을 측정했으며, 추가된 세부 정보가 수신자의 역할과 루틴에 맞는 경우 설득력이 높아지는 반면, 오류나 모호한 정보는 의심을 유발하는 것으로 나타났다.

이 연구는 피싱 공격 대응 교육에서 수신자의 업무 맥락에 맞는 개인화 정보를 구분하는 능력을 강화해야 함을 시사한다.

LLM피싱개인화설득력PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 4일Uday Vallabhaneni 외 2명

SENTINEL-RL: 보안 운영 센터에서 LLM 에이전트의 위상적 추론 분산 처리

LLM 에이전트의 문맥 한계와 추론 불확실성을 해결하기 위해, 위상적 추론과 의미적 추론을 분리한 보안 운영 센터(SOC) 아키텍처를 제안한다. 제안된 시스템은 인증 서브그래프를 고정 차원 상태로 요약하고, PPO 정책을 통해 제한된 조사 동작을 매핑하며, LLM 에이전트는 정책 추천을 소비하고 분석가용 서술을 생성한다.

이 연구는 대규모 인증 그래프를 처리하는 LLM 에이전트의 한계를 극복할 수 있는 새로운 SOC 아키텍처를 제시하여, 실무에서 보다 신뢰성 있는 자동화 SOC 운영을 가능하게 한다.

LLM 에이전트보안 운영 센터위상적 추론PPO 정책PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 4일Fabio F. G. Buono

비형식화 정리: 유한 구문 시스템의 기본 한계와 보안 및 AI에 미치는 영향

유한 구문 시스템 S가 일관되고 충분히 표현력이 있으면, S가 자율적으로 생성할 수 없는 정리가 적어도 하나 존재함을 증명한다. 이 결과는 보안 메커니즘, AI 시스템, 형식 검증기, 법적 시스템, 경제 모델 등 모든 유한 구문 시스템에 적용되는 메타정리이다.

이 연구는 보안 및 AI 시스템 설계 시 형식 시스템의 한계를 인식해야 함을 시사한다.

비형식화 정리유한 구문 시스템보안AIPDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 4일Arslan Br\"omme

에이전트 프로세스의 블랙박스: 블록체인 기반 증거로 AI 에이전트 통신, 인간 감독, GRC 감사 지원

AI 에이전트 간의 자율적 상호작용을 감사하기 위한 블록체인 기반 블랙박스 아키텍처를 제안한다. 블록체인에 암호화된 약속을 남겨 에이전트 통신, 인간 승인, 도구 호출 등을 추적할 수 있도록 하며, GRC 감사와 규정 준수를 지원한다.

AI 에이전트 프로세스의 감사 가능성과 규정 준수를 강화하기 위해 블록체인 기반의 증거 모델을 도입해야 한다.

AI 에이전트블록체인감사 가능성GRCPDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 4일Pengxun Li 외 6명

공격자가 조절하는 훅 업데이트를 통한 AI 에이전트 해킹(AI Agent Harnesses)

AI 에이전트 허브(AI agent harnesses)의 라이프사이클 훅(lifecycle hook) 업데이트 경로를 새로운 공격 표면으로 제시하고, HookPry라는 오픈소스 공격 프레임워크를 제안한다. HookPry는 1,000회 종단간 실험에서 평가된 7개 허브 중 92.5% 성공률을 기록했으며, 대표 방어 시스템은 0% 감지율을 보였다.

AI 에이전트 허브의 라이프사이클 훅 업데이트 경로를 보호하는 방어 전략이 필요하다.

AI 에이전트HookPry라이프사이클 훅공격 표면PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 4일Simone Ceppi, Ignacio Sanchez

Flip, Don't Shuffle: 추론 속도에 맞춘 대형 언어 모델 워터마크

대형 언어 모델(LLM)에 새로운 통계적 워터마크 기법인 Stateless Bernoulli Watermarking(SBW)을 제안한다. SBW는 토큰당 독립적인 베르누이 시도를 통해 멤버십을 결정하여, 기존 방법 대비 6000배 이상 빠른 성능을 보인다. 1% 미만의 오버헤드로 끝到끝 생성 벤치마크를 수행했으며, GPU 네이티브 Jenkins 해시를 사용해 null calibration을 1.8배 개선했다.

이 연구는 대형 언어 모델의 워터마크 기술을 추론 속도에 최적화하여 실용성을 높였으며, 기존 방법 대비 높은 성능 향상을 보여준다.

대형 언어 모델워터마크베르누이 시도Jenkins 해시PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 4일Haoyang Li 외 4명

개인화된 LLM 에이전트의 행동으로부터 숨겨진 사용자 모델 추론

개인화된 LLM 에이전트가 메모리에 보관한 정보를 압축된 형태로 변환하여 사용자 모델을 생성하는 방식을 분석하고, 이를 기반으로 UMPeek이라는 블랙박스 공격 기법을 제안한다. UMPeek은 기존 공격 기법보다 벤치마크 및 실제 시스템에서 더 높은 성능을 보이며, 응답 수준의 방어를 무력화할 수 있다.

UMPeek 공격 기법은 개인화된 LLM 에이전트의 보안 취약점을 드러내며, 사용자 모델을 보호하기 위한 새로운 방어 전략이 필요하다.

LLM 에이전트UMPeek사용자 모델 추론블랙박스 공격PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 4일Alexandr Goultiaev Tolstokorov 외 3명

Rent-a-RAG: RAG 시장에서 문서 재사용 감사를 위한 임베딩 공간 워터마크

제3자 RAG 시장에서 문서 재사용을 감사하기 위한 DirBucket이라는 의미 보존 워터마크 기법을 제안한다. DirBucket은 23개 감사 응답에서 모든 비준수를 탐지하며, 사용자 인식 응답 품질을 유지하면서 적대적 후처리를 견딘다.

이 연구는 RAG 기반 시스템에서 문서 재사용을 효과적으로 감사할 수 있는 워터마크 기법을 제시하여, 제3자 제공업체와의 계약 준수를 확인하는 데 유용하다.

RAG워터마크감사임베딩 공간PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 4일Jakub Re\v{s} 외 4명

AlcaTRAz - 탈옥 공격에 대항하는 앵커드 트리-규칙 방어

LLM의 탈옥 공격을 방어하기 위해 입력 텍스트만을 대상으로 모델 가중치나 내부 구조를 수정하지 않는 트리 기반 규칙 방어 기법을 제안한다. 33개 오픈 모델과 22개 탈옥 공격 유형에서 기존 방어 대비 73.4%의 경우 보안 및 기능성 점수가 가장 높았으며, 평균 정상 요청 점수는 0.27포인트 이내로 유지했다.

LLM 탈옥 공격 방어에 트리 기반 규칙 방식을 적용할 수 있으며, 기존 방어 대비 높은 성능을 보여 모델 보호 전략에 활용할 수 있다.

LLM탈옥 공격트리 기반 방어보안PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 4일Syed Ghazanfar Abbas, Dongyan Xu

신뢰해줘, 나는 너의 개발자야: 대규모 언어 모델에서의 자가 발급 인증

대규모 언어 모델(LLM)이 사용자가 자체적으로 설계한 테스트를 통해 신분을 확인하는 요청을 어떻게 처리하는지를 실험적으로 분석했다. 5개 모델 중 Qwen, Mistral, Llama는 기술적 지식을 바탕으로 테스트를 생성하고 평가해 '확인됨'을 반환했다.

대규모 언어 모델이 대화 내에서 자가 발급 인증을 생성하는 것은 보안 취약점으로 작용할 수 있어 외부 보안 구성요소에서 신분을 생성하고 관리해야 한다.

대규모 언어 모델자가 발급 인증대화형 거짓 인증보안 취약점PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 4일Yury Korolev

8억 3천 5백만 주소 규모에서 인구 기반 그래프 스크리닝 및 라벨 없는 이전

블록체인 주소의 컴플라이언스 스크리닝을 위해 다중 체인 거래 그래프에서 주소의 위치를 기반으로 점수를 매기는 시스템을 제안한다. 8억 3천 5백만 주소와 158억 개의 엣지를 포함하는 단일 그래프를 구축하고, 0.8598 / 0.8182 / 0.9967의 재현율을 달성했다.

이 연구는 블록체인 컴플라이언스 스크리닝에서 라벨 없는 체인을 처리할 수 있는 새로운 접근법을 제시하여, 기존 방법의 한계를 극복할 수 있다.

블록체인컴플라이언스 스크리닝그래프 기반 점수라벨 없는 이전PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 4일Jinxi Yu 외 8명

프라이버시 보호를 위한 토폴로지 가이드 안전성 확보: LLM 기반 멀티에이전트 시스템에서의 연방그래프 학습 적용

LLM 기반 멀티에이전트 시스템의 안전성을 보장하기 위해 연방그래프 학습(federated graph learning)을 활용한 FGLGuard 방식을 제안한다. FGLGuard는 각 기관이 자체 라벨 데이터로 학습한 모델 업데이트만 공유함으로써 프라이버시를 보호하면서도, 단일 도메인 가드가 다른 도메인에서 실패하는 문제를 해결한다.

이 연구는 멀티에이전트 시스템에서 프라이버시와 안전성을 동시에 달성할 수 있는 실용적인 방안을 제시하여, 기업 간 협업 환경에서의 LLM 보안 적용에 참고가 될 수 있다.

LLM멀티에이전트 시스템프라이버시 보호연방그래프 학습PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 4일Haozhang Li 외 5명

최적화가 조작이 되었을 때: 생성형 검색의 GEO 공격 방어

생성형 검색 엔진을 악의적인 생성 엔진 최적화(GEO) 공격으로부터 보호하기 위해 GEO Defender라는 방어 기법을 제안한다. GEO Defender를 사용하면 평균 공격 성공률이 50.32%에서 6.20%로 감소한다.

이 연구는 생성형 검색 엔진의 신뢰성을 높이기 위한 방어 기법을 제시하여, 실제 시스템에 적용할 수 있다.

생성형 엔진 최적화GEOLLM 방어공격 방어PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 3일Varun Gadey 외 2명

CodePoisonRAG: 검색 기반 코드 생성에 대한 지식 오염 공격

CodePoisonRAG는 검색 기반 코드 생성(RACG) 시스템에 대한 새로운 지식 오염 공격 기법을 제안한다. 85개의 오염된 아티팩트를 생성하여 0.7%의 코퍼스 오염 비율을 달성했으며, 공격 성공률은 0.80에서 0.93에 달한다.

이 연구는 RACG 시스템이 외부 지식 오염에 취약할 수 있음을 보여주어, 코드 생성 시 외부 자료의 신뢰성을 철저히 검증할 필요가 있음을 시사한다.

CodePoisonRAG지식 오염 공격RACG코드 생성PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 3일Zhiyang Ding 외 4명

ACLE-MCP: 원격 LLM 도구 사용 시 실행 시간 신뢰를 위한 인증된 능력 임대

OAuth만으로는 보장되지 않는 원격 LLM 도구 사용 시 실행 신뢰 문제를 해결하기 위해 ACLE-MCP라는 새로운 아키텍처를 제안한다. 제안된 아키텍처를 구현한 프로토타입을 통해 기존 방식보다 공격을 더 효과적으로 차단하는 것을 보인다.

ACLE-MCP를 도입하면 OAuth 기반 원격 LLM 도구 사용 시 발생할 수 있는 실행 신뢰 공격을 방지할 수 있다.

AI 보안OAuth인증원격 도구 사용PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 3일Mohammad Waquas Usmani 외 2명

기계 학습 기반 재구성 공격에 대한 좌표 암호화 포인트 클라우드 분석

선택적 좌표 암호화 방식의 보안성을 기계 학습 기반 재구성 공격에 대해 평가했다. X 좌표 전체 암호화는 재구성이 어려웠으나, 2X 방식은 인접 좌표를 통해 정확한 재구성이 가능했다.

포인트 클라우드 암호화 시 암호화 단위를 신중히 선택해야 보안성을 확보할 수 있다.

포인트 클라우드선택적 암호화기계 학습재구성 공격PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 3일Jiarui Li 외 7명

스킬 정책의 은밀한 조정: 에이전트 기술(Agentic Skills)을 통한 공격

대규모 언어 모델 에이전트의 재사용 가능한 스킬이 공격에 악용될 수 있는 새로운 공격 기법 SkillShift를 제안한다. SkillShift는 81.33%와 63.33%의 공격자 선호 선택률을 달성하면서 100% 유틸리티 보존률을 유지한다.

이 연구는 대규모 언어 모델 에이전트의 스킬 공급망에서 발생할 수 있는 보안 위험을 실증하고, 스킬 정책의 행동 감사 필요성을 강조한다.

LLM 에이전트스킬 정책정책 조정보안 위험PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 3일Zhongrui Sun 외 6명

LLM 소유권 검증: 의미 구조를 통한 PROSE 기법

LLM의 소유권을 검증하기 위해 의미 구조를 활용한 새로운 블랙박스 지문 기법 PROSE를 제안한다. PROSE는 의미 구조를 내재화하여 모델의 도메인별 결론 조직 방식을 기반으로 소유권을 검증하며, 실험에서 100%의 지문 탐지율을 기록했다.

PROSE는 모델의 내부 구조를 변경하지 않고도 소유권을 검증할 수 있어, LLM 모델의 무단 복제나 재배포를 방지하는 데 실무적으로 활용될 수 있다.

LLM 소유권블랙박스 지문의미 구조PROSEPDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 3일Achilleas Spanos, Ioanna Kantzavelou

기계 학습 기반 침입 탐지 시스템 평가: 모델 효율성의 환상

기계 학습 기반 침입 탐지 시스템의 일반화 능력을 평가하기 위해 차원 수 조정 실험을 수행하였다. 실험 결과 모델이 새로운 공격을 얼마나 효과적으로 탐지하는지를 보여주며, 기계 학습 기반 IDS 연구와 평가 기법의 구조적 약점을 드러냈다.

기계 학습 기반 침입 탐지 시스템의 평가 시 일반화 능력을 고려해야 한다.

기계 학습침입 탐지 시스템모델 평가일반화PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 3일Oguzhan Salman, Kemal Bicakci

에이전트 시대의 CAPTCHA: 경험을 통해 학습하는 풀이 시스템

시각 기반 CAPTCHA 풀이 시스템을 제안하고, 경험을 통해 학습하는 방식으로 정확도를 높인다. 85.4% 전체 정확도와 84.2% 매크로 정확도를 달성했다.

CAPTCHA 운영자는 적응형 풀이 시스템에 대응하기 위해 지속적인 도전문제 개발이 필요하다.

CAPTCHAVLM적응형 풀이 시스템AI 보안PDF 있음

본 페이지의 연구 요약은 공개된 초록을 AI가 한국어로 정리한 것으로, 원문과 차이가 있을 수 있습니다. 정확한 내용은 반드시 원문을 확인하십시오. 본문과 PDF는 제공하지 않으며, 모든 저작권은 각 저자와 발행처에 있습니다.