RESEARCH

연구·리포트 참고 자료

이번 주 연구최근 7200편 · 출처 5
320Updated 2일 전
arXivAI 보안 · 프리프린트 · 2026년 9월 3일Ziwei Zhao 외 4명

Skill-as-API: 기밀 유지 멀티에이전트 협업을 위한 프로토콜

AI 코딩 에이전트가 협업할 때 기밀 정보를 보호하기 위해 Skill-as-API라는 새로운 프로토콜을 제안한다. 이 프로토콜은 기술의 본문을 전달하지 않고 이름, 설명, 입력/출력 스키마만 공개하며, 1.8-2.9초의 대륙 간 재접속 지연 시간을 보인다.

AI 에이전트 협업 시 기밀 정보 유출을 방지할 수 있는 프로토콜을 개발하여 실무에서 적용할 수 있다.

AI 에이전트프로토콜기밀 유지Skill-as-APIPDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 3일Safayat Bin Hakim, Houbing Herbert Song

매처에 의한 순위: 위협 보고서에서 지식 그래프 추출의 재현 가능성 감사

보안 팀과 연구자들이 위협 보고서에서 지식 그래프 추출 도구를 선택할 때 발표된 triple-F1 점수에 의존하지만, 이 점수는 예측된 트리플이 금색 주석과 어떻게 매칭되는지에 따라 달라진다. 12개 시스템 중 5개만이 발표된 매칭 규칙을 재구현할 수 있었고, 10개 시스템 출력을 공유 문서에서 8개 프로토콜로 다시 점수화하면 45개 쌍 중 11개의 순위가 뒤바뀐다.

이 연구는 보안 팀이 위협 보고서에서 추출 도구를 선택할 때 점수 재산정과 매칭 규칙의 영향을 고려해야 함을 시사한다.

지식 그래프 추출재현 가능성triple-F1 점수매칭 규칙PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 3일Prince Jha 외 2명

제한 없이 컨텍스트 추론 공격(Context Inference Attacks)

에이전트 AI 시스템이 민감한 데이터를 추론 시간에 처리할 때 발생하는 개인정보 유출 위험을 분석하고, 기존 방어 기법을 무력화하는 새로운 컨텍스트 추론 공격 기법을 제시한다. 공격 성공률(ASR) 100% 및 AUROC 92.5 등 높은 정량적 성능을 보인다.

에이전트 AI 시스템을 사용하는 기업은 컨텍스트 추론 공격에 대한 보안 대책을 강화해야 한다.

AI 보안컨텍스트 추론 공격프라이버시 유출에이전트 AIPDF 있음
Unit42AI 보안 · 기술 리포트 · 2026년 9월 2일Renzon Cruz 외 2명

AI 지원 사이버 공격: Unit 42 조사 사례

Unit 42는 랜섬웨어 공격에서 인간 공격자가 최첨단 AI를 활용해 기업 네트워크를 자동화된 방식으로 침해한 사례를 분석했다. 공격자는 50개 이상의 MITRE ATT&CK 기술을 10시간 미만으로 집약적으로 수행했으며, 80페이지에 달하는 보안 평가 보고서를 남겼다.

AI 에이전트를 활용한 공격은 기존 방어 전략을 빠르게 무력화할 수 있어, 실무자는 AI 기반의 자동화된 공격 패턴을 감지하고 대응할 수 있는 방안을 마련해야 한다.

AI 에이전트랜섬웨어MITRE ATT&CK자동화 공격
arXivAI 보안 · 프리프린트 · 2026년 9월 2일Xiaofang Yang 외 4명

Defense-as-Skill: 스킬 강화 에이전트를 위한 런타임 가드 스킬 진화

스킬 강화 에이전트에 대한 런타임 보호 기법을 제안하고, SCOPE-R 데이터셋을 구축하여 SkillSonar라는 구현체를 평가했다. ID ASR 0.482→0.104, OOD ASR 0.606→0.115로 감소시켰다.

스킬 강화 에이전트의 런타임 보호를 위해 Defense-as-Skill 패러다임을 채택할 수 있다.

ai-security런타임 보호스킬 강화 에이전트Defense-as-SkillPDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 2일Yitong Guo 외 4명

안전 라우팅이 붕괴될 때: 올바른 조정의 취약성 이해

대형 언어 모델(LLM)의 안전 정렬이 올바른 미세 조정으로 인해 심각하게 약화되는 이유를 연구했다. 100개의 올바른 미세 조정 예시 후, 출력 측 MLP 모듈에서 경로가 선택적으로 재예화되어 비대칭적 취약성이 설명된다.

이 연구는 LLM의 안전 정렬이 어떻게 미세 조정에 의해 약화되는지를 이해하는 데 도움이 된다.

대형 언어 모델안전 정렬미세 조정Fisher-geometricPDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 2일Zichuan Li 외 4명

AI 에이전트 허네스의 컨텍스트 조립 공격

AI 에이전트 허네스의 컨텍스트 조립 설계를 체계적으로 분석하고, 두 가지 새로운 공격 벡터인 MessageRole Context Privilege Escalation(M-CPE)와 Cross-Scope Context Privilege Escalation(X-CPE)를 제시한다. 12개 실제 허네스에서 CPE 공격에 대한 보안 분석을 수행하여 전체 에이전트 침해, 원격 코드 실행, 서비스 거부 등의 결과를 보인다.

AI 에이전트 허네스의 컨텍스트 조립 설계에 대한 보안 검토가 필요하며, M-CPE와 X-CPE 공격에 대한 방어 전략을 수립해야 한다.

AI 에이전트Context Privilege EscalationM-CPEX-CPEPDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 2일Rui Yang 외 9명

중국어 안전 QA 벤치마크 C-SafeQA: 대규모 언어 모델 응답 및 안전 판정기 평가

중국어 해로운 콘텐츠 평가에서 언어적 변이와 적대적 변형이 위험한 의도를 가릴 수 있다는 점을 고려해, 응답 수준의 중국어 안전 평가 벤치마크인 C-SafeQA를 제안한다. C-SafeQA는 538개의 기본 질문과 8,877개의 적대적 질문을 포함하며, 4개의 전체 모델 LLM 배포를 통해 생성된 37,660개의 질문-응답 기록을 안전, 비안전, 논란으로 라벨링한 결과, 기본 질문에서 0.93%~3.35%, 적대적 질문에서 11.68%~30.05%의 비안전 응답률을 보였다.

C-SafeQA 벤치마크를 활용하면 대규모 언어 모델의 안전성 평가와 자동화된 안전 판정기의 정확도를 검증할 수 있다.

대규모 언어 모델안전 평가C-SafeQA적대적 질문PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 2일Hadjer Benkraouda 외 3명

리버시: LLM 리버스 엔지니어링 에이전트 진단 프레임워크

리버스 엔지니어링(RE) 능력을 평가하기 위해 CTF 문제를 사용하지만, 기존 방법은 플래그 획득 여부만 확인한다. 이 논문은 RE 과정의 세 단계에서 LLM RE 에이전트의 성능을 진단하는 Reveree 프레임워크를 제안한다.

이 결과는 LLM 기반 RE 에이전트의 평가 기준을 개선하고, 실제 분석 능력과 기억력의 차이를 구분하는 데 도움이 된다.

LLM리버스 엔지니어링진단 프레임워크CTFPDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 2일Saastha Vasan 외 10명

사이버 위협 지능(CTI) 생성 및 공유를 위한 대규모 언어 모델(LLM) 탐색

연구팀은 CTI 생성 및 공유 과정에서의 주요 문제점을 실증적으로 분석하고, 대규모 언어 모델(LLM)이 이를 어떻게 지원할 수 있는지 탐구했다. 실증 연구에서 LLM은 CTI 생성의 4단계에서 분석가를 지원하지만, 민감 정보 노출 방지, 지표 추출, 표준 TTPs와의 연관성, 공유 포맷 변환 등의 문제를 해결하지 못한다.

이 연구는 CTI 생성 과정의 자동화를 위한 연구 방향을 제시하며, 실무에서 LLM을 도구로 활용할 때 전문가의 감독이 필수적임을 시사한다.

사이버 위협 지능(CTI)대규모 언어 모델(LLM)정보 공유보안 분석PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 2일Muhammad Salman 외 3명

존니가 여전히 스팸 SMS를 받는다: SMS 스팸 탐지의 내구성 평가

SMS 스팸 탐지 시스템의 실제 내구성을 평가하고, 적대적 공격에 대한 취약점을 분석했다. 다중 모델 앙상블을 통해 내구성을 크게 향상시켰다.

실무에서는 스팸 탐지 시스템의 적대적 공격 내구성을 평가하고, 앙상블 방식을 도입해 보호 수준을 높여야 한다.

SMS 스팸 탐지적대적 공격앙상블 방어내구성 평가PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 2일Marta Bistro\'n, Zbigniew Piotrowski

딥 이미지 워터마킹의 강건성 한계: 메커니즘과 용량에 따른 확장 분석

딥 이미지 워터마킹의 강건성 한계를 메커니즘과 용량 확장에 따라 분석했다. 64~16384비트의 페이로드를 측정해 3가지 한계를 확인했다.

워터마킹 시스템 설계 시 페이로드 그리드의 동기화, 인코더-디코더 왜곡 저항, 임베딩 강도 범위를 고려해야 한다.

딥 이미지 워터마킹강건성페이로드 용량디코더 왜곡PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 2일Nikita Oblakov 외 2명

HiveTraceGuard-Pro: 프롬프트 인젝션(prompt injection), 탈옥(jailbreaks), 적대적 오염(adversarial obfuscation)을 위한 컴팩트한 생성형 가드레일

LLM 보안을 위해 생성형 가드레일을 제안하고, 러시아어와 영어로 훈련시켜 다양한 벤치마크에서 성능을 평가했다. 러시아어 세트에서 0.88의 결합 F1 점수와 0.999의 프롬프트 인젝션 재현률을 달성했다.

이 연구는 LLM의 프롬프트 인젝션 탐지를 위한 새로운 생성형 가드레일을 제시하여, 보안 실무자들이 LLM 보안을 강화하는 데 참고할 수 있다.

프롬프트 인젝션탈옥적대적 오염생성형 가드레일PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 2일Chou Jin Chua 외 3명

AKRASIA: 추론 기반 코드 LLM에 대한 은밀한 백도어 공격

이 연구는 추론 기반 코드 LLM에 대한 stealthy backdoor 공격 기법 AKRASIA를 제안한다. AKRASIA는 99.34% 평균 공격 성공률을 기록했으며, 최신 방어 기법을 98.82% 평균 ASR로 우회하고, 80% 설정에서 인간 검사를 회피했다.

이 연구는 코드 생성 LLM에 대한 stealthy 백도어 공격이 가능함을 보여주어, LLM 보안 방어 전략의 재검토가 필요하다.

LLM 보안백도어 공격추론 기반 코드 생성AI 보안PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 2일Michail Takaronis 외 4명

대형 언어 모델(LLM)을 활용한 서비스 지향 사이버 레인지의 보안 요구사항 도출

서비스 지향 사이버 레인지(SOR)의 보안 요구사항 도출을 지원하기 위해 대형 언어 모델(LLM)을 활용한 방법을 제시한다. 다섯 가지 LLM을 사용하여 84개의 보안 요구사항을 생성하고, 전문가 평가를 통해 27개의 종합적 요구사항을 도출하여, 필요성 98.5%, 명확성 87.4%, 완전성 85.2%, 실행 가능성 78.5%, 거부율 0.7%의 높은 수용률을 보였다.

이 연구는 보안 요구사항 도출 과정에서 LLM을 활용할 수 있음을 보여주며, 초기 단계에서의 효율성을 입증하지만, 최종 검토는 여전히 필요하다.

LLM보안 요구사항서비스 지향 사이버 레인지대형 언어 모델PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 2일Kyle Fredrickson

AI 기반 사기 대응 전략

AI 기반 사기의 경제적 영향을 분석하고, 신고율, 신고 집중화, 신고 정확도를 통한 대응 전략을 제시한다. 2020년부터 2025년 사이 미국의 사기 피해 금액은 약 400% 증가했다.

AI 기반 사기의 경제적 영향을 고려한 대응 전략은 사기 수익을 줄이고 비용을 증가시켜 사기 사업 모델의 수익성을 저하시킬 수 있다.

AI 기반 사기사기 대응 전략신고율사기 수익 감소PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 2일Wenhan Chang 외 4명

RISA: 대형 언어 모델에서 거부 조정을 위한 응답 검사 및 선택적 조치

대형 언어 모델(LLM)의 신뢰할 수 있는 거부 행동을 개선하기 위해 추론 시 정렬 기법으로 응답 검사와 선택적 조치를 제안한다. 실험 결과 RISA는 거부 신뢰도를 향상시키면서 모델 유틸리티를 크게 유지하는 것으로 나타났다.

이 연구는 LLM의 거부 조정을 위한 실용적인 솔루션으로, 추론 시 정렬 기법을 활용한 응답 검사 프레임워크를 제공한다.

LLM대형 언어 모델거부 조정추론 시 정렬PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 2일Seongkyu Yang 외 3명

MROP: 딥 JSCC에서의 백도어 공격 방어를 위한 마스크 영역 최적화 정화

이 연구는 딥 JSCC 시스템에서 입력 패치를 이용한 백도어 공격을 방어하기 위해 마스크 영역 최적화 정화(MROP) 기법을 제안한다. 실험 결과, MROP는 공격 성공률(ASR)을 크게 낮추면서 깨끗한 재구성의 최대 신호 대 잡음비(PSNR)를 유지하는 것으로 나타났다.

이 연구는 딥 JSCC 시스템의 보안성을 향상시키기 위해 새로운 방어 기법을 제시하여, 실무에서 해당 시스템을 사용하는 기업이나 연구자들에게 보안 대응 방안을 제공한다.

딥 JSCC백도어 공격MROP보안PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 2일Padmeswari Nandiya 외 4명

NeuroGraph: 설명 가능한 위협 추론을 위한 AI 그래프 기반 신경-기호 프레임워크

공급망 보안에서 위협 분석의 복잡성을 해결하기 위해 그래프 기반 신경-기호 프레임워크를 제안하고, 이는 기존 기반선 대비 추론 정확도를 개선하며 환상 생성을 줄인다. 공개된 CTI 벤치마크를 사용한 실험 평가에서 NeuroGraph는 추론 정확도, 다중 홉 추론, 적대적 변동에 대한鲁棒성을 개선하였다.

이 연구는 공급망 보안 분석에서 설명 가능하고 신뢰할 수 있는 위협 추론을 가능하게 하여 실무자의 결정 과정을 지원할 수 있다.

공급망 보안신경-기호 추론그래프 기반 RAG설명 가능한 AIPDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 2일Rui Yang 외 6명

안전한 에이전트가 함께 실패할 때: 다중 에이전트 LLM 시스템의 보안

다중 에이전트 LLM 시스템(MAS)에서 정보, 상태, 결정, 권한이 주체 경계를 넘나들며 발생하는 보안 문제를 체계적으로 분석하고, 공격 경로와 방어 전략을 제시한다. 197개 연구를 분석하여 6개의 상호작용 인터페이스, 4개의 공격자 위치, 7개의 시스템 수준 위험, 8개의 반복 공격 경로를 정리하고, A-I-R 프레임워크와 5부분 계약 방식의 방어 전략을 제안한다.

다중 에이전트 LLM 시스템의 보안을 평가할 때 상호작용 경로를 종단간으로 추적하고 방어 전략이 해당 경로를 차단하는지 테스트해야 한다.

다중 에이전트 시스템LLM 보안A-I-R 프레임워크상호작용 인터페이스PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 2일Chuanchao Zang 외 7명

LLM 에이전트의 간접 장기 메모리 오염을 위한 전이 가능한 엔드투엔드 최적화

LLM 에이전트의 장기 메모리 오염 공격을 엔드투엔드 최적화 문제로 접근하여, 기존 단계별 최적화의 한계를 극복하는 새로운 공격 기법 PipePoison을 제안한다. 세 가지 에이전트 프레임워크와 네 가지 메모리 메커니즘에서 공격 활용률을 19.1% 포인트 향상시켰으며, 미확인 피해 설정에서도 기존 최고 기준을 16% 포인트 초과했다.

LLM 에이전트의 장기 메모리 보호를 위해 단계별 최적화보다 엔드투엔드 접근을 고려해야 한다.

LLM 에이전트장기 메모리 오염엔드투엔드 최적화공격 기법PDF 있음

본 페이지의 연구 요약은 공개된 초록을 AI가 한국어로 정리한 것으로, 원문과 차이가 있을 수 있습니다. 정확한 내용은 반드시 원문을 확인하십시오. 본문과 PDF는 제공하지 않으며, 모든 저작권은 각 저자와 발행처에 있습니다.