MeMark: 막대 상태 기반 스파이킹 신경망 워터마킹
스파이킹 신경망(SNN)의 체크포인트 재사용을 위해 출력 헤드가 아닌 내부 막 상태에 워터마크를 삽입하는 MeMark 기법을 제안한다. 20개의 독립 64비트 키가 51/64 검증 규칙을 통과하며, 3만 개의 무작위 키는 통과하지 못하는 결과를 보인다.
SNN 체크포인트의 소유권 증명을 위해 내부 막 상태에 워터마크를 삽입하는 MeMark 기법을 실무에 적용할 수 있다.
스파이킹 신경망(SNN)의 체크포인트 재사용을 위해 출력 헤드가 아닌 내부 막 상태에 워터마크를 삽입하는 MeMark 기법을 제안한다. 20개의 독립 64비트 키가 51/64 검증 규칙을 통과하며, 3만 개의 무작위 키는 통과하지 못하는 결과를 보인다.
SNN 체크포인트의 소유권 증명을 위해 내부 막 상태에 워터마크를 삽입하는 MeMark 기법을 실무에 적용할 수 있다.
LLM 에이전트에서 분산된 보안 위험을 방어하기 위해 경로 수준 보안 증거를 기반으로 행동 생성을 조건부로 하는 ReDiR 방식을 제안한다. ReDiR은 공격 성공률을 8% 이하로 낮추며, 새로운 도메인으로 전이 가능하고 계산 오버헤드가 낮다.
ReDiR은 LLM 에이전트의 다중 턴 공격을 방어하는 실용적인 방안으로, 기존 방어 방식보다 효율적이다.
LLM 보안을 위해 Linux 보안 모듈(LSM)의 개념을 적용한 LMSM 프레임워크를 제안한다. Qwen3-4B 모델에서 LMSM-Checkpoint를 사용하면 HarmBench 공격 성공률이 39.20%에서 3.32%로 감소하고 XSTest 거부율은 2.40%에서 4.40%로 증가한다.
이 연구는 LLM 보안 방안을 표준화하고 확장할 수 있는 새로운 프레임워크를 제시하여, 다양한 보안 모듈을 통합적으로 관리할 수 있게 된다.
대규모 언어 모델(LLM)을 보안 취약점 평가에 통합하면서 발생하는 신뢰성 문제인 'AI slop'을 실증적으로 조사하고, 이를 해결하기 위한 전략을 제시한다. Deductive Coverage Score라는 측정 지표를 제안하고, chain-of-thought 프롬프팅과 도구 사용 에이전트가 이 격차를 줄이는 데 기여하지만 완전히 해소하지 못함을 보인다.
이 연구는 AI 기반 취약점 평가 시스템의 신뢰성을 높이기 위해 수학적 검증 가능성으로 평가 기준을 전환할 필요성을 시사한다.
다중모달 대형 언어 모델(MLLM)의 제이블레이크 취약성 원인을 분석하기 위해 인수를 분리한 벤치마크 MMJailBench를 제안한다. 16개의 오픈소스 및 프로퍼티어리 MLLM을 대상으로 한 대규모 평가에서 제이블레이크 취약성은 해로운 의도, 프롬프트 구성, 시각적 의미, 지시문 전달 방식에 따라 달라지는 것을 확인했다.
이 연구는 MLLM의 제이블레이크 취약성을 세분화하여 평가할 수 있는 벤치마크를 제공하여, 모델 보안 강화에 기여할 수 있다.
권한 부여와 증명을 분리하는 보안 아키텍처를 제안한다. 전체 매개변수의 해시를 계산하여 공개 정보를 최소화하면서 기록을 보장한다.
이 아키텍처는 권한 결정과 정보 공개를 분리하여 보안성을 향상시키며, 실무에서 데이터 최소화 원칙을 구현하는 데 활용할 수 있다.
기존 보안 지침 주입 및 다중 에이전트 피드백 방식의 한계를 분석하고, 기능 정확성과 보안성을 동시에 최적화하는 다중 에이전트 프레임워크 MACGen을 제안한다. CWEval과 BaxBench에서 F&S@1 지표가 평균 19.61pp와 10.57pp 개선되었다.
코드 생성 시 기능 정확성과 보안성을 동시에 고려하는 다중 에이전트 협업 방식을 실무에 도입할 수 있다.
LLM 추론 과정에서 발생하는 물리적 사이드채널 취약점을 분석하고, 레이저 전압 이미징을 사용하여 모델 자산을 추출하는 공격 기법을 제시한다. FPGA 기반 LLM 가속기에서 공격을 수행하여 타겟 자산의 완전한 복원을 보인다.
이 연구는 에지 AI 칩에서 LLM 자산을 물리적 공격으로 추출할 수 있음을 보여주어, 에지 기기의 보안 설계 시 사이드채널 공격에 대한 대비가 필요하다.
RAG 시스템의 보안 취약점을 체계적으로 분류하고, 공격 목적과 방어 전략을 파이프라인별로 정리했다. 정량 결과는 원문 참조.
RAG 시스템을 사용하는 실무자는 공격 범주와 방어 단계를 파악해 보안 설계에 반영해야 한다.
LLM 에이전트가 도구 호출 시 불필요한 개인정보(PSD)를 포함하는 문제를 분석하고, 도구 기능에 필요한 최소한의 데이터만 남기는 중간웨어를 제안한다. 3개 LLM에서 실시간 검증 결과, 개인정보 노출 비용을 81.2~92.0% 줄이며 100%의 작업 유효성을 달성했다.
LLM 에이전트의 도구 호출 시 불필요한 개인정보를 효과적으로 제거하여 실무에서 개인정보 보호를 강화할 수 있다.
LLM 생성 파이썬 코드의 보안 취약점을 실증적으로 분석하고, 프롬프트 구조가 취약점 분포에 미치는 영향을 밝혔다. GPT-4o의 고위험 취약점은 20.8%에서 13.6%로 감소했으나, 저위험 취약점은 32%에서 43.5%로 증가했다.
LLM 개발 지원에서 프롬프트 구조는 보안 제어를 대체할 수 없으며, 강력한 보안 조치가 여전히 필요하다.
시스템 프롬프트를 추출해 재배포하는 행위를 탐지하기 위해 Black-Box Behavioral Fingerprinting (BBF) 기법을 제안하고, 4개 모델 가족, 8개 벤치마크, 288,000개의 응답을 대상으로 실증 연구를 수행했다. 동일 모델 탐지에서 AUC 0.876, 교차 모델 탐지에서 평균 AUC 0.725를 달성했으며, 비적응적 프롬프트 변형에도 견디는 것을 확인했다.
이 연구는 LLM 시스템 프롬프트의 무단 재배포를 탐지하는 실용적인 방법을 제시하여, AI 모델 보호와 관련된 실무에 기여할 수 있다.
GNN 기반 NIDS가 구조적 적대적 공격에 취약하다는 문제를 해결하기 위해 적대적 훈련을 기반으로 방어 프레임워크를 제안한다. CTU-13과 TON-IoT 데이터셋에서 E-GraphSAGE 기반으로 실험한 결과, 정상 그래프에서의 탐지 성능이 우수하고 구조적 공격에 대한 내성이 향상되었다.
GNN 기반 NIDS의 구조적 공격 내성을 향상시키는 방어 전략을 제시하여, 실제 네트워크 보안 시스템의 신뢰도를 높일 수 있다.
MLLMs에 존재하는 백도어를 모델 수준에서 제거하기 위해 RACER라는 프레임워크를 제안한다. RACER는 백도어가 유발하는 내부 표현의 계층별 불일치를 지역별로 정규화하여 36개의 백도어 설정에서 평균 ASR을 1.1%로 줄였다.
RACER는 MLLMs에 숨겨진 백도어를 제거하면서 모델 성능을 유지할 수 있는 방안으로, 모델 수준의 방어 기술을 개선하는 데 기여할 수 있다.
AI 음성 에이전트 허니팟을 통해 수집한 10,211개의 전화 사기 및 스팸 전화를 분석하여, 사기 전화의 운영 방식을 밝혔다. 사기 전화는 평일에 6.6배 더 많고, 30개의 반복 스크립트를 사용하며, 15% 더 많은 대화 턴을 노년층에게 제공한다.
전화 사기는 템플릿화된 운영 방식으로, 노년층을 대상으로 더 적극적으로 접근하는 것으로 나타나, 실무에서는 대상별 대응 전략이 필요하다.
LLM 에이전트에서 프롬프트 인젝션 공격을 방어하기 위해 행동 지침을 지역화하는 Attnlocate 프레임워크를 제안한다. Attnlocate는 0.743의 평균 IoU, 0.956의 평균 AUROC, 0.067의 거짓 양성률에서 0.934의 참 양성률을 달성한다.
이 연구는 LLM 에이전트의 프롬트 인젝션 공격을 실시간으로 감지하고 방어할 수 있는 새로운 기법을 제시하여, AI 보안 분야의 실무에 즉각적으로 적용될 수 있다.
W3C WebMCP 제안에서 브라우저 내 LLM 에이전트가 웹 페이지 도구를 호출하는 방식의 보안 취약점을 분석하고, 신뢰 경계를 강제하는 이중 레이어 아키텍처를 제안한다. 실험 결과, 100%였던 공격 성공률을 0%로 낮추고, 80개 중 78개의 프롬프트 인젝션을 차단하는 것을 보였다.
이 연구는 브라우저 내 LLM 에이전트의 보안 아키텍처 설계에 중요한 기준을 제시하며, 실무에서 프롬프트 인젝션 방어 구조를 구현할 수 있다.
RAGSentinel은 검색 증강 생성(RAG) 시스템의 보안 취약점을 방어하기 위해 훈련 없이 레이블 없이 작동하는 방어 기법을 제안한다. 실험 결과, RAGSentinel은 다양한 질문-답변 데이터셋과 LLM 가족, 중독 공격에서 낮은 공격 성공률을 유지하면서 경쟁력 있는 정확도를 보인다.
RAGSentinel은 적대적 문서를 효과적으로 필터링하여 RAG 시스템의 보안을 향상시킬 수 있어, 실무에서 보안 강화에 활용할 수 있다.
대규모 언어 모델(LLM)의 안전 정렬 문제를 해결하기 위해 NeuronGuard라는 새로운 방어 기법을 제안한다. NeuronGuard는 안전 신호를 더 넓은 뉴런 집합에 재분배함으로써 탈옥 공격과 뉴런 수준 공격에 동시에 강건하게 만든다. 실험 결과, 세 가지 LLM과 여섯 가지 최신 공격 전략을 통해 공격 성공률(ASR)이 거의 0%로 유지되며 작업 정확도를 보존한다.
이 연구는 LLM의 안전 정렬을 강화하는 새로운 방어 기법을 제시하여, 실제 시스템에서의 안전성을 향상시킬 수 있다.
연방 학습 환경에서 감시 영상 이상 탐지를 위한 모델 학습 시, 클라이언트가 서버에 속이기 위해 배후도 공격을 주입할 수 있는 문제를 해결하기 위해 STAIN-FL이라는 새로운 공격 프레임워크를 제안한다. STAIN-FL은 낮은 조도, 실내 환경, 군중 밀도 등 자연스러운 감시 조건을 트리거로 사용하여 정상 정확도를 유지하면서도 특정 조건에서 오분류를 유도한다.
이 연구는 연방 학습 기반 감시 시스템에서 배후도 공격의 지속적 위험성을 보여주며, 특히 저강도 공격이 탐지 회피와 높은 공격 효과를 동시에 달성할 수 있음을 시사한다.
Google이 제시한 AP2 프로토콜의 보안 분석을 수행하고, 48개의 보안 위협을 식별하여 8개의 고위험 위협을 AIVSS 점수로 평가했다. 5개의 아키텍처를 포함한 테스트베드를 구축하고, 8개의 고위험 위협에 대한 증명 개념을 개발했다.
AP2 프로토콜의 보안 취약점을 이해하고, 위협 평가 및 완화 방안을 설계하는 데 이 결과를 활용할 수 있다.
본 페이지의 연구 요약은 공개된 초록을 AI가 한국어로 정리한 것으로, 원문과 차이가 있을 수 있습니다. 정확한 내용은 반드시 원문을 확인하십시오. 본문과 PDF는 제공하지 않으며, 모든 저작권은 각 저자와 발행처에 있습니다.