감금 해제 평가자에 대한 실증적 측정
감금 해제 공격의 성공 여부를 자동 평가하는 다양한 평가자를 비교 분석하였다. JADES가 가장 높은 성능을 보였다.
감금 해제 공격 평가 시 JADES를 사용하는 것이 효과적일 수 있다.
감금 해제 공격의 성공 여부를 자동 평가하는 다양한 평가자를 비교 분석하였다. JADES가 가장 높은 성능을 보였다.
감금 해제 공격 평가 시 JADES를 사용하는 것이 효과적일 수 있다.
PuzzleMask는 기존 LLM 기반 정책 검사를 우회하기 위해 일반 영어 텍스트를 특수하게 구성한 공격 기법이다. 정책 위반 페이로드를 특수하게 구성된 텍스트로 감싸서 탐지 회피를 시도한다.
이 기법은 기존 LLM 기반 정책 검사의 한계를 드러내며, 보다 정교한 프롬프트 분석 기법이 필요하다.
LL-Verifier라는 새로운 자동화된 프레임워크를 제안하여, 대규모 언어 모델과 논리 모델 체커를 결합하여 애플리케이션의 논리 결함을 식별한다. 27개의 IoT 장치 액세스 제어 프로토콜에서 다양한 논리 취약점을 발견했다.
이 연구는 IoT 프로토콜의 논리 결함을 자동으로 탐지할 수 있는 프레임워크를 제시하여, 실무에서 보안 분석의 효율성을 높일 수 있다.
코딩 에이전트의 최종 패치에 워터마크를 삽입하는 기존 방법은 제출된 아티팩트의 출처를 증명하지만, 생성 과정을 인증하지 못한다. TrajMark은 소유권을 강력하게 추적하면서 로컬한 수정을 감지할 수 있는 트레이스 워터마킹 프레임워크로, 3개의 코딩 에이전트 프레임워크와 3개의 LLM에서 정확한 소유자 복원률 100%, 수정 탐지률 95.5%-100%, 수정 사이트 정위치율 95.8%를 보였다.
TrajMark은 코딩 에이전트의 작업 흐름을 보호하고 위조를 탐지하는 데 활용할 수 있으며, 소프트웨어 개발 과정의 무결성을 검증하는 데 유용하다.
Maverick는 행렬-벡터 곱셈 위임 프로토콜을 기반으로 사용자의 입력 비공개성과 추론 결과의 검증성을 보장하는 대형 언어 모델(LLM) 추론 방식이다. Maverick는 17x에서 157x까지의 처리량 향상을 달성했다.
이 연구는 대형 언어 모델 추론 시 사용자의 입력 비공개성과 검증성을 동시에 보장하면서 처리량을 향상시킬 수 있는 새로운 기술을 제시한다.
제로지식 증명(ZK) 시스템에서 신경망 추론을 위한 회로에서 불필요한 검증을 제거하는 자동화된 프레임워크를 제안한다. 회로 제거 후 보안성을 보장하기 위해 전체 회로 추상 해석을 사용하여 대체 증명 경로를 검증한다.
이 연구는 ZK 기반 머신러닝 회로의 성능을 향상시키는 동시에 보안성을 유지하는 방법을 제공하여, ZK 기술을 활용한 애플리케이션 개발에 실질적인 도움을 줄 수 있다.
TEE-Shielded LLM Partition(TSLP) 방식의 보안 경계를 분석하고 공통 원리를 정의하여 공격에 대한 취약점을 밝혔다. Collapse 공격을 통해 ArrowCloak, TSQP, LoRO 등의 TSLP 방식이 취약함을 실증했다.
TSLP 방식의 보안 경계를 이해하고 새로운 공격에 대비하기 위해 O_ext와 같은 확장된 방어 기법을 고려해야 한다.
LLM이 악성코드를 생성하는 것을 방지하는 보호 장치(guardrail)의 효과성을 체계적으로 평가하기 위해 CS-Guard 벤치마크를 제안한다. 텍스트-코드 생성에서 평균 공격 성공률(ASR)은 제약 해제 공격 후 약 50%, 코드-코드 생성에서는 기반 LLM에서 100%에 달한다.
코드 생성 시 보호 장치의 효과가 낮아, 실무에서는 보호 장치를 보완하거나 추가적인 검증 절차를 도입해야 한다.
연구팀은 기존의 directional ablation 공격이 대규모 혼합 전문가(MoE) 모델에서 여전히 효과적임을 보였다. 320B 파라미터 GLM-5.3-Flash 모델에서 74%의 효과가 조인트 인터벤션에만 존재하는 것으로 나타났다.
이 연구는 대규모 MoE 모델의 안전 정렬이 기존 공격에 취약함을 보여주어, 모델 보안 설계 시 새로운 고려가 필요하다.
대규모 언어 모델에서 탈옥 공격을 위해 암호화된 문장을 학습시켜 악의적인 응답을 유도하는 임의 암호 공격을 제시하고, Anthropic, Google, OpenAI의 최첨단 모델에서 성공적으로 작동함을 보였다. 암호화된 악의적 콘텐츠는 기존 해로운 콘텐츠 분류기를 우회할 수 있다.
대규모 언어 모델의 탈옥 공격 방식으로 암호화된 문장을 활용하는 새로운 공격 벡터가 등장하여, 기존 해로운 콘텐츠 필터링 방식의 한계를 드러낸다.
추천 시스템에 대한 기존 시링 공격의 한계를 극복하기 위해 Coordinato가 여러 에이전트를 조정하는 Agentic Group Attack System (AGAS)을 제안한다. AGAS는 다양한 공격 대상에 걸쳐 표적 아이템을 적응적으로 홍보하면서 양성 추천 품질을 유지하고, 기존 탐지기를 약화시키며, 이전 공격보다 더 높은 효율성을 달성한다.
추천 시스템 보안 강화를 위해 적응적 시링 공격에 대응하는 메커니즘을 고려해야 한다.
딥페이크 오디오를 탐지하기 위해 시간적 일관성 분석 프레임워크를 제안한다. CLAP 임베딩을 기반으로 오디오 구간 간 코사인 유사도를 계산하고, 분포에서 통계적 특성을 추출하여 경량 앙상블 분류기를 학습시켰으며, 21개의 통계적 특성이 학습과 실제 배포에서 구분 방향이 뒤바뀌는 현상을 발견했다.
이 연구는 딥페이크 오디오 탐지에 있어 시간적 일관성 분석을 통해 경량화된 방법으로도 높은 성능을 달성할 수 있음을 보여준다.
풀더플렉스 음성 모델에서 사용자의 음성 입력을 수신하면서 응답을 생성하는 과정에서 발생하는 공격 표면을 분석하고, 새로운 공격 기법 DuplexJail을 제안한다. 4개 오픈소스 모델과 720개 해악 요청을 대상으로 실험한 결과, 고정 지연 인터럽션이 PersonaPlex와 PersonaPlex-RL에서 각각 40.3%와 48.7%의 공격 성공률을 보였다.
풀더플렉스 음성 모델의 안전 정렬이 말한 중간 인터럽션에 의해 붕괴될 수 있으므로, 지속적인 상호작용 중 안전성을 평가해야 한다.
연구팀은 agentic AI 프레임워크에 대한 멀티모달 프롬프트 인젝션 공격을 평가하기 위한 MMPIBench 벤치마크를 제안하고, 720회 실험을 통해 공격 성공률이 약 1%이지만 시도율은 12.8%에 달하는 것을 보였다. 공격 시도는 대부분 계획 단계에서 차단되며, 모델 종류에 따라 공격 시도율 차이가 큰 것으로 나타났다.
agentic AI 프레임워크는 멀티모달 입력을 통해 프롬프트 인젝션 공격에 노출될 수 있으므로, 특히 모델 수준의 방어 강화가 필요하다.
자율주행차(AV)의 안전성에 영향을 주는 소프트웨어 취약점을 효과적으로 탐지하기 위해 LLM을 활용한 분석 프레임워크 LLMSec-AV를 제안한다. 18개의 취약점 분류체계를 구축하고, 이를 통해 기존 정적 분석 도구보다 높은 탐지 성능을 보인다.
LLMSec-AV는 자율주행차 소프트웨어의 취약점을 탐지하는 데 LLM을 효과적으로 활용할 수 있음을 보여주어, 실무에서 기존 분석 도구와 병행하여 사용할 수 있다.
RAG 시스템의 견고성을 문서 오염 공격에 대해 측정하여, 일부 검색된 문서가 오염되었을 때 정확도가 77.9%에서 43.5%로 감소함을 보였다. Entity swap 공격이 가장 많은 정답을 뒤바꾸는 것으로 나타났다.
RAG 시스템은 문서 오염 공격에 취약할 수 있으므로, 검색된 문서의 신뢰성을 철저히 검증해야 한다.
이 연구는 컴퓨터 사용 에이전트(CUAs)에 대한 이미지 트리거로 인한 명령 주입 공격을 종단간 평가하는 프레임워크를 제시한다. 실험에서 84.5%의 T-ASR, 47.0%의 TAPR, 20.3%의 E2E-ASR를 달성했으며, 일부 성공 사례에서 에이전트가 악성 터미널 명령을 실행한 후 원래의 선량한 작업을 계속하는 경로를 보였다.
이 연구는 컴퓨터 사용 에이전트의 시각적 입력 취약점을 보여주어, 실무에서는 이러한 공격 방식에 대한 보호 조치를 강화해야 한다.
AI 음성 사기의 예방 방법으로 안전 단어를 제안하고, 사기 수법과 대응 전략을 설명한다. 24%의 미국인이 최근 12개월 내 딥페이크 음성 전화를 받았다고 보고한다.
가족 간 사전에 약속된 안전 단어를 설정함으로써 딥페이크 음성 사기를 효과적으로 예방할 수 있다.
LLM 기반 공격 에이전트가 허니팟을 인식하고 예산을 할당하는 전략을 연구하여, 예산이 제한된 상황에서 효과적인 펜테스트를 수행하는 방법을 제시한다. 허니팟 의심이 생기면 공격을 중단하거나 건너뛰는 정책을 제안하고, 이를 통해 호스트 풀에서 호스트를 침해하는 데 예산을 효과적으로 할당할 수 있음을 보인다.
LLM 기반 공격 에이전트가 허니팟을 인식하는 능력을 고려하여 예산을 동적으로 할당하는 전략을 설계해야 한다.
LLM 에이전트가 소프트웨어 공급망 취약점의 공격 가능성 평가 능력을 평가하기 위한 새로운 벤치마크 VEX-Bench를 제안하고, 75개 실제 사례를 기반으로 9개 모델을 평가했다. GPT-5.5는 이진 분류에서 약 80% F1, 세부 사유 분류에서 70% 이상 macro-F1을 달성했다.
이 연구는 LLM 에이전트가 소프트웨어 공급망 보안 분석에 활용될 수 있음을 보여주며, 실제 취약점 평가 과정에서의 성능 한계를 드러낸다.
포스트-퀀텀 보호는 피어 간 관계에 따라 제공되며, 단일 피어가 이를 제대로 제어할 수 없음을 보인다. 40개 중 40개 에피소드에서 보안 퇴화가 발생함을 실험으로 확인했다.
포스트-퀀텀 보호의 적용 상태를 자동 감지하는 기존 도구는 실패하며, 보안 퇴화를 실시간으로 감지해야 한다.
본 페이지의 연구 요약은 공개된 초록을 AI가 한국어로 정리한 것으로, 원문과 차이가 있을 수 있습니다. 정확한 내용은 반드시 원문을 확인하십시오. 본문과 PDF는 제공하지 않으며, 모든 저작권은 각 저자와 발행처에 있습니다.