컨텍스트가 루트가 되다: LLM 허네스에서의 권한 상승
LLM 에이전트 허네스에서 낮은 수준의 악성 콘텐츠를 높은 권한으로 승격시켜 모델 행동을 조작하는 공격 기법을 제안한다. 6개의 코드 에이전트 허네스에서 13개의 공격 목표를 달성하는 실험을 통해 이 공격의 일반성을 보인다.
이 연구는 LLM 에이전트 허네스의 권한 관리 메커니즘을 재검토하고, 낮은 수준의 입력이 높은 권한으로 승격되는 것을 방지하는 방어 전략을 개발할 필요성을 시사한다.
LLM 에이전트 허네스에서 낮은 수준의 악성 콘텐츠를 높은 권한으로 승격시켜 모델 행동을 조작하는 공격 기법을 제안한다. 6개의 코드 에이전트 허네스에서 13개의 공격 목표를 달성하는 실험을 통해 이 공격의 일반성을 보인다.
이 연구는 LLM 에이전트 허네스의 권한 관리 메커니즘을 재검토하고, 낮은 수준의 입력이 높은 권한으로 승격되는 것을 방지하는 방어 전략을 개발할 필요성을 시사한다.
기존 백도어 공격은 높은 공격 성공률(ASR)을 가정하지만, 저자들은 ASR을 의도적으로 낮추어 방어를 회피할 수 있음을 보인다. 실험을 통해 최신 방어 기법이 저ASR 조건에서 실패함을 확인하였다.
이 연구는 기존 백도어 방어 기법의 한계를 드러내어, ASR 기반의 평가 체계를 재검토할 필요성을 제시한다.
지속적 LLM 에이전트의 보안을 강화하기 위해 SPA라는 새로운 아키텍처를 제안한다. SPA는 정보 흐름 제어를 적용하여 'tool_knowledge' 공격에서 공격 성공률을 0%와 0.2%로 줄였다.
지속적 LLM 에이전트를 사용하는 시스템에서는 SPA와 같은 정보 흐름 제어를 도입해 지속성과 보안의 균형을 유지해야 한다.
웹 트래픽에서 이상을 탐지하기 위해 Transformer 기반 언어 모델을 활용하고, 탐지된 이상에 대한 상세한 설명을 제공하는 방법을 제안한다. 인기 있는 공개 데이터셋에서 라벨링 불일치를 발견함으로써 제안된 설명 기법의 효과성을 보인다.
Transformer 기반 모델을 사용한 웹 이상 탐지 시스템에 설명 기능을 추가하면 데이터 오염 문제를 식별하는 데 도움이 될 수 있다.
자율적 대규모 언어 모델 에이전트의 안전성 보장 방법을 연구하고, 루프 수준에서 지속적인 비감소 안전 상태를 복원하는 LoopHarness를 제안한다. LoopHarness는 매개변수 조건 하에서 비인가된 실행 불가능한 작업 수를 상수로 제한한다.
LoopHarness를 통해 자율적 LLM 에이전트의 안전성을 지속적으로 보장할 수 있다.
LLM 에이전트가 공격자 제어 웹 콘텐츠를 읽는 동안 비밀 정보를 유출할 수 있는 간접 프롬프트 인젝션 공격을 분석하고, 공격 기법과 방어 방법을 제시한다. gpt-4o 모델에서 0%에서 100%까지의 유출률을 보이며, 템플릿 기반 공격이 효과적임을 실험적으로 보인다.
LLM 에이전트의 보안 설계 시 표면적인 정책 조항보다는 목적지 제한 또는 능력 격리를 통한 방어가 필요하다.
이 연구는 사이버와 전자기 전파 영역에서의 이상을 동시에 탐지하기 위해 두 가지 모델을 개발하고 평가했다. 랜덤 포레스트 모델은 F1-score 89.76%, LSTM-Autoencoder 모델은 64.09%를 달성했다.
실무에서는 사이버 및 전자기 전파 신호를 결합한 이상 탐지 모델을 도입해 운영 상황 인식을 강화해야 한다.
LLM이 실행하기 전에 각 행동을 승인하거나 거부하는 에이전트 가드레일의 과도한 안전성 문제를 분석하고, 이를 평가할 수 있는 새로운 벤치마크인 Cautious Bench를 제안한다. Cautious Bench는 756개의 결정 가능한 양호/이중 쌍과 40개의 결정 불가능한 쌍을 포함하며, 5개 디자인에서 6개의 가드레일을 평가하여 '이름 숭배 효과'를 발견했다.
이 연구는 에이전트 가드레일의 과도한 거부 현상을 평가할 수 있는 벤치마크를 제공하여, AI 보안 시스템의 정확한 설계에 기여할 수 있다.
자동화된 LLM 에이전트가 네트워크 접근 가능한 PLC를 지속적인 물리적 영향으로 전환할 수 있는지 평가하기 위해 PLCBENCH라는 새로운 하드웨어-인-더-루프(HIL) 프레임워크를 제안한다. 4개의 상용 PLC와 4개의 폐루프 작업 환경에서 5개의 LLM 가족을 대상으로 240회 실험한 결과, 31.3%의 에피소드가 각각의 물리적 목표를 지속적으로 달성했다.
이 연구는 자동화된 LLM 에이전트가 ICS에 물리적 영향을 미칠 수 있는 잠재력을 평가하는 데 도움이 되며, PLC-프로세스 배포에서 실패 원인을 특정하고 미래 방어 평가의 개입 지점을 식별할 수 있다.
5G 네트워크 침입 탐지에서 전통적 머신러닝 모델(XGBoost, TabNet)과 대형 언어 모델(LLM)의 탐지 성능과 계산 비용을 비교했다. 전통적 모델은 높은 정확도와 낮은 추론 시간을 보였으며, LLM은 성능이 낮고 CPU 사용량이 훨씬 높았다.
5G 네트워크 침입 탐지에는 복잡한 모델보다 전통적 머신러ting 모델이 더 효율적이다.
이 연구는 블랙박스 작업 상호작용을 통해 숨겨진 에이전트 스킬을 유출하는 새로운 공격 기법인 Daydreaming을 제안한다. Daydreaming은 7개 스킬과 4개 피해 모델에서 원래 스킬의 86.8% 기능을 복구하는 데 성공했으며, SigLeak보다 약 4배 우수한 성능을 보였다.
이 연구는 기존 방어만으로는 에이전트 스킬의 기능적 복구를 막을 수 없음을 보여주어, 보다 강력한 보호 전략이 필요하다는 시사점을 제공한다.
TEE 환경에서 대규모 언어 모델의 공격 기법인 SpectralLeak과 LatticeLeak을 제안하고, 이를 극복하기 위한 ButterflyCloak 방어 기법을 설계한다. 12개의 작업 설정에서 87.98% 평균 정확도를 달성했다.
TEE 환경에서 대규모 언어 모델의 보안을 강화하기 위해 새로운 방어 기법을 설계해야 한다.
LLM이 RTL 코드를 생성할 때 명시되지 않은 보안 의무를 어떻게 처리하는지 분석하고, 이를 해결하기 위한 신규 프레임워크 RTL-Obliger를 제안한다. RTL-Obliger는 기능적 의미 그래프를 추출하고 CWE 패턴과 비교해 보안 의무를 보완해 61.6%의 전체 통과율을 달성한다.
LLM으로 RTL 코드를 생성할 때 명시되지 않은 보안 의무를 체계적으로 확인해야 하며, RTL-Obliger와 같은 도구를 활용할 수 있다.
SILK는 RoT 인증 후 발생하는 TOCTOU 취약점을 해결하기 위해 가중치 스트림을 최종 계산 경계에서 인증하는 방식을 제안한다. INT8 기준 CNN에서 최대 0.76 pp, LLM에서 0.17 perplexity의 품질 손실을 보인다.
SILK는 RoT 보호 AI 시스템에서 발생하는 TOCTOU 취약점을 실시간 인증으로 보완할 수 있다.
CTF 벤치마크에서 LLM 에이전트의 플래그 획득 경로를 분석하여 실제 공격과 단순 추측 등을 구분하는 CTF-ABACUS라는 추적 기반 감사 프레임워크를 제안한다. 1,435개의 CTF 시도를 분석한 결과, 추적 검증된 공격이 플래그 회수의 62-87%를 차지하는 것으로 나타났다.
이 결과는 CTF 평가에서 단순히 플래그 회수 수를 세는 방식에서 벗어나, 실제 공격을 검증하는 방식으로 전환할 필요가 있음을 시사한다.
컴퓨터 사용 에이전트(CUA)의 시각 인터페이스와의 안전한 상호작용 능력을 평가하는 ADeptS-Bench 벤치마크를 제안한다. 7개 모델을 평가한 결과, 80% 이상의 작업 성공률과 30% 이하의 공격 성공률을 동시에 달성하는 모델은 없으며, '체크아웃' 버튼 클릭이나 '공장 초기화' 버튼 오인정도를 보인다.
CUA의 안전성과 모호한 지시 처리 능력을 평가하는 ADeptS-Bench를 통해, 실무에서는 에이전트의 신뢰성 검증이 중요하다.
AI는 보안 위협을 변화시키고 있으며, 특히 OSINT(개방 출처 정보 수집)를 통해 개인 및 기업을 대상으로 한 사기 행위를 용이하게 만드는 방법을 분석한다. AI 도구는 공개된 정보를 대규모로 수집하고, 이를 기반으로 사회 공학 스크립트를 설계하여 사기 행위를 확장할 수 있다.
AI 지원 OSINT를 통해 개인 정보가 대규모로 수집되어 사기 행위가 쉬워지고 있으므로, 개인 및 기업은 소셜 미디어 정보 공개를 제한하고 다중 인증을 사용하는 등 보호 조치를 강화해야 한다.
AI를 활용한 RTL 코드 생성 모델에서 발생할 수 있는 백도어 위협을 완화시키기 위해 RTLGuard라는 경량형 교사-학생 방어 기법을 제안한다. 실험 결과, RTLGuard는 공격 성공률(ASR)을 크게 줄이면서 생성된 RTL 코드의 기능적 정확성과 합성 가능성(스inté시즈 가능성)을 유지한다.
RTLGuard는 AI 기반 RTL 코드 생성 과정에서 발생할 수 있는 백도어 위협을 경량한 방식으로 완화할 수 있어, 반도체 설계 공급망 보안에 기여할 수 있다.
LLM 탈옥 공격을 방어하기 위해 공격 전략을 추상화하여 메서드 수준 규칙으로 저장하고 재사용하는 자체 진화하는 방어 프레임워크를 제안한다. 4가지 블랙박스 탈옥 공격 패밀리와 여러 모델에서 공격 성공률을 크게 줄이며, 정상적인 기능을 유지하고 메모리가 확장되더라도 과도한 거부를 증가시키지 않는다.
LLM 탈옥 공격에 대응하는 실시간 적응 방어 기법을 제공하여, 지속적인 공격 진화에 효과적으로 대응할 수 있다.
LLM 코딩 에이전트의 보안 취약점을 해결하기 위해 시스템 프롬프트에 보안 기술을 통합하는 SkillShield를 제안한다. RedCode에서 6개의 대형 언어 모델을 대상으로 실험한 결과, 악성코드 생성의 심각도를 3.37에서 0.58로 줄이고 실행 공격 성공률을 43.6%로 나타냈다.
SkillShield는 LLM 코딩 에이전트의 악성 요청을 방지하는 보안 기술로, 실무에서 즉시 적용 가능한 방어 기법으로 활용될 수 있다.
자가진화하는 LLM 코딩 에이전트가 공유된 스킬 라이브러리에서 악성 스킬을 템플릿으로 사용하여 새로운 악성 스킬을 생성하는 self-poisoning 취약점을 발견하고, 이를 악용하는 EvoMal 공격을 제시한다. 153개의 SWE-bench Verified 작업에서 ASPR(에이전트 자기중독률)은 20.3%에서 41.8%까지이며, 심지어 심도 있는 심도-V4-프로 모델은 11.1%의 ASPR을 보인다.
자가진화 코딩 에이전트의 스킬 라이브러리 관리 시 악성 스킬이 자가복제되는 self-poisoning 공격 가능성에 주의해야 한다.
본 페이지의 연구 요약은 공개된 초록을 AI가 한국어로 정리한 것으로, 원문과 차이가 있을 수 있습니다. 정확한 내용은 반드시 원문을 확인하십시오. 본문과 PDF는 제공하지 않으며, 모든 저작권은 각 저자와 발행처에 있습니다.