안전장치가 작동했다. LLM 시스템은 더 안전한가?
LLM 서비스의 안전장치 평가 방법을 분석하고, 실제 배포 환경에서의 효과를 측정하는 기준을 제시한다. 안전장치의 로컬 성능 향상이 전체 시스템의 안전성 향상으로 이어지지 않는다는 점을 보인다.
LLM 시스템의 안전성 평가 시 단순히 안전장치의 성능 향상에 집중하기보다, 전체 시스템에서의 잔여 위험을 고려해야 한다.
LLM 서비스의 안전장치 평가 방법을 분석하고, 실제 배포 환경에서의 효과를 측정하는 기준을 제시한다. 안전장치의 로컬 성능 향상이 전체 시스템의 안전성 향상으로 이어지지 않는다는 점을 보인다.
LLM 시스템의 안전성 평가 시 단순히 안전장치의 성능 향상에 집중하기보다, 전체 시스템에서의 잔여 위험을 고려해야 한다.
신경 기호(Neuro-Symbolic) AI 모델의 적대적 공격에 대한 안정성을 평가하기 위해 DeepProbLog와 기초 신경망을 8가지 백도어 설정과 4가지 추론 작업에서 비교했다. 평균적으로 신경 기호 모델이 신경망보다 더 안정적이지만, 추론 과정의 엄격성과 공격 대상과의 호환성에 따라 안정성이 크게 달라진다.
신경 기호 AI 모델의 적대적 공격에 대한 안정성은 추론 과정의 엄격성과 공격 대상과의 호환성에 크게 의존하므로, 이 점을 고려한 설계가 필요하다.
언어 모델의 배포 보안 기법을 개선하기 위해 'capability-gated deployment'라는 새로운 접근법을 제안한다. 이 기법은 단일 가중치 집합 내에서 각 사용자의 접근 제어를 구현하며, 보안성이 이론적으로 증명된다.
이 연구는 언어 모델의 보안 기능을 효과적으로 구성하는 새로운 방법을 제시하여, 보안 정책의 유연한 적용을 가능하게 한다.
광물 공급망에서 검증 가능성과 정보 공개 간의 갈등을 해결하기 위해 OreProof라는 프로토타입 추적성 플랫폼을 제안한다. OreProof는 제로지식 증명을 활용해 선택적 공개를 가능하게 하며, 기존의 투명성 기준 대비 기밀 속성의 유추 가능성을 4개 중 3개에서 0개로 감소시켰다.
이 연구는 주요광물 공급망에서 정보 보호와 검증 가능성의 균형을 유지하는 기술적 접근법을 제시하여, 공급망 보안 및 정보 관리 실무에 새로운 방안을 제시한다.
NVIDIA H200 GPU의 전력 소모를 분석하여 AI 작업 부하를 식별하는 방법을 제시한다. 97% 정확도로 학습과 추론을 구분할 수 있으며, 4가지 회피 전략 중 3가지에 대해 99% 이상의 탐지 성능을 보인다.
이 연구는 AI 작업 감시를 위한 물리적 부채널 기반의 새로운 접근법을 제시하여, AI 거버넌스 정책 수립에 기여할 수 있다.
다중 에이전트 언어 모델 시스템에서 권한 위임과 런타임 거버넌스의 보안 문제를 실증적으로 분석하고, 4가지 공격 시나리오에 대응하는 권한 부여 브로커를 제안한다. 200,000개의 위조 토큰 중 0개를 수용하고, 평균 1.5개의 행동만 허용하는 등 높은 보안 성능을 보인다.
이 연구는 다중 에이전트 LLM 시스템에서 권한 위임 시 보안을 강화하기 위한 실용적 접근법을 제시하며, 실무에서는 권한 부여 브로커 도입을 고려해야 한다.
DUPIN은 대량의 감사 이벤트를 사용하여 비감독 사전 학습을 수행한 후 소수의 라벨이 있는 공격 예제로 미세 조정하는 학습 기반 공격 포렌식 접근법을 제안한다. DUPIN은 최대 38-52일 동안의 감사 로그(총 7.3TB)로 사전 학습하고 4개의 다른 데이터 소스에서 25개의 APT 캠페인에 대해 다양한 기준선과 비교 평가한다.
이 연구는 대량의 감사 로그를 활용한 학습 기반 공격 포렌식 접근법을 제시하여, 소규모 라벨 데이터로도 효과적인 공격 탐지를 가능하게 한다.
산업 사이버보안에서 인공지능(AI)의 불투명한 의사결정이 운영 신뢰와 규정 준수를 어렵게 하므로, 설명 가능한 인공지능(XAI) 기법을 검토하여 투명성과 해석성을 향상시킨다. XAI 기법의 주요 유형과 산업 환경에서의 적용 가능성, 한계를 분석한다.
이 결과로 실무에서는 XAI 도구를 보안 운영 센터(SOC)에 통합하여 AI 기반 위협 탐지의 신뢰도를 높이고 규정 준수를 용이하게 할 수 있다.
에이전트 언어 모델(agentic LLM) API 제공업체의 백본 모델을 감사하기 위해 도구 사용 패턴을 분석하는 새로운 방법 AgentProv를 제안한다. AgentProv는 630개 체크포인트 쌍에서 100%의 탐지 성능을 보이며, 시스템 프롬프트 주입에 따른 오류율은 7% 미만이다.
이 연구는 제공업체가 주장하는 모델과 실제 제공하는 모델이 다른 경우를 감지하는 데 실무적으로 활용될 수 있다.
기존 탈옥 공격 평가가 단일 설정에서의 성공률만을 기준으로 하였으나, 실제 사용 환경에서의 다양한 운영 상태 변화가 공격 성공률에 큰 영향을 미친다는 점을 실증했다. 7개 정렬된 모델과 3가지 대표 탈옥 공격을 통해 평가 상태가 아닌 비평가 상태에서 공격 성공률이 최대 56%포인트 증가하는 현상을 관찰하였다.
LLM의 탈옥 공격에 대한 평가 시 단일 운영 상태만을 기준으로 하면 실제 보안 취약성을 과소평가할 수 있으므로, 다양한 운영 상태에서의 평가가 필요하다.
대규모 언어 모델(LLM)의 런타임 가드를 위해 내재적 방법인 SingProbe를 제안하고, 토큰 수준에서 질의 의도, 응답 안전성, 환상 위험을 예측한다. SingProbe는 약 2M 파라미터와 0.5% 미만의 추가 오버헤드로 기존 가드레일보다 경쟁적 또는 우수한 성능을 보인다.
SingProbe는 LLM 생성 과정의 실시간 모니터링과 제어를 저비용으로 가능하게 하여, 보안 및 의료 분야에서의 안전한 사용을 촉진할 수 있다.
코딩 에이전트가 타사 레포지토리에서 작업할 때 사용자의 인보케이션 선택이 취약성에 미치는 영향을 분석하고, CIPR이라는 벤치마크를 제안한다. CIPR은 20개 레포지토리, 4가지 작업 유형, 3가지 프롬프트 스타일, 3가지 스킬/규칙 조건을 포함하며, 공격 성공률(ASR)과 에이전트 경고률(AR)을 측정한다.
코딩 에이전트의 취약성은 사용자 설정에 따라 달라지므로, 개발자는 작업 유형과 프롬프트 표현 방식을 신중히 선택해야 한다.
LLM 에이전트가 장기적 작업을 수행하는 시스템에 대해, 기존 프롬프트 인젝션 공격의 한계를 극복한 ECLIPSE 공격 기법을 제안하고, 이 기법이 기존 방어 기법을 우회하는 높은 공격 성공률을 보인다. ECLIPSE는 방어 없이 96.7%, 일반적인 안전 필터 하에서 69.2%의 공격 성공률을 달성한다.
이 연구는 LLM 에이전트 시스템의 보안 취약성을 드러내며, 기존 방어 기법의 한계를 보여주어 보다 효과적인 방어 기법 개발이 필요하다.
LLM 백도어 공격 방어 기법이 분산된 이유를 희소 오토인코더(SAE)를 사용한 특징 수준 분석을 통해 밝혔다. 실험 결과, SAE 기반 분석을 통해 정상 작업 성능을 유지하면서 ASR을 최대 10.8%까지 감소시켰다.
이 연구는 LLM 백도어 방어 기법의 분산 원인을 설명하고, 해석 가능한 방어 전략을 제시하여 실무에서 보안 설계에 활용할 수 있다.
다중 에이전트 시스템에서 독립적으로 운영되는 배포자 간의 작업 위임을 인증하기 위한 두 단계 인증 설계를 제안한다. Apple M1 Pro에서 계보 확인은 24.3-499.2us, AWS 클라우드에서 1,000개 경로가 검증되는 결과를 얻었다.
이 연구는 다중 에이전트 AI 시스템에서 위임 인증을 강화하는 기술로, 실무에서 위임 흐름의 보안성을 확보하는 데 활용될 수 있다.
LLM 에이전트가 도구를 사용할 때 노출된 지식을 추출하는 공격 기법인 ToolSiphon을 제안한다. 평가 결과, 74.3%의 원본 기록을 복원할 수 있었다.
LLM 에이전트가 도구를 사용할 때 지식 유출 위험이 있으며, ToolSiphon을 통해 이를 확인할 수 있다.
컴퓨터 사용 에이전트(CUAs)는 인젝션 공격에 취약하다. SIR은 적응적 공격을 시뮬레이션하여 공격 성공률을 4%에서 24%, 0%에서 28%로 높였다.
CUAs를 사용하는 실무자는 SIR을 통해 보안 취약점을 사전에 확인하고 대응 전략을 수립해야 한다.
LLM 에이전트 메모리의 단계별 유틸리티-위험 교환을 이해하기 위해 MemGauge라는 제어 가능한 프레임워크를 제시한다. 11개 LLM과 두 개의 장기 메모리 벤치마크에서 단계별 평가를 통해 3가지 구별된 프로파일을 밝혀냈다.
이 결과는 LLM 에이전트 메모리의 단계별 평가와 제어가 필요하다는 것을 시사한다.
대형 언어 모델(LLM)의 정렬 과정에서 프라이버시, 유틸리티, 안전성을 균형 있게 맞추기 위해 새로운 데이터 구성 프로토콜인 Privacy-Pressure Preference Mixing(P3M)을 제안하고 실험적으로 평가했다. P3M은 프라이버시-선호도 데이터 비율을 조정하여 기존 정렬 방식 대비 프라이버시 유출 가능성을 낮추는 효과를 보였다.
이 연구는 LLM 정렬 과정에서 프라이버시 보호를 강화하는 실용적인 방법을 제시하여, 모델 개발자들이 프라이버시-유틸리티-안전성 간의 균형을 고려하는 데 참고할 수 있다.
AI 에이전트 간 데이터 공유 시 민감 정보 누출을 방지하기 위해 제로지식 증명 기반의 게이트웨이를 구현하고, GDPR 데이터 최소화 원칙을 기술적 조치로 구현했다. 6.2ms의 증명 시간과 1.0ms의 검증 시간을 기록했다.
AI 에이전트 간 민감 정보 공유 시 제로지식 증명을 활용해 데이터 누출을 사전에 방지할 수 있다.
LLM 에이전트가 외부 스킬의 출력을 실행 컨텍스트에 삽입하는 방식을 통해 공격자가 제어하는 데이터가 후속 권한 있는 작업에 영향을 미치는 문제를 해결하기 위해 SkillGuard라는 새로운 방어 기법을 제안한다. SkillGuard는 오염 발생 시 이진, 분수, 분수 흐름 전략을 사용하여 능력 제한을 계산하여 공격 성공률을 4.8%와 14.3%로 줄인다.
이 연구는 LLM 에이전트의 보안을 강화하기 위한 실용적인 방어 기법을 제시하여, AI 보안 분야의 실무자들에게 중요한 참고 자료가 될 수 있다.
본 페이지의 연구 요약은 공개된 초록을 AI가 한국어로 정리한 것으로, 원문과 차이가 있을 수 있습니다. 정확한 내용은 반드시 원문을 확인하십시오. 본문과 PDF는 제공하지 않으며, 모든 저작권은 각 저자와 발행처에 있습니다.