AI 에이전트 간 제로지식 예측 증명: 측정된, 프로토콜 간 게이트웨이와 소스 무결성 간극
AI 에이전트 간 데이터 공유 시 민감 정보 누출을 방지하기 위해 제로지식 증명 기반의 게이트웨이를 구현하고, GDPR 데이터 최소화 원칙을 기술적 조치로 구현했다. 6.2ms의 증명 시간과 1.0ms의 검증 시간을 기록했다.
AI 에이전트 간 민감 정보 공유 시 제로지식 증명을 활용해 데이터 누출을 사전에 방지할 수 있다.
AI 에이전트 간 데이터 공유 시 민감 정보 누출을 방지하기 위해 제로지식 증명 기반의 게이트웨이를 구현하고, GDPR 데이터 최소화 원칙을 기술적 조치로 구현했다. 6.2ms의 증명 시간과 1.0ms의 검증 시간을 기록했다.
AI 에이전트 간 민감 정보 공유 시 제로지식 증명을 활용해 데이터 누출을 사전에 방지할 수 있다.
LLM 에이전트가 외부 스킬의 출력을 실행 컨텍스트에 삽입하는 방식을 통해 공격자가 제어하는 데이터가 후속 권한 있는 작업에 영향을 미치는 문제를 해결하기 위해 SkillGuard라는 새로운 방어 기법을 제안한다. SkillGuard는 오염 발생 시 이진, 분수, 분수 흐름 전략을 사용하여 능력 제한을 계산하여 공격 성공률을 4.8%와 14.3%로 줄인다.
이 연구는 LLM 에이전트의 보안을 강화하기 위한 실용적인 방어 기법을 제시하여, AI 보안 분야의 실무자들에게 중요한 참고 자료가 될 수 있다.
시스템 수준 모바일 에이전트가 고정된 스크립트에서 벗어나 동적 UI를 탐색하고 복잡한 작업을 수행할 수 있도록 진화하고 있다. ActReal은 진짜 터치 궤적과 물리 기반 IMU 신호를 생성하여 기존 탐지 방식을 우회하는 공격 프레임워크이다.
ActReal을 통해 모바일 자동화 탐지 기술의 한계를 인식하고, 시스템 수준의 보안 강화가 필요하다.
현재 최신 인플루언스 기반 가드레일은 외부 도구 정보에 의존하는 정당한 사용과 악의적인 사용을 구분하지 못한다는 한계를 분석하고, 이를 보완하기 위한 새로운 접근법을 제안한다. 실험 결과, 사용자 권한이 있는 경우와 없는 경우의 평균 점수 변화가 실제 권한 변화보다 더 크며, 새로운 접근법으로 공격 성공률은 0%로 낮아지고 유틸리티는 28%로 유지된다.
이 연구는 인플루언스 기반 가드레일의 한계를 드러내고, 도구 사용을 정당한지 판단하는 새로운 접근법을 제시하여 AI 에이전트 보안 설계에 실질적인 개선을 제공한다.
JIT 컴파일을 사용하는 클라우드 기반 LLM 서비스의 호스트 측 제어 플레인을 타겟으로 하는 새로운 bit-flip 공격 기법 JITterFlip을 제안한다. JITterFlip은 PPL 비율 15.45~2.48×10⁶배, 지연 증폭 2.03~181.90배의 공격 효과를 보인다.
JIT 컴파일 기반 LLM 서비스는 CPU 측 제어 플레인의 취약점을 공격받을 수 있으므로, 해당 제어 플레인 보안 강화가 필요하다.
하드-라벨 블랙박스 텍스트 공격에서 공격 성공률과 퍼트رب레이션을 균형 있게 조정하는 공격자 시퀀스 최적화 방법을 제안한다. 여러 데이터셋과 대상 모델, 대형 언어 모델에서 실험한 결과, 기존 단일 공격 기반의 강력한 기준 모델과 수동적으로 구성된 체인을 꾸준히 초과하는 성능을 보인다.
텍스트 기반 블랙박스 공격 시 공격자 시퀀스 최적화를 통해 공격 성능을 향상시킬 수 있다.
보안 인증에서 시각 환경적 위험 인식 능력을 평가하는 새로운 벤치마크인 SpatialTrust를 제안한다. SpatialTrust는 민감 요인 탐지, 직접/간접 요인 식별 및 설명 능력을 평가하며, 현재 MLLMs가 간접 위험을 이해하고 설명하는 데 어려움을 겪는다는 것을 보인다.
이 연구는 보안 인증에서 MLLMs의 환경적 위험 인식 능력 향상을 위한 벤치마크와 추론 방법 개발의 필요성을 강조한다.
벤치마크 오염을 기존 완화책별로 분류하는 새로운 체계를 제안하고, 평가 프로토콜과 실증 결과를 제시한다. 41개 문서에 대한 측정에서 변수별 내부일치도가 0.00~0.35로 나타났으며, 일부 항목은 기준 이하인 것으로 드러났다.
벤치마크 오염 분류체계를 활용해 연구 공개 수준을 체계적으로 평가할 수 있으며, 이는 모델 평가의 신뢰도를 높이는 데 기여할 수 있다.
AI 에이전트의 체크포인트 및 롤백 기술의 보안 문제를 체계적으로 분석하고, 5가지 핵심 실패 모드를 제시한다. 헤르메스, 클라인, 랭그래프에서 실제 공격을 통해 악성코드 검증 우회, 비인가 이메일 전달, 이중 결제를 보인다.
AI 에이전트 시스템의 체크포인트 및 롤백 기술은 보안 취약점이 존재하므로, 실행 연속성 관리 시 주의가 필요하다.
3D Gaussian Splatting(3DGS)에 공격을 적용하는 새로운 입력 트리거 방식의 백도어 기법인 GhostSplat을 제안한다. 실험 결과, 최대 96%와 100%의 공격 성공률을 달성하면서 JPEG, 블러, 리샘플링 공격에 견디는 것을 보였다.
이 연구는 공유된 3D 생성 모델에 지속적인 조작을 유발할 수 있는 새로운 백도어 공격 방식을 제시하여, 공격자들이 공유된 생성 모델을 악용할 수 있는 잠재적 위험성을 드러냅니다.
LLM 워터마킹 기법의 한계를 분석하고, 스파스 Mixture-of-Experts(MoE) 모델의 구조적 특성을 활용한 새로운 텍스트 프로바네이스 방법인 Watermarking of Experts(WoE)를 제안한다. 8개의 MoE 모델에서 평가한 결과, 1%의 거짓 긍정률에서 평균 90.1%의 진짜 긍정률을 달성했으며, 최대 94.9%에 달했다.
WoE는 도난당한 모델 가중치나 유출된 체크포인트로 생성된 텍스트를 추적할 수 있는 새로운 워터마킹 방법으로, 악의적인 행위자에게 추가적인 모델 적응이나 텍스트 재작성 작업을 요구한다.
대규모 언어 모델(LLM)이 음성 대 텍스트 요청에 따라 보호적 개입이 달라지는지 실험했다. 음성 인터페이스에서 보호 행동이 줄어드는 경향을 관찰했으며, 응답 길이와 무관하게 나타났다.
LLM의 보호적 개입이 요청 수신 방식에 따라 달라질 수 있으므로, 보호 정책 설계 시 인터페이스 차이를 고려해야 한다.
LLM 시대의 언어 스테가노그래피 분야를 체계적으로 정리하고, 148개의 방법, 60개의 대응책, 23개의 평가 지표, 9개의 개방적 과제를 분류하고 분석한다. LLM 시대의 5가지 패러다임 변화를 식별한다.
이 서베이를 통해 실무자는 LLM 시대의 언어 스테가노그래피 기술 동향과 주요 과제를 파악할 수 있다.
연방 학습(FL)에서 악의적인 클라이언트에 대한 취약성을 개선하기 위해 CARVY-FL이라는 새로운 방어 기법을 제안한다. MNIST와 Fashion-MNIST에서 FLCert보다 높은 인증 정확도(CA)를 보였다.
CARVY-FL은 연방 학습 환경에서 악성 클라이언트의 영향을 줄이는 데 실무적으로 활용될 수 있다.
확산 모델의 지적 재산권 보호를 위해 훈련 시간에 워터마크를 삽입하는 기존 방법의 한계를 극복한 새로운 소유권 검증 프레임워크를 제안한다. MiO는 ROC-AUC와 true-positive rate 지표에서 성능을 보인다.
이 연구는 확산 모델의 지적 재산권 보호를 위한 실용적인 방안을 제시하여, 모델 도용 방지를 위한 실무 전략에 기여할 수 있다.
SQL 인젝션 공격 탐지를 위해 DistilBERT-Stacked 앙상블 파이프라인을 설계하고 최적화하여 탐지 효율과 견고함을 향상시켰다. 최적화된 앙상블은 정확도 99.81%를 달성했으며, 단일 모델 대비 140배 빠른 추론 속도를 기록했다.
이 연구는 실시간 SQL 인젝션 탐지에 적합한 고정확도, 고속도의 방화벽 구축 방법을 제시한다.
BERT와 그래프 신경망(GNN)을 결합한 하이브리드 모델을 설계하여 SQL 인젝션 공격 탐지 정확도를 향상시켰다. 99.67% 정확도, 99.71% 정밀도, 99.39% 재현율, 99.55% F1 점수를 달성했다.
BERT-GNN 하이브리드 모델은 웹 애플리케이션 방화벽의 SQL 인젝션 탐지 성능을 현저히 향상시킬 수 있다.
다크넷 환경에서 자주 사용되는 자바스크립트 없는 CAPTCHA를 대형 언어 모델(LLM)로 해결하는 방법을 연구하고, 정확도 90% 이상의 하이브리드 프레임워크를 제안한다. 실험 결과, LLM과 전통적 컴퓨터 비전 기법을 결합한 시스템이 90% 이상의 성공률을 보였다.
이 연구는 LLM과 전통적 컴퓨터 비전 기법을 결합한 하이브리드 시스템이 CAPTCHA 해결에 효과적임을 보여주어, 보안 설계 시 이러한 결합 방식을 고려해야 한다는 시사점을 제공한다.
LLM 에이전트가 시스템 프롬프트, 사용자, 메모리, 도구에서 온 지시를 조정하지만, 이 조정이 신뢰 경계를 강제하지 못한다는 것을 보인다. 46개 모델 엔드포인트에서 평균 실행률은 1.21%이며, 외부 참조 모니터를 통해 위조된 요청을 확정적으로 거부하는 방어 기법을 제안한다.
LLM 에이전트의 자체 조정은 보안 경계로 간주할 수 없으며, 외부 강제가 필요하다.
LLM 기반 에이전트가 보안 작업을 자동화하는 방식을 체계적으로 검토하고, 기술적 접근, 응용 분야, 평가 방법을 분석했다. 2023~2026년 동안의 동료 평가 논문을 대상으로 했다.
이 연구는 LLM 기반 에이전트의 보안 자동화에 대한 체계적 이해를 제공하여, 실무에서의 적용 범위와 한계를 파악하는 데 도움이 된다.
긴 문맥에서의 프롬프트 인젝션 공격과 방어를 평가하기 위해 LongPIBench라는 새로운 벤치마크를 제안한다. 평가 결과, 기존 방어 기법이 긴 문맥에서 높은 성공률로 우회되는 것으로 나타났다.
긴 문맥 환경에서 기존 프롬트 인젝션 방어 기법의 효과가 크게 떨어진다는 점을 실무에서 고려해야 한다.
본 페이지의 연구 요약은 공개된 초록을 AI가 한국어로 정리한 것으로, 원문과 차이가 있을 수 있습니다. 정확한 내용은 반드시 원문을 확인하십시오. 본문과 PDF는 제공하지 않으며, 모든 저작권은 각 저자와 발행처에 있습니다.