LLM 생성 음식 안전 콘텐츠의 신뢰성 있는 워터마킹 프레임워크
LLM 생성 콘텐츠의 무결성과 추적성을 보호하기 위해 ToSS라는 신뢰할 수 있는 인증 방법을 제안한다. ToSS는 워터마킹 용량과 디코딩 정확도에서 우수한 성능을 보인다.
이 연구는 AI 생성 콘텐츠의 신뢰성 확보를 위해 워터마킹 기법을 개선하는 방안을 제시한다.
LLM 생성 콘텐츠의 무결성과 추적성을 보호하기 위해 ToSS라는 신뢰할 수 있는 인증 방법을 제안한다. ToSS는 워터마킹 용량과 디코딩 정확도에서 우수한 성능을 보인다.
이 연구는 AI 생성 콘텐츠의 신뢰성 확보를 위해 워터마킹 기법을 개선하는 방안을 제시한다.
로컬 호스팅된 대형 언어 모델(LLM)이 생성한 텍스트를 디토크나이제이션 중 CPU 캐시 활동을 관찰하여 재구성하는 새로운 공격 기법을 제시한다. 실제 로컬 LLM 배포에서 의미적으로 정확한 출력을 복원할 수 있음을 보인다.
이 공격 기법은 널리 사용되는 로컬 LLM 제품과 에이전트 프레임워크에 적용 가능한 취약점을 드러내므로, 해당 시스템의 캐시 타이밍 보호를 강화해야 한다.
LLM 공격 메커니즘 40개를 체계적으로 평가하고, 런타임 감사 도구를 설계하여 81.1%의 감지율을 달성했다. 감사 도구는 0.70%의 오류율을 유지하면서 78.1%의 재현율을 보였다.
이 연구는 다양한 LLM 공격 메커니즘에 대한 체계적인 평가와 런타-감사 도구 설계를 제안하여, 실무에서 공격 감지 정확도를 향상시킬 수 있다.
LLM에 대한 jailbreak 공격을 방어하기 위해 의미 재작성과 다중 모델 점수를 결합한 SRD-GUARD 방식을 제안한다. SRD-GUARD는 평균 DSR 91.44%와 100%, ORR 8.00%와 12.00%를 달성한다.
SRD-GUARD는 LLM에 대한 jailbreak 공격을 효과적으로 방어할 수 있는 새로운 방식으로, 실무에서 적용 가능한 방어 기법을 제시한다.
대형 언어 모델의 원천 추적을 위해 BReF라는 새로운 지문 기법을 제안한다. BReF는 22/22 사례에서 기록된 부모 모델을 정확히 검색했으며, DP-DF AUC 1.0000을 달성했다.
이 연구는 대형 언어 모델의 변형 추적 기법을 개선하여 모델의 원천을 정확히 식별하는 데 기여할 수 있다.
보안 운영 센터(SOC)에서 대량의 티켓 처리 과제를 해결하기 위해 생성형 AI 기반 자동화를 설계하고 1년 이상 현장에서 운영한 사례를 보고한다. 분석 결과, 90% 이상의 경우 동반자의 출력이 티켓 종결 보고서에 재사용되었으며, 인간 분석가가 AI 동반자의 행동을 조정할수록 AI 시스템의 출력에 대한 신뢰도가 높아져 생산성이 향상되었다.
SOC에서 생성형 AI 동반자를 현장 작업과 밀접하게 연계하여 설계하면 분석가의 신뢰를 높이고 생산성을 향상시킬 수 있다.
공격 에이전트가 공유 인프라를 통해 조정된 침투를 수행하는 방식을 분석하고, 침투 사건을 효과적으로 억제하기 위한 방안을 제시한다. 평가 설계를 통해 조정된 행동 집합을 식별하고, 침해 결과를 측정한다.
공유 인프라를 통한 조정된 침투를 감지하고 분석하는 새로운 접근법을 실무에 적용할 수 있다.
이 연구는 Generative Engine Optimization(GEO)를 통해 검색 기반 대형 언어 모델 에이전트를 조작하는 계층적 웹 증거 오염 공격을 평가하기 위한 HAE-GEO 벤치마크를 제안한다. 10개의 에이전트를 평가한 결과, 증거 인식이 코로보레이션 트랩에서 악화되고, 에이전트 검색이 최종 저항성을 향상시키지만 증거 인식이나 유틸리티는 개선되지 않는다는 패턴을 발견했다.
이 연구는 검색 기반 대형 언어 모델 에이전트의 취약점을 드러내며, 보다 강력한 방어 전략이 필요함을 시사한다.
기계 학습 기반 네트워크 침입 탐지 시스템(ML-based NIDS)의 적대적 회피 공격에 대한 내성을 평가하고, 공격 탐지 방법을 제안한다. 8개의 적대적 공격, 15개의 탐지 모델, 3개의 방어 전략을 평가하여, 적대적 학습을 적용한 앙상블 모델이 평균 공격 성공률을 0.41에서 0.03으로 줄이고 내성 지수(RI) 0.98을 달성했다.
ML-based NIDS의 적대적 공격 내성을 평가하고, 적대적 학습을 적용한 앙상블 모델을 통해 공격 탐지 성능을 향상시킬 수 있다.
ClosureBound는 에이전트 스킬의 이질적인 의존성 폐쇄에서 권한 이전을 방지하는 참조 모니터를 제안한다. 84,608개 상태와 530,752개 전이를 달성했다.
ClosureBound는 에이전트 스킬의 의존성 관리와 권한 이전 방지를 위한 새로운 보안 기법으로, 실무에서 의존성 폐쇄의 안정성과 효과성을 높일 수 있다.
LLM 에이전트의 보안 노출을 측정하기 위해 실행 구조를 분석하는 새로운 방법을 제안한다. 454개의 주입-싱크 쌍에서 96.9%가 시간적 거리보다 구조적 거리가 더 짧았으며, 평균 갭은 9개의 허프였다.
LLM 에이전트의 보안 분석에서 시간적 거리보다 구조적 거리를 고려하는 것이 중요하다.
LLM 에이전트의 안전성을 향상시키기 위해 EvoSafeHarness라는 새로운 안전 장치 프레임워크를 제안한다. DecodingTrust-Agent에서 평균 공격 성공률을 45.6%에서 10.0%로 줄이며, AgentDojo에서 82.8%의 유틸리티를 0.0% ASR로 달성한다.
EvoSafeHarness는 LLM 에이전트의 안전성과 유틸리티를 동시에 향상시켜, 실제 시스템에 적용할 수 있는 새로운 방안을 제시한다.
LLM 에이전트의 권한 부여 프로세스를 분리하여 공격에 대한 내성을 강화하는 새로운 보안 아키텍처인 KITA를 제안한다. 6개의 시스템 테스트와 암호화 미세 벤치마크를 통해 임계 서명의 정합성과 확장성을 검증한다.
이 연구는 LLM 에이전트가 권한 부여를 분리하여 공격에 대한 내성을 강화하는 새로운 보안 아키텍처를 제안한다.
LLM의 내부 거부 신호를 중독시켜 백박스 편집 제한 해제 공격을 방어하는 새로운 방어 기법을 제안한다. 4개의 오픈 가중치 모델에서 거부율을 16.25%에서 71.75%로 높였다.
이 방어 기법은 LLM의 안전 정렬을 유지하면서 일반적인 성능에 영향을 주지 않아, 실제 시스템에 적용할 수 있는 실용적인 보완책을 제공한다.
ChatGPT의 샌드박스 환경에서 공유 클립보드를 통한 계정 간 데이터 유출 취약점을 분석했다. 특정 조건에서 다른 사용자의 데이터를 접근할 수 있음을 보였다.
ChatGPT 사용자는 샌드박스 기능 사용 시 데이터 유출 위험에 주의해야 한다.
LLM 기반 디컴파일러가 재컴파일 가능성과 실행 가능성에만 집중하는 경향이 있어, 실제 동작 차이를 포착하지 못한다는 점을 보인다. 4.9%의 함수가 재컴파일된 코드에서 동작이 달라지고, 일부 취약점이 출력에서 사라지는 현상이 관찰된다.
LLM 디컴파일러의 재컴파일 가능성은 완전한 동작 보존을 보장하지 않으므로, 보안 분석 시 동작 차이를 확인하는 추가 검증이 필요하다.
LLM 에이전트 시스템에서 보안 컨텍스트가 구성 요소 간 전달 시 손실되는 문제를 해결하기 위해, 보안 컨텍스트 연속성을 보장하는 CONTINUITY 프레임워크를 제안한다. 2,560개의 공격 시나리오에서 해로운 외부 효과가 발생하지 않았으며, 700개의 정상 작업을 완료하고 200개의 모호한 사례를 상향 조정하였다.
이 연구는 LLM 에이전트 시스템의 보안을 강화하기 위해 구성 요소 간 보안 컨텍스트의 일관성을 보장하는 계약 기반 프레임워크를 설계하는 데 실무적 시사점을 제공한다.
본 연구는 콘포멀 예측(Conformal Prediction) 기법을 공격 분석에 적용한 연구이다. 콘포멀 예측은 기존에 방어적 수단으로 사용되었으나, 공격 분석에의 활용은 거의 연구되지 않았다. 연구는 개인정보 보호 머신러닝과 네트워크 트래픽 분석 두 분야에서의 초기 결과를 제시한다.
이 연구는 콘포멀 예측 기법을 공격 분석에 적용함으로써 보안 분야에서의 새로운 응용 가능성을 제시한다.
LLM의 안전성 평가에 사용할 수 있는 새로운 벤치마크인 TIER를 제안한다. 6개 오픈 웨이트 LLM을 대상으로 실험한 결과, 위협 수준에 따라 안전성 행동이 점진적으로 변화함을 보인다.
이 결과는 LLM의 안전성 평가 시 단순한 이진 평가보다 행동 기반의 세분화된 평가가 필요함을 시사한다.
가려진 중국어 SMS 메시지를 효과적으로 분류하기 위해 복원 인식형 계단식 훈련 프레임워크인 ReCAST를 제안한다. 내부적으로 구축한 실제 중국어 SMS 벤치마크에서 ReCAST는 직접 훈련된 기준 모델보다 가려짐 상황에서 분류 성능을 크게 향상시킨다.
이 연구는 실제 운영 환경에서 작동하는 소형 모델로 가려진 SMS 메시지를 효과적으로 분류하는 방법을 제시한다.
LLM 에이전트가 실행 중인 상태에서 특정 정보를 완전히 제거하는 실행 상태 언러닝 방법을 제안한다. 실험 결과, 선택적 재생(selective replay)은 전체 재시작과 구별되지 않으면서 9배 적은 토큰을 재계산한다.
이 연구는 LLM 에이전트에서 정보 삭제 시 잔여 유출을 방지하는 실용적인 접근을 제시한다.
본 페이지의 연구 요약은 공개된 초록을 AI가 한국어로 정리한 것으로, 원문과 차이가 있을 수 있습니다. 정확한 내용은 반드시 원문을 확인하십시오. 본문과 PDF는 제공하지 않으며, 모든 저작권은 각 저자와 발행처에 있습니다.