중국어 안전 QA 벤치마크 C-SafeQA: 대규모 언어 모델 응답 및 안전 판정기 평가
중국어 해로운 콘텐츠 평가에서 언어적 변이와 적대적 변형이 위험한 의도를 가릴 수 있다는 점을 고려해, 응답 수준의 중국어 안전 평가 벤치마크인 C-SafeQA를 제안한다. C-SafeQA는 538개의 기본 질문과 8,877개의 적대적 질문을 포함하며, 4개의 전체 모델 LLM 배포를 통해 생성된 37,660개의 질문-응답 기록을 안전, 비안전, 논란으로 라벨링한 결과, 기본 질문에서 0.93%~3.35%, 적대적 질문에서 11.68%~30.05%의 비안전 응답률을 보였다.
C-SafeQA 벤치마크를 활용하면 대규모 언어 모델의 안전성 평가와 자동화된 안전 판정기의 정확도를 검증할 수 있다.