LLM 안전 보상 역이용 공격 ReSA 제안

2분 LLMAI 안전ReSA보상 모델
최근 30일 조회수 — 좋아요 —

핵심 요약

모델 응답에서 안전 보상을 복원해 유해 출력을 유도하며 여러 모델로 전이되는 공격 기법이 제안됐다.

대규모 언어 모델(LLM)이 안전하게 답하도록 만드는 보상 신호를 행동만 보고 복원한 뒤, 이를 거꾸로 적용해 유해 출력을 유도하는 공격 기법이 제안됐다. 10월 5일 arXiv에 공개된 논문에서 연구진은 이 공격을 ReSA(Reward Stealing Attack)라고 이름 붙였다. 모델 내부의 원래 보상 모델에 직접 접근하지 않고도 정렬된 모델의 응답만으로 대리 보상 모델을 만든다는 점이 핵심이다.1

LLM 정렬은 바람직한 답변에는 높은 보상을, 위험한 답변에는 낮은 보상을 주는 방식으로 모델의 행동을 조정한다. ReSA는 최대 엔트로피 역강화학습(maximum entropy inverse reinforcement learning)을 이용해 정렬된 모델의 행동에 숨어 있는 안전 보상을 추정한다. 이후 추론 단계에서 복원한 보상의 방향을 뒤집어 적대적 정책을 만들고, 보상 유도 디코딩을 통해 이 정책에 맞는 출력을 생성한다. 안전장치를 우회할 문구를 프롬프트마다 새로 탐색하기보다, 안전 판단의 기준 자체를 공격에 재사용하는 접근이다.

논문이 강조하는 차이는 효율성과 전이성이다. 기존 적대적 공격은 계산 비용이 많이 들거나, 공격을 준비할 때 사용한 모델과 실제 표적 모델이 엄격하게 짝을 이뤄야 해 확장하기 어렵다는 한계가 있었다. 연구진의 실험에서는 한 번 복원한 보상이 여러 프롬프트와 서로 다른 모델에 걸쳐 일반화됐으며, ReSA가 기존 공격보다 공격 효과와 전이성에서 크게 앞섰다. 연구진은 이를 특정 질문이나 단일 모델의 결함이 아니라, 보상을 이용한 정렬 방식에 공통으로 잠재한 취약점으로 해석했다.

다만 공개된 초록에는 실험 대상 모델, 성공률, 비교 기법별 수치가 제시되지 않았다. 따라서 성능 우위의 크기나 상용 비공개 모델에서도 같은 결과가 나오는지는 이 자료만으로 판단할 수 없다. 논문은 코드도 공개했다고 밝혔지만, ReSA의 재현성과 방어 기법의 효과 역시 추가 검증이 필요하다.1

Footnotes

  1. arXiv, 「Reward Stealing Attack on Large Language Models」 ↩ ↩2

읽기 목록은 이 브라우저에 저장됩니다.

출처

  1. Reward Stealing Attack on Large Language Models — arXiv (cs.AI/cs.CL/cs.LG)

이 글은 위 출처를 근거로 자동 생성된 뒤 발행됐습니다. 원문을 함께 확인해 주세요. 교차 보도 없이 단독 출처로 작성됐습니다.