질의만으로 LLM 소유권 증명하는 SimPrint 기법 제안

2분 LLM워터마킹AI보안모델소유권
최근 30일 조회수 — 좋아요 —

핵심 요약

연구진이 가중치 접근 없이 입출력 질의만으로 미세조정·병합된 LLM의 원 소유권을 검증하는 SimPrint 기법을 제안했다.

오픈웨이트 대형언어모델(LLM)을 내려받아 미세조정하거나 다른 모델과 합친 뒤 자신의 API 뒤에 숨기면, 원 소유자가 이를 증명하기가 사실상 불가능했다. 연구진이 이 문제를 풀기 위해 모델 가중치나 내부 활성값에 접근하지 않고도 입출력 질의만으로 소유권을 확인하는 기법 SimPrint를 제안했다.1

기존 블랙박스 워터마킹은 대개 비밀 질문-답변 쌍을 모델에 심어두고, 나중에 같은 질문을 던져 정해진 답이 그대로 나오는지 확인하는 방식이었다. 문제는 이 방식이 너무 쉽게 깨진다는 점이다. 미세조정, 프루닝(pruning), 양자화, 다른 모델과의 병합, 심지어 서빙 단계에서 프롬프트 형식만 바꿔도 심어둔 정답이 흐트러지면서 워터마크 자체가 사라져 버린다. 정답 하나하나가 독립된 고정값이라 일부만 손상돼도 검증 전체가 실패하는 구조적 약점이 있었다.

SimPrint는 이 취약점을 정보 인코딩 방식으로 우회한다. 소유자 서명을 하나의 정답에 담는 대신, 이진 질의응답(binary question-answering) 형태의 자연스러운 프로브 여러 개에 걸쳐 코드화된 시맨틱 핑거프린트로 분산시킨다. 이후 모델을 삽입할 때는 원래 모델의 기존 답변 분포와 다르게 반응하는 프로브들만 골라, 원본 동작을 최대한 건드리지 않는 저간섭 배치 업데이트(low-interference batch update)로 심는다. 검증 시에는 의심 대상 모델의 응답들을 신뢰 가능한 비트 또는 소거(erasure)로 파싱한 뒤, 오류정정(error-correcting) 복구 메커니즘으로 서명을 재구성한다. 즉 응답 일부가 손상되거나 사라져도, 남은 비트로 전체 서명을 복원할 수 있는 구조다.

연구진은 세 개의 오픈웨이트 LLM을 대상으로 실험했고, 원본 상태는 물론 미세조정·프루닝·양자화·모델 병합·서빙 단계 변형을 가한 상태에서도 SimPrint가 소유자 서명을 안정적으로 복구했다고 보고했다. 또한 이런 워터마크 삽입이 모델의 다운스트림 성능을 크게 떨어뜨리지 않았다고 밝혔다. 이는 워터마크를 견고하게 심으면서도 모델의 실사용 품질은 유지했다는 뜻이다.

다만 이 결과는 논문 저자들의 자체 실험이며, 제3자의 독립적인 검증이나 공격자 관점의 회피 시도에 대한 평가는 아직 제시되지 않았다. 논문은 2026년 9월 21일 arXiv에 게재됐으며, 코드나 데이터 공개 여부는 초록만으로는 확인되지 않는다.

Footnotes

  1. arXiv (cs.CR), “From Bits to Beliefs: Recoverable Semantic Fingerprints for Black-Box Verification of Large Language Models” ↩

읽기 목록은 이 브라우저에 저장됩니다.

출처

  1. From Bits to Beliefs: Recoverable Semantic Fingerprints for Black-Box Verification of Large Language Models — arXiv (cs.CR)

이 글은 위 출처를 근거로 자동 생성된 뒤 발행됐습니다. 원문을 함께 확인해 주세요. 교차 보도 없이 단독 출처로 작성됐습니다.