Claude 전 모델 워터마크 적용, 비공개 대화까지 확대
최근 30일 조회수 — 좋아요 —핵심 요약
Anthropic이 Claude 전 모델에 도입한 워터마크가 비공개 대화까지 적용되며 글쓰기 품질을 훼손한다는 지적이 나온다.
Anthropic이 Claude 전 모델에 워터마크를 적용하기로 하면서, 이 기술이 공개된 글뿐 아니라 사용자만 보는 비공개 대화에도 똑같이 적용된다는 점이 논란이 되고 있다. GeekNews가 정리한 내용에 따르면 이 워터마크는 EU AI 생성 콘텐츠 투명성 행동강령을 지키기 위한 조치로, 200토큰(약 150단어)을 넘는 모든 Claude 응답에 비밀 키로 단어 선택 확률을 조정하는 방식으로 삽입된다.
작동 원리는 눈에 보이지 않는 문자를 끼워 넣는 것이 아니다. 모델이 다음 토큰을 고를 때마다 후보들을 결정론적으로 ‘green’과 ‘red’ 두 목록으로 나누고, green 후보가 조금 더 자주 선택되도록 확률을 기울이는 식이다. red 후보가 아예 배제되지는 않지만, 텍스트가 길어질수록 green 쪽으로 쏠린 통계적 흔적이 뚜렷해져 탐지 신뢰도가 올라간다. 이 흔적을 읽어내려면 생성 시점에 어떤 후보가 어느 목록에 속했는지 아는 비밀 키가 필요한데, 이 키는 Anthropic만 갖고 있다. 사용자나 독자는 특정 문장이 의미와 문체 때문에 선택된 것인지, 워터마크 때문에 선택된 것인지 직접 확인할 방법이 없다.
문제는 이 조정이 “품질에 영향을 주지 않는다”는 Anthropic의 설명과 실제 글쓰기의 성격이 충돌한다는 데 있다. Anthropic은 “The weather today was cold and…” 뒤에 오는 grey와 overcast처럼 의미가 비슷한 후보는 무작위로 골라도 무방하다고 본다. 하지만 “He leaped at the chance”와 “He jumped at the opportunity”가 뜻은 비슷해도 어조와 리듬까지 같지는 않듯, 동의어 사이의 미묘한 차이를 무시하는 전제 자체가 정확한 단어 선택을 중시하는 글쓰기와 어긋난다는 지적이다. 게다가 이 조정은 사용자가 원해서 감수하는 속도·비용·품질 절충이 아니라, 출처 추적이라는 사용자와 무관한 목적을 위해 걸리는 제약이라는 점에서 성격이 다르다.
Google이 Gemini에 적용한 SynthID의 실험도 이 논쟁의 근거로 자주 인용되지만, 한계가 뚜렷하다. Google의 Nature 논문은 약 2,000만 개의 워터마크·비워터마크 응답을 비교해 thumbs-up 비율은 0.01% 높고 thumbs-down 비율은 0.02% 낮았다고 밝혔는데, 두 차이 모두 95% 신뢰구간 안에 있어 통계적으로 유의하지 않다. Google은 이를 근거로 품질 차이가 무시할 수준이라며 SynthID-Text를 정식 배포했지만, thumbs-up/down 같은 거친 평가 지표로는 bananas 대신 pineapple이 선택된 정도의 미묘한 품질 저하를 애초에 잡아내기 어렵다. 통계적으로 유의하지 않다는 결과가 인간이 그 차이를 전혀 느끼지 못한다는 증명은 아니라는 뜻이다.
역설적인 대목은 정직한 사용자일수록 더 불리해진다는 점이다. 자기 글을 AI 산출물처럼 속이려는 사람은 워터마크를 지키지 않는 재작성 도구로 흔적을 지울 수 있다. 실제로 James Padolsey가 만든 Declaude 같은 웹 앱은 AI 특유의 문체를 평범한 산문으로 바꾸면서 복사·붙여넣기 한 번으로 Claude 워터마크까지 제거하는 수단이 될 수 있다. 반면 Claude로 교정·요약·번역만 거친 인간의 글은 도리어 AI 작성물로 의심받을 여지가 생긴다. Padolsey는 자신의 글 “Anthropic’s Weak Watermarks Appease a Weak Law”에서 이 구현이 법이 요구하는 최소 수준보다 광범위하다고 지적한다. 의도적인 대규모 재작성으로는 쉽게 제거되는 흔적을, 정작 무해한 교정이나 보조 작업에까지 남긴다는 것이다.
결국 남는 질문은 검증 가능성이다. Anthropic은 워터마크로 사후에 Claude 생성 가능성을 확인할 수 있다고 밝혔지만, 판별에 쓰이는 키는 Anthropic만 보유하고 판정 자체도 확률적 추정이라 생성 여부를 확정하는 증거는 되지 못한다. 사용자 입장에서는 자신이 읽는 모든 단어가 명료함을 위해 골라진 것인지, 규제 대응을 위해 골라진 것인지 구분할 길이 없는 채로 Claude를 써야 하는 상황이 된 셈이다.
읽기 목록은 이 브라우저에 저장됩니다.
출처
- Claude의 ‘워터마크’가 글쓰기를 왜곡하는 방식 | GeekNews — GeekNews
이 글은 위 출처를 근거로 자동 생성된 뒤 발행됐습니다. 원문을 함께 확인해 주세요.