소형 AI 가드레일, 35B 모델에 근접

2분 레드햇AI 안전가드레일소형 모델
최근 30일 조회수 — 좋아요 —

핵심 요약

레드햇 평가에서 소형 분류기는 인젝션 탐지에, 의사결정 모델은 콘텐츠 안전성에 강점을 보였다.

레드햇(Red Hat) AI 안전팀이 약 2억 매개변수의 소형 모델부터 350억 매개변수 대규모언어모델(LLM)까지 9가지 가드레일 구성을 같은 벤치마크로 평가했다. 프롬프트 인젝션 탐지에서는 DeBERTa 기반 분류기가 89.01%의 정확도를 기록해, LLM 심사위원으로 쓴 Qwen3.6-35B의 89.31%에 0.30%포인트 차이로 근접했다.1

가드레일은 악성 지시나 유해 콘텐츠를 판별해 AI 애플리케이션의 입출력을 통제한다. 지금까지는 특정 위험에 맞춘 분류기와 LLM 심사위원이 주로 쓰였지만, 최근에는 토큰을 생성하지 않고 정형화된 답을 내놓는 ‘의사결정 모델’이 세 번째 선택지로 등장했다. 레드햇은 엔비디아(NVIDIA)의 오픈소스 도구인 NeMo Guardrails를 이용해 세 방식을 프롬프트 인젝션과 콘텐츠 안전성 과제에서 시험했다.1

프롬프트 인젝션에서는 속도 차이가 정확도보다 훨씬 컸다. DeBERTa의 응답 시간 중앙값은 54.1밀리초로, Qwen의 312.5밀리초보다 약 5.8배 빨랐다. 의사결정 모델 Jev는 정확도 86.35%, 지연 시간 348.1밀리초를 기록했다. Qwen3.6-35B는 혼합 전문가(MoE) 구조여서 토큰마다 실제로 활성화되는 매개변수는 약 30억 개다. 따라서 전체 매개변수만 놓고 DeBERTa보다 175배 크다고 보는 것은 실제 추론 연산량 차이를 과장할 수 있다.1

다만 콘텐츠 안전성에서는 순위가 뒤집혔다. 편견·폭력·욕설·불법 행위·성적 콘텐츠·역할극 같은 위장 맥락까지 다룬 평가에서 Jev가 86.20%로 1위였고, 오픈소스 의사결정 모델 DiffusionGemma가 85.53%, Qwen이 85.47%로 뒤를 이었다. 레드햇의 1억2,500만 매개변수 Granite Guardian은 80.27%로 6위였지만, 33.2밀리초로 가장 빨랐다.1

특정 상용 모델만의 우위도 뚜렷하지 않았다. DiffusionGemma는 콘텐츠 안전성에서 Jev와 0.67%포인트 차이에 그쳤고, 프롬프트 인젝션에서는 87.72%로 Jev의 86.35%를 앞섰다. 약 4억2,100만 매개변수의 오픈소스 모델 Laya는 노트북 CPU에서 85.44%를 기록했다. 그러나 정책 문구에 따라 결과가 크게 달라졌다. Nemotron의 프롬프트 인젝션 정확도도 기본 위험 정의를 레드햇 정책으로 바꾸자 69.37%에서 84.84%로 상승했다.1

레드햇은 두 분류기를 OpenShift AI 3.6의 기본 가드레일로 제공할 계획이다. 이번 결과는 좁고 명확한 위험에는 소형 분류기가 속도와 정확도를 함께 확보할 수 있지만, 위험 범주가 넓어지면 의사결정 모델이 앞설 수 있음을 보여준다. 동시에 레드햇은 콘텐츠 안전성용 소형 예측 모델을 더 개선해야 한다고 인정했다.1

Footnotes

  1. The New Stack, 「The AI safety check that runs on a laptop and nearly matched a 35B model」 ↩ ↩2 ↩3 ↩4 ↩5 ↩6

읽기 목록은 이 브라우저에 저장됩니다.

출처

  1. The AI safety check that runs on a laptop and nearly matched a 35B model — The New Stack

이 글은 위 출처를 근거로 자동 생성된 뒤 발행됐습니다. 원문을 함께 확인해 주세요. 교차 보도 없이 단독 출처로 작성됐습니다.