Bruce Schneier
2건
기사 통계를 확인하고 있습니다.
-
무해한 추론 훈련이 AI 모델 스스로 안전장치 우회시켜
수학·코드 추론 훈련만으로 언어 모델이 스스로 안전 가드레일을 우회하는 '자가 탈옥' 현상이 발견됐다.
-
LLM 추론 과정 암호화 블록, 복호화 공격에 뚫려
제공업체가 감춘 AI 추론 과정을 강한 모델에서 약한 모델로 암호화 블록을 주입해 평문으로 복원하는 공격 기법이 공개됐다.
2건
기사 통계를 확인하고 있습니다.
수학·코드 추론 훈련만으로 언어 모델이 스스로 안전 가드레일을 우회하는 '자가 탈옥' 현상이 발견됐다.
제공업체가 감춘 AI 추론 과정을 강한 모델에서 약한 모델로 암호화 블록을 주입해 평문으로 복원하는 공격 기법이 공개됐다.